-
TurboVLA: модель «зрение-язык-действие» в реальном времени на 32 Гц на RTX 4090 с менее чем 1 ГБ VRAM
research
-
Qwen-Image-2.0: унифицированная генерация и редактирование изображений в разрешении 2K, первое место на AI Arena
Alibaba
research
-
Baidu выпускает ERNIE 5.1 при 6% отраслевых затрат на предобучение и входит в мировой топ-10 поиска
Baidu
models-llm
-
JetSpec: преодоление потолка масштабирования спекулятивного декодирования с помощью параллельного построения деревьев черновиков
Hao AI Lab, UC San Diego
research
-
Dockerless: верификатор программ без окружения для агентов кодирования
ByteDance
research
-
DOPD: двойная on-policy дистилляция с advantage-aware маршрутизацией токенов
research
-
Систематический анализ гибридного линейного внимания: исследование 72 моделей
ByteDance Seed
research
-
Program-as-Weights: компиляция спецификаций задач в LoRA-адаптеры для инференса на устройстве
University of Waterloo / Harvard
research
-
MrFlow: ускорение flow-matching моделей text-to-image в 10–25 раз без дообучения
Beihang University
research
-
Mage-VL: эффективная кодек-нативная потоковая мультимодальная базовая модель
Microsoft
research
-
Kwai Keye-VL-2.0: открытая мультимодальная MoE-модель 30B с контекстом 256K для длинного видео
Kwai
research
-
MiniMax Sparse Attention: сокращение вычислений в 28 раз при контексте 1M токенов без потери качества
MiniMax
research
-
Moebius: лёгкая модель инпейнтинга на 0,2 млрд параметров сравнялась с FLUX на 11,9 млрд
Huazhong University of Science and Technology
research
-
BDH-CQ: рекуррентная модель латентного рассуждения преодолевает границу эффективности затрат на ARC-AGI-1
Pathway
research
-
Orthrus: 7,8-кратное ускорение инференса для Qwen3 за счёт совместного использования KV-кеша AR и диффузии
research
-
SANA-WM: мировое моделирование 720p длительностью в минуту на одном GPU
NVIDIA
research
-
ThoughtFold: интроспективное обучение предпочтениям сокращает токены рассуждения на 56% без потери точности
research
-
FastContext: специализированный субагент-исследователь сокращает использование токенов агентами по коду на 60%
Microsoft / Shanghai Jiao Tong University
research
-
Квантизированные модели рассуждения думают, что им нужно думать дольше, — но это не так
Meta
research
-
vLLM v0.24.0: Model Runner V2 по умолчанию, Rust-фронтенд, ускорение SM90 FP8
vLLM
tools
-
Program-as-Weights: парадигма «компилируй один раз» достигает качества 32B-моделей при 1/50 объёма памяти
research
-
Super Weights в LLM: почему высокосалиентные параметры не работают как цели дообучения
Amazon
research
-
Готовы ли мы к агент-нативным системам памяти? SJTU сравнивает 12 архитектур
research
-
BlockPilot: адаптивный размер блока для диффузионного спекулятивного декодирования
research
-
Jet-Long: эффективное расширение контекстного окна с динамическим Bifocal RoPE
MIT / NVIDIA
research
-
Масштабируемое визуальное предобучение для языкового интеллекта
research
-
О геометрии on-policy дистилляции: парадигма обучения, отличная от SFT и RLVR
Hong Kong University of Science and Technology
research
-
SHERLOC: структурированная диагностическая локализация сокращает потребление токенов при ремонте кода на 36,7%
research
-
OPRD: дистилляция представлений на политике для пост-обучения LLM
research
-
ELDR: маршрутизация с учётом локальности экспертов снижает задержку при обслуживании MoE-моделей на 14%
Microsoft Research
research
-
FlashMorph: управляемое данными размещение слоёв гибридного внимания через обучаемые гейты
ByteDance Seed
research
-
Mage-Flow: эффективная базовая модель нативного разрешения для генерации и редактирования изображений
Microsoft
research
-
LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
research