-
TurboVLA: модель «зрение-язык-действие» в реальном времени на 32 Гц на RTX 4090 с менее чем 1 ГБ VRAM
research
-
Qwen-Image-2.0: унифицированная генерация и редактирование изображений в разрешении 2K, первое место на AI Arena
Alibaba
research
-
Baidu выпускает ERNIE 5.1 при 6% отраслевых затрат на предобучение и входит в мировой топ-10 поиска
Baidu
models-llm
-
JetSpec: преодоление потолка масштабирования спекулятивного декодирования с помощью параллельного построения деревьев черновиков
Hao AI Lab, UC San Diego
research
-
Dockerless: верификатор программ без окружения для агентов кодирования
ByteDance
research
-
DOPD: двойная on-policy дистилляция с advantage-aware маршрутизацией токенов
research
-
Систематический анализ гибридного линейного внимания: исследование 72 моделей
ByteDance Seed
research
-
Program-as-Weights: компиляция спецификаций задач в LoRA-адаптеры для инференса на устройстве
University of Waterloo / Harvard
research
-
MrFlow: ускорение flow-matching моделей text-to-image в 10–25 раз без дообучения
Beihang University
research
-
Mage-VL: эффективная кодек-нативная потоковая мультимодальная базовая модель
Microsoft
research
-
Tencent Hunyuan открывает SAS — маршрутизаторы разреженного внимания, обученные end-to-end на Qwen3
Tencent Hunyuan
research
-
Kwai Keye-VL-2.0: открытая мультимодальная MoE-модель 30B с контекстом 256K для длинного видео
Kwai
research
-
MiniMax Sparse Attention: сокращение вычислений в 28 раз при контексте 1M токенов без потери качества
MiniMax
research
-
Moebius: лёгкая модель инпейнтинга на 0,2 млрд параметров сравнялась с FLUX на 11,9 млрд
Huazhong University of Science and Technology
research
-
BDH-CQ: рекуррентная модель латентного рассуждения преодолевает границу эффективности затрат на ARC-AGI-1
Pathway
research
-
Uno: lossless-ускорение LLM через диффузионно-аугментированную авторегрессию
MBZUAI
research
-
WMRL: масштабирование автоматических research-агентов через world-модели
University of Illinois / NVIDIA
research
-
NCP-ArchPreview: латентные языковые модели на 8,9B параметров через Next Concept Prediction
Shanghai AI Lab
research
-
Vidu S2: realtime-интерактивная, редактируемая и пространственная видеогенерация
ShengShu Intelligence
research
-
ZGCM-1: полностью открытая и крайне эффективная 7B-модель для математики и агентного поиска
ZGCAGI
research
-
Dream-RSI: рекурсивное самоулучшение через эволюционирующие миры
Google
research
-
Orthrus: 7,8-кратное ускорение инференса для Qwen3 за счёт совместного использования KV-кеша AR и диффузии
research
-
SANA-WM: мировое моделирование 720p длительностью в минуту на одном GPU
NVIDIA
research
-
ThoughtFold: интроспективное обучение предпочтениям сокращает токены рассуждения на 56% без потери точности
research
-
FastContext: специализированный субагент-исследователь сокращает использование токенов агентами по коду на 60%
Microsoft / Shanghai Jiao Tong University
research
-
Квантизированные модели рассуждения думают, что им нужно думать дольше, — но это не так
Meta
research
-
vLLM v0.24.0: Model Runner V2 по умолчанию, Rust-фронтенд, ускорение SM90 FP8
vLLM
tools
-
Program-as-Weights: парадигма «компилируй один раз» достигает качества 32B-моделей при 1/50 объёма памяти
research
-
Super Weights в LLM: почему высокосалиентные параметры не работают как цели дообучения
Amazon
research
-
Команда Qwen раскрыла архитектуру Qwen3.8-Next: гибридное внимание, n-gram эмбеддинги, Muon
Qwen (Alibaba)
research
-
Google DeepMind добавила агентное понимание видео в Gemini
Google DeepMind
tools
-
LatentPress: сжатие контекста в непрерывные memory-токены, которые замороженная LLM читает напрямую
research
-
DeepSeek-V4.1-Flash: пределы сжатия KV-кэша
DeepSeek
research
-
Готовы ли мы к агент-нативным системам памяти? SJTU сравнивает 12 архитектур
research
-
BlockPilot: адаптивный размер блока для диффузионного спекулятивного декодирования
research
-
Jet-Long: эффективное расширение контекстного окна с динамическим Bifocal RoPE
MIT / NVIDIA
research
-
Масштабируемое визуальное предобучение для языкового интеллекта
research
-
SMELT: зацикленные MoE-трансформеры догоняют базовое масштабирование при равных вычислениях
ByteDance Seed
research
-
COBRA-Skills: эволюция агентных скиллов под управлением контекстных бандитов
Chinese University of Hong Kong, Shenzhen
research
-
О геометрии on-policy дистилляции: парадигма обучения, отличная от SFT и RLVR
Hong Kong University of Science and Technology
research
-
SHERLOC: структурированная диагностическая локализация сокращает потребление токенов при ремонте кода на 36,7%
research
-
OPRD: дистилляция представлений на политике для пост-обучения LLM
research
-
ELDR: маршрутизация с учётом локальности экспертов снижает задержку при обслуживании MoE-моделей на 14%
Microsoft Research
research
-
FlashMorph: управляемое данными размещение слоёв гибридного внимания через обучаемые гейты
ByteDance Seed
research
-
Mage-Flow: эффективная базовая модель нативного разрешения для генерации и редактирования изображений
Microsoft
research
-
LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
research
-
Действительно ли on-policy дистилляция дистиллирует? Безучительская OPSA обгоняет её на AIME24
Purdue University
research
-
Language Models Can Control Their Own Attention
research
-
Don't Drop Dropout: оптимизация разреженности слоёв для эффективного обучения и инференса LLM
Cerebras
research
-
SoL-Pi: рекурсивное масштабирование авто-research-циклов для эффективного agent harness
research