-
Mean Mode Screaming: исправление патологии обучения открывает путь к 1000-слойным Diffusion Transformer
research
-
Prime Intellect выпускает prime-rl v0.6.0 для агентного RL на триллионно-параметрических MoE-моделях
Prime Intellect
research
-
DOPD: двойная on-policy дистилляция с advantage-aware маршрутизацией токенов
research
-
Статья ByteDance Seed исследует, как часто высококачественные доменные данные следует повторять при масштабировании LLM
ByteDance
research
-
SLAI T-Rex: полнопараметрический post-training семейства DeepSeek-V4 на Ascend SuperPOD
SLAI
research
-
Model Spec Midtraining: как нормативное самопознание улучшает обобщение alignment
Anthropic
research
-
Квантизированные модели рассуждения думают, что им нужно думать дольше, — но это не так
Meta
research
-
Hidden Decoding at Scale: новая ось масштабирования LLM без роста основного блока
research
-
Команда Qwen раскрыла архитектуру Qwen3.8-Next: гибридное внимание, n-gram эмбеддинги, Muon
Qwen (Alibaba)
research
-
ScienceIDE: превращение мировой научной кодовой базы в среды, обучаемые агентами
PhAI Labs
research
-
TrOPD: Trust-Region On-Policy Distillation Stabilizes LLM Training When Teacher-Student Gap Is Large
Samsung Research
research
-
FORT-Searcher: фреймворк обучающих данных, устойчивых к «срезанию углов», для агентов глубокого поиска
research
-
DomainShuttle: синтез видео по субъекту из текста для внутри- и междоменных сценариев
research
-
Guardian: OpenAI остановила обучение новейших моделей на фоне сообщений о «беглых агентах»; рамка оспаривается
OpenAI
industry
-
QUBRIC: Co-Designing Queries and Rubrics Extends RLVR to Open-Ended Reasoning Domains
research
-
ZPPO: дистилляция знаний через учителя-в-промптах превосходит градиентные методы для малых моделей рассуждений
NVIDIA
research
-
Agentic ESOpt: файнтюн long-horizon LLM-агентов с минимальными требованиями к GPU
National University of Singapore (Zhi Zheng, Wee Sun Lee et al.)
research
-
Don't Drop Dropout: оптимизация разреженности слоёв для эффективного обучения и инференса LLM
Cerebras
research
-
FlowBalance: самосовершенствование reasoning-моделей с опорой на верификатор
research
-
When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
research
-
Маск заявил, что двухтриллионная модель xAI Grok 4.6 завершила начальное обучение
xAI
industry