-
MegaParts: масштабирование 3D-генерации объектов с учётом частей до 300 частей через токен-эффективное авторегрессионное моделирование
Shanghai AI Lab
research
-
Mean Mode Screaming: исправление патологии обучения открывает путь к 1000-слойным Diffusion Transformer
research
-
Lance: 3B Unified Multimodal Model for Understanding, Generation, and Editing (314 HF upvotes)
ByteDance Research
research
-
Систематический анализ гибридного линейного внимания: исследование 72 моделей
ByteDance Seed
research
-
Metis: базовая модель памяти
MemTensor
research
-
Recurrent Looped Transformer: вирусный технический отчёт заявляет «бесконечную временную глубину» для латентного ризонинга
Princeton University
research
-
NCP-ArchPreview: латентные языковые модели на 8,9B параметров через Next Concept Prediction
Shanghai AI Lab
research
-
Echo-Infinity: генерация бесконечного видео в реальном времени через обучаемый Memory Query
research
-
Hidden Decoding at Scale: новая ось масштабирования LLM без роста основного блока
research
-
Metis: базовая модель памяти
MemTensor, Renmin University, NUS, Shanghai Jiao Tong University, Tongji University
research
-
Команда Qwen раскрыла архитектуру Qwen3.8-Next: гибридное внимание, n-gram эмбеддинги, Muon
Qwen (Alibaba)
research
-
Do Language Models Need Sleep? Offline Recurrence as Memory Consolidation for Improved Inference
Google / CMU
research
-
Wan-Streamer v0.1: сквозная интерактивная фундаментальная модель реального времени с задержкой менее 550 мс
Wan-AI
research
-
Jet-Long: эффективное расширение контекстного окна с динамическим Bifocal RoPE
MIT / NVIDIA
research
-
Intern-S2-Mobius: фундаментальная модель с разделёнными знаниями и рассуждением
Shanghai AI Lab
research
-
SMELT: зацикленные MoE-трансформеры догоняют базовое масштабирование при равных вычислениях
ByteDance Seed
research
-
LLM с бесконечными параметрами: статья на arXiv предлагает генерацию весов из живых данных
Independent researchers
research
-
«Форма» языковых моделей: проектирование архитектур под агентные воркфлоу
Alex Zhang (independent)
research
-
Структурное происхождение attention sink: расхождение дисперсий, суперн ейроны и исправление
research
-
Cola DLM: непрерывная латентная диффузионная языковая модель с конкурентным масштабированием
research
-
FlashMorph: управляемое данными размещение слоёв гибридного внимания через обучаемые гейты
ByteDance Seed
research
-
xHC: Expanded Hyper-Connections масштабируют параллелизм residual-потока за прежние пределы
Shanghai Jiao Tong University / Xiaohongshu / USTC / Peking University / CUHK
research
-
Motif 3: технический отчёт
Motif Technologies
research