#architecture
- MegaParts: масштабирование 3D-генерации объектов с учётом частей до 300 частей через токен-эффективное авторегрессионное моделирование Shanghai AI Lab research
- Mean Mode Screaming: исправление патологии обучения открывает путь к 1000-слойным Diffusion Transformer research
- Lance: 3B Unified Multimodal Model for Understanding, Generation, and Editing (314 HF upvotes) ByteDance Research research
- Систематический анализ гибридного линейного внимания: исследование 72 моделей ByteDance Seed research
- Metis: базовая модель памяти MemTensor research
- Echo-Infinity: генерация бесконечного видео в реальном времени через обучаемый Memory Query research
- Hidden Decoding at Scale: новая ось масштабирования LLM без роста основного блока research
- Metis: базовая модель памяти MemTensor, Renmin University, NUS, Shanghai Jiao Tong University, Tongji University research
- Do Language Models Need Sleep? Offline Recurrence as Memory Consolidation for Improved Inference Google / CMU research
- Wan-Streamer v0.1: сквозная интерактивная фундаментальная модель реального времени с задержкой менее 550 мс Wan-AI research
- Jet-Long: эффективное расширение контекстного окна с динамическим Bifocal RoPE MIT / NVIDIA research
- Intern-S2-Mobius: фундаментальная модель с разделёнными знаниями и рассуждением Shanghai AI Lab research
- Структурное происхождение attention sink: расхождение дисперсий, суперн ейроны и исправление research
- Cola DLM: непрерывная латентная диффузионная языковая модель с конкурентным масштабированием research
- FlashMorph: управляемое данными размещение слоёв гибридного внимания через обучаемые гейты ByteDance Seed research
- xHC: Expanded Hyper-Connections масштабируют параллелизм residual-потока за прежние пределы Shanghai Jiao Tong University / Xiaohongshu / USTC / Peking University / CUHK research
- Motif 3: технический отчёт Motif Technologies research