Ежедневный дайджест
5 пунктов · ~5 мин · Неделя 2026-W31
Обязательно к прочтению (1)
Технический отчёт Kimi K3: подробности об архитектуре Kimi Delta Attention и Stable LatentMoE
Moonshot AIMoonshot AI опубликовала на arXiv технический отчёт по Kimi K3, раскрывающий архитектуру модели MoE с 2,8T параметров (104B активных), веса которой были выложены в открытый доступ днём ранее: Kimi Delta Attention с Attention Residuals, Stable LatentMoE с маршрутизацией 16 из 896 экспертов, а также постобучение с RL по общим, агентным и кодинговым доменам на нескольких уровнях reasoning-усилия. В отчёте заявлено примерно 2,5-кратное повышение эффективности масштабирования по сравнению с Kimi K2.
Справочно (4)
VK Research: классические алгоритмы рекомендаций способны учитывать будущие интересы пользователей
VKAI VK Research представила новый подход, позволяющий классическим, не нейросетевым алгоритмам рекомендаций учитывать, как текущая рекомендация повлияет на будущие предпочтения пользователя, а не только на его нынешние интересы. Метод принят на воркшоп Customer Journey конференции KDD 2026 и показал улучшенную точность на открытых датасетах, включая VK-LSVD.
Mage-VL: эффективная codec-native стриминговая мультимодальная базовая модель
MicrosoftИсследователи Microsoft представили Mage-VL, vision-language модель на 4B параметров с визуальным энкодером (Mage-ViT), обученным с нуля на 560M изображений и 100M видеокадров. Модель использует codec-guided разреженный отбор токенов, заимствуя структуру I-frame/P-frame из видеокодеков, что сокращает число визуальных токенов примерно на 75% по сравнению с плотной выборкой кадров и даёт до 3,5-кратного ускорения инференса по реальному времени. Двухсистемный дизайн сочетает лёгкий стриминговый gate с полноценным reasoning-декодером; модель соответствует Qwen3-VL-4B на статическом VQA, превосходя её в понимании видео и пространственном рассуждении.
Skill Self-Play: расширение границ возможностей LLM с помощью совместно эволюционирующих навыков
AlibabaКоманда Qwen в Alibaba предложила Skill-SP — фреймворк обучения с подкреплением с тремя совместно эволюционирующими компонентами: proposer, генерирующий задачи с учётом динамически выбираемых навыков, solver, исследующий решения, и skill controller, обновляющий библиотеку навыков на основе обратной связи от выполнения. Цель — соединить надёжное, но узкое обучение в рамках среды с широкой, но менее надёжной генерацией открытых задач; показаны улучшения на бенчмарках по использованию инструментов и рассуждению, включая значительный прирост для изначально слабых моделей.
Codex CLI 0.146.0: именованные/закреплённые сессии, Agent Plugins, форкинг тредов
OpenAIOpenAI выпустила Codex CLI 0.146.0, добавив именованные и закрепляемые сессии через /new или /clear, манифесты Agent Plugins с публикацией плагинов рабочего пространства и новыми маркетплейсами (Amazon Bedrock, Claude Code), форкинг тредов с постраничной историей, WebSocket-соединения от app-server к удалённым хостам Code Mode, автономный веб-поиск для совместимых кастомных провайдеров моделей, а также обнаружение скиллов, предоставляемых исполнителем (executor). Релиз также включает набор исправлений по конфигурации прокси и переподключению MCP.