Ежедневный дайджест
7 пунктов · ~7 мин · Неделя 2026-W30
Стоит знать (1)
RESOURCE2SKILL: дистилляция исполняемых агентных навыков из мультимодальных ресурсов, созданных людьми
Microsoft ResearchMicrosoft Research предлагает метод дистилляции переиспользуемых, исполняемых агентных навыков из созданных людьми мультимодальных ресурсов, таких как обучающие видео, с организацией их в иерархическую wiki-подобную библиотеку навыков, которую агенты могут находить, изучать и комбинировать в разных программных областях — дизайне слайдов, работе с таблицами, CAD и создании музыки.
Справочно (6)
Маск заявил, что двухтриллионная модель xAI Grok 4.6 завершила начальное обучение
xAIИлон Маск сообщил, что следующая крупная модель xAI, ожидаемо получившая название Grok 4.6 и построенная примерно на 2 триллионах параметров, завершила первичный предобучающий прогон на неделе 20 июля 2026 года — спустя несколько дней после релиза Moonshot AI открытой модели Kimi K3 на 2,8 триллиона параметров.
Anthropic открывает приём заявок на гранты AI for Science по исследованию редких заболеваний
AnthropicAnthropic принимает заявки до 2 августа 2026 года в рамках нового направления по редким заболеваниям программы AI for Science, предлагая до $50 000 в виде кредитов Claude на шесть месяцев по двум направлениям: клинические исследования (с партнёрами вроде Monarch Initiative) и биотехнологии для разработки лекарств.
Понимание рассуждения: от предобучения к пост-обучению
Используя шахматы как контролируемый тестовый стенд, охватывающий весь пайплайн от предобучения до RL, авторы показывают, что RL-пост-обучение не просто «затачивает» обученную с учителем политику: на лёгких задачах оно усиливает ходы, которые модель уже предпочитала, а на сложных — выявляет правильные ходы, почти отсутствовавшие после SFT, причём модели с более долгим предобучением получают больше пользы от RL.
Recursive Harness Self-Improvement (RHI): доработка агентных «обвязок» по обратной связи от выполнения
Sakana AIИсследователи Sakana AI и UC Berkeley представляют Recursive Harness Self-Improvement — итеративный алгоритм, дорабатывающий созданные пользователем агентные «обвязки» (harness) с помощью попарной обратной связи, извлекаемой из истории выполнения самого агента, без переобучения базовой модели.
Claude Code v2.1.216 добавляет опцию отключения файловой песочницы и исправляет изоляцию git worktree
AnthropicClaude Code v2.1.216, вышедший 20 июля 2026 года, добавляет настройку sandbox.filesystem.disabled для отключения изоляции файловой системы при сохранении контроля сетевого исходящего трафика, исправляет квадратичное замедление нормализации сообщений в длинных сессиях и устраняет несколько багов изоляции worktree, из-за которых субагенты могли перенаправлять git-операции в общий checkout.
OpenCode v1.18.4 добавляет адаптивное управление режимом «размышления» для моделей Kimi
SST (OpenCode)OpenCode v1.18.4, вышедший 20 июля 2026 года, добавляет адаптивное управление режимом «размышления» для моделей Kimi у Anthropic-совместимых провайдеров, синхронизирует тему встроенного терминала десктоп-приложения с общей темой приложения, снижает таймауты заголовков у провайдера OpenAI и восстанавливает поддержку Azure Cognitive Services.