Ежедневный дайджест

9 пунктов · ~9 мин · Неделя 2026-W32

Стоит знать (5)

xAI выпустила Grok Imagine Image 2.0 с редактированием по областям и вводом нескольких референсных изображений

xAI
изображения только СМИ 3 ист. ~1 мин

xAI сделала Grok Imagine Image 2.0 общедоступной в качестве Quality Mode на grok.com/imagine и в приложениях для iOS/Android, добавив редактор областей с «волшебной палочкой», выделение на основе сегментации, удаление фона и мультиреференсное редактирование, принимающее до пяти входных изображений за одну генерацию.

Почему это важно
Позиционирует модель изображений xAI как прямого конкурента в области точного редактирования — сфере, где темп задавали OpenAI и Google; сообщается, что доступ через API появится в ближайшее время.

LongHorizon-Harness предлагает цикл Manage-Execute-Audit для долгосрочных агентов

исследования официальный 2 ист. ~1 мин

Предлагает цикл Manage-Execute-Audit (MEA), отделяющий отслеживание состояния задачи от исполнения: менеджер хранит проверенное состояние задачи, исполнитель с чистым контекстом обрабатывает каждую подзадачу, а аудитор в режиме только для чтения проверяет состояние среды перед каждым новым раундом. Среди заявленных результатов — рост Qwen 3.7-Plus с 51,8% до 80,7% на WeaveBench и рост Claude Opus 4.7 с 20,0% до 34,3% на подмножестве OSWorld 2.0.

Почему это важно
Находится в HuggingFace Daily Papers с числом отметок «нравится» выше 100, что указывает на сильный интерес сообщества к решению проблемы надёжности долгосрочных агентов за счёт отделения отслеживания состояния от исполнения.

Recursive Synthetic Terminal Tasks генерирует более 37 000 проверяемых долгосрочных агентных задач

исследования официальный 1 ист. ~1 мин

Представляет Recursive Synthetic Terminal Tasks (RST) — рекурсивный фреймворк проверяемого синтеза, автоматически генерирующий более 37 000 проверяемых долгосрочных задач для терминальных агентов, сохраняя согласованность инструкций, окружений, решений и верификаторов при стоимости примерно $0,05 за задачу. Сложность задач нарастает от раунда к раунду: медианная длина эталонного решения растёт с 67 до 374 строк, а pass@4 модели DeepSeek-V4-Pro падает с 90% до 2,5% за 15 раундов.

Почему это важно
Опубликовано с высоким числом отметок «нравится» в HuggingFace Daily Papers; предлагает масштабируемый и дешёвый способ генерации сложных данных для обучения/оценки агентов по мере насыщения бенчмарков для терминальных агентов.

DAPD выявляет режим отказа «иллюзия привилегии» в самодистилляции on-policy

Shanghai AI Laboratory
исследования официальный 1 ист. ~1 мин

Выявляет режим отказа «иллюзия привилегии» (privilege illusion) в самодистилляции on-policy, при котором модель-ученик усваивает поведение, зависящее от привилегированной информации, доступной во время обучения, но недоступной при инференсе. Предлагает Dual-Path и Dual-Source Anchoring для двунаправленного согласования поведения референсной модели и роллаутов, улучшая результаты предыдущей on-policy самодистилляции примерно на 2-2,8 балла на моделях Qwen3 от 4B до 32B.

Почему это важно
Опубликовано с более чем 100 отметками «нравится» в HuggingFace Daily Papers; устраняет тонкий, но широко применимый режим отказа во всё более распространённом рецепте обучения с on-policy самодистилляцией.

Claude Code открыла публичную бету self-hosted окружений; v2.1.224 добавляет межсессионный обмен сообщениями агентов

Anthropic
инструменты официальный 2 ист. ~1 мин

Anthropic запустила публичную бету, позволяющую клиентам Claude Team и Enterprise запускать облачные сессии Claude Code на собственной инфраструктуре через `claude self-hosted-runner`, сохраняя чекауты репозиториев, артефакты сборки и секреты внутри сети организации. В том же релизе v2.1.224 добавлены межсессионные API `SendMessage`/`ListAgents`, позволяющие сессиям на разных машинах обмениваться сообщениями; за ним 8 августа последовали v2.1.225/226 с предупреждениями о лимитах расходов gateway и исправлениями MCP OAuth.

Почему это важно
Self-hosted runner'ы устраняют распространённое препятствие для enterprise (резидентность данных, внутренние сервисы), а межсессионный обмен сообщениями расширяет возможности мультиагентной оркестрации — два значимых скачка возможностей в одном цикле релизов.
Справочно (4)

OpenAI приобрела стартап NextSlide для AI-презентаций

OpenAI
индустрия офиц. + СМИ 2 ист. ~1 мин

OpenAI приобрела стартап NextSlide, специализирующийся на генерации презентаций; его команда присоединится к разработке новых продуктивных функций ChatGPT для превращения промптов и документов в готовые, редактируемые презентации. Сделка была закрыта ранее, но публично раскрыта около 7-8 августа 2026 года; финансовые условия не разглашаются.

Почему это важно
Расширяет присутствие ChatGPT в офисных рабочих процессах, продолжая паттерн OpenAI по небольшим tuck-in приобретениям для ускорения разработки конкретных продуктовых функций.

Anthropic ослабила классификаторы биобезопасности Claude Fable 5, сократив ложные блокировки на 85%

Anthropic
исследования официальный 1 ист. ~1 мин

Anthropic переписала классификаторы биобезопасности, контролирующие Claude Fable 5, сократив ненужные откаты к менее мощной модели Opus 5 примерно на 85%, продолжая при этом блокировать запросы двойного назначения в области вирусологии, токсикологии и молекулярного дизайна.

Почему это важно
Показывает, как Anthropic настраивает баланс между передовыми биологическими возможностями и риском злоупотребления — актуальный политический вопрос для любой лаборатории, выпускающей модели с потенциальным биобезопасным уплифтом.

OpenAI Codex CLI 0.147.0 добавляет переносимые Agent Plugins и поддержку MCP 2026-07-28

OpenAI
инструменты официальный 1 ист. ~1 мин

Codex CLI 0.147.0, выпущенный 7 августа 2026 года, добавляет переносимые Agent Plugins, устанавливаемые из локальных, персональных, workspace или удалённых каталогов, постоянные вручную упорядочиваемые разделы диалогов, флаг автоодобрения --approve-for-me и поддержку редакции протокола MCP 2026-07-28.

Почему это важно
Переносимые плагины и поддержка MCP 2026-07-28 приближают Codex CLI к той же модели расширяемости, которую строят конкуренты вроде Claude Code и OpenCode.

ByteDance открыла публичный доступ к developer API Seedance 2.5

ByteDance
видео только СМИ 2 ист. ~1 мин

7 августа 2026 года ByteDance открыла публичный доступ разработчиков к API Seedance 2.5 — спустя неделю после потребительского запуска модели. API предоставляет одношаговую генерацию 30-секундного видео с поддержкой до 50 мультимодальных референсных входов (изображения, видео, аудио) и управлением 3D-блокингом камеры.

Почему это важно
Переносит одношаговую 30-секундную генерацию Seedance 2.5 и высокий лимит референсных входов из собственных приложений ByteDance в сторонние инструменты через платформу Volcano Engine Ark, усиливая конкуренцию с Kling, Wan 3.0 и Veo за API для разработчиков в области видео.