Ежедневный дайджест
9 пунктов · ~9 мин · Неделя 2026-W32
Обязательно к прочтению (3)
LongHorizon-Harness: развитие агентов для долгих горизонтов в реальных задачах
Harness, переформулирующий выполнение агентом долгих горизонтов задач как явную проблему управления состоянием задачи: верифицированное состояние хранится вне растущего контекста модели вместо неконтролируемого накопления допущений. Он поднимает Qwen 3.7-Plus с 51.8% до 80.7% на WeaveBench и с 2.8% до 8.3% на OSWorld 2.0, а также поднимает Claude Opus 4.7 с 20.0% до 34.3% на подмножестве OSWorld 2.0.
SwanTale: унифицированная генерация многоголосой речи и аудио для instruct и zero-shot задач
ByteDanceМодель ByteDance для генерации многоголосой выразительной речи и аудио поддерживает как instruct-режим (по текстовой подсказке), так и zero-shot (по референсному аудио), сочетая контроль качества с reward-conditioning, Engram conditioning и унифицированный MoE, обученный с curriculum learning и пост-тренингом GRPO. Ориентирована на такие приложения, как дубляж, аудиодрамы и производство коротких видео.
MiniMax открывает веса омни-модальной видеомодели H3
MiniMaxMiniMax 3 августа 2026 года выложила на Hugging Face открытые веса своей омни-модальной видеомодели H3 (Hailuo 3.0) — спустя три дня после дебюта только через API. Релиз на 33 млрд параметров включает чекпоинты FL2VA (текст/первый-последний кадр) и Ref2VA (референс-в-видео), генерирующие клипы до 2K и длительностью 15 секунд с нативным стереозвуком, и с первого дня получил нативную поддержку ComfyUI.
Стоит знать (3)
DAPD: Dual-Anchored Policy Distillation
Работа выявляет режим отказа «иллюзии привилегии» в on-policy self-distillation, когда student-модель учится полагаться на привилегированную информацию учителя, доступную только во время обучения, но не в инференсе. DAPD устраняет это с помощью dual-path anchoring и dual-source anchoring, превосходя предыдущий on-policy self-distillation в среднем на +2.00 балла по шести бенчмаркам на Qwen3-4B.
Progressive Agent Skill Generation via Reinforcement Learning (Skill-α)
The Chinese University of Hong KongSkill-α представляет генерацию навыков агента как последовательный процесс редактирования (CREATE, UPDATE, MERGE, PRUNE, NOOP), обучаемый с наградой за откат, которая сравнивает результат выполнения нижестоящей задачи с исходным навыком против отредактированного на закреплённом запросе. Поддерживает как генерацию навыка из документа, так и из опыта через единый редактор навыков.
Mistral AI выпускает Shieldstral — классификатор безопасности с открытыми весами
Mistral AIMistral AI выпустила Shieldstral — классификатор безопасности контента с открытыми весами на 3 миллиарда параметров для текста и изображений, лицензированный под Apache 2.0. Он принимает политики безопасности на естественном языке во время инференса вместо дообучения, работает на одном GPU с 16 ГБ и возвращает калиброванные вероятностные оценки вместо бинарных меток.
Справочно (3)
Anthropic назначает Тино Куэльяра директором по глобальным связям
AnthropicAnthropic объявила, что Мариано-Флорентино (Тино) Куэльяр, бывший судья Верховного суда Калифорнии, присоединяется к компании в качестве Chief Global Affairs Officer для руководства работой по политике и связям с государственными органами.
Claude Code v2.1.222 устраняет проблемы безопасности: деструктивные git-команды в worktree и обход хуков
AnthropicВслед за вчерашним v2.1.221 (Focus view, маскировка credentials в sandbox) Anthropic 4 августа выпустила Claude Code v2.1.222, устранив два пробела в безопасности: изолированные worktree-сессии и сабагенты могли выполнять деструктивные git-команды над основным checkout, а хуки PreToolUse auto-allow можно было обойти через инструменты, запущенные в фоновых задачах.
OpenCode v1.18.13 добавляет контекст GitHub PR review и исправляет RTL-вёрстку
sstВслед за фиксом Azure GPT-5.5+ reasoning в v1.18.12, OpenCode 4 августа выпустила v1.18.13, добавив в GitHub PR review контекст с номером и URL pull request-а, а также исправив проблемы с right-to-left вёрсткой в десктопном приложении.