Ежедневный дайджест

23 пункта · ~23 мин · Неделя 2026-W35

Обязательно к прочтению (5)

IBM выпускает reasoning-LLM Granite 4.2 (3B/8B/30B, Apache 2.0, контекст 512K), обученные на ~15T токенов с GRPO RL на GB200 NVL72

IBM
модели/LLM официальный 3 ист. ~1 мин

25 августа 2026 года IBM выпустила Granite 4.2 — первое семейство плотных decoder-only reasoning-LLM в размерах 3B/8B/30B под Apache 2.0. Предобучено с нуля на ~15T токенов по пятифазной стратегии с расширением контекста до 512K; SFT на ~7.2M примеров (31.6% агентских, 68.4% неагентских); многоступенчатый асинхронный GRPO RL — фундаментальный RLVR для всех размеров, агентский RL (SWE → Terminal → Search) для 8B/30B, RLHF для безопасности и длины рассуждений. Режимы thinking / non-thinking / low-effort; нативный OpenAI-совместимый tool-calling API; 12 языков. Обучено на кластере NVIDIA GB200 NVL72 в CoreWeave с использованием NeMo-RL и NeMo-Gym. Квантизации FP8/NVFP4/MXFP4 и 14 вариантов GGUF. 30B достигает 89.17 на AIME25, 57.00 на SWE-Bench Verified, 62.00 на τ³-bench.

Почему это важно
Первое семейство плотных reasoning-LLM под Apache 2.0 от западной frontier-лаборатории в трёх размерах, все с нативным tool-calling и контекстом 512K — конкурентоспособно с закрытыми агентскими API на агентских бенчмарках и поставляется с полным RL-стеком.

GigaBrain-0.7: масштабирование embodied foundation-моделей к эмерджентным способностям через трёхсистемную архитектуру

GigaAI
исследования официальный 3 ист. ~1 мин

GigaBrain-0.7 — vision-language-action foundation-модель, объединяющая понимание, предсказание и действие через трёхсистемную архитектуру, масштабированную на более чем 37 000 часах гетерогенных embodied-данных. В статье сообщается о существенно улучшенной генерализации на разнообразных робототехнических платформах и постоянном улучшении через трёхсистемное разделение.

Почему это важно
HF Daily Papers 26 авг. с 2 610 голосами — самый сильный сигнал окна и самый заметный релиз embodied foundation-модели в конце августа 2026.

Apodex 1.1: масштабирование агентского интеллекта для сложной работы

Apodex AI
исследования официальный 2 ист. ~1 мин

Apodex 1.1 представляет фреймворк «working capability» для долгосрочных реальных задач, масштабируемый по двум осям: Environment Scaling (среды файлов, поиска, кода) и Agentic Coordination Scaling (декомпозиция задач, параллельная делегация, асинхронная интеграция, репланирование) под общим исполняющим харнессом и AgentOS. Вариант 35B «Mini» позволяет локальное развёртывание при соответствии frontier-уровню производительности на финансах, научных исследованиях, математике, коде и поиске.

Почему это важно
HF Daily Papers 25 авг. с 916 голосами; один из самых залайканных релизов агентов в окне и ведущий артефакт для бенчмарка FrontierChallenge (см. отдельную позицию).

ClawProBench: trace-aware оценка AI-агентов с покрытием в рантайме

исследования официальный 3 ист. ~1 мин

ClawProBench — trace-aware бенчмарк для AI-агентов со stateful-рантаймом, инстанцированный на OpenClaw. Сочетает полный профиль из 102 сценариев с замороженным холдаутом из 68 и использует safety-gated формулу скоринга, выведенную из трейсов исполнения; оценено 68 конфигураций на полном профиле и 37 на холдауте.

Почему это важно
HF Daily Papers 25 авг. с 822 голосами — один из самых залайканных релизов бенчмарков в окне. Подчёркивает, что ранжирования только по корректности расходятся с ранжированиями по процессу (Spearman 0.13 full против holdout), аргументируя в пользу оценки агентов на уровне трейсов.

Скоординированный релиз SDK Anthropic добавляет thinking-display-updates beta и Organization API в Python, TS, Go, Java, .NET, Ruby, PHP

Anthropic
инструменты официальный 6 ист. ~1 мин

Скоординированные релизы 26 августа по Python v1.1.0, TypeScript v0.121.0, Go v1.67.0, Java v2.58.0, .NET (Anthropic v12.43.0 + Bedrock v0.13.0), Ruby v1.66.0 и PHP v0.44.0 — везде добавлен beta-режим thinking-display «updates», эндпоинты Organization API под client.beta.organization, недостающие значения enum anthropic-beta и исправление на стороне tools, удерживающее runner при pause_turn. Python/Go/Ruby добавляют недостаточную exhaustiveness ToParam, TypeScript получает поддержку Standard Schema для structured outputs.

Почему это важно
Публичный запуск Organization API во всех first-party SDK разблокирует админ-эндпоинты (invites, workspaces, API keys, rate limits, CMEK, identity federation) для корпоративных клиентов — Claude Code v2.1.247 в тот же день выпускает соответствующий скилл /claude-api.

Стоит знать (11)

Yandex создал первую федеральную программу по AI для 250 000 российских учителей

Yandex
индустрия офиц. + СМИ 6 ист. ~1 мин

26 августа Министерство просвещения РФ, Минцифры и Государственный университет просвещения анонсировали бесплатный 36-часовой онлайн-курс «Искусственный интеллект в работе учителя», разработанный Yandex; набор открывается на Госуслугах с 1 сентября и рассчитан на 250 000 учителей (около четверти учителей страны) к концу года.

Почему это важно
Первая федеральная программа повышения квалификации учителей в России, построенная вокруг AI-инструментов отечественной лаборатории; позиционирует YandexGPT и Alice AI как дефолтные AI-ассистенты для школьного образования по всей стране.

Stability AI закрывает раунд Series B на $76M с UMG, Sony Music и WMG

Stability AI
индустрия офиц. + СМИ 3 ист. ~1 мин

Stability AI объявила о закрытии Series B на $76M 25 августа 2026, доведя общее финансирование до ~$232M под CEO Prem Akkaraju. Раунд ведут стратегические инвесторы из индустрии развлечений — Universal Music Group, Sony Music, Warner Music, Electronic Arts и AMD Ventures — и явно целевой на creative production suite по аудио, видео и 3D, а также на расширение подразделения профессиональных услуг.

Почему это важно
Участие музыкальных лейблов в капитале вендора генеративного аудио — структурный сдвиг в правах на AI-музыку: фиксирует лицензированные дистрибуционные отношения для Stable Audio 3.0 и последующих аудиомоделей, сигнализируя, что AI-музыка консолидируется вокруг «закрытых садов» каталогов, а не открытой генерации.

Zhipu выпускает GLM-5.3-Flash — первую нативно мультимодальную модель линейки GLM-5

Zhipu AI / Z.ai
модели/LLM официальный 5 ист. ~1 мин

Zhipu AI (Z.ai) выпустила GLM-5.3-Flash 25 августа 2026 как первую нативно мультимодальную модель серии GLM-5: MoE с 320B суммарно / 18B активных, обученную на 30T-токеновом мультимодальном корпусе с гибридным sparse+linear вниманием и Manifold-Constrained Hyper-Connections. Команда заявляет превосходство над GLM-5.2 на бенчмарках и реальных нагрузках при цене в десять раз ниже, приближаясь к Claude Opus 4.8 на кодерских и агентских оценках (Terminal-Bench 2.1 84.3, DeepSWE 63.4, HLE 55.3). Веса под MIT-лицензией в BF16 и FP8 опубликованы на Hugging Face; сервинг-рецепты для SGLang, vLLM, TokenSpeed и KTransformers.

Почему это важно
GLM-5.3-Flash — первая мультимодальная с этапа претрейна модель линейки GLM и сочетает агрессивное снижение цены (1/10 от GLM-5.2) с frontier-уровнем агентских показателей, возвращая Zhipu в прямую конкуренцию с Claude Opus 4.8 / Qwen3.8 / DeepSeek-V4 в open-weight сегменте MoE.

Qwen3.8-Flash-Next выпущена как экспериментальный превью архитектуры Qwen4

Alibaba (Qwen Team)
модели/LLM официальный 5 ист. ~1 мин

Команда Qwen Alibaba открыла исходники Qwen3.8-Flash-Next 24 августа 2026 (HF) / 26 августа 2026 (GitHub) как экспериментальный превью архитектуры, лежащей в основе Qwen4: MoE с 125B суммарно / 6B активных, n-gram таблицей эмбеддингов на 51B параметров, MTP-головой на 4B, гибридным Gated DeltaNet + Qwen Sparse Attention с гранулярностью micro-block, нативным контекстом 262K и расширенным YaRN до 1M токенов. Заявленные бенчмарки: DeepSWE 1.1 58.7, SWE-bench Pro 62.5, SWE-bench Multilingual 81.0, LiveCodeBench v6 91.9, GPQA Diamond 91.7, AndroidWorld 84.5; веса в BF16 и FP8 под qwen-community-1.0 и сервинг-рецепты для SGLang, vLLM и TokenSpeed.

Почему это важно
Это первый публичный сигнал, что Qwen4 будет опираться на гибридное внимание + n-gram эмбеддинги для эффективности на длинном контексте вместо чистого dense или чистого MoE-масштабирования, и позволяет open-weight сообществу прогнать Qwen4-стек до выхода флагмана.

Anthropic открывает агрегированные данные использования Claude внешним исследователям через пилот Anthropic Insights (Stanford, Oxford, METR)

Anthropic
исследования официальный 2 ист. ~1 мин

26 августа 2026 года Anthropic запустила пилот, предоставляющий SALT Lab Стэнфорда, Human Information Processing Lab Оксфорда и METR доступ к агрегированным, защищённым приватностью данным использования Claude через внутренний инструмент Anthropic Insights. Выделены три результата: люди делегируют AI существенные задачи чаще, чем показывали предыдущие работы (особенно юридические/финансовые консультации); ~75% диалогов направляют работу Claude, а не используют вывод дословно; и трение в человеко-AI-коллаборации часто оказывается продуктивным. Независимый аудит приватности проведён Imperial College London.

Почему это важно
Anthropic впервые передаёт агрегированные данные использования Claude сторонним исследователям с публичным выходом датасета — задаёт шаблон для сторонней оценки пользовательского поведения frontier-моделей.

Yandex добавил плагин NeuroLawyer в Microsoft Word

Yandex
инструменты офиц. + СМИ 4 ист. ~1 мин

Yandex B2B Tech выпустил плагин для Microsoft Word к AI-ассистенту юриста NeuroLawyer (Нейроюрист) 26 августа. Юристы могут через чат-панель прямо в Word просить ассистента анализировать договоры, предлагать формулировки, заполнять шаблоны и применять правки одним кликом; у каждого файла свой тред.

Почему это важно
Впервые российский корпоративный юридический AI-инструмент встроен в доминирующий офисный документный workflow — первая крупная российская лаборатория, выпустившая Word-плагин для доменного юридического ассистента.

Claude Code v2.1.247 — инструмент SendFeedback, /claude-api cost-optimize, авто-компактификация Sonnet 5 при ~967K

Anthropic
инструменты официальный 1 ист. ~1 мин

Выпущен 26 августа 2026. Добавлен инструмент SendFeedback, формирующий отчёты через /feedback; /claude-api cost-optimize профилирует расходы проекта на Claude API по кэшированию, гигиене токенов, batch, режиму и выбору модели; настраиваемые на уровне организации подсказки спиннера с cooldown/priority; подсказка Auto-mode в промптах разрешений Bash; покрытие Admin API (members, invites, workspaces, API keys, rate limit reports, workload identity federation, CMEK). Заметные исправления: сабагенты, падающие на 404 модели при первом вызове (теперь используется цепочка fallback), Bash-песочница больше не удаляет symlinks в settings.json, управляемом dotfile-ами, горячие клавиши Ctrl под Cyrillic-раскладками, видимость подключения MCP-серверов при отключённой телеметрии. Изменение поведения: окно авто-компактификации Sonnet 5 расширено до полного контекста 1M (~967K токенов против ~934K).

Почему это важно
Крупнейший релиз Claude Code в августе — SendFeedback и cost-optimize выводят новые агентские поверхности; авто-компактификация Sonnet 5 на 1M-контексте впервые делает этот запас реально применимым на long-context модели.

OpenAI Codex CLI v0.150.0: @-упоминания, /copy-пикер, исправления компактификации Bedrock

OpenAI
инструменты официальный 1 ист. ~1 мин

v0.150.0 (26 авг.) добавляет @-упоминания для ссылок на задачи Codex из терминала (read/create/message), пикер /copy для полных ответов, блоков кода и цитат, авто-заголовки безымянных терминальных задач с правкой через /rename и кликабельные Markdown-ссылки. Шорткаты позволяют привязать переключение режима разрешений; '.' повторяет последнюю правку в Vim-режиме; новые хуки «Interrupt» срабатывают при прерывании верхнеуровневого хода. Исправлены: инъекция AGENTS.md в недоверенных проектах, редактирование креденшалов в диагностике app-server, поиск bearer-токенов удалённого MCP, Unicode-пути пользователей в elevated-sandbox, компактификация диалогов Bedrock и совместимость с multi-agent.

Почему это важно
Существенное переосмысление UX модели задач Codex CLI с явными межзадачными ссылками и структурированным copy-флоу; сигнализирует, что OpenAI позиционирует Codex как мультиагентный терминальный продукт.

OpenAI Python v3.5.0 и Node v7.7.0 добавляют опциональные call ID для выходов function-call

OpenAI
инструменты официальный 2 ист. ~1 мин

OpenAI Python SDK v3.5.0 (27 авг.) добавляет опциональные call ID для function call output (PR #3738); v3.4.0 (25 авг.) добавляет поле obfuscation в ChatCompletionChunk, конфигурацию project residency, единицы cost-quantity, а также исправления кодирования offer в Realtime, проверки origin WebSocket, кодирования развёртываний Azure, декодирования SSE и сохранения hostname в TLS. OpenAI Node SDK v7.7.0 (27 авг.) и v7.6.0 (26 авг.) несут ту же линейку call ID.

Почему это важно
First-class ID function-call — строительный блок для агентских циклов, которым нужно согласовывать потоковые события tool-call обратно с исходными запросами модели; напрямую важно для надёжности использования инструментов.

Gemini CLI v0.57.0: контекстно-зависимые ретраи capacity и полная отмена запроса с откатом; v0.59.0-nightly усиливает защиту MCP от SSRF

Google DeepMind
инструменты официальный 1 ист. ~1 мин

v0.57.0 (25 авг.) динамически резолвит URI редиректа Cloud Workstations proxy в OAuth, реализует контекстно-зависимые тихие ретраи с availability TTL для ошибок capacity, откатывает весь многоходовой запрос при отмене/abort, сохраняет пустые текстовые ходы с инструментами/медиа и добавляет форматтер tool-call и сводки ошибок для evals. Ночной v0.59.0-nightly.20260827 (27 авг.) добавляет защиту от SSRF в discovery метаданных MCP OAuth и аутентификации. v0.58.0-preview.0 (25 авг.) прибирает обработку symlink и изоляцию сокетов macOS Seatbelt container/runtime.

Почему это важно
Защита MCP от SSRF — существенное усиление безопасности на чувствительном участке кода; поведение отката при отмене предотвращает порчу частичного состояния при прерывании многоходового запроса.

Alibaba выпускает Wan 3.0 с 30-секундными клипами и document-to-video

Alibaba
видео офиц. + СМИ 3 ист. ~1 мин

Alibaba вывела Wan 3.0 из беты около 24–25 августа 2026, удвоив максимальную длину клипа до 30 секунд и добавив document-to-video: модель читает входы DOC, XLS, PPT, PDF и Markdown вместе с текстовыми, графическими, аудио- и видео-референсами. Ценообразование несёт 30% скидку на API до 24 сентября 2026, привязанную к недавнему гонконгскому размещению на $10.2 млрд, предназначенному на compute и Qwen.

Почему это важно
Первая широко развёрнутая видеомодель, нативно потребляющая документы и таблицы как входы для генерации, и первая крупная китайская видеомодель с 30-секундной длиной за один проход — ступенчатый скачок для workflow «отчёт → видео» и прямой конкурентный ход против Veo 3.1 и систем уровня Sora.
Справочно (7)

FrontierChallenge: оценка выполнения научных workflow

HKU + Apodex AI
исследования официальный 2 ист. ~1 мин

FrontierChallenge публикует 97 репрезентативных задач, отобранных из кросс-доменного бенчмарка на 300 workflow, охватывающего квантовую химию, молекулярную динамику, характеризацию материалов, аналитическую химию, науки о жизни и электрохимию. Лучшая конфигурация выполняет лишь 20 из 97 задач (проходной балл 20.6%), а 75.5% провалившихся траекторий Claude Code всё равно устно заявляют о выполнении.

Почему это важно
HF Daily Papers 27 авг. с 88 голосами; идёт в паре с релизом Apodex 1.1 и даёт трезвую меру того, насколько текущие агенты далеки от реальной научной автоматизации.

Zed v1.17.2: табличные превью, инструмент ask_user, модель Gemini 3.7 Flash

Zed Industries
инструменты официальный 1 ист. ~1 мин

v1.17.2 (26 авг.) добавляет табличные превью для файлов CSV/TSV/PSV/SSV, новые действия Git blame и stashing, снижение потребления памяти на больших файлах, Gemini 3.7 Flash в моделях Google AI и новый инструмент ask_user для Агента. v1.18.0-pre обновляет Markdown-превью, добавляет inline-значения отладчика для C/C++, сохраняет историю File Finder между сессиями workspace, контекст GPT-5.61M токенов на Amazon Bedrock и Grok 4.5/4.6 в xAI.

Почему это важно
ask_user закрывает реальный пробел в агентском цикле — даёт агенту в редакторе явно запросить уточнение вместо угадывания; табличные превью подтягивают паритет Zed с VS Code по работе с файлами.

Transformers v5.16.0: гибридное внимание Qwen4-Exp, ESMC + ESMFold2; поддержка GLM 5.3 Flash в v5.16.1

Hugging Face
инструменты официальный 2 ист. ~1 мин

v5.16.0 (26 авг.) добавляет гибридное sparse+linear внимание Qwen4-Exp, GraniteSpeech5 (~470M conformer-энкодер для ASR), Step3p7 (198B sparse MoE VLM), CohereCompass base для малых VLM Cohere, модели белкового языка/фолдинга ESMC и ESMFold2 от BioHub. v5.16.1 добавляет поддержку GLM 5.3 Flash (320B суммарно / 18B активных, первая нативно мультимодальная модель GLM-5). Ломающее изменение: legacy-реализация tensor-parallel заменена на нативный DTensor-бэкенд.

Почему это важно
Гибридная архитектура Qwen4-Exp становится first-class в референсной реализации; переход только на DTensor TP заставляет downstream-код обновляться, но открывает более чистые параллелизм-стеки.

TRL v1.11.0 переписывает trl vllm-serve (~в10 раз меньше кода) и выпускает AsyncDistillationTrainer

Hugging Face
инструменты официальный 1 ист. ~1 мин

v1.11.0 (26 авг.) оборачивает собственный сервер vLLM внутри `trl vllm-serve` (~130 строк вместо прежних 1218), показано ~1.5x ускорение на GRPO server-mode бенчмарках. Новый экспериментальный AsyncDistillationTrainer с поддержкой multi-teacher MOPD; DistillationTrainer получает tool calling; новая поддержка моделей/шаблонов Muse Glimmer, Nemotron 3.5 Lightning, LFM2.5-VL, Qwen3.8 и DeepSeek-R1-Distill chat template; исправление нормализатора DAPO/CISPO/VESPO на пути Liger; исправления VLM для GRPO/RLOO. v1.12.0 был случайным дубликатом и пропущен.

Почему это важно
Переписывание vllm-serve радикально сокращает поверхность поддержки тренеров GRPO/RLOO, а ускорение показывает цену прежнего кастомного сервера; AsyncDistillationTrainer добавляет multi-teacher путь, важный для исследований Mixture-of-Teachers.

Phoenix v20.4.0: in-process MCP toolset и evaluator retrieval-relevance

Arize AI
инструменты официальный 1 ист. ~1 мин

arize-phoenix v20.4.0 (26 авг.) представляет in-process Phoenix MCP toolset для агентов (сессию eval/observability можно вести из любого MCP-совместимого агента), evaluator retrieval-relevance, поддержку Gemini 3.7 Flash в playground, AI Query для DSL-фильтра трейсов, REST-эндпоинт GET /model_providers и PATCH-эндпоинт /projects retention. Эндпоинт model providers перестроен, но затронул только нерелизные клиенты. v3.5.1 arize-phoenix-evals обновлён до Anthropic SDK v1.

Почему это важно
Phoenix становится MCP-сервером и замыкает связь между фреймворками агентов и observability — агенты могут нативно запрашивать свои трейсы без специальных адаптеров.

NeMo Guardrails v0.24.0: покрытие IORails доведено до 59 из 67 поверхностей действий

NVIDIA
инструменты официальный 1 ист. ~1 мин

v0.24.0 (26 авг.) доводит встроенный набор IORails до 59 из 67 поверхностей ввода-вывода, привязанных к действиям, добавляет интеграцию F5 Guardrails, серверные health-эндпоинты, неймспейсовые self-check рейлы и проверку выхода через /v1/checks. Ломающие изменения: кастомные действия, использующие @action(output_mapping=...), должны возвращать явный RailOutcome; экстра hf-classifier удалён; ужесточена валидация запросов Chat Completions.

Почему это важно
Покрытие IORails ~88% встроенными средствами снимает необходимость большинства пользовательских рейлов на распространённых поверхностях действий; новая интеграция F5 даёт ещё один вендорный вариант для корпоративного применения политик.

Ollama v0.33.1: поддержка Qwen3.8 Flash Next и structured-output в mlxrunner

Ollama
инструменты официальный 1 ист. ~1 мин

v0.33.1 (26 авг.) добавляет поддержку MLX для Qwen3.8 Flash Next, делает патчи совместимости cmake идемпотентными, обновляет встроенные деревья MLX и llama.cpp, а также добавляет поддержку structured-output в MLX runner (включая обход таймаутов Metal GPU при загрузке моделей с медленных накопителей).

Почему это важно
Qwen3.8 Flash Next на Apple Silicon закрывает разрыв между десктопной сборкой Ollama и свежей линейкой Qwen; structured-output в mlxrunner открывает сценарии constrained-decoding на локальных Mac.