Ежедневный дайджест
23 пункта · ~23 мин · Неделя 2026-W35
Обязательно к прочтению (5)
IBM выпускает reasoning-LLM Granite 4.2 (3B/8B/30B, Apache 2.0, контекст 512K), обученные на ~15T токенов с GRPO RL на GB200 NVL72
IBM25 августа 2026 года IBM выпустила Granite 4.2 — первое семейство плотных decoder-only reasoning-LLM в размерах 3B/8B/30B под Apache 2.0. Предобучено с нуля на ~15T токенов по пятифазной стратегии с расширением контекста до 512K; SFT на ~7.2M примеров (31.6% агентских, 68.4% неагентских); многоступенчатый асинхронный GRPO RL — фундаментальный RLVR для всех размеров, агентский RL (SWE → Terminal → Search) для 8B/30B, RLHF для безопасности и длины рассуждений. Режимы thinking / non-thinking / low-effort; нативный OpenAI-совместимый tool-calling API; 12 языков. Обучено на кластере NVIDIA GB200 NVL72 в CoreWeave с использованием NeMo-RL и NeMo-Gym. Квантизации FP8/NVFP4/MXFP4 и 14 вариантов GGUF. 30B достигает 89.17 на AIME25, 57.00 на SWE-Bench Verified, 62.00 на τ³-bench.
GigaBrain-0.7: масштабирование embodied foundation-моделей к эмерджентным способностям через трёхсистемную архитектуру
GigaAIGigaBrain-0.7 — vision-language-action foundation-модель, объединяющая понимание, предсказание и действие через трёхсистемную архитектуру, масштабированную на более чем 37 000 часах гетерогенных embodied-данных. В статье сообщается о существенно улучшенной генерализации на разнообразных робототехнических платформах и постоянном улучшении через трёхсистемное разделение.
Apodex 1.1: масштабирование агентского интеллекта для сложной работы
Apodex AIApodex 1.1 представляет фреймворк «working capability» для долгосрочных реальных задач, масштабируемый по двум осям: Environment Scaling (среды файлов, поиска, кода) и Agentic Coordination Scaling (декомпозиция задач, параллельная делегация, асинхронная интеграция, репланирование) под общим исполняющим харнессом и AgentOS. Вариант 35B «Mini» позволяет локальное развёртывание при соответствии frontier-уровню производительности на финансах, научных исследованиях, математике, коде и поиске.
ClawProBench: trace-aware оценка AI-агентов с покрытием в рантайме
ClawProBench — trace-aware бенчмарк для AI-агентов со stateful-рантаймом, инстанцированный на OpenClaw. Сочетает полный профиль из 102 сценариев с замороженным холдаутом из 68 и использует safety-gated формулу скоринга, выведенную из трейсов исполнения; оценено 68 конфигураций на полном профиле и 37 на холдауте.
Скоординированный релиз SDK Anthropic добавляет thinking-display-updates beta и Organization API в Python, TS, Go, Java, .NET, Ruby, PHP
AnthropicСкоординированные релизы 26 августа по Python v1.1.0, TypeScript v0.121.0, Go v1.67.0, Java v2.58.0, .NET (Anthropic v12.43.0 + Bedrock v0.13.0), Ruby v1.66.0 и PHP v0.44.0 — везде добавлен beta-режим thinking-display «updates», эндпоинты Organization API под client.beta.organization, недостающие значения enum anthropic-beta и исправление на стороне tools, удерживающее runner при pause_turn. Python/Go/Ruby добавляют недостаточную exhaustiveness ToParam, TypeScript получает поддержку Standard Schema для structured outputs.
Стоит знать (11)
Yandex создал первую федеральную программу по AI для 250 000 российских учителей
Yandex26 августа Министерство просвещения РФ, Минцифры и Государственный университет просвещения анонсировали бесплатный 36-часовой онлайн-курс «Искусственный интеллект в работе учителя», разработанный Yandex; набор открывается на Госуслугах с 1 сентября и рассчитан на 250 000 учителей (около четверти учителей страны) к концу года.
Stability AI закрывает раунд Series B на $76M с UMG, Sony Music и WMG
Stability AIStability AI объявила о закрытии Series B на $76M 25 августа 2026, доведя общее финансирование до ~$232M под CEO Prem Akkaraju. Раунд ведут стратегические инвесторы из индустрии развлечений — Universal Music Group, Sony Music, Warner Music, Electronic Arts и AMD Ventures — и явно целевой на creative production suite по аудио, видео и 3D, а также на расширение подразделения профессиональных услуг.
Zhipu выпускает GLM-5.3-Flash — первую нативно мультимодальную модель линейки GLM-5
Zhipu AI / Z.aiZhipu AI (Z.ai) выпустила GLM-5.3-Flash 25 августа 2026 как первую нативно мультимодальную модель серии GLM-5: MoE с 320B суммарно / 18B активных, обученную на 30T-токеновом мультимодальном корпусе с гибридным sparse+linear вниманием и Manifold-Constrained Hyper-Connections. Команда заявляет превосходство над GLM-5.2 на бенчмарках и реальных нагрузках при цене в десять раз ниже, приближаясь к Claude Opus 4.8 на кодерских и агентских оценках (Terminal-Bench 2.1 84.3, DeepSWE 63.4, HLE 55.3). Веса под MIT-лицензией в BF16 и FP8 опубликованы на Hugging Face; сервинг-рецепты для SGLang, vLLM, TokenSpeed и KTransformers.
Qwen3.8-Flash-Next выпущена как экспериментальный превью архитектуры Qwen4
Alibaba (Qwen Team)Команда Qwen Alibaba открыла исходники Qwen3.8-Flash-Next 24 августа 2026 (HF) / 26 августа 2026 (GitHub) как экспериментальный превью архитектуры, лежащей в основе Qwen4: MoE с 125B суммарно / 6B активных, n-gram таблицей эмбеддингов на 51B параметров, MTP-головой на 4B, гибридным Gated DeltaNet + Qwen Sparse Attention с гранулярностью micro-block, нативным контекстом 262K и расширенным YaRN до 1M токенов. Заявленные бенчмарки: DeepSWE 1.1 58.7, SWE-bench Pro 62.5, SWE-bench Multilingual 81.0, LiveCodeBench v6 91.9, GPQA Diamond 91.7, AndroidWorld 84.5; веса в BF16 и FP8 под qwen-community-1.0 и сервинг-рецепты для SGLang, vLLM и TokenSpeed.
Anthropic открывает агрегированные данные использования Claude внешним исследователям через пилот Anthropic Insights (Stanford, Oxford, METR)
Anthropic26 августа 2026 года Anthropic запустила пилот, предоставляющий SALT Lab Стэнфорда, Human Information Processing Lab Оксфорда и METR доступ к агрегированным, защищённым приватностью данным использования Claude через внутренний инструмент Anthropic Insights. Выделены три результата: люди делегируют AI существенные задачи чаще, чем показывали предыдущие работы (особенно юридические/финансовые консультации); ~75% диалогов направляют работу Claude, а не используют вывод дословно; и трение в человеко-AI-коллаборации часто оказывается продуктивным. Независимый аудит приватности проведён Imperial College London.
Yandex добавил плагин NeuroLawyer в Microsoft Word
YandexYandex B2B Tech выпустил плагин для Microsoft Word к AI-ассистенту юриста NeuroLawyer (Нейроюрист) 26 августа. Юристы могут через чат-панель прямо в Word просить ассистента анализировать договоры, предлагать формулировки, заполнять шаблоны и применять правки одним кликом; у каждого файла свой тред.
Claude Code v2.1.247 — инструмент SendFeedback, /claude-api cost-optimize, авто-компактификация Sonnet 5 при ~967K
AnthropicВыпущен 26 августа 2026. Добавлен инструмент SendFeedback, формирующий отчёты через /feedback; /claude-api cost-optimize профилирует расходы проекта на Claude API по кэшированию, гигиене токенов, batch, режиму и выбору модели; настраиваемые на уровне организации подсказки спиннера с cooldown/priority; подсказка Auto-mode в промптах разрешений Bash; покрытие Admin API (members, invites, workspaces, API keys, rate limit reports, workload identity federation, CMEK). Заметные исправления: сабагенты, падающие на 404 модели при первом вызове (теперь используется цепочка fallback), Bash-песочница больше не удаляет symlinks в settings.json, управляемом dotfile-ами, горячие клавиши Ctrl под Cyrillic-раскладками, видимость подключения MCP-серверов при отключённой телеметрии. Изменение поведения: окно авто-компактификации Sonnet 5 расширено до полного контекста 1M (~967K токенов против ~934K).
OpenAI Codex CLI v0.150.0: @-упоминания, /copy-пикер, исправления компактификации Bedrock
OpenAIv0.150.0 (26 авг.) добавляет @-упоминания для ссылок на задачи Codex из терминала (read/create/message), пикер /copy для полных ответов, блоков кода и цитат, авто-заголовки безымянных терминальных задач с правкой через /rename и кликабельные Markdown-ссылки. Шорткаты позволяют привязать переключение режима разрешений; '.' повторяет последнюю правку в Vim-режиме; новые хуки «Interrupt» срабатывают при прерывании верхнеуровневого хода. Исправлены: инъекция AGENTS.md в недоверенных проектах, редактирование креденшалов в диагностике app-server, поиск bearer-токенов удалённого MCP, Unicode-пути пользователей в elevated-sandbox, компактификация диалогов Bedrock и совместимость с multi-agent.
OpenAI Python v3.5.0 и Node v7.7.0 добавляют опциональные call ID для выходов function-call
OpenAIOpenAI Python SDK v3.5.0 (27 авг.) добавляет опциональные call ID для function call output (PR #3738); v3.4.0 (25 авг.) добавляет поле obfuscation в ChatCompletionChunk, конфигурацию project residency, единицы cost-quantity, а также исправления кодирования offer в Realtime, проверки origin WebSocket, кодирования развёртываний Azure, декодирования SSE и сохранения hostname в TLS. OpenAI Node SDK v7.7.0 (27 авг.) и v7.6.0 (26 авг.) несут ту же линейку call ID.
Gemini CLI v0.57.0: контекстно-зависимые ретраи capacity и полная отмена запроса с откатом; v0.59.0-nightly усиливает защиту MCP от SSRF
Google DeepMindv0.57.0 (25 авг.) динамически резолвит URI редиректа Cloud Workstations proxy в OAuth, реализует контекстно-зависимые тихие ретраи с availability TTL для ошибок capacity, откатывает весь многоходовой запрос при отмене/abort, сохраняет пустые текстовые ходы с инструментами/медиа и добавляет форматтер tool-call и сводки ошибок для evals. Ночной v0.59.0-nightly.20260827 (27 авг.) добавляет защиту от SSRF в discovery метаданных MCP OAuth и аутентификации. v0.58.0-preview.0 (25 авг.) прибирает обработку symlink и изоляцию сокетов macOS Seatbelt container/runtime.
Alibaba выпускает Wan 3.0 с 30-секундными клипами и document-to-video
AlibabaAlibaba вывела Wan 3.0 из беты около 24–25 августа 2026, удвоив максимальную длину клипа до 30 секунд и добавив document-to-video: модель читает входы DOC, XLS, PPT, PDF и Markdown вместе с текстовыми, графическими, аудио- и видео-референсами. Ценообразование несёт 30% скидку на API до 24 сентября 2026, привязанную к недавнему гонконгскому размещению на $10.2 млрд, предназначенному на compute и Qwen.
Справочно (7)
FrontierChallenge: оценка выполнения научных workflow
HKU + Apodex AIFrontierChallenge публикует 97 репрезентативных задач, отобранных из кросс-доменного бенчмарка на 300 workflow, охватывающего квантовую химию, молекулярную динамику, характеризацию материалов, аналитическую химию, науки о жизни и электрохимию. Лучшая конфигурация выполняет лишь 20 из 97 задач (проходной балл 20.6%), а 75.5% провалившихся траекторий Claude Code всё равно устно заявляют о выполнении.
Zed v1.17.2: табличные превью, инструмент ask_user, модель Gemini 3.7 Flash
Zed Industriesv1.17.2 (26 авг.) добавляет табличные превью для файлов CSV/TSV/PSV/SSV, новые действия Git blame и stashing, снижение потребления памяти на больших файлах, Gemini 3.7 Flash в моделях Google AI и новый инструмент ask_user для Агента. v1.18.0-pre обновляет Markdown-превью, добавляет inline-значения отладчика для C/C++, сохраняет историю File Finder между сессиями workspace, контекст GPT-5.61M токенов на Amazon Bedrock и Grok 4.5/4.6 в xAI.
Transformers v5.16.0: гибридное внимание Qwen4-Exp, ESMC + ESMFold2; поддержка GLM 5.3 Flash в v5.16.1
Hugging Facev5.16.0 (26 авг.) добавляет гибридное sparse+linear внимание Qwen4-Exp, GraniteSpeech5 (~470M conformer-энкодер для ASR), Step3p7 (198B sparse MoE VLM), CohereCompass base для малых VLM Cohere, модели белкового языка/фолдинга ESMC и ESMFold2 от BioHub. v5.16.1 добавляет поддержку GLM 5.3 Flash (320B суммарно / 18B активных, первая нативно мультимодальная модель GLM-5). Ломающее изменение: legacy-реализация tensor-parallel заменена на нативный DTensor-бэкенд.
TRL v1.11.0 переписывает trl vllm-serve (~в10 раз меньше кода) и выпускает AsyncDistillationTrainer
Hugging Facev1.11.0 (26 авг.) оборачивает собственный сервер vLLM внутри `trl vllm-serve` (~130 строк вместо прежних 1218), показано ~1.5x ускорение на GRPO server-mode бенчмарках. Новый экспериментальный AsyncDistillationTrainer с поддержкой multi-teacher MOPD; DistillationTrainer получает tool calling; новая поддержка моделей/шаблонов Muse Glimmer, Nemotron 3.5 Lightning, LFM2.5-VL, Qwen3.8 и DeepSeek-R1-Distill chat template; исправление нормализатора DAPO/CISPO/VESPO на пути Liger; исправления VLM для GRPO/RLOO. v1.12.0 был случайным дубликатом и пропущен.
Phoenix v20.4.0: in-process MCP toolset и evaluator retrieval-relevance
Arize AIarize-phoenix v20.4.0 (26 авг.) представляет in-process Phoenix MCP toolset для агентов (сессию eval/observability можно вести из любого MCP-совместимого агента), evaluator retrieval-relevance, поддержку Gemini 3.7 Flash в playground, AI Query для DSL-фильтра трейсов, REST-эндпоинт GET /model_providers и PATCH-эндпоинт /projects retention. Эндпоинт model providers перестроен, но затронул только нерелизные клиенты. v3.5.1 arize-phoenix-evals обновлён до Anthropic SDK v1.
NeMo Guardrails v0.24.0: покрытие IORails доведено до 59 из 67 поверхностей действий
NVIDIAv0.24.0 (26 авг.) доводит встроенный набор IORails до 59 из 67 поверхностей ввода-вывода, привязанных к действиям, добавляет интеграцию F5 Guardrails, серверные health-эндпоинты, неймспейсовые self-check рейлы и проверку выхода через /v1/checks. Ломающие изменения: кастомные действия, использующие @action(output_mapping=...), должны возвращать явный RailOutcome; экстра hf-classifier удалён; ужесточена валидация запросов Chat Completions.
Ollama v0.33.1: поддержка Qwen3.8 Flash Next и structured-output в mlxrunner
Ollamav0.33.1 (26 авг.) добавляет поддержку MLX для Qwen3.8 Flash Next, делает патчи совместимости cmake идемпотентными, обновляет встроенные деревья MLX и llama.cpp, а также добавляет поддержку structured-output в MLX runner (включая обход таймаутов Metal GPU при загрузке моделей с медленных накопителей).