Ежедневный дайджест

21 пункт · ~21 мин · Неделя 2026-W35

Обязательно к прочтению (10)

Tencent открывает исходники Hy4 preview: 770B / 49B-active MoE с Gated DSA + iHC, контекст 1M, Apache 2.0

Tencent
модели/LLM официальный 4 ист. ~1 мин

Команда Hy компании Tencent 27–28 августа 2026 года открыла исходники Hy4 preview и его FP8-варианта на Hugging Face, ModelScope, GitCode и CNB. Это MoE на 770B-total / 49B-active (78 слоёв, 1 dense + 77 MoE с 256 routed + 1 shared expert, top-8 routed), с нативным слоем MTP (10B/0.7B-active) для спекулятивного декодирования, Gated DeepSeek Sparse Attention с IndexCache для повторного использования разреженных индексов между слоями и identity Hyper-Connections (iHC) на остаточном пути. Нативный контекст — 1M токенов, словарь 120 832, веса под Apache 2.0. Внутренняя слепая оценка Tencent (163 эксперта, 203 инженерные задачи) ставит Hy4 preview немного впереди GLM-5.3 (2.99 против 2.92; 46.8% побед / 12.8% ничьих / 40.4% поражений) и Kimi K3 (2.99 против 2.94; 51.2% побед / 7.9% ничьих / 40.9% поражений).

Почему это важно
Первый флагманский MoE от Tencent с Gated DSA + iHC + нативным спекулятивным слоем MTP на 770B/49B-active; лицензия Apache 2.0 делает его крупнейшим полностью открытым китайским frontier-MoE-релизом окна, и он попадает в тренды Hugging Face в тот же день.

Долгосрочная аудиовизуальная генерация для persistent stories и интерактивных миров

исследования офиц. + СМИ 2 ист. ~1 мин

Представлен JoyAI-Echo-1.5 — унифицированная система аудиовизуальной генерации с двумя вариантами: длинный нарративный видеоряд и интерактивная 6-DoF world-модель, построенная на компонуемой памяти между шотами, речевых аудио-сигналах с фильтрацией и каузальном few-step генераторе, обученном с прогрессивным teacher forcing и Self-Gradient Forcing.

Почему это важно
HF Daily Papers за 27 августа — 1.96k апвоутов, с большим отрывом самая голосованная новая статья окна; показывает, что долгосрочная аудиовизуальная согласованность с управляемыми траекториями камеры теперь достижима для унифицированных систем генерации.

Anthropic открывает исследовательский превью Model Hardware Standard (MHS) для AI-агентов, управляющих лабораторным оборудованием, разработанный совместно с HHMI Janelia

Anthropic
исследования официальный 2 ист. ~1 мин

27 августа 2026 года Anthropic открыла исследовательский превью Model Hardware Standard (MHS) — общей спецификации, позволяющей AI-агентам безопасно управлять физическим лабораторным оборудованием: микроскопами, дозаторами жидкостей и роборуками. Спецификация разработана совместно с HHMI Janelia и, по имеющимся данным, сокращает время интеграции устройств с недель до часов; партнёры Genentech, University of Washington, Carnegie Mellon, HHMI Janelia, QuEra и Tetsuwan продемонстрировали ранние применения в drug discovery, дизайне белков, квантовых вычислениях и науках об окружающей среде.

Почему это важно
Первый отраслевой открытый аппаратный стандарт для автоматизации физических лабораторий на базе AI; в случае широкого распространения даёт Anthropic и Claude такой же позиционирующий слой, каким Android стал для мобильных устройств — интерфейс по умолчанию между frontier-моделями и фрагментированным рынком лабораторных приборов.

OpenCode v1.18.24 + v1.18.25: вход через Microsoft Entra ID для Azure, исправление кэша рассуждений Bedrock и очистка архива в Desktop

SST
инструменты официальный 2 ист. ~1 мин

v1.18.24 (28 августа): ответы с рассуждениями в Bedrock больше не попадают в нерепродуцируемые пустые сообщения кэша; провайдеры Azure теперь могут выполнять вход через Microsoft Entra ID через Azure CLI (без API-ключа); V1 читает поддерживаемые поля конфигурации V2, поэтому новые конфиги продолжают работать в смешанных сетапах; архивные сессии в Desktop немедленно пропадают из списка Home. v1.18.25 (28 августа) идёт следом и содержит дополнительный фикс: вход через Azure CLI работает без обязательного Bun.

Почему это важно
Первый релиз OpenCode с нативным входом через Azure Entra ID, устраняющим требование API-ключа — главную точку трения для корпоративных Azure-клиентов; исправление кэша рассуждений Bedrock прекращает давно существовавший путь потери данных на AWS-развёртываниях.

Согласованный релиз Anthropic SDK v1.2.0 (Python, TS, Go, Java, Ruby, C#): Files и Skills API переведены в GA, beta-заголовки сняты

Anthropic
инструменты официальный 2 ист. ~1 мин

Согласованный релиз 27 августа 2026 года: Python v1.2.0, TypeScript v0.122.0, Go v1.68.0, Java v2.59.0, Ruby v1.67.0 и C# v12.44.0. client.beta.files и client.beta.skills больше не отправляют устаревшие beta-заголовки files-api-2025-04-14 и skills-2025-10-02 и возвращают те же формы, что и client.files и client.skills; client.beta.skills.delete() теперь удаляет Skill вместе со всеми его версиями; beta-тип Messages BetaSkill (ссылка на container Skill) переименован в BetaContainerSkill. Исправления багов: подпись при загрузке бинарных файлов в Bedrock (#531), forward-compat аккумулятора событий сессий (#533), tools read view_range за пределами ограничения размера (#538), точное сохранение байтов файлов в наборах инструментов agent и memory (#540), webhook unwrap() теперь требует заголовки. В тот же день в Claude Console добавлены personal keys и service-account keys (с вариантами workspace-scoped и admin-endpoint). PHP 0.44.0 в этом раунде не обновлялся.

Почему это важно
Убирает последние закреплённые beta-заголовки с поверхностей Files и Skills, позволяя корпоративным клиентам избавиться от условных ветвей в коде и синхронизировать код SDK с тем же днём, когда Anthropic выпускает personal / service-account keys в Console — Files и Skills теперь полноценные во всех first-party SDK.

vLLM v0.28.0: перф-улучшения Kimi-K3, полная поддержка sparse-MLA DeepSeek-V4, зрелость Model Runner V2 и многоуровневая выгрузка KV-кэша

vLLM Project
инструменты официальный 1 ист. ~1 мин

Выпущен 28 августа 2026 года. 584 коммита от 270 контрибьюторов. Главное: context parallel в декодировании для Kimi-K3, объединённые ядра FlashKDA, активация SiTU для MegaMoE, sequence parallelism GEMM-RS, улучшение TTFT у DSpark примерно на 60% за счёт адаптивного спекулятивного бюджета; добавлена поддержка ROCm. DeepSeek-V4: сквозной sparse MLA для декодирования, MTP, DSpark; AMD Quark NVFP4; маппинги уровней рассуждений. Спекулятивное декодирование: DFlash2 с локальной свёрткой, confidence-планирование для DSpark. Model Runner V2: разделение E/P/D, выгрузка весов, многослойный MTP KV-кэш, CUDA-графы для энкодера, модели без внимания. Многоуровневая выгрузка KV-кэша с дисковым уровнем, OOT-менеджеры вторичных уровней, частичные результаты загрузки, метрики распределения по уровням. Frontend на Rust/gRPC получает мультимодальный инференс изображений и protobuf-схемы на Buf. Новые значения по умолчанию: max_num_batched_tokens с 8192 до 16384, prefix caching включён для Mamba, захват Blackwell CUDA graph — 1024. Ломающие изменения: bitsandbytes вынесен в OOT-плагин, базовая версия Transformers 5.15.0, calculate_kv_scales и override_attention_dtype удалены. Онлайн MXFP4/NVFP4; CPU-бэкенд MLA для DeepSeek-V2/V3.

Почему это важно
Крупнейший августовский релиз vLLM и первый, где новый стек Model Runner V2, полноценная многоуровневая выгрузка KV и перф Kimi-K3 в день-один стабильны вместе; DeepSeek-V4 со сквозным sparse MLA + DSpark делает vLLM фактическим inference-рантаймом для свежего китайского MoE-уровня.

Cline Desktop v0.0.20: первый релиз для Windows с подписанным установщиком, inline-изображениями в результатах инструментов и полноценным поиском по сессиям

Cline
инструменты официальный 1 ист. ~1 мин

Выпущен 28 августа 2026 года. Первый релиз Desktop для Windows: подписанный x64-установщик с автообновлениями; фоновые процессы больше не выбрасывают окна консоли; путь MCP-настроек откатывается на USERPROFILE, когда HOME не задан. Inline-рендеринг изображений в результатах инструментов с раскрытием по клику и каруселью для нескольких изображений. Полноценный поиск по сессиям через командную панель (Cmd/Ctrl+P) с серверно-ранжированными результатами. Новый шаг онбординга для GitHub. Запланированные задачи теперь сохраняются в ~/.cline/schedules и показывают финальный ответ по завершении. Бейджи провайдеров обновляются на лету после смены учётных данных. Вход в OpenAI Codex завершается быстро с понятной ошибкой, когда callback-порт 1455 занят. Восстановление из чекпойнта отказывается сбрасывать рабочее пространство, если после чекпойнта были сделаны коммиты.

Почему это важно
Windows-паритет — настоящее открытие для корпоративных развёртываний за пределами macOS; inline-рендеринг изображений и защита восстановления из чекпойнта напрямую улучшают циклы визуальной отладки и безопасного возобновления.

OpenAI Node SDK v7.8.0 добавляет compute_units в объекты usage, User-Agent для WebSocket и события аудит-лога

OpenAI
инструменты официальный 1 ист. ~1 мин

Выпущен 27 августа 2026 года. Добавлено поле compute_units в объекты usage Responses и Chat Completions. WebSocket-соединения теперь отправляют User-Agent по умолчанию и эмитят события аудит-лога жизненного цикла соединений, чтобы серверные логи и метрики могли идентифицировать клиент. Буфер обновления workload-identity ограничен сроком жизни токена, чтобы избежать преждевременного истечения. Усилена безопасность first-class workload credentials X.509. Ожидающие WebSocket корректно завершаются, даже когда слушатели бросают исключения. Определение multipart body теперь опирается только на собственные свойства, сокращая ложные срабатывания по prototype chain. Восстановлены нативные браузерные ESM-импорты.

Почему это важно
compute_units в usage — это хук для биллинговой наблюдаемости, который downstream-инструменты мониторинга затрат и токен-бюджетирования могут подхватить немедленно; User-Agent по умолчанию и события аудит-лога для WS заметно улучшают трассировку продакшен-стриминговых agent-loop'ов.

OpenAI Codex CLI v0.150.1 бэкпортирует исправление remote compaction: сохранённые изображения теперь учитываются в токен-бюджете

OpenAI
инструменты официальный 1 ист. ~1 мин

Выпущен 27 августа 2026 года (PR #41003, автор — rhan-oai). Remote compaction теперь по умолчанию учитывает сохранённые изображения в токен-бюджете и при необходимости подрезает более старые, вместо того чтобы молча выходить за лимиты сессии из-за удержанных изображений. Никаких новых функций, изменений команд или ломающих изменений API помимо этого единственного изменения.

Почему это важно
Бьёт по самому частому режиму скрытого переполнения в длинных сессиях Codex, удерживающих изображения (скриншоты, дизайн-моки, скриншоты из браузерных инструментов) — напрямую влияет на надёжность контекста в image-heavy воркфлоу.

Joy Future Academy JD.com выпускает JoyAI-Echo 1.5 — 5-минутную аудиовизуальную генерацию с памятью персонажа и голоса между шотами

JD.com (Joy Future Academy)
видео официальный 5 ист. ~1 мин

28 августа 2026 года Echo Team из Joy Future Academy JD выпустил JoyAI-Echo 1.5 (Echo-LongVideo) — унифицированную систему аудиовизуальной генерации на базе Lightricks LTX-2.3 с 8-шаговым DMD-сэмплером, парной кросс-модальной памятью (слоты изображения + аудио) для внешности персонажа и идентичности голоса и Gemma 3 (12B IT) в качестве текстового энкодера. Пайплайн reference-to-video принимает текстовый промпт, опциональное условие первого кадра и до семи упорядоченных референсных слотов памяти на шот и поставляется с профилями для потребительских GPU через layer-wise DiT offload и тайловое декодирование Video VAE. Веса выпущены в BF16, FP8 и FP4 на основной ветке open-source репозитория под LTX-2 Community License.

Почему это важно
Первая open-weights модель аудиовизуальной генерации минутной длины с явными слотами памяти персонажа и голоса — напрямую бьёт по use case «persistent story», который Veo 3.1, модели уровня Sora и Wan 3.0 оставляют открытым, и работает в связке с Director Agent для оркестрированных много-шотных пайплайнов.

Стоит знать (9)

Anthropic расширяет поддержку учёных: 10 000 мест Claude, расширенная программа AI for Science, партнёрство с правительством США по life sciences на Mythos

Anthropic
индустрия официальный 1 ист. ~1 мин

27 августа 2026 года Anthropic объявила о выделении 10 000 бесплатных и льготных мест подписки Claude для учёных по всему миру через новый командный тариф, расширив программу AI for Science за пределы биологии на дополнительные области исследований. Параллельно компания заключает партнёрство с правительством США по отдельной программе доступа, позволяющей специалистам в области life sciences использовать модели уровня Mythos для исследований и разработок.

Почему это важно
Открывает прямой доступ к самой мощной модели Anthropic (Mythos) в исследовательских процессах госсектора и примерно впятеро увеличивает исходное предложение AI for Science 2025 года; сигнализирует о том, что доступ к моделям уровня Mythos становится рычагом внутренней научной политики США, а не только коммерческим продуктом.

VoiceMem: стриминговая двухмозговая память для взаимодействия в реальном времени

исследования офиц. + СМИ 2 ист. ~1 мин

VoiceMem — стриминговая архитектура памяти с двумя мозгами для дуплексных речевых языковых моделей: информационное «левое полушарие» (индекс схема-сущность с кластерной эмерджентностью) и эмоциональное «правое полушарие» (независимые и кросс-сущностные узлы персоны с краткосрочной и долгосрочной эмоциональной атрибуцией), укладывающаяся в 134 ms silence-окно детекции голосовой активности.

Почему это важно
HF Daily Papers за 27 августа — 157 апвоутов; демонстрирует стриминговую память с латентностью ниже VAD с верифицированным выигрышем относительно Mem0 и недавно выпущенного ChatMem-Bench, задавая новую планку для разговорных голосовых агентов с памятью.

VGI-Bench: проверка визуального интеллекта в моделях генерации видео

исследования офиц. + СМИ 2 ист. ~1 мин

VGI-Bench объединяет 27 задач / 810 инстансов в двухуровневой таксономии доменов задач и скилл-тегов для проверки zero-shot визуальных рассуждений в сгенерированных видеокадрах. Самая сильная из оцененных генеративных систем (Seedance 2.0) набирает лишь 51.0% по предложенным критериям.

Почему это важно
HF Daily Papers за 27 августа — 143 апвоута; даёт принципиальную метрику для отличия world-model-подобных видеогенераторов от правдоподобных, но ненадёжных сэмплеров, и количественно оценивает, насколько текущие системы далеки от подлинного визуального рассуждения.

WarpSAC: на пути к вершине масштабируемого off-policy RL через переосмысление исследования и эксплуатации

исследования офиц. + СМИ 2 ист. ~1 мин

Диагностирует, что стабилизаторы off-policy (нормализация параметров, clipped double-Q) зависят от режима данных, и предлагает WarpSAC — семейство off-policy RL-алгоритмов, учитывающих режим, с Sample Weight Decay и age-biased replay. Заявлены +4.5% AUC относительно FlashSAC на 9 CPU-scale средах и +23.1% на 14 GPU-parallel средах.

Почему это важно
HF Daily Papers за 27 августа — 134 апвоута; даёт drop-in путь апгрейда для массивно параллельного обучения off-policy RL с отдельными вариантами для CPU-scale режима с ограниченными данными и GPU-scale режима с избытком данных.

Claude Code v2.1.248: режим --restricted, per-agent cacheTtl, /usage-credits, межсессионный обмен сообщениями и большой пакет исправлений и патчей безопасности

Anthropic
инструменты официальный 1 ист. ~1 мин

Выпущен 27 августа 2026 года (v2.1.248). Добавлен флаг --restricted (CLAUDE_CODE_RESTRICTED=1), отключающий встроенные инструменты для команд и кода, а также WebFetch, ограничивающий файловые инструменты рабочей директорией, отклоняющий bypassPermissions и игнорирующий все файлы настроек; экспериментальный per-agent cacheTtl (5m или 1h); переопределение --client-label для self-hosted-runner claude; диагностика server-managed-settings; /usage-credits для организаций AWS-Marketplace / self-serve / Enterprise-trial; межсессионные SendMessage/ListAgents на Bedrock, Vertex и Foundry, а также при выключенной телеметрии. Среди исправлений: баг обновления OAuth-токена, уничтожавший prompt-кэш (примерно раз в час в длинных сессиях), /ultrareview, выгружавший незакоммиченные правки в prod.env / *.tfvars / swap-файлы редактора, несколько падений claude agents, ввод в Windows-терминале и сопоставление @-упоминаний для корейской IME; размер промпта Workflow-инструмента сократился с ~5.7k до ~1k токенов.

Почему это важно
Режим --restricted закрывает давний пробел, при котором у администраторов не было встроенного способа разворачивать Claude Code среди недоверенных пользователей без отдельной песочницы; исправление свежести кэша и поверхность межсессионного обмена сообщениями — два самых высокоэффективных выигрыша для agent-loop в августовской серии Claude Code.

LangChain 1.4.0a1 вводит пространство имён langchain.mcp с MCPAdapter и elicitation через LangGraph interrupts

LangChain
инструменты официальный 1 ист. ~1 мин

Волна от 27 августа 2026 года: langchain 1.4.0a1 вводит новое пространство имён langchain.mcp с MCPAdapter и поддержкой elicitation через LangGraph interrupts; langchain-core 1.6.1 делает StructuredTool JSON-сериализуемым и пробрасывает информацию о шлюзе по пути ошибки; langchain-anthropic 1.7.0 поддерживает Anthropic SDK 1.0 и параметр top-level container для skills, а также метаданные ответа шлюза; langchain-fireworks 1.6.1 убирает блоки истории рассуждений и обновляет данные профилей моделей; langchain 1.3.18 исправляет PIIMiddleware-редактирование с сохранением формы content-block и баг индексирования в core для стриминга genai v1.

Почему это важно
Первый MCP-адаптер, поставляемый внутри пакета LangChain (а не отдельной интеграцией); проводка elicitation через LangGraph interrupts означает, что агенты теперь могут запрашивать уточнения изнутри мультиагентного графа, а не через хардкод промптов.

Gemini CLI v0.59.0-nightly.20260827 исправляет SSRF в MCP OAuth metadata discovery и аутентификации

Google DeepMind
инструменты официальный 1 ист. ~1 мин

Выпущен 27 августа 2026 года (PR #29081 от @josebalius). fix(core): предотвращение SSRF в MCP OAuth metadata discovery и аутентификации. Закрывает уязвимость Server-Side Request Forgery в OAuth-флоу Model Context Protocol, покрывающую шаги metadata discovery и аутентификации. 28 августа выпущен следом v0.59.0-nightly.20260828.g3c311beac без публичного ченджлога.

Почему это важно
Усиливает MCP OAuth-путь на критичной для безопасности ветке кода, через которую атакующий может пивотить серверные запросы через CLI; дополняет работу v0.57.0 от 25 августа, освещённую в 2026-08-27, и завершает раунд улучшений безопасности MCP.

Ollama v0.33.2 (pre-release) восстанавливает системную тёмную тему и поддерживает работу прокси при изменениях каталога моделей

Ollama
инструменты официальный 1 ист. ~1 мин

Pre-release от 27 августа 2026 года. Восстанавливает обработку системной тёмной темы в приложении, поддерживает обслуживание запросов прокси при изменении базового каталога моделей в середине сессии и синхронизирует macOS app handoff.

Почему это важно
Быстрый фоллоу-ап к v0.33.1 (освещён в 2026-08-27), адресующий видимую UX-регрессию, внесённую вместе с поддержкой Qwen3.8-Flash-Next MLX; актуально для любого локального пользователя Ollama Desktop на macOS.

Релиз LangGraph SDK v0.4.4

LangChain
инструменты официальный 1 ист. ~1 мин

Выпущен 27 августа 2026 года (langgraph-sdk==0.4.4). Подробного публичного ченджлога в GitHub-релизе нет; идёт следом за v0.4.3 от 19 августа и попадает в ту же волну 27 августа, что и работа над пространством имён langchain.mcp, зависящая от LangGraph interrupts для elicitation.

Почему это важно
Парный релиз к langchain.mcp MCPAdapter (elicitation через LangGraph interrupts), выпущенный в тот же день; без этого бампа SDK путь MCP elicitation был бы недоступен для потребителей.
Справочно (2)

PAWBench: как далеко мы от вероятностно согласованного world-моделирования?

исследования офиц. + СМИ 2 ист. ~1 мин

Формализует «вероятностную согласованность» как дистрибутивный критерий для видеогенераторов, действующих как стохастические сэмплеры мировой динамики, и выпускает PAWBench + PAWEval на 50 сценариях и 11 системах. Ни один из оцененных генераторов стабильно не совпадает с референсными вероятностями при сохранении диапазона допустимых поведений.

Почему это важно
Самая голосованная статья HF Daily Papers за 28 августа — 43 апвоута; смещает разговор об оценке world-моделей с правдоподобия отдельных видео к восстановлению распределений, обнажая системный режим отказа современных генеративных видеосистем.

llama.cpp b10660 добавляет архитектуру Qwen3.8-Flash-Next (qwen4exp): hyper-connections, gated delta net, MoE, PLE n-gram embedding

llama.cpp
инструменты официальный 1 ист. ~1 мин

Выпущен 27 августа 2026 года (PR #27742). Добавлена поддержка архитектуры Qwen3.8-Flash-Next (qwen4exp), включая hyper-connections, gated delta net, MoE, PLE n-gram embedding и опциональный indexer key cache в llama_memory_hybrid. В сопутствующих сборках b10656-b10659: ограничение рабочей памяти квантизатора, спекулятивное декодирование DFlash2 с локальной свёрткой, OpenCL-ядра MoE (q4_0_q8_1 и mxfp4_q8_1), бандлинг HIP-runtime DLL на Windows ROCm и CI-изменение, собирающее только ggml-hip бэкенд на windows-rocm.

Почему это важно
Первый inference-рантайм за пределами собственной референсной реализации Qwen, нативно запускающий Qwen3.8-Flash-Next — превью экспериментальной архитектуры Qwen4, освещённое в дайджесте от 2026-08-27 — что делает новую архитектуру сразу запускаемой на Apple Silicon, ROCm, CUDA и CPU.