Ежедневный дайджест
21 пункт · ~21 мин · Неделя 2026-W35
Обязательно к прочтению (10)
Tencent открывает исходники Hy4 preview: 770B / 49B-active MoE с Gated DSA + iHC, контекст 1M, Apache 2.0
TencentКоманда Hy компании Tencent 27–28 августа 2026 года открыла исходники Hy4 preview и его FP8-варианта на Hugging Face, ModelScope, GitCode и CNB. Это MoE на 770B-total / 49B-active (78 слоёв, 1 dense + 77 MoE с 256 routed + 1 shared expert, top-8 routed), с нативным слоем MTP (10B/0.7B-active) для спекулятивного декодирования, Gated DeepSeek Sparse Attention с IndexCache для повторного использования разреженных индексов между слоями и identity Hyper-Connections (iHC) на остаточном пути. Нативный контекст — 1M токенов, словарь 120 832, веса под Apache 2.0. Внутренняя слепая оценка Tencent (163 эксперта, 203 инженерные задачи) ставит Hy4 preview немного впереди GLM-5.3 (2.99 против 2.92; 46.8% побед / 12.8% ничьих / 40.4% поражений) и Kimi K3 (2.99 против 2.94; 51.2% побед / 7.9% ничьих / 40.9% поражений).
Долгосрочная аудиовизуальная генерация для persistent stories и интерактивных миров
Представлен JoyAI-Echo-1.5 — унифицированная система аудиовизуальной генерации с двумя вариантами: длинный нарративный видеоряд и интерактивная 6-DoF world-модель, построенная на компонуемой памяти между шотами, речевых аудио-сигналах с фильтрацией и каузальном few-step генераторе, обученном с прогрессивным teacher forcing и Self-Gradient Forcing.
Anthropic открывает исследовательский превью Model Hardware Standard (MHS) для AI-агентов, управляющих лабораторным оборудованием, разработанный совместно с HHMI Janelia
Anthropic27 августа 2026 года Anthropic открыла исследовательский превью Model Hardware Standard (MHS) — общей спецификации, позволяющей AI-агентам безопасно управлять физическим лабораторным оборудованием: микроскопами, дозаторами жидкостей и роборуками. Спецификация разработана совместно с HHMI Janelia и, по имеющимся данным, сокращает время интеграции устройств с недель до часов; партнёры Genentech, University of Washington, Carnegie Mellon, HHMI Janelia, QuEra и Tetsuwan продемонстрировали ранние применения в drug discovery, дизайне белков, квантовых вычислениях и науках об окружающей среде.
OpenCode v1.18.24 + v1.18.25: вход через Microsoft Entra ID для Azure, исправление кэша рассуждений Bedrock и очистка архива в Desktop
SSTv1.18.24 (28 августа): ответы с рассуждениями в Bedrock больше не попадают в нерепродуцируемые пустые сообщения кэша; провайдеры Azure теперь могут выполнять вход через Microsoft Entra ID через Azure CLI (без API-ключа); V1 читает поддерживаемые поля конфигурации V2, поэтому новые конфиги продолжают работать в смешанных сетапах; архивные сессии в Desktop немедленно пропадают из списка Home. v1.18.25 (28 августа) идёт следом и содержит дополнительный фикс: вход через Azure CLI работает без обязательного Bun.
Согласованный релиз Anthropic SDK v1.2.0 (Python, TS, Go, Java, Ruby, C#): Files и Skills API переведены в GA, beta-заголовки сняты
AnthropicСогласованный релиз 27 августа 2026 года: Python v1.2.0, TypeScript v0.122.0, Go v1.68.0, Java v2.59.0, Ruby v1.67.0 и C# v12.44.0. client.beta.files и client.beta.skills больше не отправляют устаревшие beta-заголовки files-api-2025-04-14 и skills-2025-10-02 и возвращают те же формы, что и client.files и client.skills; client.beta.skills.delete() теперь удаляет Skill вместе со всеми его версиями; beta-тип Messages BetaSkill (ссылка на container Skill) переименован в BetaContainerSkill. Исправления багов: подпись при загрузке бинарных файлов в Bedrock (#531), forward-compat аккумулятора событий сессий (#533), tools read view_range за пределами ограничения размера (#538), точное сохранение байтов файлов в наборах инструментов agent и memory (#540), webhook unwrap() теперь требует заголовки. В тот же день в Claude Console добавлены personal keys и service-account keys (с вариантами workspace-scoped и admin-endpoint). PHP 0.44.0 в этом раунде не обновлялся.
vLLM v0.28.0: перф-улучшения Kimi-K3, полная поддержка sparse-MLA DeepSeek-V4, зрелость Model Runner V2 и многоуровневая выгрузка KV-кэша
vLLM ProjectВыпущен 28 августа 2026 года. 584 коммита от 270 контрибьюторов. Главное: context parallel в декодировании для Kimi-K3, объединённые ядра FlashKDA, активация SiTU для MegaMoE, sequence parallelism GEMM-RS, улучшение TTFT у DSpark примерно на 60% за счёт адаптивного спекулятивного бюджета; добавлена поддержка ROCm. DeepSeek-V4: сквозной sparse MLA для декодирования, MTP, DSpark; AMD Quark NVFP4; маппинги уровней рассуждений. Спекулятивное декодирование: DFlash2 с локальной свёрткой, confidence-планирование для DSpark. Model Runner V2: разделение E/P/D, выгрузка весов, многослойный MTP KV-кэш, CUDA-графы для энкодера, модели без внимания. Многоуровневая выгрузка KV-кэша с дисковым уровнем, OOT-менеджеры вторичных уровней, частичные результаты загрузки, метрики распределения по уровням. Frontend на Rust/gRPC получает мультимодальный инференс изображений и protobuf-схемы на Buf. Новые значения по умолчанию: max_num_batched_tokens с 8192 до 16384, prefix caching включён для Mamba, захват Blackwell CUDA graph — 1024. Ломающие изменения: bitsandbytes вынесен в OOT-плагин, базовая версия Transformers 5.15.0, calculate_kv_scales и override_attention_dtype удалены. Онлайн MXFP4/NVFP4; CPU-бэкенд MLA для DeepSeek-V2/V3.
Cline Desktop v0.0.20: первый релиз для Windows с подписанным установщиком, inline-изображениями в результатах инструментов и полноценным поиском по сессиям
ClineВыпущен 28 августа 2026 года. Первый релиз Desktop для Windows: подписанный x64-установщик с автообновлениями; фоновые процессы больше не выбрасывают окна консоли; путь MCP-настроек откатывается на USERPROFILE, когда HOME не задан. Inline-рендеринг изображений в результатах инструментов с раскрытием по клику и каруселью для нескольких изображений. Полноценный поиск по сессиям через командную панель (Cmd/Ctrl+P) с серверно-ранжированными результатами. Новый шаг онбординга для GitHub. Запланированные задачи теперь сохраняются в ~/.cline/schedules и показывают финальный ответ по завершении. Бейджи провайдеров обновляются на лету после смены учётных данных. Вход в OpenAI Codex завершается быстро с понятной ошибкой, когда callback-порт 1455 занят. Восстановление из чекпойнта отказывается сбрасывать рабочее пространство, если после чекпойнта были сделаны коммиты.
OpenAI Node SDK v7.8.0 добавляет compute_units в объекты usage, User-Agent для WebSocket и события аудит-лога
OpenAIВыпущен 27 августа 2026 года. Добавлено поле compute_units в объекты usage Responses и Chat Completions. WebSocket-соединения теперь отправляют User-Agent по умолчанию и эмитят события аудит-лога жизненного цикла соединений, чтобы серверные логи и метрики могли идентифицировать клиент. Буфер обновления workload-identity ограничен сроком жизни токена, чтобы избежать преждевременного истечения. Усилена безопасность first-class workload credentials X.509. Ожидающие WebSocket корректно завершаются, даже когда слушатели бросают исключения. Определение multipart body теперь опирается только на собственные свойства, сокращая ложные срабатывания по prototype chain. Восстановлены нативные браузерные ESM-импорты.
OpenAI Codex CLI v0.150.1 бэкпортирует исправление remote compaction: сохранённые изображения теперь учитываются в токен-бюджете
OpenAIВыпущен 27 августа 2026 года (PR #41003, автор — rhan-oai). Remote compaction теперь по умолчанию учитывает сохранённые изображения в токен-бюджете и при необходимости подрезает более старые, вместо того чтобы молча выходить за лимиты сессии из-за удержанных изображений. Никаких новых функций, изменений команд или ломающих изменений API помимо этого единственного изменения.
Joy Future Academy JD.com выпускает JoyAI-Echo 1.5 — 5-минутную аудиовизуальную генерацию с памятью персонажа и голоса между шотами
JD.com (Joy Future Academy)28 августа 2026 года Echo Team из Joy Future Academy JD выпустил JoyAI-Echo 1.5 (Echo-LongVideo) — унифицированную систему аудиовизуальной генерации на базе Lightricks LTX-2.3 с 8-шаговым DMD-сэмплером, парной кросс-модальной памятью (слоты изображения + аудио) для внешности персонажа и идентичности голоса и Gemma 3 (12B IT) в качестве текстового энкодера. Пайплайн reference-to-video принимает текстовый промпт, опциональное условие первого кадра и до семи упорядоченных референсных слотов памяти на шот и поставляется с профилями для потребительских GPU через layer-wise DiT offload и тайловое декодирование Video VAE. Веса выпущены в BF16, FP8 и FP4 на основной ветке open-source репозитория под LTX-2 Community License.
Стоит знать (9)
Anthropic расширяет поддержку учёных: 10 000 мест Claude, расширенная программа AI for Science, партнёрство с правительством США по life sciences на Mythos
Anthropic27 августа 2026 года Anthropic объявила о выделении 10 000 бесплатных и льготных мест подписки Claude для учёных по всему миру через новый командный тариф, расширив программу AI for Science за пределы биологии на дополнительные области исследований. Параллельно компания заключает партнёрство с правительством США по отдельной программе доступа, позволяющей специалистам в области life sciences использовать модели уровня Mythos для исследований и разработок.
VoiceMem: стриминговая двухмозговая память для взаимодействия в реальном времени
VoiceMem — стриминговая архитектура памяти с двумя мозгами для дуплексных речевых языковых моделей: информационное «левое полушарие» (индекс схема-сущность с кластерной эмерджентностью) и эмоциональное «правое полушарие» (независимые и кросс-сущностные узлы персоны с краткосрочной и долгосрочной эмоциональной атрибуцией), укладывающаяся в 134 ms silence-окно детекции голосовой активности.
VGI-Bench: проверка визуального интеллекта в моделях генерации видео
VGI-Bench объединяет 27 задач / 810 инстансов в двухуровневой таксономии доменов задач и скилл-тегов для проверки zero-shot визуальных рассуждений в сгенерированных видеокадрах. Самая сильная из оцененных генеративных систем (Seedance 2.0) набирает лишь 51.0% по предложенным критериям.
WarpSAC: на пути к вершине масштабируемого off-policy RL через переосмысление исследования и эксплуатации
Диагностирует, что стабилизаторы off-policy (нормализация параметров, clipped double-Q) зависят от режима данных, и предлагает WarpSAC — семейство off-policy RL-алгоритмов, учитывающих режим, с Sample Weight Decay и age-biased replay. Заявлены +4.5% AUC относительно FlashSAC на 9 CPU-scale средах и +23.1% на 14 GPU-parallel средах.
Claude Code v2.1.248: режим --restricted, per-agent cacheTtl, /usage-credits, межсессионный обмен сообщениями и большой пакет исправлений и патчей безопасности
AnthropicВыпущен 27 августа 2026 года (v2.1.248). Добавлен флаг --restricted (CLAUDE_CODE_RESTRICTED=1), отключающий встроенные инструменты для команд и кода, а также WebFetch, ограничивающий файловые инструменты рабочей директорией, отклоняющий bypassPermissions и игнорирующий все файлы настроек; экспериментальный per-agent cacheTtl (5m или 1h); переопределение --client-label для self-hosted-runner claude; диагностика server-managed-settings; /usage-credits для организаций AWS-Marketplace / self-serve / Enterprise-trial; межсессионные SendMessage/ListAgents на Bedrock, Vertex и Foundry, а также при выключенной телеметрии. Среди исправлений: баг обновления OAuth-токена, уничтожавший prompt-кэш (примерно раз в час в длинных сессиях), /ultrareview, выгружавший незакоммиченные правки в prod.env / *.tfvars / swap-файлы редактора, несколько падений claude agents, ввод в Windows-терминале и сопоставление @-упоминаний для корейской IME; размер промпта Workflow-инструмента сократился с ~5.7k до ~1k токенов.
LangChain 1.4.0a1 вводит пространство имён langchain.mcp с MCPAdapter и elicitation через LangGraph interrupts
LangChainВолна от 27 августа 2026 года: langchain 1.4.0a1 вводит новое пространство имён langchain.mcp с MCPAdapter и поддержкой elicitation через LangGraph interrupts; langchain-core 1.6.1 делает StructuredTool JSON-сериализуемым и пробрасывает информацию о шлюзе по пути ошибки; langchain-anthropic 1.7.0 поддерживает Anthropic SDK 1.0 и параметр top-level container для skills, а также метаданные ответа шлюза; langchain-fireworks 1.6.1 убирает блоки истории рассуждений и обновляет данные профилей моделей; langchain 1.3.18 исправляет PIIMiddleware-редактирование с сохранением формы content-block и баг индексирования в core для стриминга genai v1.
Gemini CLI v0.59.0-nightly.20260827 исправляет SSRF в MCP OAuth metadata discovery и аутентификации
Google DeepMindВыпущен 27 августа 2026 года (PR #29081 от @josebalius). fix(core): предотвращение SSRF в MCP OAuth metadata discovery и аутентификации. Закрывает уязвимость Server-Side Request Forgery в OAuth-флоу Model Context Protocol, покрывающую шаги metadata discovery и аутентификации. 28 августа выпущен следом v0.59.0-nightly.20260828.g3c311beac без публичного ченджлога.
Ollama v0.33.2 (pre-release) восстанавливает системную тёмную тему и поддерживает работу прокси при изменениях каталога моделей
OllamaPre-release от 27 августа 2026 года. Восстанавливает обработку системной тёмной темы в приложении, поддерживает обслуживание запросов прокси при изменении базового каталога моделей в середине сессии и синхронизирует macOS app handoff.
Релиз LangGraph SDK v0.4.4
LangChainВыпущен 27 августа 2026 года (langgraph-sdk==0.4.4). Подробного публичного ченджлога в GitHub-релизе нет; идёт следом за v0.4.3 от 19 августа и попадает в ту же волну 27 августа, что и работа над пространством имён langchain.mcp, зависящая от LangGraph interrupts для elicitation.
Справочно (2)
PAWBench: как далеко мы от вероятностно согласованного world-моделирования?
Формализует «вероятностную согласованность» как дистрибутивный критерий для видеогенераторов, действующих как стохастические сэмплеры мировой динамики, и выпускает PAWBench + PAWEval на 50 сценариях и 11 системах. Ни один из оцененных генераторов стабильно не совпадает с референсными вероятностями при сохранении диапазона допустимых поведений.
llama.cpp b10660 добавляет архитектуру Qwen3.8-Flash-Next (qwen4exp): hyper-connections, gated delta net, MoE, PLE n-gram embedding
llama.cppВыпущен 27 августа 2026 года (PR #27742). Добавлена поддержка архитектуры Qwen3.8-Flash-Next (qwen4exp), включая hyper-connections, gated delta net, MoE, PLE n-gram embedding и опциональный indexer key cache в llama_memory_hybrid. В сопутствующих сборках b10656-b10659: ограничение рабочей памяти квантизатора, спекулятивное декодирование DFlash2 с локальной свёрткой, OpenCL-ядра MoE (q4_0_q8_1 и mxfp4_q8_1), бандлинг HIP-runtime DLL на Windows ROCm и CI-изменение, собирающее только ggml-hip бэкенд на windows-rocm.