Ежедневный дайджест

14 пунктов · ~14 мин · Неделя 2026-W35

Обязательно к прочтению (1)

Z.ai подтвердила, что Ox Alpha — это GLM-5.3-Flash на ~100 000 китайских чипов; акции в Гонконге выросли на ~8–12%

Zhipu
модели/LLM офиц. + СМИ 4 ист. ~1 мин

27–28 августа 2026 года Z.ai (международный бренд Zhipu AI) подтвердила, что анонимная стелс-модель Ox Alpha на OpenRouter на самом деле была GLM-5.3-Flash — нативно мультимодальная MoE с 320B суммарно / 18B активных параметров и контекстом 1M токенов, под лицензией MIT. Z.ai заявила, что модель полностью обучена и обслуживается на кластере примерно из 100 000 китайских чипов. Акции гонконгской Z.AI (02513) выросли на ~8–12% за 27–28 августа.

Почему это важно
Раскрытие Ox Alpha — первое явное заявление лаборатории первого эшелона из Китая о том, что MoE уровня frontier обучена и обслуживается end-to-end на отечественном кремнии при значимом масштабе кластера (100 тыс. чипов), и рынок это оценил.

Стоит знать (2)

Agentic Game Development как верифицируемый data-engine траекторий для масштабирования world-моделей

National University of Singapore
исследования официальный 2 ист. ~1 мин

Утверждается, что масштабирование world-моделей на собранном видео вычислительно неэффективно, и предлагается рекурсивный data-engine, в котором разработка игр выступает reward-средой: игровой движок кодирует исполняемую спецификацию мира, способную проверять коллизии, физику, проходимость и ограниченную играбельность, а решения разработчиков «принять/отклонить» дают глобальный сигнал верификации. Вводится Reinforcement Learning with Human-Engine Verification (RLHEV) — комбинация плотных сигналов движка с имплицитной обратной связью от людей, собираемой в ходе разработки.

Почему это важно
Статья №1 в HuggingFace Daily Papers за 28 августа 2026 с 122 голосами — явный лидер дня. Предлагает новую парадигму обучающих данных для пространственных world-моделей, аналогичную тому, как компиляторы дают агентам для кода верифицируемые награды.

Claude Code v2.1.251: hook-события, стриминг сабагентов в Remote Control и исправление path-traversal через симлинки

Anthropic
инструменты официальный 2 ист. ~1 мин

Anthropic выпустила Claude Code v2.1.251 28 августа 2026 с обширным чейнджлогом. Новые возможности: hook-события PreModelSwitch / PostModelSwitch (блокировка / подтверждение / аннотирование переключения модели); живая стриминг-трансляция вызовов инструментов и результатов foreground-сабагентов в клиенты Remote Control; индикатор лимита трат в /usage и поле rate_limits.spend_limit в строке статуса; строка prompt-cache на сессию в /cost. Заметные исправления безопасности: файловые инструменты (Read/Write/Edit) теперь блокируют чтение/запись за пределами одобренной локации, если внутри рабочей директории после проверки прав был подменён симлинк. Изменения поведения: стандартный trailer коммита — Co-Authored-By: Claude Code, когда активная модель не является распознанной моделью Claude; модель по умолчанию для seat-based Enterprise теперь Opus 5; /effort сохраняет значение по умолчанию для каждой модели. Отдельно вышел v2.1.250 (28 августа) — точечный баг-фикс релиз.

Почему это важно
v2.1.251 объединяет реальное исправление path-traversal через симлинки, закрывающее класс обхода песочницы в файловых инструментах, и первые встроенные lifecycle-хуки вокруг переключения моделей, дающие командам способ enforce-политики выбора модели, а не только на Bash или Edit. v2.1.250 был более тихим точечным релизом того же дня.
Справочно (11)

Midjourney открывает публичное тестирование модели редактирования изображений V8.2

Midjourney
изображения официальный 1 ист. ~1 мин

Управляемая инструкциями модель редактирования изображений, поставляемая вместе с V8.2 на midjourney.com, alpha.midjourney.com и в Discord-клиент. Редактирует изображения по промпту на естественном языке, принимает до четырёх референсных изображений вместо прежней системы omni-reference и добавляет локальный inpainting и outpainting по холсту. Personalization, mood boards и style references (sref) компонуются с новым редактором; ожидается, что UI будет итерироваться по мере развёртывания модели в раннем тестировании.

Почему это важно
Заменяет псевдо-reference workflow Midjourney настоящей моделью инструкционного редактирования и даёт платформе первый встроенный inpainting/outpainting поверх генератора V8.2, ставя её в более прямое сопоставление с Recraft V4, Adobe Firefly и редакторами на Flux.

OpenAI сворачивает контракт на модели с Cursor после покупки SpaceX за $60 млрд

OpenAI
индустрия офиц. + СМИ 2 ист. ~1 мин

OpenAI сообщила в своём блоге, что после закрытия сделки по полной акционной покупке SpaceX компании Anysphere (материнская компания Cursor) за $60 млрд, состоявшейся 14 августа 2026 года, она уведомила SpaceX о намерении свернуть контракт, по которому OpenAI поставляет свои модели в Cursor.

Почему это важно
Cursor был одной из крупнейших сторонних поверхностей для моделей OpenAI — потеря доступа к OpenAI вынуждает Anysphere/SpaceX либо маршрутизировать через другого провайдера, либо хостить open-weight модели, либо пересогласовывать условия.

Автоматизированные исследователи способны надёжно устранять сбои выравнивания

Anthropic
исследования офиц. + СМИ 2 ист. ~1 мин

Anthropic опубликовала работу, в которой показано, что агент Automated Alignment Researcher (AAR) выполняет поиск по литературе, предлагает методы и обучает модели, закрывая разрывы в выравнивании. В десяти категориях сбоев — включая обман, соглашательство и нарушения приватности — система закрыла от 26% до 96% разрыва в безопасности и превзошла 28 исследователей-людей в области безопасности на задачах вроде снижения обмана; один прогон поднял ранний чекпоинт Claude Opus 4.8 почти до продакшен-уровня выравнивания за 60 часов.

Почему это важно
Первые свидетельства в духе peer-review, что ИИ-агент способен выполнять содержательные исследования по выравниванию end-to-end быстрее и дешевле команд людей; делает рекурсивное самоулучшение в выравнивании правдоподобным в ближайшей перспективе, а не спекулятивным.

TTPO: Test-Time Policy Optimization

исследования официальный 2 ист. ~1 мин

Безлейбловый метод пост-обучения, использующий асимметричный режим сбоев в псевдо-метках majority-vote: rollout'ы, не согласные с псевдо-меткой, обычно неверны вне зависимости от голосования. Согласные rollout'ы дистиллируются через On-Policy Self-Distillation, несогласные штрафуются через Grouped RL. Без ground-truth меток TTPO матчит label-supervised OPSD на пяти соревновательных бенчмарках и поднимает Qwen3-1.7B с 38,0% до 45,2%.

Почему это важно
67 голосов в HF Daily Papers. Демонстрирует безлейбловый пайплайн пост-обучения в стиле RLVR, конкурирующий с методами, требующими меток.

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

исследования официальный 2 ист. ~1 мин

Безучительная on-policy дистилляция для flow matching. На каждом шаге детерминированное предсказание следующего состояния студентом ветвится на K стохастических кандидатов SDE, разворачивается ODE-сэмплером и оценивается относительно детерминированной самореференции для получения нормализованных преимуществ. Затем поле скоростей оптимизируется с помощью all-branch pull-push цели. Превосходит прежние RL и OPD базлайны на бенчмарках с одной и смешанной наградой без необходимости в учителях под конкретные задачи.

Почему это важно
66 голосов в HF Daily Papers. Убирает главный ценовой блокер (обучение учителей под каждую задачу) для on-policy дистилляции в flow-matching генераторах.

UrbanGround: от локального восприятия к пространственной агентуре в городе реального масштаба

Shanghai Jiao Tong University
исследования официальный 2 ист. ~1 мин

Песочница, построенная на 3D-геопространственных данных Гонконга, поддерживающая навигацию от первого лица для оценки MLLM-агентов. Три исследовательских вопроса исследуют привязку к сцене, навигацию на длинные дистанции и устойчивость к изменениям среды. MLLM-агенты хорошо справляются с базовым визуальным распознаванием, но испытывают трудности с ориентацией, учётом пешеходов и устойчивым целенаправленным поведением при длительном исследовании.

Почему это важно
70 голосов в HF Daily Papers. Даёт тест-стенд реального масштаба и геодостоверности для пространственных MLLM-агентов вместо синтетических indoor-сцен.

Google AI Mode добавляет отслеживание цен на авиабилеты, цены в баллах/милях и бронирование отелей в чате

Google DeepMind
инструменты офиц. + СМИ 2 ист. ~1 мин

Google запустила три обновления AI Mode в Поиске: отслеживание цен на авиабилеты через чат-оповещения в более чем 180 странах; отображение цен в баллах и милях для авиабилетов и отелей по всему миру; бронирование отелей в чате в США совместно с Booking.com, Expedia, Hilton и Marriott.

Почему это важно
Первый флоу бронирования уровня Поиска от Google, который проводит транзакцию внутри LLM-опосредованного опыта.

Яндекс перезапускает Яндекс Сим как AI-native виртуального мобильного оператора на сети Beeline с транскрибацией звонков и прерыванием мошенничества

Yandex
инструменты офиц. + СМИ 2 ист. ~1 мин

28 августа 2026 года Яндекс объявил о перезапуске Яндекс Сим — виртуального мобильного оператора на сети Beeline — с ИИ-возможностями, встроенными прямо в поток звонков: с согласия пользователя ассистент транскрибирует звонки, извлекает задачи, выполняет детекцию мошенничества в реальном времени, способную прерывать подозрительные звонки, и предупреждает о рисках раскрытия персональных данных. Отдельный «чистый» номер с диапазонами, никогда ранее не использовавшимися в мобильных сетях, предлагается для банковских приложений и Госуслуг.

Почему это важно
Первый российский AI-native MVNO и конкретное развёртывание речевого стека Яндекса в живом пути звонка, а не в роли постфактум-ассистента; даёт Яндексу позицию между слоем ИИ-ассистента (Alice AI) и телеком-оператором.

openai-python v3.6.0 добавляет compute_units в payload'ы usage и усиливает X.509 workload identity

OpenAI
инструменты официальный 1 ист. ~1 мин

OpenAI выпустила openai-python v3.6.0 28 августа 2026. Объекты usage в Responses и Chat Completions теперь раскрывают поле compute_units; интеграция X.509 workload identity была усилена.

Почему это важно
compute_units — это новая единица, которую OpenAI продвигает в payload'ах usage для нормализации биллинга между разнородными конечными точками моделей.

Google DeepMind выпускает Gemini Omni 1.1 Flash для видео-разработчиков

Google DeepMind
видео офиц. + СМИ 2 ист. ~1 мин

Итерация видео-модели Gemini, сфокусированная на управлении со стороны разработчиков: расширение сцены, подтягивающее до 10 секунд предыдущего контекста и продолжающееся шагами по 10 секунд до 40 секунд; генерация по первому и последнему кадру для орбит и бесшовных лупов; 360p-черновики с превью до 60% быстрее и при трети стоимости 720p; 4K-апскейл поверх 1080p-выхода; до 3 секунд видео-референса для непрерывности персонажей и визуала.

Почему это важно
Привносит явное длинноформатное сшивание сцен и 4K-финиш в Gemini video по цене 360p-черновика, сокращая разрыв с инструментами длинных клипов уровня Sora для разработчиков, строящих через Google AI Studio, API Gemini Enterprise Agent Platform и Google Flow.

fal запускает H3 Max — пост-обученную видео-модель MiniMax H3, оптимизированную для генерации 5-секундных роликов менее чем за 3 секунды

fal
видео офиц. + СМИ 2 ист. ~1 мин

fal Research дообучила open-weights видеофундамент H3 от MiniMax новыми данными и оптимизацией инференса, целясь в пропускную способность, а не только в качество. fal заявляет 5-секундное видео менее чем за 3 секунды (~35× быстрее официального эндпоинта H3), №1 по общему качеству, пониманию промпта и эстетике в head-to-head Elo-рейтинге человеческих предпочтений fal на 12 моделях.

Почему это важно
Первое широко доступное развёртывание open-weights видео-модели уровня frontier с экономикой «менее секунды на кадр», меняющее потолок цены короткоформатного генеративного видео на API fal и через Playground/fal Agent.