Ежедневный дайджест
14 пунктов · ~14 мин · Неделя 2026-W35
Обязательно к прочтению (1)
Z.ai подтвердила, что Ox Alpha — это GLM-5.3-Flash на ~100 000 китайских чипов; акции в Гонконге выросли на ~8–12%
Zhipu27–28 августа 2026 года Z.ai (международный бренд Zhipu AI) подтвердила, что анонимная стелс-модель Ox Alpha на OpenRouter на самом деле была GLM-5.3-Flash — нативно мультимодальная MoE с 320B суммарно / 18B активных параметров и контекстом 1M токенов, под лицензией MIT. Z.ai заявила, что модель полностью обучена и обслуживается на кластере примерно из 100 000 китайских чипов. Акции гонконгской Z.AI (02513) выросли на ~8–12% за 27–28 августа.
Стоит знать (2)
Agentic Game Development как верифицируемый data-engine траекторий для масштабирования world-моделей
National University of SingaporeУтверждается, что масштабирование world-моделей на собранном видео вычислительно неэффективно, и предлагается рекурсивный data-engine, в котором разработка игр выступает reward-средой: игровой движок кодирует исполняемую спецификацию мира, способную проверять коллизии, физику, проходимость и ограниченную играбельность, а решения разработчиков «принять/отклонить» дают глобальный сигнал верификации. Вводится Reinforcement Learning with Human-Engine Verification (RLHEV) — комбинация плотных сигналов движка с имплицитной обратной связью от людей, собираемой в ходе разработки.
Claude Code v2.1.251: hook-события, стриминг сабагентов в Remote Control и исправление path-traversal через симлинки
AnthropicAnthropic выпустила Claude Code v2.1.251 28 августа 2026 с обширным чейнджлогом. Новые возможности: hook-события PreModelSwitch / PostModelSwitch (блокировка / подтверждение / аннотирование переключения модели); живая стриминг-трансляция вызовов инструментов и результатов foreground-сабагентов в клиенты Remote Control; индикатор лимита трат в /usage и поле rate_limits.spend_limit в строке статуса; строка prompt-cache на сессию в /cost. Заметные исправления безопасности: файловые инструменты (Read/Write/Edit) теперь блокируют чтение/запись за пределами одобренной локации, если внутри рабочей директории после проверки прав был подменён симлинк. Изменения поведения: стандартный trailer коммита — Co-Authored-By: Claude Code, когда активная модель не является распознанной моделью Claude; модель по умолчанию для seat-based Enterprise теперь Opus 5; /effort сохраняет значение по умолчанию для каждой модели. Отдельно вышел v2.1.250 (28 августа) — точечный баг-фикс релиз.
Справочно (11)
Midjourney открывает публичное тестирование модели редактирования изображений V8.2
MidjourneyУправляемая инструкциями модель редактирования изображений, поставляемая вместе с V8.2 на midjourney.com, alpha.midjourney.com и в Discord-клиент. Редактирует изображения по промпту на естественном языке, принимает до четырёх референсных изображений вместо прежней системы omni-reference и добавляет локальный inpainting и outpainting по холсту. Personalization, mood boards и style references (sref) компонуются с новым редактором; ожидается, что UI будет итерироваться по мере развёртывания модели в раннем тестировании.
OpenAI сворачивает контракт на модели с Cursor после покупки SpaceX за $60 млрд
OpenAIOpenAI сообщила в своём блоге, что после закрытия сделки по полной акционной покупке SpaceX компании Anysphere (материнская компания Cursor) за $60 млрд, состоявшейся 14 августа 2026 года, она уведомила SpaceX о намерении свернуть контракт, по которому OpenAI поставляет свои модели в Cursor.
Автоматизированные исследователи способны надёжно устранять сбои выравнивания
AnthropicAnthropic опубликовала работу, в которой показано, что агент Automated Alignment Researcher (AAR) выполняет поиск по литературе, предлагает методы и обучает модели, закрывая разрывы в выравнивании. В десяти категориях сбоев — включая обман, соглашательство и нарушения приватности — система закрыла от 26% до 96% разрыва в безопасности и превзошла 28 исследователей-людей в области безопасности на задачах вроде снижения обмана; один прогон поднял ранний чекпоинт Claude Opus 4.8 почти до продакшен-уровня выравнивания за 60 часов.
TTPO: Test-Time Policy Optimization
Безлейбловый метод пост-обучения, использующий асимметричный режим сбоев в псевдо-метках majority-vote: rollout'ы, не согласные с псевдо-меткой, обычно неверны вне зависимости от голосования. Согласные rollout'ы дистиллируются через On-Policy Self-Distillation, несогласные штрафуются через Grouped RL. Без ground-truth меток TTPO матчит label-supervised OPSD на пяти соревновательных бенчмарках и поднимает Qwen3-1.7B с 38,0% до 45,2%.
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Безучительная on-policy дистилляция для flow matching. На каждом шаге детерминированное предсказание следующего состояния студентом ветвится на K стохастических кандидатов SDE, разворачивается ODE-сэмплером и оценивается относительно детерминированной самореференции для получения нормализованных преимуществ. Затем поле скоростей оптимизируется с помощью all-branch pull-push цели. Превосходит прежние RL и OPD базлайны на бенчмарках с одной и смешанной наградой без необходимости в учителях под конкретные задачи.
UrbanGround: от локального восприятия к пространственной агентуре в городе реального масштаба
Shanghai Jiao Tong UniversityПесочница, построенная на 3D-геопространственных данных Гонконга, поддерживающая навигацию от первого лица для оценки MLLM-агентов. Три исследовательских вопроса исследуют привязку к сцене, навигацию на длинные дистанции и устойчивость к изменениям среды. MLLM-агенты хорошо справляются с базовым визуальным распознаванием, но испытывают трудности с ориентацией, учётом пешеходов и устойчивым целенаправленным поведением при длительном исследовании.
Google AI Mode добавляет отслеживание цен на авиабилеты, цены в баллах/милях и бронирование отелей в чате
Google DeepMindGoogle запустила три обновления AI Mode в Поиске: отслеживание цен на авиабилеты через чат-оповещения в более чем 180 странах; отображение цен в баллах и милях для авиабилетов и отелей по всему миру; бронирование отелей в чате в США совместно с Booking.com, Expedia, Hilton и Marriott.
Яндекс перезапускает Яндекс Сим как AI-native виртуального мобильного оператора на сети Beeline с транскрибацией звонков и прерыванием мошенничества
Yandex28 августа 2026 года Яндекс объявил о перезапуске Яндекс Сим — виртуального мобильного оператора на сети Beeline — с ИИ-возможностями, встроенными прямо в поток звонков: с согласия пользователя ассистент транскрибирует звонки, извлекает задачи, выполняет детекцию мошенничества в реальном времени, способную прерывать подозрительные звонки, и предупреждает о рисках раскрытия персональных данных. Отдельный «чистый» номер с диапазонами, никогда ранее не использовавшимися в мобильных сетях, предлагается для банковских приложений и Госуслуг.
openai-python v3.6.0 добавляет compute_units в payload'ы usage и усиливает X.509 workload identity
OpenAIOpenAI выпустила openai-python v3.6.0 28 августа 2026. Объекты usage в Responses и Chat Completions теперь раскрывают поле compute_units; интеграция X.509 workload identity была усилена.
Google DeepMind выпускает Gemini Omni 1.1 Flash для видео-разработчиков
Google DeepMindИтерация видео-модели Gemini, сфокусированная на управлении со стороны разработчиков: расширение сцены, подтягивающее до 10 секунд предыдущего контекста и продолжающееся шагами по 10 секунд до 40 секунд; генерация по первому и последнему кадру для орбит и бесшовных лупов; 360p-черновики с превью до 60% быстрее и при трети стоимости 720p; 4K-апскейл поверх 1080p-выхода; до 3 секунд видео-референса для непрерывности персонажей и визуала.
fal запускает H3 Max — пост-обученную видео-модель MiniMax H3, оптимизированную для генерации 5-секундных роликов менее чем за 3 секунды
falfal Research дообучила open-weights видеофундамент H3 от MiniMax новыми данными и оптимизацией инференса, целясь в пропускную способность, а не только в качество. fal заявляет 5-секундное видео менее чем за 3 секунды (~35× быстрее официального эндпоинта H3), №1 по общему качеству, пониманию промпта и эстетике в head-to-head Elo-рейтинге человеческих предпочтений fal на 12 моделях.