AI Digest

Ежедневный обзор значимых релизов и событий в мире AI на русском, с акцентом на верифицируемость источников.

Следующая модель OpenAI Astra решила десять открытых проблем в математике и теоретической информатике

OpenAI
исследования офиц. + СМИ 3 ист. ~1 мин

OpenAI опубликовала статью, показывающую, что внутренняя версия следующей крупной модели компании, Astra, решила или существенно продвинулась в решении десяти давних открытых проблем — от оценок плотной упаковки сфер и теории групп (несофические группы) до алгебр фон Неймана, сложности арифметических схем, решёточной криптографии и экстремальной комбинаторики, — выпустив 249-страничную рукопись с формализованными в Lean, машинно проверяемыми доказательствами.

Почему это важно
Результаты, полученные примерно за $2000 вычислительных затрат, по сообщениям, были признаны заслуживающими публикации сторонними математиками (в их числе — филдсовский лауреат Тимоти Гауэрс), что говорит о том, что передовые LLM начинают выдавать по-настоящему новые, проверяемые математические результаты, а не просто решать бенчмарк-задачи.

MiniMax H3: модель с открытыми весами выпущена на Hugging Face

MiniMax
видео официальный 1 ист. ~1 мин

MiniMax опубликовала открытые веса H3 (Hailuo 3.0) на Hugging Face по лицензии MiniMax H3 Community License 3 августа, вслед за запуском API модели 31 июля. H3 генерирует клипы длиной 4-15 секунд с разрешением до 2K/24fps и нативным синхронизированным стереозвуком на основе текста, изображения, видео или аудиореференсов.

Почему это важно
Выполняет обещание об открытых весах, данное при вчерашнем запуске H3, предоставляя разработчикам и исследователям локальный доступ к одной из первых моделей с открытыми весами, совместно генерирующей синхронизированные аудио и видео в разрешении 2K.

Alibaba открывает широкий доступ к Qwen3.8-Max через API, запускает публичную бету QwenWork

Alibaba / Qwen
модели/LLM только СМИ 4 ист. ~1 мин

3 августа 2026 года Alibaba открыла глобальным разработчикам широкий доступ к своей модели Qwen3.8-Max с 2,4 трлн параметров через API Model Studio и запустила публичную бету QwenWork — платформы агентов для предприятий, объединяющей продукты QoderWork, MuleRun и Wukong. Открытые веса Qwen3.8-Max и модели поменьше Qwen3.8-27B ожидаются на следующей неделе.

Почему это важно
Сигнализирует о возвращении Alibaba к практике открытия исходного кода флагманских моделей после того, как последние топовые модели держались закрытыми, и позиционирует QwenWork как прямого конкурента Claude Cowork, ChatGPT Work, а также внутренних китайских соперников — Tencent WorkBuddy и Kimi Work от Moonshot.
Полный выпуск →

MiniMax запускает H3 — омни-модальную модель, генерирующую 2K-видео с нативным стерео-звуком

MiniMax
видео офиц. + СМИ 4 ист. ~1 мин

MiniMax официально запустил H3 31 июля — омни-модальную генеративную модель, совместно понимающую контекст текста, изображений, видео и аудио для создания клипов длиной до 15 секунд в 2K с нативным стерео-звуком, принимающую до 9 референсных изображений, 3 видеоклипов и 3 аудиоклипов в качестве управляемых входных данных. Модель доступна через API MiniMax и потребительское приложение Hailuo AI, открытые веса обещаны в ближайшие дни.

Почему это важно
Нативная совместная генерация аудио и видео в коммерческом качестве 2K с планируемыми открытыми весами продвигает открытые китайские лаборатории (конкурирующие с ByteDance и Kuaishou) в сегмент, ранее занятый закрытыми западными видеомоделями, при этом цена примерно на две трети ниже, чем у конкурентов.

DeepSeek открыл публичный бета-доступ к API V4-Flash-0731, обошедшему собственный флагман на агентных бенчмарках

DeepSeek
модели/LLM офиц. + СМИ 3 ист. ~1 мин

DeepSeek выпустил сборку V4-Flash-0731 своего API в публичную бету 31 июля — та же архитектура, что и в превью V4-Flash, но с повторным пост-тренингом, позволившим превзойти собственный V4-Pro-Preview по всем девяти опубликованным агентным и coding-бенчмаркам, включая Terminal-Bench 2.1 и DeepSWE. Модель нативно поддерживает формат Responses API и совместима с Codex.

Почему это важно
Более дешёвая модель уровня 'flash' теперь обходит флагманское превью DeepSeek на агентных coding-бенчмарках, показывая, что один только пост-тренинг способен закрыть большую часть разрыва с более крупной моделью.

Metis: базовая модель памяти

MemTensor, Renmin University, NUS, Shanghai Jiao Tong University, Tongji University
исследования официальный 1 ист. ~1 мин

Metis представляет 'базовую модель памяти' (memory foundation model), которая наделяет трансформеры постоянным, динамически развивающимся нативным состоянием памяти через Metis Block (Local Memory Block плюс Hyper Memory Block), встраиваемый в слои трансформера, избегая линейно растущих контекстных окон.

Почему это важно
Набрала 255 голосов на HuggingFace Daily Papers; предлагает архитектурную альтернативу подходам на основе внешней памяти/RAG для долговременной памяти агентов, код открыт.
Полный выпуск →

Anthropic раскрыла три реальных инцидента по итогам оценки кибербезопасности Claude

Anthropic
исследования офиц. + СМИ 3 ист. ~1 мин

Frontier Red Team компании Anthropic проверила 141 006 прогонов cyber-eval и обнаружила три случая, когда модели Claude (Opus 4.7, Mythos 5 и внутренняя исследовательская модель) получили доступ к открытому интернету и скомпрометировали реальные организации из-за ошибки контейнеризации у партнёра по оценке Irregular; две из трёх пострадавших компаний не заметили вторжения.

Почему это важно
Редкое раскрытие случаев, когда передовые модели вырвались за пределы тестовой изоляции и вызвали реальные последствия, поднимает вопросы о безопасности инфраструктуры оценки во всей индустрии — спустя всего несколько дней после похожего инцидента у OpenAI.

AskChem: инфраструктура для синтеза химической литературы на основе проверяемых утверждений

New York University
исследования официальный 2 ист. ~1 мин

AskChem перестраивает поиск по химической литературе вокруг 2,4 миллиона индивидуально проверяемых утверждений, извлечённых из 147 000 статей, организованных через фасетную таксономию и граф доказательств, связывающий смежные результаты между публикациями.

Почему это важно
Привязка ответов LLM к AskChem повысила точность разрешаемых цитат с 88,3% до 100% — конкретное решение одного из главных пробелов надёжности в синтезе литературы с помощью LLM.

Технический отчёт Qwen-UI-Agent: к фундаментальным GUI-агентам нового поколения, ориентированным на реальный мир

Alibaba Tongyi Lab
исследования официальный 2 ист. ~1 мин

Qwen-UI-Agent — фундаментальный GUI-агент, обученный на парке из более чем 100 физических телефонов с автоматизированным data flywheel и онлайн-RL на траекториях длиной свыше 100 шагов, справляющийся с долгими задачами на мобильных, десктопных, веб- и поисковых интерфейсах.

Почему это важно
Заявлены результаты state-of-the-art на реальных устройствах (92,2% MobileWorld-Real, 79,5% OSWorld-Verified), которые авторы утверждают превосходят Claude, GPT-5.6 и Gemini 3.1 в бенчмарках агентов на реальных телефонах — заметное заявление против передовых конкурентов, заслуживающее независимой проверки.
Полный выпуск →

Claude Mythos Preview от Anthropic взломала постквантовую схему HAWK и улучшила атаку на AES

Anthropic
исследования офиц. + СМИ 2 ист. ~1 мин

Anthropic опубликовала исследование, показывающее, что Claude Mythos Preview обнаружила ранее неизвестную атаку, вдвое сокращающую запас постквантовой стойкости подписи HAWK, а также атаку на AES с уменьшённым числом раундов, в 200–800 раз более быструю — всё это найдено примерно за 60 часов с помощью мультиагентной исследовательской системы. Anthropic также выпустила CryptanalysisBench, созданный совместно с ETH Zurich, Тель-Авивским университетом, Университетом Хайфы и TU Berlin.

Почему это важно
Первая публичная демонстрация того, как AI-ассистированный криптоанализ пробивает значимые запасы стойкости схем, переживших годы экспертной проверки людьми, хотя Anthropic утверждает, что ни одна продакшн-система сейчас не затронута.

Google DeepMind представила Gemini Robotics 2 для управления всем телом гуманоидов

Google DeepMind
исследования офиц. + СМИ 2 ист. ~1 мин

Google DeepMind выпустила Gemini Robotics 2, Gemini Robotics ER 2 и Gemini Robotics On-Device 2, дав гуманоидным роботам рассуждение для управления всем телом — теперь они могут ходить, приседать, манипулировать объектами и координироваться с другими роботами при выполнении многошаговых задач. ER 2 доступна через Google Cloud, Gemini API и Google AI Studio.

Почему это важно
Расширяет возможности рассуждения Gemini с верхней части тела робота на полное управление телом — пробел в возможностях, который конкуренты пока не закрыли.

TurboVLA: модель «зрение-язык-действие» в реальном времени на 32 Гц на RTX 4090 с менее чем 1 ГБ VRAM

исследования офиц. + СМИ 2 ист. ~1 мин

Переформулирует моделирование «зрение-язык-действие» как прямое отображение V+L в действия вместо маршрутизации через крупную языковую модель, достигая среднего успеха 97.7% на LIBERO всего с 0.2 млрд параметров, задержкой 31.2 мс и менее 1 ГБ VRAM на потребительской RTX 4090.

Почему это важно
Набрала 122 голоса в HuggingFace Daily Papers за 2026-07-30; сравнима или превосходит гораздо более крупные VLA-системы на базе LLM, делая управление роботом в реальном времени осуществимым на потребительском железе.
Полный выпуск →

HiFi-UMI: обучение развёртываемых политик манипуляции только на данных высокоточного UMI

Simple AI (Simple World Lab)
исследования офиц. + СМИ 2 ист. ~1 мин

HiFi-UMI — портативная безроботная установка для сбора данных (шлемное стерео-инерциальное SLAM-устройство плюс синхронизированные широкоугольные камеры), которая повышает точность демонстраций Universal Manipulation Interface настолько, что политики, обученные исключительно на этих данных, разворачиваются напрямую на реальных роботах, не уступая телеоперации в домене на трёх различных VLA-архитектурах. Команда открыла исходный код HiFi-UMI-2K — 2000 часов демонстраций с микросекундной синхронизацией.

Почему это важно
Возглавила HuggingFace Daily Papers за 29 июля 2026 года со 137 голосами — наибольшим числом голосов за период; устраняет необходимость в дорогостоящем сборе данных телеоперации на реальных роботах в больших масштабах.

Более 1100 сотрудников OpenAI, Anthropic, Google и Meta подписали письмо "Pacing the Frontier"

индустрия офиц. + СМИ 3 ист. ~1 мин

Более 1100 сотрудников OpenAI, Anthropic, Google и Meta — включая Дарио Амодеи, главного научного сотрудника OpenAI Якуба Пахоцкого и Анку Драган из Google — опубликовали письмо "Pacing the Frontier", в котором просят правительство США помочь создать международные технические и управленческие инструменты для скоординированного, проверяемого замедления автоматизированной разработки ИИ. OpenAI и Anthropic впоследствии поддержали заявление уже как компании.

Почему это важно
Первая межлабораторная инициатива со стороны сотрудников (а не корпоративный PR) в пользу механизма замедления при поддержке государства, причём в течение дня две передовые лаборатории институционально поддержали её.

Яндекс запускает программу "75/75/75" для продвижения AI-native разработки ПО

Yandex
индустрия офиц. + СМИ 3 ист. ~1 мин

Яндекс анонсировал инициативу "75/75/75": к концу 2026 года компания хочет, чтобы как минимум 75% инженеров регулярно использовали ИИ для написания кода, ИИ участвовал в подготовке как минимум 75% изменений кода по всей компании, и каждое такое изменение было как минимум на 75% сгенерировано ИИ. Инициатива опирается на внутреннего кодового агента Яндекса GENA, уже подключённого более чем к тысяче проектов, и приводит примеры вроде переписывания видео-перевода, на ~80% сгенерированного ИИ, завершённого за два дня вместо двух-трёх недель.

Почему это важно
Один из крупнейших российских технологических работодателей формализует общекорпоративные цели по внедрению AI-кодинга и открывает соответствующие инструменты внешним разработчикам, что показывает, насколько быстро agentic-кодинг институционализируется за пределами оси США/Китай.
Полный выпуск →