Ежедневный дайджест
7 пунктов · ~7 мин · Неделя 2026-W32
Стоит знать (3)
Alibaba открывает широкий доступ к Qwen3.8-Max через API, запускает публичную бету QwenWork
Alibaba / Qwen3 августа 2026 года Alibaba открыла глобальным разработчикам широкий доступ к своей модели Qwen3.8-Max с 2,4 трлн параметров через API Model Studio и запустила публичную бету QwenWork — платформы агентов для предприятий, объединяющей продукты QoderWork, MuleRun и Wukong. Открытые веса Qwen3.8-Max и модели поменьше Qwen3.8-27B ожидаются на следующей неделе.
Следующая модель OpenAI Astra решила десять открытых проблем в математике и теоретической информатике
OpenAIOpenAI опубликовала статью, показывающую, что внутренняя версия следующей крупной модели компании, Astra, решила или существенно продвинулась в решении десяти давних открытых проблем — от оценок плотной упаковки сфер и теории групп (несофические группы) до алгебр фон Неймана, сложности арифметических схем, решёточной криптографии и экстремальной комбинаторики, — выпустив 249-страничную рукопись с формализованными в Lean, машинно проверяемыми доказательствами.
MiniMax H3: модель с открытыми весами выпущена на Hugging Face
MiniMaxMiniMax опубликовала открытые веса H3 (Hailuo 3.0) на Hugging Face по лицензии MiniMax H3 Community License 3 августа, вслед за запуском API модели 31 июля. H3 генерирует клипы длиной 4-15 секунд с разрешением до 2K/24fps и нативным синхронизированным стереозвуком на основе текста, изображения, видео или аудиореференсов.
Справочно (4)
От RLVR к RLSVR: преобразование задач порождает самопроверяемые вознаграждения для самосовершенствования LLM в открытых доменах
Предлагается RLSVR — метод, преобразующий открытые задачи (суммаризация, творческое письмо) в верифицируемые прокси-среды, так что сигналы вознаграждения возникают автоматически, без опоры на человеческие предпочтения или LLM-судей. Реализовано в виде SpyRL — мультиагентной игры с самообучением, где результаты голосования дают верифицируемые с точностью до истины вознаграждения; показано улучшение как на неверифицируемых, так и на верифицируемых задачах рассуждения.
AISPA: пользователецентричный аудит системных промптов для приложений на больших языковых моделях
Stanford UniversityПредставлена система аудита по 8 измерениям (прозрачность идентичности, приватность, предотвращение манипуляций, предотвращение вреда, справедливость и др.), основанная на руководствах по AI-безопасности и статьях о правах человека, с помощью которой проведён аудит 3249 инструкций системных промптов в 88 коммерческих AI-продуктах.
Защитные механизмы на основе копируемого контекста не могут обеспечить надёжную безопасность LLM
Формализуется «трилемма безопасности»: для задач двойного назначения защитные механизмы LLM не могут одновременно обеспечивать полезные возможности, надёжную безопасность и открытый доступ, поскольку злоумышленник может скопировать или имитировать любые доказательства промпта/контекста, которые предъявил бы легитимный пользователь. Выводится математическая нижняя граница помощи злоумышленнику в худшем случае и предлагаются «доверенные учётные данные» — трудно копируемые, привязанные к использованию доказательства — как необходимое дополнение к защите на основе промптов.
QQWorld: квантиль-квантильное сопоставление для регуляризации мировых моделей
Выявлено, что цель регуляризации Эппса-Пулли в LeWorldModel, подталкивающая латентные представления к изотропному гауссову распределению, имеет корректирующие градиенты, которые исчезают для изолированных выбросов в хвостах, оставляя тяжелохвостые отклонения латентного пространства плохо контролируемыми. QQWorld заменяет её целью квантиль-квантильного сопоставления, сохраняющей активные градиенты в хвостах, что улучшает качество латентного пространства для планирования.