Ежедневный дайджест
13 пунктов · ~13 мин · Неделя 2026-W32
Стоит знать (4)
GPT-5.6 Sol получила ползунок глубины рассуждений; Luna стала моделью по умолчанию для бесплатных пользователей ChatGPT
OpenAIOpenAI обновила GPT-5.6 Sol, добавив новый ползунок уровня рассуждений для пользователей Plus/Pro в вебе, на мобильных устройствах и десктопе, и начала раскатывать GPT-5.6 Luna как модель по умолчанию для пользователей тарифов Free и Go с неограниченным числом текстовых чатов. OpenAI сообщила о снижении частоты фактических ошибок примерно на 62-68% по сравнению с GPT-5.5 Instant на тестовых запросах в финансовой, медицинской и юридической сферах.
Claude Code сделает авторежим настройкой прав по умолчанию
AnthropicAnthropic объявила, что авторежим Claude Code, который направляет вызовы инструментов через классификатор безопасности вместо ручного подтверждения каждого действия, станет настройкой по умолчанию для пользователей Pro, Max и Team с 14 августа. Anthropic сослалась на исследование с участием 1053 тестировщиков, в котором классификатор заблокировал 89% опасных команд против 13,6%, пойманных проверяющими-людьми, и сообщила, что перестанет взимать плату за токен-нагрузку классификатора на этих тарифах.
Модель с открытыми весами Kimi K3 достигла общей доступности в GitHub Copilot
Moonshot AIGitHub объявила об общей доступности Kimi K3 — модели с открытыми весами для написания кода от Moonshot AI — в GitHub Copilot (VS Code, JetBrains, github.com) по состоянию на 6 августа 2026 года; модель размещена на инфраструктуре Fireworks AI по цене $3/$15 за миллион входных/выходных токенов. Раскатка была ненадолго приостановлена из-за инцидента с GitHub Actions, а затем возобновлена; функция по умолчанию отключена для тарифов Business/Enterprise до включения администратором соответствующей политики.
Alibaba открывает публичную бету видеомодели Wan 3.0 с генерацией 30-секундного одного кадра
AlibabaAlibaba Cloud открыла публичную бету 6 августа 2026 года для Wan 3.0 — видеогенеративной модели, поддерживающей до 30 секунд непрерывного вывода одним планом, а также мультимодальные входы, включая веб-страницы и документы. Модель доступна через Alibaba Model Studio и сайт Wan, полный доступ к API описан как «скоро».
Справочно (9)
Suno объявляет принципы работы с AI-музыкой, водяные знаки и ограничения на скачивание на фоне исков об авторских правах
SunoCEO Suno Майки Шульман опубликовал 6 августа 2026 года четыре операционных принципа и анонсировал предстоящую технологию водяных знаков/фингерпринтинга аудио, а также более жёсткие ограничения на скачивание, направленные на пресечение массового распространения и имитации голосов артистов, на фоне продолжающихся судебных разбирательств об авторских правах.
DeepSeek предупреждает о значительном повышении цен на API
DeepSeekDeepSeek объявила 6 августа 2026 года, что «значительно» повысит цены на API в ближайшем будущем, не раскрыв точные новые тарифы или дату вступления в силу, отказываясь от прежнего позиционирования как поставщика с ультранизкой стоимостью на фоне резко возросшего спроса.
AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением
Исследователи из Университета Цинхуа, Чжэцзянского университета и Meituan предлагают AgentOPSD — метод, перераспределяющий разреженные итоговые награды в пошаговые сигналы вклада для многошагового многораундового агентного RL с длинным горизонтом, используя рекурсивные байесовские обновления по разрывам правдоподобия между учителем и учеником вместо равномерного распределения преимущества на уровне траектории (как в GRPO). Метод достигает 89,1% успеха на ALFWorld с Qwen2.5-7B без дополнительных роллаутов или обученных критиков.
OSReward тестирует кросс-платформенные модели вознаграждения для computer-use
University of Hong KongКоманда из нескольких университетов создала OSReward — бенчмарк из 1019 размеченных людьми траекторий computer-use на вебе, Windows, Ubuntu и мобильных устройствах — для проверки надёжности VLM в роли судьи. Топовые модели-судьи набирают около 90% в целом, но падают до 70% на сложных случаях, в основном ошибочно засчитывая незавершённые задачи как успешные; команда также выпустила открытые модели-судьи OS-Shepherd (9B/35B), сопоставимые с коммерческими судьями при цене в 30-60 раз ниже.
WorldClaw генерирует агентные 3D открытые миры в масштабе
Tencent HunyuanИсследователи Tencent Hunyuan представляют WorldClaw — агентный pipeline «от грубого к детальному», превращающий текстовые запросы в большие, свободно исследуемые 3D-миры через три стадии: планирование замысла, генерация глобального рельефа и заполнение регионов редактируемыми, текстурированными объектами-мешами, при этом сохраняя глобальную пространственную согласованность.
EnvACE усваивает динамику среды через «репетицию мира» для агентного RL
Совместная команда из академии и Tencent предлагает EnvACE, где единая политика одновременно действует и симулирует собственные ответы среды («репетиция мира») во время RL-обучения, устраняя необходимость во внешних симуляторах. Это усваивает динамику среды в параметрах модели как интернализированную модель мира, повышая как эффективность обучения, так и производительность на тестовых агентных бенчмарках.
GST-Bench проверяет, развивают ли VLM глобальное пространственное восприятие по видео
ByteDance SeedByteDance Seed и академические партнёры представляют GST-Bench — бенчмарк видео-VQA из 2762 вопросов, проверяющий способность моделей «зрение-язык» выстраивать глобальное пространственное восприятие по длинным видео от первого лица, включая вывод с новых точек обзора и картирование в план сверху. Лучшая VLM в режиме zero-shot набирает 42,68 балла против базового уровня человека в 79,08; проприетарные модели ошибаются в основном на интеграции между кадрами, открытые модели ошибаются как в локальных, так и в глобальных рассуждениях.
OpenCode v1.18.15 исправляет хронологический порядок сообщений, добавляет экспорт сессий на десктопе
OpenCode (sst) выпустила v1.18.15 7 августа 2026 года, исправив хронологический порядок сообщений при импорте или когда легаси-идентификаторы сообщений идут не по порядку, добавив JSON-экспорт полных транскриптов сессий на десктопе, а также исправив баги с blob-вложениями и буфером обмена в tmux.
Видеомодель MiniMax H3 стала доступна в продукте Luma Agents
MiniMaxОмни-модальная видеомодель MiniMax H3 (Hailuo 3.0), генерирующая клипы до 15 секунд в 2K с нативным стереозвуком, была добавлена в мультимодельный продукт Luma Agents 6 августа 2026 года, что подтверждено на странице новостей Luma.