Ежедневный дайджест

14 пунктов · ~14 мин · Неделя 2026-W37

Обязательно к прочтению (2)

Dario Amodei опубликовал эссе «We Must Pace the Frontier», обязав Anthropic к встраиванию сторонних оценщиков

Anthropic
индустрия офиц. + СМИ 4 ист. ~1 мин

Генеральный директор Anthropic Dario Amodei опубликовал эссе, в котором утверждает, что прогресс frontier-моделей должен замедлиться, чтобы безопасность успела подтянуться, ссылаясь на ускоряющуюся способность ИИ строить следующее поколение ИИ и недавние инциденты. Он обязал Anthropic размещать встроенных сторонних оценщиков вроде METR с доступом, сопоставимым с внутренними командами рисков, и призвал правительства требовать того же от других frontier-лабораторий. Sam Altman заявил, что OpenAI согласна и сделает то же самое, а Elon Musk публично присоединился.

Почему это важно
Первый конкретный план сдерживания темпов, добровольно взятый на себя главой frontier-лаборатории: абстрактные предупреждения о безопасности превращаются в проверяемое обязательство.

NVIDIA открыла рецепт золотого уровня IMO с пайплайном Nemotron на естественном языке

NVIDIA
исследования официальный 1 ист. ~1 мин

Отталкиваясь от Nemotron 3 Ultra, NVIDIA двумя SFT+RL-этапами обучила два математических чекпойнта и запустила итеративный цикл generate-verify-refine из трёх чекпойнтов полностью на естественном языке — без формального прувера, инструментов и интернета — набрав 30/42 на IMO 2026, выше золотого порога. Чекпойнты, данные, код, поданные решения и бенчмарк из 200 задач — всё опубликовано.

Почему это важно
Первый полностью открытый рецепт (веса, данные, код, решения), достигший золота IMO без формальных верификаторов

Стоит знать (4)

Sam Altman исключил IPO OpenAI в 2026 году, назвав текущий момент «неудачным» для выхода на биржу

OpenAI
индустрия только СМИ 3 ист. ~1 мин

В интервью Fortune Sam Altman заявил, что OpenAI не выйдет на биржу в 2026 году, несмотря на конфиденциальную подачу заявки: нынешний климат вокруг безопасности делает IPO «необдуманным шагом», и компания листинговаться будет только тогда, когда к этому будут готовы и бизнес, и общественный момент. Reuters, CNBC и Axios подтвердили отказ от прежних планов на Q3–Q4 2026.

Почему это важно
Откладывается самое ожидаемое тех-IPO цикла; сигнал, что последствия вокруг безопасности меняют финансовые планы frontier-лабораторий.

Moonshot AI рассчитывает на $2 млрд годовой выручки к концу 2026 года на волне Kimi K3

Moonshot AI
индустрия только СМИ 2 ист. ~1 мин

Moonshot AI намерена удвоить темп августа и достичь $2 млрд годовой выручки к концу года, сообщает Bloomberg. Kimi K3 генерирует до 300 млрд токенов в день только на OpenRouter, хотя open-weight-релиз держит маржу тоньше, чем у закрытых конкурентов — OpenAI ($40B+) и Anthropic ($65B).

Почему это важно
Первый жёсткий ориентир выручки для бизнес-модели open-weights в масштабе

Z.AI запускает привлечение $5 млрд в Гонконге: $2 млрд размещение акций плюс $3 млрд конвертируемых облигаций

Zhipu AI (Z.AI)
индустрия только СМИ 3 ист. ~1 мин

Zhipu AI (Z.AI) начала одно из крупнейших пост-IPO привлечений среди китайских ИИ-компаний, согласно term sheet: размещение около 21,97 млн H-акций по HK$714 (~$2 млрд) плюс около $3 млрд конвертируемых облигаций — суммарно порядка $5 млрд. Средства предназначены для вычислительной инфраструктуры, пока создатель GLM наращивает масштаб против DeepSeek и MiniMax.

Почему это важно
Конкуренция моделей в Китае превращается в капиталоёмкую гонку вычислительной инфраструктуры

Specific выпустила бенчмарк Real-SWE на задачах из приватных корпоративных кодовых баз

Specific
инструменты офиц. + СМИ 2 ист. ~1 мин

Specific (YC F25) запустила Real-SWE — coding-бенчмарк из задач, лицензированных у реальных частных компаний; оцениваются пары «модель + harness» вроде Claude Code и Codex CLI с pass@1, усреднённым по восьми прогонам. Fable 5.1 через Claude Code лидирует с 38,8%, впереди GPT-6 Astra через Codex CLI (33,8%) и Gemini 3.8 Flash (31,2%); «пропущенное требование» — самый частый режим отказа, а стоимость прогона не предсказывала точность.

Почему это важно
Первый бенчмарк, изначально выходящий за пределы тренировочного распределения, показывает, насколько SWE-bench-подобные оценки приукрашивают frontier-агентов.
Справочно (8)

DeepSeek начала серое тестирование голосового диалога с ИИ с четырьмя вариантами голоса

DeepSeek
аудио только СМИ 2 ист. ~1 мин

Приложение-ассистент DeepSeek начало серое тестирование голосового диалога: выбранные пользователи могут разговаривать с моделью и выбирать один из четырёх стилей озвучки. Это первый режим голосового взаимодействия в приложении, закрывающий давний разрыв в функциональности с ассистентами Doubao и Qwen.

Почему это важно
DeepSeek наконец выходит на арену голосовых ассистентов, доминируемую потребительскими приложениями ByteDance и Alibaba

Minitap утверждает, что репозиторий Artemis от Google использовал её код для mobile-use и стёр имена авторов

Google
индустрия офиц. + СМИ 2 ист. ~1 мин

Minitap опубликовала сравнительные доказательства того, что новый репозиторий Artemis для мобильной автоматизации от Google содержит код, скопированный из её Apache-2.0 проекта mobile-use, включая инструкции агенту слово в слово, и что force push в августе заменил имена трёх авторов Minitap. По словам Minitap, четыре письма с заявками на бенчмарк в AndroidWorld leaderboard от Google остались без ответа; компания требует от Google признать происхождение кода и исправить атрибуцию.

Почему это важно
Проверка на прочность норм атрибуции open-source при поглощении работы проекта-агента ИИ-гигантом.

Скандал OpenAI вокруг Navier-Stokes разгорается: математики выступают против из-за авторства и поведения

OpenAI
индустрия только СМИ 3 ист. ~1 мин

Спор вокруг заявленного OpenAI прогресса по Navier-Stokes обострился: New York Times выпустила профиль математика, оказавшегося между двумя лабораториями, а Guardian описала заявления математиков, называющих поведение OpenAI «незрелым хвастовством на детской площадке». Исследователи обвиняют OpenAI в нечестной борьбе за карьерный результат и поднимают вопросы о приватности данных; сам результат OpenAI по-прежнему ждёт независимой человеческой проверки.

Почему это важно
Практики присвоения заслуг и хайпа frontier-лабораторий оказались под прицелом в самой громкой математической заявке года.

Moonshot опровергла слухи о задержании основателя Yang Zhilin и 16 сотрудников, написала заявление в полицию

Moonshot AI
индустрия только СМИ 2 ист. ~1 мин

Вирусный скриншот утверждал, что основателя Moonshot Yang Zhilin и 16 сотрудников забрали власти. Компания назвала это утверждение злонамеренной фабрикацией, заявила, что информация полностью выдумана, и подала заявление в полицию против распространителей слухов. Слух разошёлся через несколько дней после сообщений о потенциальной оценке в $50 млрд и планах IPO в Гонконге.

Почему это важно
Governance-FUD против самой горячей open-weights-лаборатории Китая накануне мега-IPO

EvoSafeHarness: автоматически эволюционирующие safety-харнессы для LLM-агентов

исследования официальный 1 ист. ~1 мин

Фреймворк, синтезирующий специфичные для развёртывания safety-харнессы агентов — совместный поиск политики на естественном языке и исполняемой логики принуждения — для замороженной модели в целевом домене. На AgentDojo достигает 82,8% utility при 0% attack success rate — примерно вдвое выше utility CaMeL в той же рабочей точке — и переносится без изменений на незнакомые наборы.

Почему это важно
Показывает, что универсальные защиты агентов — узкое место: поиск харнесса под конкретную модель и домен примерно удваивает безопасную utility

SpatialBlock: обучение LVLM пространственному мышлению на синтетике с блоками

KAIST AI
исследования официальный 1 ист. ~1 мин

Исследователи KAIST собрали SpatialBlock-15k — синтетический датасет из 15 тысяч задач на складывание блоков, покрывающий проекцию 3D→2D, смену точки обзора и структурную композицию. Дообученные на нём VLM заметно превосходят базлайны и обобщаются на реальные пространственные задачи, избегая дорогой плотной геометрической разметки реальных сцен.

Почему это важно
Дешёвые структурированные синтетические данные закрывают реальный пробел в пространственном мышлении, который разметка реальных изображений так и не устранила

DSPy 3.4.0b1 переносит исполнение LM на нативный engine-интерфейс с локальным code interpreter

Stanford NLP
инструменты официальный 1 ист. ~1 мин

DSPy выпустил первую бету 3.4: исполнение языковых моделей перенесено на общий engine-интерфейс lm15 с engine='auto', который перед исполнением откатывается к LiteLLM; добавлены локальный CPython-интерпретатор для доверенного кода и асинхронное исполнение в ReActV2, а также произвольные Flex-предложения кода в GEPA. Команда называет 3.4 релизом перехода на LM, а 3.5 — дедлайном миграции с экспериментальных LM-типов 3.3.

Почему это важно
Сигнал ухода DSPy с монокультуры LiteLLM к нативному слою запросов и ответов, с объявленным горизонтом депрекации для авторов кастомных LM.

AI-чат в Яндекс Картах научился искать места вдоль маршрута между двумя точками

Yandex
инструменты только СМИ 2 ист. ~1 мин

Яндекс обновил AI-чат в Яндекс Картах: модель теперь строит отрезок между двумя заданными пользователем точками (например, общежитием и корпусом кампуса) и рекомендует заведения вдоль него или рядом с одной ориентиром. Если по близости ничего не подходит, чат расширяет область поиска или поясняет, каким критериям найденные места не соответствуют. Обновление подано вокруг студентов, обустраивающихся в новом городе.

Почему это важно
Показывает, как Яндекс поставляет LLM-улучшения локального поиска внутри массового потребительского продукта