Ежедневный дайджест
14 пунктов · ~14 мин · Неделя 2026-W37
Обязательно к прочтению (2)
Dario Amodei опубликовал эссе «We Must Pace the Frontier», обязав Anthropic к встраиванию сторонних оценщиков
AnthropicГенеральный директор Anthropic Dario Amodei опубликовал эссе, в котором утверждает, что прогресс frontier-моделей должен замедлиться, чтобы безопасность успела подтянуться, ссылаясь на ускоряющуюся способность ИИ строить следующее поколение ИИ и недавние инциденты. Он обязал Anthropic размещать встроенных сторонних оценщиков вроде METR с доступом, сопоставимым с внутренними командами рисков, и призвал правительства требовать того же от других frontier-лабораторий. Sam Altman заявил, что OpenAI согласна и сделает то же самое, а Elon Musk публично присоединился.
NVIDIA открыла рецепт золотого уровня IMO с пайплайном Nemotron на естественном языке
NVIDIAОтталкиваясь от Nemotron 3 Ultra, NVIDIA двумя SFT+RL-этапами обучила два математических чекпойнта и запустила итеративный цикл generate-verify-refine из трёх чекпойнтов полностью на естественном языке — без формального прувера, инструментов и интернета — набрав 30/42 на IMO 2026, выше золотого порога. Чекпойнты, данные, код, поданные решения и бенчмарк из 200 задач — всё опубликовано.
Стоит знать (4)
Sam Altman исключил IPO OpenAI в 2026 году, назвав текущий момент «неудачным» для выхода на биржу
OpenAIВ интервью Fortune Sam Altman заявил, что OpenAI не выйдет на биржу в 2026 году, несмотря на конфиденциальную подачу заявки: нынешний климат вокруг безопасности делает IPO «необдуманным шагом», и компания листинговаться будет только тогда, когда к этому будут готовы и бизнес, и общественный момент. Reuters, CNBC и Axios подтвердили отказ от прежних планов на Q3–Q4 2026.
Moonshot AI рассчитывает на $2 млрд годовой выручки к концу 2026 года на волне Kimi K3
Moonshot AIMoonshot AI намерена удвоить темп августа и достичь $2 млрд годовой выручки к концу года, сообщает Bloomberg. Kimi K3 генерирует до 300 млрд токенов в день только на OpenRouter, хотя open-weight-релиз держит маржу тоньше, чем у закрытых конкурентов — OpenAI ($40B+) и Anthropic ($65B).
Z.AI запускает привлечение $5 млрд в Гонконге: $2 млрд размещение акций плюс $3 млрд конвертируемых облигаций
Zhipu AI (Z.AI)Zhipu AI (Z.AI) начала одно из крупнейших пост-IPO привлечений среди китайских ИИ-компаний, согласно term sheet: размещение около 21,97 млн H-акций по HK$714 (~$2 млрд) плюс около $3 млрд конвертируемых облигаций — суммарно порядка $5 млрд. Средства предназначены для вычислительной инфраструктуры, пока создатель GLM наращивает масштаб против DeepSeek и MiniMax.
Specific выпустила бенчмарк Real-SWE на задачах из приватных корпоративных кодовых баз
SpecificSpecific (YC F25) запустила Real-SWE — coding-бенчмарк из задач, лицензированных у реальных частных компаний; оцениваются пары «модель + harness» вроде Claude Code и Codex CLI с pass@1, усреднённым по восьми прогонам. Fable 5.1 через Claude Code лидирует с 38,8%, впереди GPT-6 Astra через Codex CLI (33,8%) и Gemini 3.8 Flash (31,2%); «пропущенное требование» — самый частый режим отказа, а стоимость прогона не предсказывала точность.
Справочно (8)
DeepSeek начала серое тестирование голосового диалога с ИИ с четырьмя вариантами голоса
DeepSeekПриложение-ассистент DeepSeek начало серое тестирование голосового диалога: выбранные пользователи могут разговаривать с моделью и выбирать один из четырёх стилей озвучки. Это первый режим голосового взаимодействия в приложении, закрывающий давний разрыв в функциональности с ассистентами Doubao и Qwen.
Minitap утверждает, что репозиторий Artemis от Google использовал её код для mobile-use и стёр имена авторов
GoogleMinitap опубликовала сравнительные доказательства того, что новый репозиторий Artemis для мобильной автоматизации от Google содержит код, скопированный из её Apache-2.0 проекта mobile-use, включая инструкции агенту слово в слово, и что force push в августе заменил имена трёх авторов Minitap. По словам Minitap, четыре письма с заявками на бенчмарк в AndroidWorld leaderboard от Google остались без ответа; компания требует от Google признать происхождение кода и исправить атрибуцию.
Скандал OpenAI вокруг Navier-Stokes разгорается: математики выступают против из-за авторства и поведения
OpenAIСпор вокруг заявленного OpenAI прогресса по Navier-Stokes обострился: New York Times выпустила профиль математика, оказавшегося между двумя лабораториями, а Guardian описала заявления математиков, называющих поведение OpenAI «незрелым хвастовством на детской площадке». Исследователи обвиняют OpenAI в нечестной борьбе за карьерный результат и поднимают вопросы о приватности данных; сам результат OpenAI по-прежнему ждёт независимой человеческой проверки.
Moonshot опровергла слухи о задержании основателя Yang Zhilin и 16 сотрудников, написала заявление в полицию
Moonshot AIВирусный скриншот утверждал, что основателя Moonshot Yang Zhilin и 16 сотрудников забрали власти. Компания назвала это утверждение злонамеренной фабрикацией, заявила, что информация полностью выдумана, и подала заявление в полицию против распространителей слухов. Слух разошёлся через несколько дней после сообщений о потенциальной оценке в $50 млрд и планах IPO в Гонконге.
EvoSafeHarness: автоматически эволюционирующие safety-харнессы для LLM-агентов
Фреймворк, синтезирующий специфичные для развёртывания safety-харнессы агентов — совместный поиск политики на естественном языке и исполняемой логики принуждения — для замороженной модели в целевом домене. На AgentDojo достигает 82,8% utility при 0% attack success rate — примерно вдвое выше utility CaMeL в той же рабочей точке — и переносится без изменений на незнакомые наборы.
SpatialBlock: обучение LVLM пространственному мышлению на синтетике с блоками
KAIST AIИсследователи KAIST собрали SpatialBlock-15k — синтетический датасет из 15 тысяч задач на складывание блоков, покрывающий проекцию 3D→2D, смену точки обзора и структурную композицию. Дообученные на нём VLM заметно превосходят базлайны и обобщаются на реальные пространственные задачи, избегая дорогой плотной геометрической разметки реальных сцен.
DSPy 3.4.0b1 переносит исполнение LM на нативный engine-интерфейс с локальным code interpreter
Stanford NLPDSPy выпустил первую бету 3.4: исполнение языковых моделей перенесено на общий engine-интерфейс lm15 с engine='auto', который перед исполнением откатывается к LiteLLM; добавлены локальный CPython-интерпретатор для доверенного кода и асинхронное исполнение в ReActV2, а также произвольные Flex-предложения кода в GEPA. Команда называет 3.4 релизом перехода на LM, а 3.5 — дедлайном миграции с экспериментальных LM-типов 3.3.
AI-чат в Яндекс Картах научился искать места вдоль маршрута между двумя точками
YandexЯндекс обновил AI-чат в Яндекс Картах: модель теперь строит отрезок между двумя заданными пользователем точками (например, общежитием и корпусом кампуса) и рекомендует заведения вдоль него или рядом с одной ориентиром. Если по близости ничего не подходит, чат расширяет область поиска или поясняет, каким критериям найденные места не соответствуют. Обновление подано вокруг студентов, обустраивающихся в новом городе.