Ежедневный дайджест
13 пунктов · ~13 мин · Неделя 2026-W37
Обязательно к прочтению (1)
ARC Prize показывает: результат GPT-6 Astra в 99,9% на ARC-AGI-3 получен благодаря кастомному harness OpenAI, а не самой модели
OpenAIСобственный разбор ARC Prize показывает: под стандартным harness Astra набрала 62,7% (за $26 098) на ARC-AGI-3, но 99,9% (за $18 817) через Provider Adapter от OpenAI, сохраняющий непрозрачное reasoning-состояние между запросами; даже при нулевом reasoning effort адаптер даёт 96,7%. Отдельно Fortune обнаружила пять метрик в посте OpenAI о запуске, исправленных уже после публикации (уровень галлюцинаций Astra менялся 4,2% -> 2% -> 4,2%; результат Fable 5.1 на FrontierMath 87,8% -> 78% -> 83%), а ARC Prize открещивается от AGI-фрейминга: «у нас недостаточно данных, чтобы называть это AGI».
Стоит знать (5)
Первый промежуточный отчёт Zhipu как публичной компании: выручка выросла на 400%, API теперь 86,5% бизнеса
Zhipu AI (Z.ai)Первый полугодовой отчёт Zhipu (02513.HK) с момента IPO, широко освещавшийся 6–7 сентября, показывает выручку за первое полугодие 2026 года в 954 млн юаней — рост на 399,7% год к году и уже выше всего 2025 года. Выручка открытой платформы/API выросла на 2735,7% до 825 млн юаней и теперь составляет 86,5% выручки (год назад — 15,2%); чистый убыток сократился на 12,1% до 2,07 млрд юаней; ARR достигла $1,6 млрд к концу августа.
OpenAI заявляет, что цель «автоматизированного научного стажёра» достигнута, и нацеливается на полностью автоматизированного исследователя к марту 2028 года
OpenAIВ блоге от 6 сентября 2026 года («Research acceleration: The view inside OpenAI») OpenAI сообщает, что достигла цели, поставленной осенью 2025 года, — «автоматизированного научного стажёра», системы, справляющейся с чётко определёнными задачами, на которые у квалифицированного исследователя уходили бы дни, — и идёт по графику к автоматизированному AI-исследователю к марту 2028 года. Внутренние показатели: 3,1 агенто-дня на один человеко-день по состоянию на середину августа 2026 года; медианный исследователь тратит на инференс свыше $600 в день, 90-й процентиль — свыше $7 000 в день.
Главный научный сотрудник OpenAI в эссе «An Alien Mind» предупреждает: никто не готов к рекурсивному самоулучшению
OpenAIГлавный научный сотрудник OpenAI опубликовал 6 сентября 2026 года эссе, где утверждает, что внутренние результаты дают ему «твёрдые» основания ожидать, что текущий темп прогресса приведёт к рекурсивному самоулучшению, и пишет: «Меня беспокоит, что никто не готов к последствиям продолжительного быстрого роста машинного интеллекта». Он говорит, что OpenAI продолжит выстраивать защиту и может «в одностороннем порядке приостановить дальнейшее масштабирование, когда потребуется», но настаивает, что необходимы более широкие меры, выходящие за рамки саморегулирования лабораторий.
RoboTok: поиск человеческих демонстраций в интернет-масштабе для манипуляционных политик роботов
RoboTok — это data engine, который по запросному видео с манипуляцией находит релевантные человеческие демонстрации в веб-видео для обучения ловких роботов. Он выучивает латентное пространство движений по 3D-траекториям рук в кадрах, центрированных на актёре, что делает поиск устойчивым к точке съёмки камеры, виду сцены и перекрытиям, сохраняя масштабируемость до интернета.
LatentPress: сжатие контекста в непрерывные memory-токены, которые замороженная LLM читает напрямую
Статья двух авторов вводит третье представление контекста помимо текста и скриншотов: непрерывные memory-токены, записываемые в замороженный декодер через интерфейс входных эмбеддингов, без реконструкции текста на инференсе. Небольшой writer, подобранный под reader (адаптер на 4,2–26,2 млн параметров, около 0,1% от декодера), сжимает в 4–16 раз; на LongMemEval он даёт 0,504 при сжатии в 7,7 раза против 0,490 на несжатых доказательствах, сильно обгоняя текстовые саммари (0,184) и сжатие через OCR.
Справочно (7)
Брифинг Morgan Stanley: ARR MiniMax на уровне $800 млн, Zhipu — $1,6 млрд, а конкуренция моделей превращается в раунд на выбывание по эшелонам
MiniMax / Zhipu AIЗакрытый брифинг Morgan Stanley, о котором писали 6–7 сентября, оценивает ARR MiniMax на конец августа в $800 млн (на недельной базе) при повышенной аналитической оценке $1,3 млрд к концу года, а ARR Zhipu в августе — в $1,6 млрд (на недельной базе $2 млрд+) с поднятой до $2,4 млрд концегодовой оценкой. Тот же брифинг датирует GLM-6 октябрём на архитектуре GLM-5.3-Flash и перечисляет MiniMax M3.1, H3.1 и M3 Pro на второе полугодие плюс модель на 10T параметров, планируемую на следующий год; акции MiniMax выросли почти на 8% на этой новости.
Qwen Office от Alibaba преодолел 30 млн пользователей примерно за месяц, больше половины — из компаний
Alibaba (Qwen)Освещение 4–7 сентября сообщает, что агент Qwen Office (千问办公) от Alibaba достиг 30 млн пользователей примерно за месяц после запуска, причём свыше 52% аккаунтов привязаны к реальным корпоративным организациям, а драйвером стало распространение через DingTalk, а не рекламные расходы. Продукт ввёл платные подписочные тарифы 10 августа — вторая крупная китайская AI-платформа после Doubao от ByteDance — и позиционирует Qwen3.8 как модельный слой поверх DingTalk, Alibaba Cloud и CRM/ERP/OA-систем.
GPT-6 Astra добрался до тарифа ChatGPT Plus за $20 после rollout'а, за который Altman'у пришлось извиняться
OpenAIПродолжение запуска флагмана 3 сентября: 6 сентября 2026 года OpenAI начала раскатывать GPT-6 Astra подписчикам ChatGPT Plus за $20; пост OpenAI в X подтвердил доступность «для всех пользователей Pro, Enterprise и Business Premium в ChatGPT Work и Codex. Модель также доступна в API». Раскатка платным пользователям задержалась на несколько дней после анонса, что вынудило Сэма Альтмана публично извиниться за «неопрятный» релиз; у бесплатных пользователей по-прежнему только GPT-5.6 Sol и GPT-5.
Editable Visual Design: кодинг-агенты генерируют слоистые HTML/CSS-визуалы вместо сплющенных картинок
Команда вокруг Junyan Ye предлагает новую парадигму генерации визуала, где кодинг-агент использует VLM как творческий мозг, а имидж-модель — как симулятор визуального мира по запросу: агент генерирует изолированные ассеты, пишет нативный HTML/CSS и доводит дизайн по отрендеренной обратной связи. Результат — редактируемые артефакты с развязанными слоями, в отличие от end-to-end-вывода диффузионных моделей (GPT-Image-2, Nano Banana), дающего сплющенные битмапы с ошибками в тексте.
Last Translation Benchmark: авторские задачи людей, которые всё ещё ломают frontier-модели перевода
Большой консорциум (Vilem Zouhar, Niyati Bafna, Stella Biderman и другие) выпускает LTBv1 — живую коллекцию созданных людьми и прошедших рецензирование текстов, изображений, аудио и видео, на которых ломаются ведущие системы машинного перевода, пока стандартные бенчмарки насыщаются. Каждый пример снабжён вручную составленными правилами верификации, описывающими конкретные режимы отказа, что даёт надёжную, устойчивую к reward hacking и действенную оценку.
RealSWE: бенчмарк кодинг-агентов, перестроенный вокруг реальных, небрежных пользовательских запросов
Авторы количественно оценивают разрыв между задачами в стиле SWE-bench и реальным использованием: 88% реальных промптов содержат только голую постановку проблемы (против 7% бенчмарк-задач), и 87% написаны небрежно против 94% формальных в бенчмарках. RealSWE выводит 381 семейство многовариантных задач из SWE-bench Verified и Pro, чтобы тестировать композиционное поведение при реалистичных стилях запросов.
Krea подключилась к ChatGPT для генерации изображений и видео прямо в переписке
Krea5 сентября 2026 года Krea анонсировала интеграцию с ChatGPT, позволяющую генерировать изображения и видео с модельным рядом Krea прямо внутри чата ChatGPT. Существующие мудборды и стили Krea переносятся в чат-воркфлоу, а результаты можно сохранить обратно в библиотеку пользователя.