Ежедневный дайджест

13 пунктов · ~13 мин · Неделя 2026-W37

Обязательно к прочтению (1)

ARC Prize показывает: результат GPT-6 Astra в 99,9% на ARC-AGI-3 получен благодаря кастомному harness OpenAI, а не самой модели

OpenAI
исследования офиц. + СМИ 4 ист. ~1 мин

Собственный разбор ARC Prize показывает: под стандартным harness Astra набрала 62,7% (за $26 098) на ARC-AGI-3, но 99,9% (за $18 817) через Provider Adapter от OpenAI, сохраняющий непрозрачное reasoning-состояние между запросами; даже при нулевом reasoning effort адаптер даёт 96,7%. Отдельно Fortune обнаружила пять метрик в посте OpenAI о запуске, исправленных уже после публикации (уровень галлюцинаций Astra менялся 4,2% -> 2% -> 4,2%; результат Fable 5.1 на FrontierMath 87,8% -> 78% -> 83%), а ARC Prize открещивается от AGI-фрейминга: «у нас недостаточно данных, чтобы называть это AGI».

Почему это важно
Организатор бенчмарка официально зафиксировал, что заголовочный результат в поддержку AGI-заявления породил выбор harness, а не способность модели, — образцовый кейс прозрачности бенчмарков.

Стоит знать (5)

Первый промежуточный отчёт Zhipu как публичной компании: выручка выросла на 400%, API теперь 86,5% бизнеса

Zhipu AI (Z.ai)
индустрия только СМИ 3 ист. ~1 мин

Первый полугодовой отчёт Zhipu (02513.HK) с момента IPO, широко освещавшийся 6–7 сентября, показывает выручку за первое полугодие 2026 года в 954 млн юаней — рост на 399,7% год к году и уже выше всего 2025 года. Выручка открытой платформы/API выросла на 2735,7% до 825 млн юаней и теперь составляет 86,5% выручки (год назад — 15,2%); чистый убыток сократился на 12,1% до 2,07 млрд юаней; ARR достигла $1,6 млрд к концу августа.

Почему это важно
Доказательство того, что китайская лаборатория с открытыми весами способна развернуться от on-prem-контрактов к API-подписочной выручке в масштабе, причём валовая маржа API стала положительной — 24,6%.

OpenAI заявляет, что цель «автоматизированного научного стажёра» достигнута, и нацеливается на полностью автоматизированного исследователя к марту 2028 года

OpenAI
исследования офиц. + СМИ 3 ист. ~1 мин

В блоге от 6 сентября 2026 года («Research acceleration: The view inside OpenAI») OpenAI сообщает, что достигла цели, поставленной осенью 2025 года, — «автоматизированного научного стажёра», системы, справляющейся с чётко определёнными задачами, на которые у квалифицированного исследователя уходили бы дни, — и идёт по графику к автоматизированному AI-исследователю к марту 2028 года. Внутренние показатели: 3,1 агенто-дня на один человеко-день по состоянию на середину августа 2026 года; медианный исследователь тратит на инференс свыше $600 в день, 90-й процентиль — свыше $7 000 в день.

Почему это важно
Первый количественный взгляд изнутри на то, какую долю исследовательской работы frontier-лаборатории уже выполняют агенты, плюс датированная веха на пути к автоматизированным AI-исследованиям.

Главный научный сотрудник OpenAI в эссе «An Alien Mind» предупреждает: никто не готов к рекурсивному самоулучшению

OpenAI
исследования офиц. + СМИ 2 ист. ~1 мин

Главный научный сотрудник OpenAI опубликовал 6 сентября 2026 года эссе, где утверждает, что внутренние результаты дают ему «твёрдые» основания ожидать, что текущий темп прогресса приведёт к рекурсивному самоулучшению, и пишет: «Меня беспокоит, что никто не готов к последствиям продолжительного быстрого роста машинного интеллекта». Он говорит, что OpenAI продолжит выстраивать защиту и может «в одностороннем порядке приостановить дальнейшее масштабирование, когда потребуется», но настаивает, что необходимы более широкие меры, выходящие за рамки саморегулирования лабораторий.

Почему это важно
Самый высокопоставленный голос за безопасность во frontier-лаборатории публично призывает к внешнему вмешательству, а не только к добровольной осторожности лабораторий.

RoboTok: поиск человеческих демонстраций в интернет-масштабе для манипуляционных политик роботов

исследования официальный 2 ист. ~1 мин

RoboTok — это data engine, который по запросному видео с манипуляцией находит релевантные человеческие демонстрации в веб-видео для обучения ловких роботов. Он выучивает латентное пространство движений по 3D-траекториям рук в кадрах, центрированных на актёре, что делает поиск устойчивым к точке съёмки камеры, виду сцены и перекрытиям, сохраняя масштабируемость до интернета.

Почему это важно
Более 100 апвотов на HF Daily Papers (115) — бьёт в главную боль робототехники: дешёвые, разнообразные, длиннохвостые обучающие данные.

LatentPress: сжатие контекста в непрерывные memory-токены, которые замороженная LLM читает напрямую

исследования официальный 2 ист. ~1 мин

Статья двух авторов вводит третье представление контекста помимо текста и скриншотов: непрерывные memory-токены, записываемые в замороженный декодер через интерфейс входных эмбеддингов, без реконструкции текста на инференсе. Небольшой writer, подобранный под reader (адаптер на 4,2–26,2 млн параметров, около 0,1% от декодера), сжимает в 4–16 раз; на LongMemEval он даёт 0,504 при сжатии в 7,7 раза против 0,490 на несжатых доказательствах, сильно обгоняя текстовые саммари (0,184) и сжатие через OCR.

Почему это важно
Более 100 апвотов на HF Daily Papers (110) — показывает, что латентная токен-память может обгонять текстовое суммаризирование для long-context-воспоминаний при почти нулевой стоимости обучения.
Справочно (7)

Брифинг Morgan Stanley: ARR MiniMax на уровне $800 млн, Zhipu — $1,6 млрд, а конкуренция моделей превращается в раунд на выбывание по эшелонам

MiniMax / Zhipu AI
индустрия только СМИ 2 ист. ~1 мин

Закрытый брифинг Morgan Stanley, о котором писали 6–7 сентября, оценивает ARR MiniMax на конец августа в $800 млн (на недельной базе) при повышенной аналитической оценке $1,3 млрд к концу года, а ARR Zhipu в августе — в $1,6 млрд (на недельной базе $2 млрд+) с поднятой до $2,4 млрд концегодовой оценкой. Тот же брифинг датирует GLM-6 октябрём на архитектуре GLM-5.3-Flash и перечисляет MiniMax M3.1, H3.1 и M3 Pro на второе полугодие плюс модель на 10T параметров, планируемую на следующий год; акции MiniMax выросли почти на 8% на этой новости.

Почему это важно
Первые конкретные детали роадмапа по GLM-6 и моделям MiniMax следующего поколения, а также рамка, объясняющая, почему чистая ценовая конкуренция перестаёт работать ниже уровня SOTA-способностей.

Qwen Office от Alibaba преодолел 30 млн пользователей примерно за месяц, больше половины — из компаний

Alibaba (Qwen)
индустрия только СМИ 3 ист. ~1 мин

Освещение 4–7 сентября сообщает, что агент Qwen Office (千问办公) от Alibaba достиг 30 млн пользователей примерно за месяц после запуска, причём свыше 52% аккаунтов привязаны к реальным корпоративным организациям, а драйвером стало распространение через DingTalk, а не рекламные расходы. Продукт ввёл платные подписочные тарифы 10 августа — вторая крупная китайская AI-платформа после Doubao от ByteDance — и позиционирует Qwen3.8 как модельный слой поверх DingTalk, Alibaba Cloud и CRM/ERP/OA-систем.

Почему это важно
Самый быстрый в Китае рост корпоративного агента на сегодня: связка «модель плюс рабочая экосистема» Alibaba как отдельная go-to-market-стратегия против офисных агентов Tencent и ByteDance.

GPT-6 Astra добрался до тарифа ChatGPT Plus за $20 после rollout'а, за который Altman'у пришлось извиняться

OpenAI
модели/LLM офиц. + СМИ 4 ист. ~1 мин

Продолжение запуска флагмана 3 сентября: 6 сентября 2026 года OpenAI начала раскатывать GPT-6 Astra подписчикам ChatGPT Plus за $20; пост OpenAI в X подтвердил доступность «для всех пользователей Pro, Enterprise и Business Premium в ChatGPT Work и Codex. Модель также доступна в API». Раскатка платным пользователям задержалась на несколько дней после анонса, что вынудило Сэма Альтмана публично извиниться за «неопрятный» релиз; у бесплатных пользователей по-прежнему только GPT-5.6 Sol и GPT-5.

Почему это важно
Завершает потребительскую доступность флагманской модели OpenAI и показывает, что узкое место для frontier-релизов теперь — развёртывание, а не обучение.

Editable Visual Design: кодинг-агенты генерируют слоистые HTML/CSS-визуалы вместо сплющенных картинок

исследования официальный 2 ист. ~1 мин

Команда вокруг Junyan Ye предлагает новую парадигму генерации визуала, где кодинг-агент использует VLM как творческий мозг, а имидж-модель — как симулятор визуального мира по запросу: агент генерирует изолированные ассеты, пишет нативный HTML/CSS и доводит дизайн по отрендеренной обратной связи. Результат — редактируемые артефакты с развязанными слоями, в отличие от end-to-end-вывода диффузионных моделей (GPT-Image-2, Nano Banana), дающего сплющенные битмапы с ошибками в тексте.

Почему это важно
Самая раскрученная статья чарта HF от 5 сентября (42 апвота); указывает на направление «после имидж-редакторов», где дизайны остаются структурированными и редактируемыми, а не запекаются в пиксели.

Last Translation Benchmark: авторские задачи людей, которые всё ещё ломают frontier-модели перевода

исследования официальный 2 ист. ~1 мин

Большой консорциум (Vilem Zouhar, Niyati Bafna, Stella Biderman и другие) выпускает LTBv1 — живую коллекцию созданных людьми и прошедших рецензирование текстов, изображений, аудио и видео, на которых ломаются ведущие системы машинного перевода, пока стандартные бенчмарки насыщаются. Каждый пример снабжён вручную составленными правилами верификации, описывающими конкретные режимы отказа, что даёт надёжную, устойчивую к reward hacking и действенную оценку.

Почему это важно
Ненасыщенная, поддерживаемая сообществом оценка с верификацией по правилам — шаблон постнасыщенного бенчмаркинга за пределами машинного перевода.

RealSWE: бенчмарк кодинг-агентов, перестроенный вокруг реальных, небрежных пользовательских запросов

исследования официальный 2 ист. ~1 мин

Авторы количественно оценивают разрыв между задачами в стиле SWE-bench и реальным использованием: 88% реальных промптов содержат только голую постановку проблемы (против 7% бенчмарк-задач), и 87% написаны небрежно против 94% формальных в бенчмарках. RealSWE выводит 381 семейство многовариантных задач из SWE-bench Verified и Pro, чтобы тестировать композиционное поведение при реалистичных стилях запросов.

Почему это важно
Утверждает, что текущие результаты кодинг-агентов преувеличивают готовность к реальной работе, потому что измеряются на курируемых, информационно насыщенных issue, а не на том, как пользователи пишут на самом деле.

Krea подключилась к ChatGPT для генерации изображений и видео прямо в переписке

Krea
инструменты официальный 1 ист. ~1 мин

5 сентября 2026 года Krea анонсировала интеграцию с ChatGPT, позволяющую генерировать изображения и видео с модельным рядом Krea прямо внутри чата ChatGPT. Существующие мудборды и стили Krea переносятся в чат-воркфлоу, а результаты можно сохранить обратно в библиотеку пользователя.

Почему это важно
Ещё один шаг к превращению ChatGPT во фронтенд для сторонних генеративных медиамоделей, где дифференциатором выступает система стилей и мудбордов Krea.