ARC Prize показывает: результат GPT-6 Astra в 99,9% на ARC-AGI-3 получен благодаря кастомному harness OpenAI, а не самой модели

OpenAI

исследования офиц. + СМИ 4 ист. ~1 мин

Собственный разбор ARC Prize показывает: под стандартным harness Astra набрала 62,7% (за $26 098) на ARC-AGI-3, но 99,9% (за $18 817) через Provider Adapter от OpenAI, сохраняющий непрозрачное reasoning-состояние между запросами; даже при нулевом reasoning effort адаптер даёт 96,7%. Отдельно Fortune обнаружила пять метрик в посте OpenAI о запуске, исправленных уже после публикации (уровень галлюцинаций Astra менялся 4,2% -> 2% -> 4,2%; результат Fable 5.1 на FrontierMath 87,8% -> 78% -> 83%), а ARC Prize открещивается от AGI-фрейминга: «у нас недостаточно данных, чтобы называть это AGI».

Почему это важно

Организатор бенчмарка официально зафиксировал, что заголовочный результат в поддержку AGI-заявления породил выбор harness, а не способность модели, — образцовый кейс прозрачности бенчмарков.

Важность: 4/5

История о управлении бенчмарками, подтверждённая 4 независимыми источниками

Источники