Ежедневный дайджест
9 пунктов · ~9 мин · Неделя 2026-W33
Обязательно к прочтению (2)
Ouroboros: самостоятельно развивающийся кодинг-агент, эволюционирующий через проверяемые коммиты
Ouroboros — это харнесс кодинг-агента, чьи инструменты, промпты, сборка контекста и основная реализация эволюционируют через проверяемые коммиты, сочетая рекурсивный цикл свободной эволюции с изменениями, основанными на опыте, выявляемыми в ходе обычного использования. Работая на Opus 5, он показывает 86,74% на Terminal-Bench 2.1 и 90,69% на OSWorld-Verified — оба результата являются новыми лучшими среди заявленных, а также SOTA в пятираундовой кампании CL-Bench.
BDH-CQ: рекуррентная модель латентного рассуждения преодолевает границу эффективности затрат на ARC-AGI-1
PathwayBDH-CQ сочетает обучение в контексте с рекуррентным латентным рассуждением: модель обновляет рекуррентную память на основе входных данных, предоставленных во время инференса, и решает запросы через итеративные вычисления в латентном пространстве без формирования вербализованной цепочки рассуждений. Конфигурация с 150 млн параметров достигает 29,5% pass@2 на публичном оценочном наборе ARC-AGI-1 при стоимости $0,0007 за задачу, превосходя ранее заявленную границу Парето по соотношению стоимости и точности для этого бенчмарка.
Стоит знать (3)
Исследовательская модель Claude повышает нижнюю оценку нулей дзета-функции Римана с 41,6% до 67,2%
AnthropicНеопубликованная исследовательская версия Claude от Anthropic, работая в двух сессиях Claude Code с примерно 60 суб-агентами и 31 млн выходных токенов, улучшила десятилетиями существовавшую нижнюю оценку доли нулей дзета-функции Римана, удовлетворяющих гипотезе Римана, объединив недавние результаты теории чисел с работой Бомбьери 2000 года в новом аргументе на основе квадратичных форм Вейля. Результат проверили два математика Anthropic и внешние эксперты (Брайан Конри, Дэн Голдстон), а Claude также подготовила проверяемую в Lean версию доказательства.
OpenAI расширяет программу кибербезопасности Daybreak, запускает GPT-5.6-Cyber
OpenAIOpenAI расширила инициативу Daybreak для проверенных команд безопасности, добавив специализированную модель GPT-5.6-Cyber (построенную на базе GPT-5.6 Sol) для авторизованных исследований уязвимостей и валидации эксплойтов, а также два уровня доступа: Daybreak Blue для общей защитной работы и Daybreak Red для специально обученных кибермоделей.
xAI запускает публичную бету Grok Bot — постоянно работающих ИИ-агентов-напарников
xAIxAI открыла публичную бету Grok Bot — ИИ-агентов, получающих собственный облачный компьютер, входящих в существующие приложения и инструменты пользователя, сохраняющих контекст между задачами и выполняющих многошаговую работу автономно, обращаясь к пользователю только когда требуется одобрение.
Справочно (4)
VK объединяет пользовательские данные всех сервисов в единый ИИ-нейропрофиль для рекомендаций
VKVK объединила обезличенные действия пользователей в VK Видео, VK Клипах и ВКонтакте в единый «нейропрофиль» на основе трансформера для улучшения рекомендаций контента, сообщив о росте времени просмотра VK Клипов на 5,5% и повышении вовлечённости в тестировании.
Anthropic расширяет Compliance API на Claude Cowork и Claude Code
AnthropicAnthropic расширила свой Compliance API (бета, для клиентов Claude Enterprise) на Claude Cowork и Claude Code — на десктопе, вебе, мобильных устройствах и в CLI, — предоставляя консолидированные транскрипты сессий с промптами, ответами и активностью инструментов для аудита и eDiscovery.
GitHub Copilot CLI v1.0.79 добавляет поддержку Kimi-K3 и пересматривает настройки авторизации sandbox
GitHub (Microsoft)GitHub Copilot CLI v1.0.79 добавляет поддержку модели kimi-k3, переводит крупные монорепозитории с ripgrep на индексацию по триграммам tgrep, пересматривает настройки sandbox, перенося авторизацию git/gh в новое пространство имён sandbox.auth.* без пути миграции, и переименовывает allowDevToolCaches в allowDevToolAccess как ломающее изменение.
Claude Code v2.1.228 усиливает защиту синхронизации навыков и устраняет утечку сессий Remote Control
AnthropicClaude Code v2.1.228 усиливает защиту навыков, синхронизируемых с claude.ai, чтобы они больше не могли перекрывать локальные команды или MCP-промпты, устраняет баг Remote Control /resume, из-за которого заголовок/история возобновлённого разговора утекали в подключённую сессию, и улучшает обработку учётных данных Vertex AI, чтобы при истёкших учётных данных происходил быстрый отказ вместо многоминутных повторных попыток.