Ежедневный дайджест

9 пунктов · ~9 мин · Неделя 2026-W33

Обязательно к прочтению (2)

Ouroboros: самостоятельно развивающийся кодинг-агент, эволюционирующий через проверяемые коммиты

исследования официальный 2 ист. ~1 мин

Ouroboros — это харнесс кодинг-агента, чьи инструменты, промпты, сборка контекста и основная реализация эволюционируют через проверяемые коммиты, сочетая рекурсивный цикл свободной эволюции с изменениями, основанными на опыте, выявляемыми в ходе обычного использования. Работая на Opus 5, он показывает 86,74% на Terminal-Bench 2.1 и 90,69% на OSWorld-Verified — оба результата являются новыми лучшими среди заявленных, а также SOTA в пятираундовой кампании CL-Bench.

Почему это важно
Получил 1,1 тыс. лайков на HuggingFace Daily Papers, отражая сильный интерес сообщества; конкретная точка данных в направлении самосовершенствующихся агентов, включая явное обсуждение проблемы безопасности агентов, переписывающих собственный код.

BDH-CQ: рекуррентная модель латентного рассуждения преодолевает границу эффективности затрат на ARC-AGI-1

Pathway
исследования официальный 2 ист. ~1 мин

BDH-CQ сочетает обучение в контексте с рекуррентным латентным рассуждением: модель обновляет рекуррентную память на основе входных данных, предоставленных во время инференса, и решает запросы через итеративные вычисления в латентном пространстве без формирования вербализованной цепочки рассуждений. Конфигурация с 150 млн параметров достигает 29,5% pass@2 на публичном оценочном наборе ARC-AGI-1 при стоимости $0,0007 за задачу, превосходя ранее заявленную границу Парето по соотношению стоимости и точности для этого бенчмарка.

Почему это важно
Получила 681 лайк на HuggingFace Daily Papers; показывает путь без вербализованной цепочки рассуждений на небольшой модели к конкурентоспособной производительности на ARC-AGI при очень низкой стоимости инференса, что актуально для текущей дискуссии о необходимости вербализованного рассуждения для высокой производительности.

Стоит знать (3)

Исследовательская модель Claude повышает нижнюю оценку нулей дзета-функции Римана с 41,6% до 67,2%

Anthropic
исследования офиц. + СМИ 2 ист. ~1 мин

Неопубликованная исследовательская версия Claude от Anthropic, работая в двух сессиях Claude Code с примерно 60 суб-агентами и 31 млн выходных токенов, улучшила десятилетиями существовавшую нижнюю оценку доли нулей дзета-функции Римана, удовлетворяющих гипотезе Римана, объединив недавние результаты теории чисел с работой Бомбьери 2000 года в новом аргументе на основе квадратичных форм Вейля. Результат проверили два математика Anthropic и внешние эксперты (Брайан Конри, Дэн Голдстон), а Claude также подготовила проверяемую в Lean версию доказательства.

Почему это важно
Это не доказательство гипотезы Римана, и Anthropic не ожидает, что техника приведёт к нему, но это редкий случай, когда передовая модель произвела экспертно проверенный прогресс по открытой проблеме в чистой математике, иллюстрируя как перспективы, так и текущие ограничения агентных ИИ-исследований.

OpenAI расширяет программу кибербезопасности Daybreak, запускает GPT-5.6-Cyber

OpenAI
инструменты офиц. + СМИ 2 ист. ~1 мин

OpenAI расширила инициативу Daybreak для проверенных команд безопасности, добавив специализированную модель GPT-5.6-Cyber (построенную на базе GPT-5.6 Sol) для авторизованных исследований уязвимостей и валидации эксплойтов, а также два уровня доступа: Daybreak Blue для общей защитной работы и Daybreak Red для специально обученных кибермоделей.

Почему это важно
Сигнализирует о сдвиге в сторону закрытого, многоуровневого по возможностям доступа к передовым моделям для задач безопасности двойного назначения — лаборатории балансируют между усилением защитников и риском злоупотребления.

xAI запускает публичную бету Grok Bot — постоянно работающих ИИ-агентов-напарников

xAI
инструменты офиц. + СМИ 2 ист. ~1 мин

xAI открыла публичную бету Grok Bot — ИИ-агентов, получающих собственный облачный компьютер, входящих в существующие приложения и инструменты пользователя, сохраняющих контекст между задачами и выполняющих многошаговую работу автономно, обращаясь к пользователю только когда требуется одобрение.

Почему это важно
Продвигает xAI дальше в пространство агентного ИИ/автономных напарников, где компания теперь напрямую конкурирует с агентными продуктами Anthropic и OpenAI.
Справочно (4)

VK объединяет пользовательские данные всех сервисов в единый ИИ-нейропрофиль для рекомендаций

VK
индустрия офиц. + СМИ 3 ист. ~1 мин

VK объединила обезличенные действия пользователей в VK Видео, VK Клипах и ВКонтакте в единый «нейропрофиль» на основе трансформера для улучшения рекомендаций контента, сообщив о росте времени просмотра VK Клипов на 5,5% и повышении вовлечённости в тестировании.

Почему это важно
Показывает, как крупная российская платформа объединяет поведенческие данные из разных сервисов в одну ИИ-модель для повышения вовлечённости и таргетинга рекламы.

Anthropic расширяет Compliance API на Claude Cowork и Claude Code

Anthropic
инструменты официальный 1 ист. ~1 мин

Anthropic расширила свой Compliance API (бета, для клиентов Claude Enterprise) на Claude Cowork и Claude Code — на десктопе, вебе, мобильных устройствах и в CLI, — предоставляя консолидированные транскрипты сессий с промптами, ответами и активностью инструментов для аудита и eDiscovery.

Почему это важно
Даёт корпоративным комплаенс-командам единую программную видимость по агентным продуктам Anthropic с использованием существующих Compliance Access Keys без отдельной интеграционной работы.

GitHub Copilot CLI v1.0.79 добавляет поддержку Kimi-K3 и пересматривает настройки авторизации sandbox

GitHub (Microsoft)
инструменты официальный 1 ист. ~1 мин

GitHub Copilot CLI v1.0.79 добавляет поддержку модели kimi-k3, переводит крупные монорепозитории с ripgrep на индексацию по триграммам tgrep, пересматривает настройки sandbox, перенося авторизацию git/gh в новое пространство имён sandbox.auth.* без пути миграции, и переименовывает allowDevToolCaches в allowDevToolAccess как ломающее изменение.

Почему это важно
Ломающее переименование настроек sandbox означает, что существующие управляемые/MDM-политики незаметно откатываются к значениям по умолчанию, если их не обновить, что может незаметно расширить доступ инструментов для команд, не заметивших изменения в changelog.

Claude Code v2.1.228 усиливает защиту синхронизации навыков и устраняет утечку сессий Remote Control

Anthropic
инструменты официальный 2 ист. ~1 мин

Claude Code v2.1.228 усиливает защиту навыков, синхронизируемых с claude.ai, чтобы они больше не могли перекрывать локальные команды или MCP-промпты, устраняет баг Remote Control /resume, из-за которого заголовок/история возобновлённого разговора утекали в подключённую сессию, и улучшает обработку учётных данных Vertex AI, чтобы при истёкших учётных данных происходил быстрый отказ вместо многоминутных повторных попыток.

Почему это важно
Усиление защиты синхронизируемых навыков и исправление Remote Control закрывают реальные риски утечки информации и подмены для команд, работающих с Claude Code на нескольких машинах.