Ежедневный дайджест
24 пункта · ~24 мин · Неделя 2026-W38
Обязательно к прочтению (1)
LimiX-2: Contextual Mechanism Network на пути к общему интеллекту на структурированных данных
Stable AILimiX-2 масштабирует Contextual Mechanism Network, предобученную контекстно-условным masked-моделированием на синтетических данных структурно-причинных моделей, смещаясь от предсказания по таргетам к механизмо-ориентированному совместному моделированию p(x, y | D_context). Обгоняет модели под конкретные датасеты и существующие табличные foundation-модели на TabArena, TALENT и BCCO, а её feature-attention восстанавливает причинные скелеты.
Стоит знать (9)
Astra for Law: OpenAI выпускает юридического ассистента на GPT-6 для фирм и инхаус-команд
OpenAIOpenAI анонсировала Astra for Law (17 сентября) — продукт для юридической области на модели GPT-6 Astra; пост позиционирует компании вроде Harvey как клиентов, а не конкурентов, и сторонние трекеры eval уже показывают модель gpt-6-astra. Обсуждение на HN (391 балл) крутится вокруг осуществимости документов, подготовленных AI, и позиционирования против инкумбентов legal-tech.
PrismML выпускает Bonsai 2 27B: тернарные веса с потерями, близкими к нулевым, относительно учителя
PrismMLPrismML выпустила Bonsai 2 27B (17 сентября) — мультимодальную модель (рассуждения, кодинг, зрение, агентность) с тернарными весами {-1,0,+1}, построенную на Qwen3.8 27B и сохраняющую 98,2% совокупных бенчмарков учителя (83,9 против 85,4) при размере 5,9 ГБ и контексте 262K, под Apache 2.0. Заявленная пропускная способность — до 143 ток/с на RTX 5090 и 46,8 ток/с на M5 Max.
Alibaba выпускает Qwen 3.8 Omni Flash как дешёвый аудиовизуальный дефолт
Alibaba (Qwen)Qwen 3.8 Omni Flash вышла (17 сентября) с заявленной аудиовизуальной производительностью, близкой к Gemini 3.8 Flash, и аудиопроизводительностью, превосходящей её, при цене примерно вдесятеро ниже за токен (около $0,15 ввод / $0,47 вывод против $1,5 / $9,0 в сравнении из HN).
Anthropic публикует прототипные метрики темпа внутреннего AI R&D и надзора за агентами
AnthropicСопроводительный исследовательский пост представляет три метрики прозрачности: R&D Automation Index, показывающий, что Claude ведёт около 26% AI R&D Anthropic по состоянию на август 2026 года; статистику надзора примерно за 30 000 параллельных внутренних агентов; и распределение вычислений, где около 6% compute AI R&D уходит на работы по безопасности.
DeepSeek-V4.1-Flash: пределы сжатия KV-кэша
DeepSeekНовая мультимодальная MoE-модель DeepSeek на 552B параметров поддерживает контексты в 1M токенов, сжимая резидентный в HBM KV-кэш примерно до 890 байт на токен (около 1/4 от DeepSeek-V4-Flash) за счёт архитектуры Causal Encoder-Decoder, межслойного переиспользования KV в Compressed Sparse Attention 2 и FP4 KV-кэширования; SWA Bounded Replay срезает постоянный footprint примерно до 1/8. Производительность на текстовых и мультимодальных агентных задачах растёт, несмотря на сжатие.
ScienceIDE: превращение мировой научной кодовой базы в среды, обучаемые агентами
PhAI LabsScienceIDE — инфраструктура, конвертирующая существующие репозитории научного кода в исполняемые, верифицируемые среды, где агенты могут генерировать задачи, запускать эксперименты и оцениваться по экспертным критериям приёмки. Обучение на верифицированных траекториях из этих сред даёт модели PhAI-IDE-72B/9B/4B, которые улучшаются на held-out задачах научного ремонта кода и показывают позитивный перенос на общие бенчмарки кода, рассуждений и знаний.
Переосмысливая обучение критика в PPO: понимание и смягчение Value Flattening
Shanghai AI LaboratoryСтатья выявляет «Value Flattening» у PPO-критиков в LLM RL: истинные значения состояний резко меняются между промежуточными токенами, тогда как предсказания критика остаются плоскими; причина — неявный штраф на дисперсию в лоссе критика плюс избыточные градиенты от временно коррелированных состояний. Предлагаемое решение, SP3O (Sparse PPO), обучает value-лосс только примерно на трёх хорошо разделённых состояниях на ответ и стабильно улучшает обучение политики на моделях Qwen3-Base разных размеров.
Anthropic запускает Life Sciences Verification Program для верифицированной работы в биологии
AnthropicAnthropic открыла бета-программу, дающую верифицированным специалистам в области наук о жизни более свободный доступ к Mythos, Opus и Sonnet для поиска лекарств, исследовательской биологии и клинической работы. Типы грантов Standard и High-risk заменяют блокировку в реальном времени на офлайн-мониторинг и ограниченные, возобновляемые гранты.
Pydantic AI v2.44.0 закрывает четыре дыры в web_fetch и OTel
Pydantic AIPydantic AI v2.44.0 (16 сентября, с бэкпортом тех же исправлений в v1.107.6) закрывает четыре advisory, достижимые через web_fetch_tool или OpenTelemetry-инструментацию: обход SSRF-блоклистов через zone-идентификаторы IPv6, суперлинейный путь ответа web_fetch, способный подвесить всех агентов в процессе, обход блоклистов через альтернативные написания доменов и утечку исключений и инструкций в OTel-спанах вопреки include_content=False.
Справочно (14)
Treble привлекает $18M расширением Series A на акустическую симуляцию и синтетические аудиоданные
TrebleИсландская Treble, основанная акустическими инженерами, привлекла $18M расширением Series A под лидом Paladin Capital Group, доведя общий объём до более чем $40M. Компания создаёт физически точные синтетические аудиоданные через волновую акустическую симуляцию для обучения моделей улучшения речи, подавления шума и voice AI; среди клиентов — Amazon, Jabra и Logitech.
LLM с бесконечными параметрами: статья на arXiv предлагает генерацию весов из живых данных
Independent researchersПрепринт на arXiv (2609.18842, 16 сентября; 122 балла на HN) предлагает вдохновлённую MoE архитектуру, где компактная гиперсеть превращает рантайм-данные в низкоранговую модуляцию общей базовой сети, поддерживая байесовское убеждение над латентным кодом, обновляемое онлайн, — так веса постоянно пересчитываются из эволюционирующего убеждения, а фиксированный объём параметров остаётся мал.
Эмпирическое исследование дизайна харнессов для кодинг-агентов
ZoomИсследование фиксирует цикл исполнения и варьирует три компонента харнесса — планирование, пространство действий и управление контекстом — на четырёх моделях и 176 согласованных настройках на SWE-Bench Verified и Terminal-Bench 2.1. Выводы: управление контекстом важнее всего при жёстких бюджетах (rule-based elision бьёт LLM-суммаризацию), планирование в основном снижает стоимость у сильных моделей, а модели с bash-способностями хорошо работают с bash-only интерфейсом инструментов при куда меньшей цене.
GitLab.com переводит rate-лимиты на уровни подписки с 19 октября
GitLabGitLab объявила, что с 19 октября rate-лимиты на GitLab.com будут привязаны к уровню подписки, для разблокировки повышенных лимитов потребуется вход в систему, а дальнейшие изменения для подписчиков Premium и Ultimate придут в январе.
Bend 2: язык, где AI-коммиты требуют машинно-проверяемых доказательств
BendBend 2 (репозиторий bendlang/bend, активен 18 сентября) — язык, где инварианты живут в файле LAWS.bend, и любое изменение, автором которого является AI, должно поставляться с PROOF.bend, машинно проверяемым против них: тайпчекер doubling as proof-checker (в стиле Lean/Rocq) отклоняет нарушающие правки до коммита, при этом заявлены single-binary масштабирование на CPU/GPU и однокоростная скорость уровня C.
Claude Code v2.1.275/276: синхронизация скиллов claude.ai, ctrl+enter для немедленной отправки, укрепление npm-плагинов
AnthropicПродолжение вчерашней v2.1.274: v2.1.275 (17 сентября) синхронизирует включённые на claude.ai скиллы и плагины в терминальные сессии, добавляет ctrl+enter для прерывания хода и сброса очереди сообщений, устанавливает плагины через --marketplace средствами npm с отключёнными install-скриптами и прекращает утечку секретов в URL marketplace/git. v2.1.276 (18 сентября) исправляет регрессию 275-й версии, ломавшую каждый запрос за кастомным шлюзом ANTHROPIC_BASE_URL.
Codex CLI 0.155.0 выходит в stable с /voice, подтверждением MCP через Touch ID, укреплением песочницы
OpenAIПродолжение вчерашней альфы 0.155.0: Rust-версия v0.155.0 помечена стабильной 17 сентября. Changelog добавляет экспериментальные голосовые диалоги /voice с живой транскрипцией, live-сводки рассуждений в строке статуса TUI, скрытие/архивацию задач в обзоре агентов, подтверждение MCP-запросов через Touch ID на Mac, настраиваемые расписания обновлений демона и получение кредов Bedrock из настроенных команд. Пункты безопасности блокируют выход Windows-процессов из WSL-песочниц и защищают снапшоты шелла от утечки кредов.
Cline выпускает SSH-ремоуты и параллельных субагентов (Desktop 0.0.31/0.0.32, ext 4.1.19)
ClineDesktop v0.0.31 (17 сентября) добавляет удалённую работу по SSH через самодостаточный хелпер на хосте и делает субагентов, порождённых на одном шаге, параллельными; v0.0.32 (18 сентября) исправляет баг, из-за которого десктоп-приложение гасило Hub, который само же запустило. Расширение VS Code v4.1.19 ретраит ошибки провайдера посреди стрима до трёх раз и защищает Windows от подброшенных в воркспейс rg.exe/git.exe.
Devin запускает Code Scans: MapReduce-свипы по всей кодовой базе под цель
CognitionCognition анонсировала Code Scans (блог 16 сентября, всплыл 18 сентября): опишите широкую инженерную цель (перф, SEO-соответствие, мёртвый код), Devin вместе с вами очерчивает критерии, параллельные агенты шардят и сканируют кодовую базу через архитектуру Agentic MapReduce, приоритизированные находки с доказательствами становятся PR-офферами через /scan.
Hugging Face выпускает funes: локальную, учитывающую секреты память для кодинг-агентов на Lance
Hugging FaceАнонсировано 17 сентября: funes индексирует трассы прошлых сессий агентов из Claude Code, Codex, pi и Hermes в локальный колоночный датасет Lance и предоставляет инструменты recall/get с провенансом и команду ask, отвечающую по извлечённым фрагментам. Индексация детерминирована и локальна, опционально — редакция через TruffleHog и fail-closed скан, удерживающий любой push, всё ещё содержащий секрет.
Anthropic открывает исходники knowledge-work-plugins для Claude Cowork
Anthropicanthropics/knowledge-work-plugins — официальный репозиторий Anthropic с open-source-плагинами для работников знания, использующих Claude Cowork; запушен 17 сентября и сейчас стоит на 24,6k звёзд, возглавляя дневной тренд Python на GitHub.
LangChain выделяет экспериментальный пакет langchain-typesafe
LangChainLangChain выпустила langchain 1.4.1 (16 сентября, исправление сохранения открытых объектных аргументов MCP) и две альфы нового экспериментального пакета langchain-typesafe 17 сентября (0.0.1a1/a2), вводящие TypeSafeClassifier плюс экспериментальные AutoModeMiddleware и ModelRouterMiddleware.
Changelog GitHub Copilot: повышение бюджетов в GA, дашборд impact получает вовлечённость по фичам
GitHubЗапросы на повышение бюджета Copilot стали общедоступны 16 сентября; 17 сентября дашборд Copilot impact получил отображения вовлечённости по фичам, а в API метрик использования добавлены детали кастомизации Agentic CLI.
Claude-Red: курируемая библиотека скиллов по наступательной безопасности набирает 6k звёзд
SnailSploitSnailSploit/Claude-Red (6,05k звёзд, сейчас #2 по дневному приросту в GitHub Python trending) — курируемая библиотека скиллов по наступательной безопасности, упакованных как файлы SKILL.md для системы скиллов Claude: SQLi, шеллкод, обход EDR, разработка эксплойтов.