Ежедневный дайджест

17 пунктов · ~17 мин · Неделя 2026-W37

Обязательно к прочтению (2)

DeepSeek V4.1 Flash выходит в GA с открытыми весами по MIT и выводом V4 Pro из эксплуатации

DeepSeek
модели/LLM офиц. + СМИ 4 ист. ~1 мин

DeepSeek перевела V4.1 Flash из беты в полноценный релиз 10 сентября, опубликовав веса по лицензии MIT и технический отчёт на Hugging Face. Мультимодальный MoE на 552B параметров (8B активных на prefill, 16B на decode) использует Causal Encoder-Decoder с FP4-кешированием KV, сокращая постоянный кэш примерно до 1/8 от V4 Flash, поддерживает контекст 1M токенов и снижает цены Flash API примерно на 11–57%. С 14 сентября запросы к deepseek-v4-pro будут маршрутизироваться на новую модель.

Почему это важно
Первая продакшен-модель на новом архитектурном семействе DeepSeek даёт открытые веса уровня, близкого к frontier, при радикально меньшем расходе памяти и цене за токен, напрямую подрывая закрытые API-цены для long-context agent-нагрузок.

Show-Harness: обычный VLM-агент уже может управлять роботами

Show Lab, NUS
исследования официальный 1 ист. ~1 мин

Show-Harness — это Embodied Harness, позволяющий vision-language моделям управлять роботами через рассуждения над дискретными семантическими единицами действий, которые детерминированные интерпретаторы компилируют в низкоуровневые команды роботу. Тот же интерфейс даёт zero-shot управление закрытыми frontier-VLM, дешёвую адаптацию маленьких открытых VLM и сбор демонстраций через GUI без телеметрического оборудования, превосходя представительных agentic- и VLA-бейзлайнов.

Почему это важно
126 upvotes на HuggingFace Daily Papers (10 сентября). Аргумент в пользу тезиса «harness важнее модели» в робототехнике: правильный интерфейс открывает embodied-способности у универсальных VLM без предобучения под конкретное воплощение.

Стоит знать (10)

OpenAI открывает доступ к полнодуплексной голосовой модели GPT-Live-1 через API

OpenAI
аудио офиц. + СМИ 2 ист. ~1 мин

OpenAI выпустила GPT-Live-1 в API 10 сентября, открыв разработчикам полнодуплексную голосовую систему, стоящую за ChatGPT Voice. Модель слушает и говорит одновременно, обрабатывает перебивания и может делегировать рассуждения или действия бэкенд-агенту; кастомные голоса и поддержка телефонии доступны по цене $0.05 за минуту.

Почему это важно
Впервые realtime-голосовой стек OpenAI открыт сторонним разработчикам по товарной поминутной цене.

Universal Music Group и ElevenLabs заключают многолетнее лицензионное соглашение по AI-музыке

ElevenLabs
аудио офиц. + СМИ 5 ист. ~1 мин

Universal Music Group и ElevenLabs объявили о многолетнем лицензионном соглашении и стратегическом сотрудничестве, начиная с лицензионной платформы создания AI-музыки, позволяющей фанатам делать ремиксы, мэшапы и новые интерпретации треков участвующих артистов. Компании также совместно разработают AI-аудиопродукты для артистов и авторов песен UMG; это первая сделка ElevenLabs с мейджор-лейблом.

Почему это важно
Первая сделка ElevenLabs с мейджор-лейблом следует через день после запуска Suno v6 при поддержке лейблов — музыкальная индустрия консолидируется вокруг лицензионных AI-платформ вместо судебных исков.

Сбер выпускает GigaChat 3.5 Reasoning — первая российская reasoning-модель с открытыми весами

Sber
модели/LLM офиц. + СМИ 2 ист. ~1 мин

Сбер запустил GigaChat 3.5 Reasoning — свою первую модель с полноценным режимом рассуждений, построенную на online RL, применённом после SFT к шести отдельным доменным экспертам (математика, код, агенты и другие) с индивидуальными reward-моделями, слитыми обратно в одну модель. Веса открыты, модель доступна конечным пользователям и разработчикам через приложение GigaChat и API.

Почему это важно
Позиционируется как первая общедоступная открытая российская reasoning-модель, прямой ответ на DeepSeek R1 и OpenAI o4-mini, с multi-expert online RL-пайплайном — техническим первым для российской лаборатории.

Cognition анонсирует кодинг-модель SWE-2 — почти уровень Fable 5.1 при цене на 64% ниже

Cognition
модели/LLM официальный 1 ист. ~1 мин

Cognition представила SWE-2 (10 сентября) — frontier-кодинг-модель, пост-тренированную с базы Kimi K3 на 2.8T параметров, и первую модель компании, где RL масштабирован до режима многих триллионов параметров, с тренировкой всех уровней reasoning-effort за один запуск через reward с ценовым штрафом. Модель набирает 50.0% на FrontierCode 1.1 Main (в одном очке от Fable 5.1 при цене на 64% ниже), 73.0% на DeepSWE 1.1 и 92.8% на Terminal-Bench 2.1; доступна в Devin Desktop и CLI, rollout в Devin Web и Fusion идёт.

Почему это важно
Лаборатория второго эшелона заявляет почти-frontier-показатели в агентном кодинге примерно за четверть цены — это давит на ценообразование всего рынка кодинг-моделей и показывает открытые базы вроде Kimi K3 как жизнеспособные субстраты для RL.

Отчёт Anthropic об угрозах называет Moonshot, DeepSeek и Alibaba в кампаниях дистилляции

Anthropic
исследования офиц. + СМИ 5 ист. ~1 мин

Anthropic опубликовала свой самый детальный отчёт по threat intelligence на сегодня, охватывающий пресечённые злоупотребления с декабря 2025 по август 2026 в семи областях вреда: кибероперации, слежка, операции влияния, мошенничество, обычные вооружения, биологическое злоупотребление и нелегальная дистилляция моделей. Сопутствующий пост атрибутирует кампании дистилляции лабам из Китая, включая Moonshot AI, DeepSeek и Alibaba — Moonshot covert covertly маршрутизировала около 300 000 пользовательских запросов Kimi к Claude за десять дней — с перечислением связанных с государствами кампаний из России, Китая и Ирана. Отчёт вышел через два дня после рекомендации US NSA, CISA и FBI о дистилляции в промышленных масштабах.

Почему это важно
Первое именованное, подкреплённое доказательствами корпоративное атрибутирование межлабораторной дистилляции и самая детальная публичная картина того, как вооружают frontier-модели.

Anthropic Frontier Red Team измеряет способности к целеуказанию и разработке вооружений

Anthropic
исследования официальный 1 ист. ~1 мин

Вместе с отчётом об угрозах команда Frontier Red Team Anthropic опубликовала новые оценки того, могут ли AI-модели выполнять тактическое разведывательное целеуказание — например, определять местоположение людей по фрагментарным данным — и задачи разработки обычных вооружений, например конструирование дронов для удара по движущимся целям. Команда установила, что модели теперь справляются с некоторыми задачами, исторически доступными лишь малочисленным высококвалифицированным специалистам.

Почему это важно
Количественное доказательство того, что frontier-модели пересекают границу военно-значимых способностей.

Programmable World Model: программируемое агентами постоянное состояние для интерактивного видео

Alaya Lab
исследования официальный 1 ист. ~1 мин

Фреймворк разделяет эволюцию мирового состояния и визуальную генерацию: агент компилирует правила на естественном языке в исполняемые программы переходов состояния, лёгкий движок поддерживает постоянное глобальное состояние (включая заэкранные сущности), а снабжённые состоянием 3D bounding box'ы детерминированно компилируются в conditioning для предобученного видео-рендерера. На новом CombatStateBench достигаются 94% точности подсчёта и 98% точности состояния — сильно выше существующих интерактивных видео world models.

Почему это важно
81 upvote на HuggingFace Daily Papers (10 сентября). Решает главную нерешённую проблему интерактивных видео world models — постоянное, уважающее правила мировое состояние — с управляемым дизайном, пригодным для игр, и открытым кодом.

OpenAI запускает ChatGPT for Financial Services со встроенными рыночными данными

OpenAI
инструменты офиц. + СМИ 3 ист. ~1 мин

OpenAI запустила ChatGPT for Financial Services — энтерпрайз-версию на GPT-6 Astra со встроенными данными от LSEG, PitchBook, Crunchbase, Daloopa и Quartr, ориентированную на фундаментальный анализ, финансовое моделирование и клиентские материалы. Продукт разрабатывался с участием Morgan Stanley и Evercore.

Почему это важно
Первый вертикальный ChatGPT с лицензированными финансовыми данными, нацеленный напрямую на работу младших аналитиков с Уолл-стрит.

OpenAI открывает публичную бету Agents API с управляемым Codex-harness

OpenAI
инструменты официальный 2 ист. ~1 мин

OpenAI выпустила Agents API в публичной бете 10 сентября, предоставив Codex-harness как управляемый сервис: OpenAI берёт на себя оркестрацию сессий, компакцию контекста и восстановление, а приложения поставляют инструменты и выбирают среду исполнения (хостящийся у OpenAI sandbox или self-hosted). Долгоживущие сессии поддерживают стриминг, вебхуки, вмешательство посреди хода, MCP-серверы и до 4 параллельных субагентов; биллинг — по стандартным API-тарифам, дата-резиденция только в США.

Почему это важно
Превращает Codex из CLI/IDE-продукта во встраиваемый платформенный примитив, напрямую конкурируя с Agent SDK от Anthropic для построения продакшен-агентов на управляемом harness.

Cursor запускает Projects: координатор-агенты с тысячами облачных субагентов

Cursor
инструменты официальный 1 ист. ~1 мин

10 сентября Cursor запустил Projects в бете: агент-координатор планирует и делегирует работу тысячам параллельных субагентов вместо того, чтобы писать код самому, причём каждый Project работает на своей облачной машине, так что работа продолжается, когда ноутбук закрыт. Общие файлы контекста синхронизируют выводы между облачными и локальными машинами, а подписки позволяют Project следить за Slack-каналом, работать по расписанию или автономно отслеживать PR.

Почему это важно
Переводит Cursor из IDE-ассистента в оркестрированную мультиагентную систему для long-horizon-работы, напрямую оспаривая автономную инженерию в духе Devin/Codex.
Справочно (5)

Mistral и Cloudera партнёрятся по суверенному энтерпрайз-AI внутри клиентских дата-платформ

Mistral
индустрия офиц. + СМИ 2 ист. ~1 мин

Mistral и Cloudera объявили о стратегическом партнёрстве, интегрирующем open-weight модели Mistral с гибридной дата-платформой Cloudera: приватный инференс внутри сред под контролем клиента, включая полностью air-gapped инсталляции, плюс кастомное обучение на принадлежащих клиенту данных по примерно 30 экзабайтам под управлением Cloudera.

Почему это важно
Продвигает развёртывание frontier-моделей в регулируемых отраслях без выхода данных за пределы инфраструктуры клиента.

Moonshot запускает Kimi Enterprise Partner Program с forward-deployed инженерами

Moonshot AI
индустрия только СМИ 3 ист. ~1 мин

10 сентября Moonshot AI запустила Kimi Enterprise Partner Program (названную Moonshot Program), партнёрствуя с IT-сервисными провайдерами и системными интеграторами для построения команд forward-deployed инженеров, встраивающих AI в ключевые бизнес-процессы клиентов. По имеющимся данным, среди первых подписантов — пять публичных компаний, включая China Soft International и Teamsun.

Почему это важно
Знаменует сдвиг китайских лабораторий с открытыми весами от продаж API и токенов к энтерпрайз-доставке на площадке в стиле Palantir, открывая вторую линию выручки перед IPO Moonshot в Гонконге.

Claude Code v2.1.268 чинит регрессию с HTTP 400 и обход разрешений через симлинки

Anthropic
инструменты официальный 1 ист. ~1 мин

Вслед за v2.1.267 (9 сентября, освещали вчера) Anthropic выпустила Claude Code v2.1.268 (10 сентября). Исправлена критическая регрессия, где каждый ход падал с HTTP 400 на сторонних Anthropic-совместимых эндпоинтах (ANTHROPIC_BASE_URL) начиная с 2.1.265; закрыты обходы разрешений deny/ask для защищённых каталогов (/etc, /tmp, /var, /bin) через симлинки; добавлены синхронизация цен через gateway и вывод --json в plugin CLI; устранён busy-loop, насаживавший CPU в 100% в неактивных сессиях.

Почему это важно
Оба релиза затрагивают связанные с безопасностью механизмы принуждения разрешений (симлинки, пути marketplace), на которых держится система разрешений, а gateway-фичи сигналят о продвижении Claude Code в энтерпрайз-развёртывания.

Codex Python SDK 0.154.0 добавляет уровни reasoning max и ultra

OpenAI
инструменты официальный 1 ист. ~1 мин

После Codex CLI 0.154.0 (9 сентября, освещали вчера) 10 сентября вышел соответствующий Python SDK 0.154.0: в нём появились значения reasoning-effort max и ultra, тип ExternalMessage для подключений с правами только на инструменты, include_turns на resume/fork и типизированные payload'ы хуков.

Почему это важно
Тип ExternalMessage и новые уровни effort в SDK намекают на более богатое программное встраивание сессий Codex, не отставая от workflows Claude Code и Cursor.

OpenClaw выпускает 2026.6.35 — финальный релиз ветки June 2026 LTS

инструменты официальный 1 ист. ~1 мин

OpenClaw выпустил 2026.6.35 10 сентября, закрывая ветку June 2026 Extended Stable 166 влитыми PR с аудированными бэкпортами: бандловые провайдеры и адаптеры каналов теперь ограничивают недоверенные тела ответов и отвергают чрезмерно большие входные данные, пути agent/gateway/retry корректно обрабатывают отмену и частичные отправки без потери работы, а инструменты браузерной автоматизации и workspace валидируют некорректный ввод, прежде чем прерывать запуски агентов.

Почему это важно
Один из крупнейших open-source агентных проектов выпускает укреплённый финальный LTS-релиз; его закалка от недоверенного ввода бьёт по поверхности prompt-инъекций, типичной для персональных агентов с доступом к инструментам.