Ежедневный дайджест

9 пунктов · ~9 мин · Неделя 2026-W33

Обязательно к прочтению (2)

Z.ai выпускает GLM-5.3: фронтир в кодинге только за счёт post-training, эмерджентные кибервозможности

Z.ai (Zhipu AI)
модели/LLM офиц. + СМИ 7 ист. ~1 мин

14 августа 2026 года Z.ai выпустила GLM-5.3 — модель с фокусом на кодинг/агентов, использующую то же базовое ядро на 743B параметров, что и GLM-5.2, — весь прирост достигается за счёт массивно масштабированного post-training (в 10 раз больше сред для долгосрочных задач). Внутренный Z.ai Code Bench улучшился на 50% относительно GLM-5.2; Terminal-Bench 3.0 подскочил с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9, а эмерджентные кибервозможности довели CyberGym до 84.5% и ExploitBench — с 24.4% до 54.4%. Модель текстовая с контекстом 1M токенов и сейчас доступна только подписчикам GLM Coding Plan; API и открытые веса раскатываются в течение ближайших ~двух недель.

Почему это важно
Показывает, что одно лишь масштабирование post-training — без нового претрейнинга — может вывести китайскую модель с открытыми весами ~750B на топ таблиц лидеров по кодингу/агентам и дать эмерджентные кибервозможности, которые, по сообщениям, уже обнаружили серьёзную уязвимость в Cursor. Результат указывает, что RL/post-training, а не только масштаб базы, теперь является ограничивающим фактором для агентов-кодеров фронтир-класса, и укрепляет позиционирование Z.ai против закрытых американских лабораторий при сохранении открытых весов.

Alaya-EVOKE: от линейно масштабируемого обучения к бесконечному миру

исследования офиц. + СМИ 2 ист. ~1 мин

Интерактивная видео-world-модель, объединяющая индексируемый по камере банк внешнего состояния мира с разреженно-внимательным учителем, линейно масштабируемым по памяти и вычислениям, дистиллированная в трёхшагового студента через 30-секундную цель distribution-matching. Устанавливает SOTA на WBench и конкурентна на VBench-Long и VBench-2.0, генерируя каждый 1,5-секундный чанк за 2,11 с на одном H200 при 384x640.

Почему это важно
HF Daily +105 голосов; единственная за день работа, преодолевшая планку notable-upvote в 100 голосов, и практический шаг к долгосрочным интерактивным world-моделям, помещающимся на одном GPU.

Стоит знать (5)

Pika запускает Pika Audio: четыре фундаментальные звуковые модели фронтир-класса со стоимостью до 20 раз ниже

Pika
аудио офиц. + СМИ 4 ист. ~1 мин

14 августа 2026 года Pika выпустила Pika Audio — первое семейство фундаментальных звуковых моделей фронтир-класса, включающее Soundtrack (видео-в-аудио, $0,617/с), Music (песни до 6 минут по тексту/тексту песни/голосу/референсу), SFX (текст-в-звуковые эффекты, 44,1 кГц стерео, средняя задержка 0,847 с) и Speech (TTS 48 кГц с пресетами голосов или клонированием голоса, real-time factor 0,02). Pika позиционирует семейство как до 20 раз более дешёвое по сравнению со сопоставимыми аудио-моделями, с конкретными заявлениями: в 9 раз против ElevenLabs v3, в 4,5 раза против Cartesia/ElevenLabs Turbo и в 2 раза против Hunyuan Foley / Fish Audio.

Почему это важно
Знаменует экспансию Pika из видео-only в полноценный набор фундаментальных аудио-моделей, при этом Speech-модель подаётся как самый дешёвый реальный конкурент ElevenLabs на рынке, а Soundtrack-модель позиционируется как экономичная альтернатива HunyuanVideo-Foley для задачи видео-в-аудио. Доступно через новый Pika API Club ($10/месяц) с агрегацией 70-100+ сторонних моделей.

Google разрешила пользователям отключать видимый водяной знак на изображениях, видео и музыке из Gemini

Google DeepMind
изображения офиц. + СМИ 3 ист. ~1 мин

14 августа 2026 года Google начала раскатывать переключатель «Настройки → Водяной знак медиа», который скрывает видимый водяной знак на изображениях (Nano Banana), видео (Omni) и музыке (Lyria), сгенерированных Gemini, как в приложении Gemini, так и в видеоредакторе Flow. Невидимые метки SynthID и C2PA Content Credentials остаются встроенными в каждый файл независимо от состояния переключателя, а Google выпускает новую open-source C++-библиотеку Credentio для локальной валидации C2PA.

Почему это важно
Первое существенное ослабление политики видимых водяных знаков Google с момента запуска SynthID на I/O; сохраняет машинно-читаемое подтверждение происхождения, возвращая авторам косметический контроль, и в один день с этим политическим изменением выпускает open-source библиотеку валидации.

DarwinX: эволюция агентских харнесов через естественный отбор

Salesforce AI Research
исследования офиц. + СМИ 2 ист. ~1 мин

Рассматривает самоэволюцию агента как отбор по популяции харнесов (промптов, инструментов, скиллов, потока управления) при замороженных весах модели, используя цикл в стиле естественного отбора для эволюции харнеса, а не самой модели. Фреймирует возможности агента как функцию и весов, и харнеса, и демонстрирует эволюцию только харнеса как универсальный рычаг самосовершенствования, не зависящий от модели.

Почему это важно
Перефреймирует проблему самосовершенствования агента в сторону эволюции харнеса, а не файнтюнинга, при участии команды Salesforce Research; HF Daily +62 голоса.

Spatial Memory Agent: процедурная память на основе опыта для пространственного интеллекта

Zhejiang University
исследования офиц. + СМИ 2 ист. ~1 мин

Фреймворк самоэволюции без обновления параметров для замороженных VLM-агентов в пространственном рассуждении: запрашивает замороженную VLM, получает reward от верификатора и дистиллирует проверенный пространственный опыт в переиспользуемые трансферабельные уроки, каждый с Transfer Reliability Score, откалиброванным по исходам последующих извлечений. На пяти пространственных бенчмарках и четырёх базовых VLM SMA достигает наилучшего макро-среднего в каждом блоке базовых моделей без экспертных пространственных инструментов на инференсе.

Почему это важно
Показывает, что замороженные VLM могут улучшать пространственное рассуждение исключительно через проверенную опытную память — без post-training и без вызовов специализированных инструментов на инференсе; HF Daily +30 голосов.

Claude Code v2.1.233 отключает инструменты Todo/Task на Opus 4.8 / Sonnet 5 / Fable 5 / Mythos 5 и закрывает утечку NTLM-учётных данных в Windows

Anthropic
инструменты офиц. + СМИ 3 ист. ~1 мин

14 августа 2026 года Anthropic выпустила Claude Code v2.1.233. Релиз добавляет поддержку URL-merge request'ов GitLab для `--worktree` и представления `claude agents` (MR отображаются как `!N`), opt-in настройку apps-gateway `forward_user_identity` для атрибуции расходов по пользователям, opt-in лимиты памяти cgroup для Linux-Bash через `CLAUDE_CODE_TOOL_MEMORY_LIMIT` и переменную окружения `CLAUDE_CODE_WEBFETCH_CACHE_TTL_MS`. Также исправлены: зацикливание реконнекта MCP v2 `subscriptions/listen` на serverless-хостах, обход валидации Windows-путей `\??\` UNC, приводивший к утечке NTLM-учётных данных, регрессия idle-CPU 100% в Linux при включённой песочнице и пропадавшие хуки уведомлений для запросов разрешений в Claude Desktop и VS Code.

Почему это важно
Первое выведение из эксплуатации набора инструментов Todo на уровне моделей и значимое исправление безопасности в Windows; downstream-инструменты и авторы скиллов, полагающиеся на TodoWrite на Opus 4.8 / Sonnet 5, должны явно включить его заново.
Справочно (2)

LLMRouter: унифицированная инфраструктура для разработки, оценки и развёртывания LLM-роутеров

University of Illinois Urbana-Champaign
исследования офиц. + СМИ 2 ист. ~1 мин

Унифицированная модульная инфраструктура, формулирующая LLM-роутинг как пятикомпонентный последовательный процесс принятия решений (контекстные энкодеры, энкодеры моделей, скоринговые функции, правила решений, сигналы обучения), и поставляющая xRouteBench — автоматизированный бенчмарк, покрывающий generic, memory-augmented, vision, time-series и персонализированный роутинг. Среди 16+ репрезентативных роутеров обученные роутеры обходят сильнейший фиксированный бейзлайн на 14,6% относительно, а лёгкие роутеры побеждают в условиях жёстких ограничений по стоимости.

Почему это важно
Наибольший суммарный отклик на HF Daily за сегодня (2,35 тыс.) и первый открытый фреймворк роутинга, объединяющий контекст, энкодеры моделей, скоринг и правила решений на едином компонуемом интерфейсе.

Как риторика может взломать оценки ИИ-ревьюеров? Разбор риторической чувствительности ИИ-систем научного рецензирования

исследования офиц. + СМИ 2 ист. ~1 мин

Использует 4200 рукописей, полученных из 120 заявок ICLR 2026, чтобы проверить, как шесть риторических измерений (фрейминг доказательств, позиция новизны, фрейминг охвата и т.д.) сдвигают оценки пяти LLM-ревьюеров при стандартном и строгом протоколах. Фрейминг доказательств и позиция новизны дают наибольшие контрасты оценок; низкие оценки стремятся расти, высокие — снижаться, а строгое рецензирование снижает среднюю общую оценку на 1,36 балла без снижения риторической чувствительности.

Почему это важно
Контролируемый эмпирический ответ на вопрос, затрагивающий каждый пайплайн LLM-as-judge: какие риторические ходы наиболее надёжно двигают оценку и насколько надёжно ревьюеров можно рестабилизировать изменениями протокола.