Ежедневный дайджест

4 пункта · ~4 мин · Неделя 2026-W31

Стоит знать (3)

Molt: масштабируемый PyTorch-native фреймворк для обучения агентного reinforcement learning

NVIDIA
исследования офиц. + СМИ 3 ист. ~1 мин

NVIDIA открывает исходный код Molt — асинхронной RL-системы обучения на базе PyTorch, спроектированной так, чтобы оставаться достаточно компактной и понятной для одного исследователя, при этом сохраняя пропускную способность на уровне стеков на основе Megatron. Система поддерживает мультимодальные политики и политики на основе mixture-of-experts, а также обеспечивает on-policy обучение, никогда не обучаясь на токене, который текущая политика не сгенерировала. Используется Ray для размещения/асинхронных очередей, vLLM для rollout и NVIDIA AutoModel + FSDP2 для обучения.

Почему это важно
Самая рейтинговая статья на HuggingFace Daily Papers за 27.07.2026 с 605 голосами — это отражает высокий интерес сообщества к упрощению инфраструктуры агентного RL в масштабе; выходит как open-source репозиторий (NVIDIA-NeMo/labs-molt), а не только как статья.

AREX: на пути к рекурсивно самосовершенствующемуся агенту для глубокого исследования

исследования офиц. + СМИ 2 ист. ~1 мин

AREX — семейство агентов для глубокого исследования (плотная модель на 4B и MoE-модель 122B-A10B), обученных с помощью reinforcement learning на верифицированных синтетических задачах. Работает по схеме с двумя циклами: внутренний цикл собирает свидетельства и составляет предварительные ответы, внешний цикл проверяет ответ по каждому ограничению и запускает целевые дополнительные поиски по неразрешённым утверждениям. Обучаемый инструмент обновления контекста автономно сжимает растущую историю взаимодействия в компактное состояние, сохраняющее верифицированные свидетельства.

Почему это важно
141 голос на HuggingFace Daily Papers; самопроверяющий внешний цикл и автономное сжатие контекста устраняют два устойчивых недостатка агентов для долгосрочного исследования, показывая конкурентоспособные результаты по сравнению с более крупными моделями на BrowseComp, WideSearch, DeepSearchQA и Humanity's Last Exam.
Справочно (1)

K12-KGraph: граф знаний, привязанный к учебной программе, для бенчмаркинга и обучения образовательных LLM

исследования офиц. + СМИ 2 ист. ~1 мин

Авторы строят K12-KGraph — граф знаний, извлечённый из китайских школьных учебников K-12 (математика, физика, химия, биология), — и на его основе создают два ресурса: K12-Bench, бенчмарк из 23 640 вопросов, охватывающий пять категорий задач и проверяющий понимание учебной программы и пререквизитов, и K12-Train, набор данных для файнтюнинга с текстовыми и визуальными парами вопрос-ответ. Оценка показывает, что современные LLM испытывают трудности с рассуждениями о пререквизитах и взаимосвязях понятий, тогда как доменно-специфичный файнтюнинг на K12-Train значительно сокращает этот разрыв.

Почему это важно
Предоставляет один из первых бенчмарков для образовательных LLM, структурированных по учебной программе и учитывающих пререквизиты, а не построенных как плоские QA-тесты — полезен для оценки того, действительно ли модели понимают педагогическую структуру зависимостей.