StepAudio 3 Realtime: аудио-языковая модель с рассуждением «думай, пока говоришь» и асинхронными вызовами инструментов
StepFun
StepAudio 3 Realtime — аудио-языковая базовая модель, построенная вокруг непрерывного цикла listen-converse-think-act: глубокое акустическое восприятие, бесшовный дуплексный обмен репликами с естественными перебиваниями, параллельное рассуждение «думай, пока говоришь» и асинхронные вызовы инструментов внутри голосового разговора. Заявлены качество диалога и рассуждения, сопоставимое со специализированными reasoning-моделями, при говорении в реальном времени.
Почему это важно
90 апвоутов на HuggingFace Daily Papers (2026-09-16); SOTA в сокращении разрыва между полной глубиной рассуждения и задержкой голоса в реальном времени — ключевом ограничении голосовых агентов.
Важность: 2/5
Заметный технический отчёт от StepFun
Источники
официальный
StepAudio 3 Realtime Technical Report
официальный
StepAudio 3 Realtime - Hugging Face Daily Papers