StepAudio 3 Realtime: аудио-языковая модель с рассуждением «думай, пока говоришь» и асинхронными вызовами инструментов

StepFun

исследования официальный 2 ист. ~1 мин

StepAudio 3 Realtime — аудио-языковая базовая модель, построенная вокруг непрерывного цикла listen-converse-think-act: глубокое акустическое восприятие, бесшовный дуплексный обмен репликами с естественными перебиваниями, параллельное рассуждение «думай, пока говоришь» и асинхронные вызовы инструментов внутри голосового разговора. Заявлены качество диалога и рассуждения, сопоставимое со специализированными reasoning-моделями, при говорении в реальном времени.

Почему это важно

90 апвоутов на HuggingFace Daily Papers (2026-09-16); SOTA в сокращении разрыва между полной глубиной рассуждения и задержкой голоса в реальном времени — ключевом ограничении голосовых агентов.

Важность: 2/5

Заметный технический отчёт от StepFun

Источники

официальный StepAudio 3 Realtime Technical Report