Meta Superintelligence Labs выпустила Muse Voice Transcribe — модель распознавания речи в реальном времени
Meta
Анонсированная 1 сентября Muse Voice Transcribe — первая модель аудиовосприятия реального времени от Meta Superintelligence Labs: потоковый speech-to-text с нативной диаризацией говорящих и определением концовки фраз в единой модели, выдерживающий часовые сессии с 20+ говорящими, 70+ языками (25 валидировано на запуске) и переключением языков посреди предложения, с адаптивной задержкой на токен. Модель питает диктовку в Mac-приложении Meta AI и доступна через Model API Meta по $3 за 1000 аудиоминут.
Почему это важно
Потоковый ASR в одной модели со встроенной диаризацией бросает вызов специализированным транскрипционным API
Важность: 3/5
Первая модель аудио реального времени от Meta Superintelligence Labs