Meta Superintelligence Labs releases Muse Voice Transcribe, a real-time speech model

Meta

Audio media only 2 src. ~1 min

Announced September 1, Muse Voice Transcribe is Meta Superintelligence Labs' first real-time audio perception model: streaming speech-to-text with native speaker diarization and endpointing in a single model, handling hour-long sessions with 20+ speakers, 70+ languages (25 validated at launch) and mid-sentence code-switching, with adaptive delay per token. It powers dictation in the Meta AI Mac app and is offered via Meta's Model API at $3 per 1,000 audio minutes.

Why it matters

Single-model streaming ASR with built-in diarization challenges dedicated transcription APIs

Importance: 3/5

First real-time audio model from Meta Superintelligence Labs

Sources