Meta Superintelligence Labs releases Muse Voice Transcribe, a real-time speech model
Meta
Announced September 1, Muse Voice Transcribe is Meta Superintelligence Labs' first real-time audio perception model: streaming speech-to-text with native speaker diarization and endpointing in a single model, handling hour-long sessions with 20+ speakers, 70+ languages (25 validated at launch) and mid-sentence code-switching, with adaptive delay per token. It powers dictation in the Meta AI Mac app and is offered via Meta's Model API at $3 per 1,000 audio minutes.
Why it matters
Single-model streaming ASR with built-in diarization challenges dedicated transcription APIs
Importance: 3/5
First real-time audio model from Meta Superintelligence Labs