SwanTale: унифицированная генерация многоголосой речи и аудио для instruct и zero-shot задач

ByteDance

исследования официальный 1 ист. ~1 мин

Модель ByteDance для генерации многоголосой выразительной речи и аудио поддерживает как instruct-режим (по текстовой подсказке), так и zero-shot (по референсному аудио), сочетая контроль качества с reward-conditioning, Engram conditioning и унифицированный MoE, обученный с curriculum learning и пост-тренингом GRPO. Ориентирована на такие приложения, как дубляж, аудиодрамы и производство коротких видео.

Почему это важно

Публикация в HuggingFace Daily Papers со 142 голосами; часть линейки аудио-исследований SwanAIGC от ByteDance наряду с SwanVoice и SwanBench-Speech.

Важность: 4/5

Заметная статья со 142 голосами HF Daily Papers (порог >=100), бонус +1.

Источники