Tencent открывает AuK — speech foundation model на 1.5B параметров для генерации и редактирования

Tencent Hunyuan

аудио официальный 4 ист. ~1 мин

Tencent выпустила AuK и её дистиллированный вариант AuK-Flash под лицензией MIT на Hugging Face: speech foundation models на 1.5B параметров, которые справляются с zero-shot TTS, клонированием голоса по 10-секундному референсу, instruct TTS по текстовому описанию, перезаписью текста песен при пении и редактированием высоты тона, скорости, эмоций и тембра по инструкции, плюс шумоподавлением и разделением источников. Обучение — на ~3 млрд пар «инструкция — аудио» и 1.95 млн часов по пяти семействам задач; AuK-Flash работает с быстрой 4-шаговой инференцией, примерно в 4.5 раза быстрее.

Почему это важно

171 апвоут на HF Daily Papers. Один открытый пермиссивно лицензированный модель, объединяющий TTS, клонирование и редактирование речи на естественном языке, — сильная бесплатная база для коммерческих голосовых приложений, как на китайском, так и на английском.

Важность: 4/5

Крупный релиз открытой speech foundation model + 171 апвоут на HF Daily Papers

Источники

официальный tencent/AuK — Hugging Face
официальный tencent/AuK-Flash — Hugging Face
официальный arXiv 2609.08936