#speech
- Thinking Machines Lab представляет TML-Interaction-Small: мультимодальная модель MoE на 276B для работы в реальном времени Thinking Machines Lab models-llm
- EVA-Bench: сквозной фреймворк для оценки голосовых агентов ServiceNow AI research
- Gemini 3.5 Live Translate: синхронный перевод речи на 70+ языках Google DeepMind audio
- Google представила речевые модели Gemini 3.8 Live и 3.8 Live Extended Thinking Google DeepMind models-llm
- MiniCPM-o 4.5: полнодуплексное омнимодальное AI в реальном времени на граничных устройствах OpenBMB / Tsinghua University research
- NVIDIA выпускает Nemotron-Labs-Audex-30B-A3B: единая MoE-модель для аудио и текста NVIDIA audio
- OpenAI добавила голосовое управление ChatGPT в десктоп-приложение с поддержкой Codex OpenAI tools
- Cartesia выпускает TTS Sonic-3.6 и заявляет верхнюю строчку Elo, обгоняя Eleven v3 Cartesia audio
- SwanTale: унифицированная генерация многоголосой речи и аудио для instruct и zero-shot задач ByteDance research
- Tencent открывает AuK — speech foundation model на 1.5B параметров для генерации и редактирования Tencent Hunyuan audio
- Audio Interaction Model: унифицированный стриминговый фреймворк, объединяющий офлайн и реальновременную обработку аудио по инструкциям research
- xAI запускает Grok Voice Agent Builder в бета-версии xAI tools
- Gander: end-to-end omni-агент взаимодействия с архитектурой Cerebellum-Brain Tencent Hunyuan research
- Яндекс открывает медицинского ИИ-ассистента для всех российских врачей Yandex industry
- Meta Superintelligence Labs выпустила Muse Voice Transcribe — модель распознавания речи в реальном времени Meta audio
- StepAudio 3 Realtime: аудио-языковая модель с рассуждением «думай, пока говоришь» и асинхронными вызовами инструментов StepFun research
- В сборке приложения обнаружены следы Grok Voice Mode для Apple CarPlay xAI tools