Google тоже выпустила SOTA модели — правда, пока что для перевода текста в речь 🔈 Компания представила сразу две модели. Главное: — Gemini 3.8 Flash TTS, старшая модель, которая умеет создавать голоса с нуля по текстовому описанию и отдельно управлять каждой репликой, включая темп, интонацию и манеру речи. Сами Google пишут, что она идеальна для озвучки персонажей в играх и аудиокниг. — Gemini 3.8 Flash-Lite TTS, более быстрая и дешёвая версия для массовой озвучки, аудиоконтента и голосовых агентов; — Поддерживается 100+ языков и диалектов, а готовых голосов уже больше 2000. При этом для копирования конкретного голоса достаточно всего 30 секунд записи. — Модели они доступны через Gemini API и Google AI Studio. Что угодо делают, лишь бы Gemini 4 не выпускать 🤬
- 47
- 25
- 5
- 4