Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

Machinelearning@ai_machinelearning_big_dataТехнологии и IT25 сентября 2026, 14:05

✔️ Google добавила в Gemini 3.8 Live говорящий видеоаватар Gemini 3.8 Live with Live Avatar - дополнение к голосовой модели Gemini 3.8 Live, которую компания представила 15 сентября. Функция почти в реальном времени генерирует видео с персонажем, который ведёт разговор голосом, двигает губами в такт речи и меняет мимику. Модель одновременно принимает от пользователя видео и звук, поддерживает естественную смену реплик и вызывает внешние инструменты в фоне, не прерывая беседу. Движения губ и мимика подстраиваются под 97 языков, и, по словам Google, переход с одного на другой не ухудшает картинку. Персонажа можно выбрать из готовой библиотеки или создать своего по одному изображению с сохранением сходства и фирменного стиля. Создание собственных аватаров пока открыто только корпоративным клиентам по запросу. Весь аудио- и видеовыход помечается невидимым водяным знаком SynthID. Google предлагает использовать аватар в клиентской поддержке и интерактивных инструкциях. Функция вышла в общий доступ в Gemini Enterprise и через Gemini Live API. Видео с аватаром стоит 1 доллар за миллион выходных токенов, секунда ролика расходует примерно 6 тыс токенов, а платить нужно только за время, пока аватар говорит. Минута его речи обходится в 37 центов за видео плюс 2 цента за голос, входящие звук и видео оплачиваются отдельно. @ai_machinelearning_big_data #news #ai #ml

  • 64
  • 22
  • 14
  • 13
  • 9
  • 8

Похожие посты

Бэкдор@whackdoorТехнологии и ITвчера
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

Google выпустил две лучшие в мире нейронки для генерации речи — Gemini 3.8 Flash TTS и её младший брат Flash-Lite знают больше 1️⃣0️⃣0️⃣ языков и диалектов. • Внутри — 2000 разных голосов на выбор с акцентами и эмоциями. • Можно сгенерировать свой голос и сразу отредактировать под свои нужды. • Голос не меняет даже по ходу зачитывания самых больших файлов. • Смех, охи, вздохи, целые диалоги с разными участниками — новый голос от Google может всё! Делаем озвучку в AI Studio — здесь. 👍 Бэкдор

  • 127
  • 36
  • 2
Техномотель @technomotelТехнологии и IT23 сентября 2026
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

Вы НЕ ПОЙМЁТЕ, что с вами говорит ИИ — Гугл дропнул самую мощную нейронку для генерации голоса. Что может Gemini 3.8 Flash TTS: · Создаёт голос по текстовому описанию; · Владеет сотней языков и диалектов; · Имеет 2000+ готовых голосов с региональными вариантами; · Точно клонирует голос по 30-секундной записи — скамеры ликуют; · Отыгрывает роли — пишем сценарий, модель читает с выражением. · Держит голос стабильным часами; · Естественно смеётся, вздыхает и перебивает. Скоро обещают ремиксы гол...

  • 97
  • 29
  • 18
  • 10
  • 8
  • 2
GPT4Telegram | AI Community @gpt4telegramТехнологии и ITвчера
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

👨 You Can Now Create "Live" AI Avatars With Gemini You can create companions based on real people or illustrated characters. The AI double will answer questions in real time, speaking in 97 languages. For now, the feature is available only to enterprise customers.

  • 269
  • 263
  • 249
  • 231
  • 21
  • 19
Не баг, а фича@bugnotfeatureТехнологии и ITвчера
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

⚡️ Мощнейшие нейронки для генерации голоса выкатила Google — это Gemini 3.8 Flash TTS и её дешёвая версия Flash-Lite TTS. Обе уже держат топ по бенчам: 🔅 Знают больше 1️⃣0️⃣0️⃣ языков и диалектов, в том числе русский; 🔅 Имеют больше 2000 голосов с различными акцентами; 🔅 Повторят ЛЮБОЙ голос по 30-секундной записи речи; 🔅 Можно сгенерить новый голос по текстовому промпту и даже редачить его; 🔅 Голос не меняется несколько часов аудио; 🔅 Можно добавлять реалистичный смех, вздохи и перебиван...

  • 36
  • 21
  • 5
  • 5
  • 1
  • 1
Техномотель @technomotelТехнологии и IT2 часа назад
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

ИИ от Гугла обрёл ЛИЦО — корпорация представила фичу Live Avatars. Gemini 3.8 Live создаёт цифровую личность с любой внешкой, обладающую точной синхронизацией губ и естественной мимикой. Она легко переключается между 97 языками без ухудшения качества видео. Нейроперсонаж может стать маскотом вашей компании или онлайн-консультантом. Он умеет запускать вызовы инструментов, при этом продолжая активный диалог и обеспечивая непрерывный поток беседы. 🤔 — «зловещая долина» какая-то ИИ от Гугла обр...

  • 93
  • 17
  • 13
  • 1
Провод@provodТехнологии и ITвчера
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

⚡️ Настоящих монстров для генерации голоса дропнула Google — свежая Gemini 3.8 Flash TTS и дешёвая версия Flash-Lite TTS уже разорвали все бенчмарки. По порядку: • Знают больше 1️⃣0️⃣0️⃣ языков и диалектов, русский, естественно, на месте; • 2000 голосов на выбор с разными акцентами; • Можно сгенерить голос по текстовому промпту и сразу же его отредачить; • Голос не меняется и не глючит даже на больших файлах; • Можно добавить смех, вздохи или создать целый диалог с несколькими участниками. Бе...

  • 49
  • 15
  • 4
  • 4
  • 3
CodeCamp@codecampТехнологии и IT23 сентября 2026
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

Google тоже выпустила SOTA модели — правда, пока что для перевода текста в речь 🔈 Компания представила сразу две модели. Главное: — Gemini 3.8 Flash TTS, старшая модель, которая умеет создавать голоса с нуля по текстовому описанию и отдельно управлять каждой репликой, включая темп, интонацию и манеру речи. Сами Google пишут, что она идеальна для озвучки персонажей в играх и аудиокниг. — Gemini 3.8 Flash-Lite TTS, более быстрая и дешёвая версия для массовой озвучки, аудиоконтента и голосовых а...

  • 47
  • 25
  • 5
  • 4
LOLZTEAM@lolz_legalТехнологии и ITвчера
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

🗣 Google выкатила мощнейшие нейросети для генерации голоса – Gemini 3.8 Flash TTS и Flash-Lite TTS Обе модели уже возглавляют топы по бенчмаркам качества озвучки. ➖ Поддерживают больше 100 языков и диалектов, включая русский; ➖ В арсенале свыше 2000 голосов с разными акцентами; ➖ Способны воспроизвести любой голос всего по 30-секундной записи речи; ➖ Можно сгенерировать новый голос по текстовому описанию и редактировать его; ➖ Голос остается стабильным на протяжении нескольких часов аудио; ➖ ...

  • 10
  • 4
  • 1
Технолавка@technolavkaЮмор и развлечения23 сентября 2026
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

⚙️ Google представили ДВЕ новые модели для генерации речи — Gemini 3.8 Flash TTS и Flash-Lite TTS. Теперь нейронка умеет не просто читать текст, а буквально отыгрывать его как актёр: 🟢 создаёт голос по текстовому описанию и управляет интонацией, темпом и манерой речи; 🟢 поддерживает 100+ языков и диалектов; 🟢 даёт доступ к более чем двум тысячам готовым голосам; 🟢 клонирует голос всего по 30 секундам записи; 🟢 умеет озвучивать диалоги нескольких персонажей — со смехом, вздохами и перебива...

  • 21
  • 1
Джейпег Малевича@malepegТехнологии и IT23 сентября 2026
Google представила новые модели Gemini для генерации речи с поддержкой множества языков и голосов

🤍 Google дропнули сразу две новые модели для генерации речи — Gemini 3.8 Flash TTS и более дешёвую Flash-Lite TTS. Главные возможности: • создают голос по текстовому описанию и позволяют управлять интонацией, темпом и манерой речи; • поддерживают 100+ языков и диалектов; • предлагают более 2000 готовых голосов; • умеют клонировать голос всего по 30-секундной записи; • могут озвучивать диалоги с несколькими персонажами, включая смех, вздохи и перебивания. Пробуем в API Gemini и Google AI Stud...

  • 15
  • 7
  • 4
  • 3