Яндекс.Метрика
← Дайджест от 23 сентября 2026

Google выпустила Gemini 3.8 TTS — синтез речи с двумя тысячами голосов

Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS — модели синтеза речи, превращающие текст в звук. Доступны больше 2000 готовых голосов и 100 языков, можно собрать свой голос с нужным акцентом или клонировать существующий.

Модели умеют вести диалог на несколько голосов и принимать указания по подаче построчно: где сделать паузу, где сменить интонацию. Lite-версия рассчитана на массовые прогоны и стоит дешевле. Google заявляет первое место в голосовых тестах Hume AI.

Simon Willison собрал на новом API интерфейс и за вечер сгенерировал диалог двух голосов, отметив низкую цену прогона.

Logan Kilpatrick@OfficialLoganK
Introducing Gemini 3.8 Flash and Flash-Lite TTS, our new SOTA text to speech model with: - a new voice design experience - 2,000+ production ready voices - voice replication - support for 100 languages - voice remixing (soon) - #1 spot on Hume AI's voice benchmarks and more!!
23 сентября 2026
Что говорят
simonwHacker News
«Клонирование голоса по 30-секундному образцу, с проверкой согласия, водяным знаком SynthID и C2PA» — видимо, клонирование голоса уже настолько доступно у других провайдеров, что Google перестал стесняться и выкатил своё.
thangalinHacker News
У меня локальное веб-приложение KeenLore, которое озвучивает книгу целым составом персонажей — без облака и без оплаты токенов. Определение принадлежности реплик даёт 97,2% точности (485 из 499 цитат), описания голосов автозаполняются по тексту прозы; крутится на Gemma 4 и Qwen3 TTS на видеокарте T1000 с 8 ГБ.
MulticompHacker News
Я «ставлю» собственный фанфик по Star Trek и пробовал озвучивать сцены как радиоспектакль: у GPT-Live слишком мало контроля, голоса не получается сделать достаточно разными и выразительными. Большая библиотека голосов Gemini 3.8 и построчное управление подачей — то, что нужно, хотя я не понимаю, который из 5286 продуктов Gemini это и как вообще начать.