Google представила две модели преобразования текста в речь: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая рассчитана на подробную творческую настройку и создание голосов персонажей, вторая — на массовую озвучку, дубляж и голосовых агентов с упором на стоимость. Обе модели позволяют задавать для отдельных строк тон, темп, акцент, актёрские ремарки и очередность реплик.
Flash TTS умеет создавать голос по текстовому описанию роли и характеристик. Google заявляет поддержку более 100 языков и диалектов, а также библиотеку из более чем 2000 готовых голосов. Согласованный голос можно сохранить для повторного использования. Отдельная функция воспроизводит голос по 30-секундному образцу, но пользователь должен владеть правами на запись и предоставить устное подтверждение от владельца голоса, совпадающего с образцом.
Компания сообщает, что каждый аудиофрагмент Gemini Audio получает незаметную маркировку SynthID. Для функции копирования голоса также заявлены учётные данные C2PA, которые помогают подтвердить происхождение материала. Возможность менять тембр, высоту, темп и акцент уже выбранного голоса Google пока только готовит.
Обе модели с 23 сентября поэтапно появляются в Gemini API и Google AI Studio. Flash TTS также доступна в Gemini Notebook, а Flash-Lite TTS — в Google Vids. Для корпоративных клиентов API в Gemini Enterprise обещан позднее. Функция копирования голоса в Google AI Studio недоступна в штатах Иллинойс и Техас, Европейской экономической зоне, Великобритании, Швейцарии и Индии. В исходной публикации не указаны цены, квоты API и точные сроки завершения развёртывания. Оценки качества в анонсе принадлежат Google и связанным с запуском бенчмаркам; независимое тестирование TheTimeAI не проводилось.