Gemini 3.1 Flash TTS: озвучка диалогом на несколько голосов

Обновлено: 14 августа 2026 г.

Gemini 3.1 Flash TTS: озвучка диалогом на несколько голосов

Gemini 3.1 Flash TTS: озвучка диалогом на несколько голосов

В музыкальной студии появился ещё один движок озвучки — и он устроен принципиально иначе, чем привычный синтез речи.

Не текст, а сценка

Вы задаёте не одну реплику, а список дикторов и их реплики по очереди — и получаете готовый диалог одной дорожкой. Ведущий и гость, продавец и покупатель, два героя ролика: голоса не склеиваются из отдельных генераций, а звучат как разговор, с нормальными паузами и реакцией друг на друга.

Сверху — поле «сцена»: там вы обычными словами описываете обстановку и настроение («спор на кухне, оба раздражены», «подкаст, спокойно и с иронией»), и модель подстраивает подачу. Есть контекстный пример для тонкой настройки и температура — насколько живо или ровно читать. Общий объём реплик — до 10 000 знаков.

Сколько стоит

1,5 токена за 100 знаков, минимальный чек — 5 токенов.

Скажем честно: посимвольно это дороже, чем ElevenLabs. Разница в том, что вы покупаете: ElevenLabs — быстрая и дешёвая начитка одним голосом, Gemini TTS — сцена на несколько голосов с управляемой подачей. Для закадрового текста берите первый, для диалогов и живых сценок — второй.

Цены указаны актуальные на сегодня — тарифы моделей со временем меняются.

Попробовать — в Студии.

Все статьи блога Genosai