Gemini 3.1 Flash TTS: озвучка диалогом на несколько голосов

Обновлено: 14 августа 2026 г.

Gemini 3.1 Flash TTS: озвучка диалогом на несколько голосов

<h1>Gemini 3.1 Flash TTS: озвучка диалогом на несколько голосов</h1> <p>В музыкальной студии появился ещё один движок озвучки — и он устроен принципиально иначе, чем привычный синтез речи.</p> <h2>Не текст, а сценка</h2> <p>Вы задаёте не одну реплику, а <strong>список дикторов и их реплики по очереди</strong> — и получаете готовый диалог одной дорожкой. Ведущий и гость, продавец и покупатель, два героя ролика: голоса не склеиваются из отдельных генераций, а звучат как разговор, с нормальными паузами и реакцией друг на друга.</p> <p>Сверху — поле «сцена»: там вы обычными словами описываете обстановку и настроение («спор на кухне, оба раздражены», «подкаст, спокойно и с иронией»), и модель подстраивает подачу. Есть контекстный пример для тонкой настройки и температура — насколько живо или ровно читать. Общий объём реплик — до 10 000 знаков.</p> <h2>Сколько стоит</h2> <p>1,5 токена за 100 знаков, минимальный чек — 5 токенов.</p> <p>Скажем честно: посимвольно это дороже, чем ElevenLabs. Разница в том, что вы покупаете: ElevenLabs — быстрая и дешёвая начитка одним голосом, Gemini TTS — сцена на несколько голосов с управляемой подачей. Для закадрового текста берите первый, для диалогов и живых сценок — второй.</p> <p><em>Цены указаны актуальные на сегодня — тарифы моделей со временем меняются.</em></p> <p>Попробовать — <a href="/studio">в Студии</a>.</p>

Все статьи блога Genosai