В Google AI Studio можно бесплатно озвучить текст на русском языке с помощью нейросети Gemini. Вы вставляете готовый текст, выбираете голос, задаёте нужную манеру речи и через несколько секунд получаете готовую аудиозапись.
Сейчас для озвучки в Google AI Studio доступна модель Gemini 3.1 Flash TTS Preview. Она поддерживает русский язык, умеет менять интонацию и темп речи, передавать эмоции и озвучивать диалоги двумя разными голосами.
Ниже покажу, как сделать озвучку текста в Google AI Studio, какой голос выбрать и как настроить звучание, чтобы результат был похож на нормальную дикторскую запись.
Как озвучить текст в Google AI Studio
Самый простой способ:
- Откройте Google AI Studio и войдите в Google-аккаунт.
- Перейдите к генерации речи и выберите Gemini 3.1 Flash TTS Preview.
- Если нужен один диктор, используйте режим с одним голосом.
- Выберите подходящий голос.
- Вставьте текст для озвучки.
- Укажите модели, как именно нужно говорить: спокойно, эмоционально, быстро, медленно и т. д.
- Запустите генерацию.
- Прослушайте результат и скачайте готовое аудио.

Сам текст можно писать сразу на русском. Модель определяет язык автоматически.
Какой голос выбрать для русской озвучки
В Gemini TTS доступно 30 голосов. Они отличаются характером звучания.
Например, Charon описывается как информативный голос, Iapetus и Erinome — как чёткие, Schedar — как ровный, Gacrux — как более зрелый, Achird — как дружелюбный, Sulafat — как тёплый.

Я не советую долго выбирать голос только по названию или короткому предпрослушиванию. Лучше взять один фрагмент русского текста на 15–20 секунд и сгенерировать его несколькими голосами.
Один и тот же голос может звучать совершенно по-разному в зависимости от инструкции.
Промпт для естественной озвучки текста
Для обычной дикторской озвучки не нужен огромный промпт. Я бы начинал с такого:
Озвучь следующий текст на естественном русском языке.
Стиль: профессиональный диктор.
Подача спокойная, уверенная и естественная.
Темп средний.
Чёткая артикуляция.
Делай естественные смысловые паузы.
Не используй чрезмерно театральную интонацию.
ТЕКСТ:
[вставьте свой текст]
Если голос получился слишком быстрым, достаточно изменить одну строку:
Темп немного медленнее обычной разговорной речи.
Если звучит слишком монотонно:
Выделяй интонацией важные слова и смысловые фразы, но не переигрывай.
Не стоит добавлять десятки требований сразу. Чем понятнее задача, тем проще добиться предсказуемого результата.
Как управлять эмоциями и интонацией
В Gemini 3.1 Flash TTS появились аудиотеги. Они вставляются прямо в текст в квадратных скобках и позволяют менять подачу конкретной фразы.
Например:
[serious] Сегодня мы расскажем историю, которая началась больше восьмидесяти лет назад.
[curious] Но одна находка полностью изменила ход поисковых работ.
[very slow] На поверхности появился солдатский медальон.
[whispers] Имя внутри всё ещё можно было прочитать.
Можно использовать, например, [serious], [excited], [curious], [whispers], [shouting], [tired], [sarcastic], [laughs], [sighs], [gasp].
Полного фиксированного списка тегов нет. Gemini понимает разные описания эмоций и способов произношения, поэтому с ними можно экспериментировать.
Для русского текста сами аудиотеги лучше писать на английском.
Как сделать дикторский голос
Если нужна озвучка для видео, презентации или документального ролика, попробуйте такой вариант:
Озвучь текст на русском языке как профессиональный диктор.
Голос спокойный и уверенный.
Подача естественная и профессиональная.
Темп средний, без спешки.
Делай небольшие паузы между смысловыми блоками.
Чётко произноси имена, даты и названия.
Без рекламной и театральной интонации.
ТЕКСТ:
[вставьте текст]
Для исторического или документального материала можно сделать подачу немного серьёзнее:
Озвучь текст на русском языке в стиле документального фильма.
Спокойная и уважительная манера речи.
Темп немного медленнее обычного.
Чёткая артикуляция.
Естественные паузы после важных фраз.
Не создавай искусственную драму.
ТЕКСТ:
[вставьте текст]
Как сделать диалог двумя голосами
Google AI Studio позволяет создавать озвучку не только одним, но и двумя голосами.
Это удобно для интервью, диалогов, небольших подкастов или роликов с двумя ведущими.
Например:
Алексей: Сегодня проверим, насколько хорошо Gemini умеет озвучивать русский текст.
Анна: И можно действительно использовать два разных голоса?
Алексей: Да. Каждому участнику можно назначить свой голос и свою манеру речи.

Для каждого спикера выбирается свой голос. Манеру речи тоже можно описать отдельно.
Как сделать речь естественнее
Качество зависит не только от модели, но и от самого исходного текста.
Если предложение занимает пять строк и написано канцелярским языком, нейросеть тоже будет читать его тяжело.
Например, вместо:
В рамках реализации проекта участниками были проведены мероприятия, направленные на сохранение исторической памяти среди представителей молодого поколения.
Для озвучки лучше написать:
Участники проекта провели несколько мероприятий. Их главная задача — сохранить историческую память и рассказать о ней молодёжи.
То есть текст для голоса лучше немного приблизить к нормальной устной речи.
Особенно внимательно проверяйте фамилии, населённые пункты, сокращения и даты.
Например, вместо сокращения «ПДР» нужно написать полностью «Поисковое движение России», вместо «в 1945 г.» — «в тысяча девятьсот сорок пятом году»
Если модель неправильно ставит ударение, можно добавить знак ударения в само слово или немного изменить его написание специально для озвучки.
Как скачать готовую озвучку
После генерации результат можно прослушать непосредственно в Google AI Studio.
Если голос не понравился, попробуйте запустить генерацию ещё раз или немного изменить инструкцию. Даже с одинаковым текстом результат может отличаться.
Когда вариант устраивает, скачайте аудиофайл и используйте его в видеоредакторе, презентации, подкасте или другом проекте.

Google AI Studio действительно бесплатный?
Для Gemini 3.1 Flash TTS существует бесплатный уровень использования. Поэтому для обычных экспериментов и небольших озвучек платить за саму генерацию не обязательно.
При этом лимиты и условия Google могут меняться, поэтому для больших объёмов работы или использования API лучше проверять актуальные условия отдельно.
Можно ли озвучивать русский текст?
Да. Русский язык официально поддерживается Gemini TTS.
Специально выбирать русский язык обычно не требуется: модель определяет язык текста автоматически.
Почему Google AI Studio плохо произносит отдельные слова?
Чаще всего проблемы возникают с фамилиями, редкими географическими названиями, сокращениями и словами, где возможно несколько вариантов ударения.
Попробуйте изменить написание слова, добавить знак ударения или расшифровать сокращение.
Для важных записей я советую сначала отдельно озвучить небольшой фрагмент с именами, датами и названиями, а уже после этого запускать весь текст.
Подводя итог
Google AI Studio позволяет бесплатно озвучивать русский текст с помощью Gemini 3.1 Flash TTS. Для простой озвучки достаточно выбрать голос, вставить текст и задать модели нужную манеру речи. Если требуется более живой результат, используйте аудиотеги: с их помощью можно менять эмоцию, темп и подачу отдельных фраз.
Для большинства роликов, презентаций, инструкций и закадровой озвучки я бы начинал с простого промпта и уже после первой генерации корректировал только то, что действительно не устраивает в голосе.
Больше моих инструкций по нейросетям, озвучке, фото, видео и цифровой памяти можно найти на сайте медяный.рф и в Telegram-канале «Медяный пишет».
Что почитать дальше
Если вы работаете с видео, голосом, архивными фотографиями или памятными роликами, вам могут быть полезны другие инструкции:
- Генерация качественного аудио для подкаста: сравнение ElevenLabs и Google Gemini
Сравнение двух сервисов на одном тексте: качество голоса, русский язык, доступность, ограничения и личные впечатления. - Как оживить фото через Алису: инструкция, промпты, примеры и ограничения
Подойдёт, если нужно быстро превратить обычную фотографию в короткое видео. - Как из старого фото сделать видео с голосом ветерана
Инструкция для памятного ролика, где изображение сочетается с голосовой озвучкой. - Как восстановить архивную фотографию, сделать цветной и добавить плавную анимацию
Полезно, если сначала нужно улучшить старый снимок, а уже потом делать видео. - Как сделать памятное видео, где вы обнимаете ветерана
Более эмоциональный формат для семейной памяти и личных историй.
Генерация изображений без сложных настроек
Я собрал в MAX бесплатного бота для генерации изображений, открыток, аватарок и нейрофотосессий. Внутри есть готовые шаблоны и режим со своим промптом. Там же веду канал «Медяный пишет | нейросети» — с короткими инструкциями, промптами и примерами из практики.
Открыть бесплатного бота


