Нейросеть для озвучки текста: один абзац и восемь голосов

Нейросети читают текст вслух, и по описанию все обещают естественный голос. Разница слышна только на слух — мы дали один абзац всем моделям каталога, послушайте каждую.

Все модели из сравнения — по одной подписке. Первая неделя бесплатно, карта не нужна.

Попробовать бесплатно

Дали восьми нейросетям один и тот же абзац на русском — про осень, с запятыми и паузами — и попросили прочитать вслух. Послушайте каждую: разница слышна сразу, а по описанию моделей её не угадать.

Один текст, от 15 до 25 секунд

Первое, что бросается в глаза ещё до прослушивания: один и тот же абзац модели читают за разное время. Самая быстрая уложилась в четырнадцать секунд с небольшим, самая медленная растянула на двадцать пять — почти вдвое дольше.

Это не мелочь. Если вы озвучиваете ролик, где голос должен уложиться в конкретный хронометраж, темп решает больше, чем тембр. Быстрые модели придётся замедлять, медленные — подрезать.

Паузы важнее скорости

Мы посчитали, сколько в каждой записи тишины — это и есть паузы между фразами. Оказалось, что самая медленная модель делает меньше всего пауз: 38% против 47% у одной из быстрых.

Звучит это именно так, как и следует из цифр: она не выдерживает интонацию, а тянет слова. Речь получается медленной, но не размеренной — эффект скорее сонный, чем спокойный.

И наоборот: модель, которая читает быстро, но с паузами на запятых, воспринимается живее. Ритм важнее темпа — на слух это очевидно, а по описанию модели не видно вовсе.

Русский понимают все, но голос надо выбрать

Ни одна модель не отказалась от русского текста — читают все восемь. Различия в другом: как расставлены ударения в редких словах и насколько естественно звучат окончания.

Отдельно стоит послушать слова с ё и составные слова: там модели расходятся чаще всего.

У одной модели голосов бывает девяносто

Модель — это ещё не голос. Внутри каждой их несколько, и разброс там больше, чем между самими моделями:

  • Deepgram Aura-290 голосов, больше, чем у любой другой модели;
  • Microsoft MAI-Voice — 43 голоса на пятнадцати языках, среди них два русских: Маша и Лев;
  • Gemini TTS — 11, OpenAI TTS — 9;
  • MiniMax — выбора нет вовсе, голос один.

Что важно понять: «русский голос» и «читает по-русски» — разные вещи. У Aura-2 нет ни одного голоса с пометкой ru, но русский текст она читает. Голос задаёт тембр, а не язык: Nova у OpenAI и Kore у Gemini называются по-английски и говорят по-русски.

Разница между голосами внутри одной модели слышна сразу — мужской и женский, спокойный и бодрый, быстрый и размеренный. Между моделями на одном абзаце она куда тоньше. Поэтому выбирать стоит в таком порядке: сначала голос, потом уже модель.

В ТвойГПТ голос выбирается прямо в форме озвучки, и каждый можно послушать до того, как тратить лимит — короткий образец записан заранее для всех голосов каталога.

Цена: разброс в семь раз, качество — нет

Озвучка считается по символам, и это самый бережный к лимиту вид генерации: абзац из двухсот с лишним знаков почти его не расходует — ни у одной модели.

При этом разброс между самой дешёвой и самой дорогой — почти в семь раз. Слышимой разницы, которая оправдывала бы семикратную цену, в нашем прогоне не нашлось: дорогие модели звучат иначе, но не лучше.

Практический вывод: выбирайте по голосу и темпу, а не по цене. На объёме в книгу разница накопится, но на роликах и озвучке постов она незаметна.

Что учесть перед озвучкой

  • Прослушайте весь текст, а не начало. Ошибки в ударениях появляются на редких словах, и они разбросаны по всему абзацу.
  • Проверьте хронометраж, если голос идёт под видео: разница в темпе доходит до двух раз.
  • Расставьте знаки препинания. Модели читают по пунктуации — текст без запятых превращается в поток без пауз.
  • Числа и сокращения пишите словами. «15%» разные модели прочтут по-разному, а «пятнадцать процентов» — одинаково.

Как попробовать

Все модели из сравнения работают в ТвойГПТ по одной подписке. Вставляете текст, выбираете модель — получаете аудиофайл.

Озвучку почти всегда переслушивают: голос выбирают на слух, а текст правят под ритм. Отдельной платы за попытку нет, и это самый щедрый вид генерации по расходу — целая статья озвучивается за копейки.

Первая неделя бесплатно — карта не нужна.

Что получилось у каждой модели

Одна и та же задача, один и тот же исходник. Ничего не отбирали: показываем всё, включая неудачные результаты.

OpenAI 2.9 с
Microsoft: MAI-Voice-2-Flash Про
Microsoft 2.2 с
Google: Gemini 3.1 Flash TTS Preview Про
Google 22.5 с
Microsoft: MAI-Voice-2 Про
Microsoft 3.3 с
Deepgram: Aura-2 Про
Deepgram 15 с
TTS HD Про
OpenAI 4.5 с
MiniMax: Speech 2.8 Turbo Про
Minimax 4.6 с
MiniMax: Speech 2.8 HD Про
Minimax 5 с

Все эти модели — по одной подписке

Переключаться можно в любой момент, первая неделя бесплатно.

Попробовать