Speechify
озвучка текста и ИИ-студия голоса
ElevenLabs превращает текст в естественную речь более чем на 70 языках, клонирует голоса, дублирует видео и питает голосовых агентов. Разбираем модели, реальные цены и подвох бесплатного тарифа.

ElevenLabs превращает текст в речь, которая звучит как живой человек, а не как диктор. Сервис начинался как инструмент синтеза речи, а вырос в полноценную аудиоплатформу: закадровый голос, клонирование голоса, дубляж на другие языки, расшифровка, разговорные голосовые агенты и генерация музыки живут в одном аккаунте и работают через один API.
Причина, по которой он занял категорию, узкая и конкретная — просодия. Большинство синтезаторов речи правильно произносят слова и ошибаются в подаче: произношение верное, ритм плоский, ударение не там. ElevenLabs справляется с паузами, акцентами и эмоциональным регистром достаточно хорошо, чтобы слушатель переставал замечать машину. В этом весь продукт.
Выбор модели важнее любой другой настройки: модели по-разному разменивают качество на задержку. Лучшей вообще не существует — есть подходящая для закадрового текста и подходящая для живого разговора.
Флагманская речевая модель, общедоступна с февраля 2026 года. Поддерживает более 70 языков, умеет диалоги с несколькими говорящими и понимает встроенные теги вроде [laughs], [whispering] или [sarcastic] — ими можно режиссировать подачу прямо изнутри сценария. Нюанс в том, что v3 не работает в реальном времени, поэтому её место в продакшене — аудиокниги, закадровый текст, голоса персонажей, — а не в живом агенте.
Эмоционально насыщенная и стабильная модель на 29 языках. Она появилась раньше v3 и остаётся разумным выбором по умолчанию для профессионального контента, где нужен предсказуемый результат, а театральный диапазон и широкий охват языков не требуются.
Задержка около 75 мс на 32 языках и примерно вдвое меньшая цена за символ, чем у более качественных моделей. Это модель для голосовых агентов и всего интерактивного, где пауза вредит куда сильнее, чем чуть менее нюансированная читка. (Turbo v2.5 функционально эквивалентна, но в среднем медленнее; ElevenLabs рекомендует Flash вместо Turbo во всех случаях.)
Расшифровка более чем на 90 языках с разделением по говорящим: модель помечает, кто что сказал, а не выдаёт сплошную стену текста. Версия для реального времени работает с задержкой около 150 мс — для живых субтитров и расшифровки встреч.
Создаёт инструментальные и вокальные треки студийного уровня по обычному текстовому описанию. Это самая новая и наименее центральная часть платформы, но она закрывает вопрос для тех, кто озвучивает видео и не хочет лицензировать сток.
| Модель | Назначение | Задержка | Языки |
|---|---|---|---|
| Eleven v3 | Самая выразительная речь, аудиотеги, диалоги | Не в реальном времени | 70+ |
| Multilingual v2 | Профессиональная озвучка, предсказуемый результат | Обычная | 29 |
| Flash v2.5 | Голосовые агенты, интерактивные приложения | ~75 ms | 32 |
| Scribe v2 | Расшифровка с метками говорящих | Обычная | 90+ |
| Scribe v2 Realtime | Живые субтитры и встречи | ~150 ms | 90+ |
| Eleven Music v2 | Музыка по текстовому описанию | Не в реальном времени | Несколько |
Основной сценарий: вставили сценарий, выбрали голос, получили готовую начитку. Сюда попадают закадровый текст для YouTube, учебные модули, аудиокниги, вставки в подкасты и рекламные ролики. Для длинных проектов интерфейс Studio работает с многоглавными документами, а не заставляет генерировать по абзацу.
Два уровня. Instant Voice Cloning делает рабочую копию по короткому образцу и доступен с тарифа Starter. Professional Voice Cloning обучается на куда более длинной записи — на практике всё упирается в то, сколько чистого аудио вы можете дать — и даёт заметно более точное совпадение; нужен тариф Creator или выше. Чаще всего авторы клонируют собственный голос, чтобы масштабировать озвучку и не начитывать каждый сценарий.
Дубляж берёт готовое видео или аудио и воспроизводит его на другом языке, сохраняя голосовую идентичность говорящего. Результат звучит так, будто тот же человек говорит на языке, которого не знает. Для тех, у кого накоплен архив контента, именно эта функция превращает одну библиотеку в несколько.
Scribe превращает записи в текст с метками говорящих. Полезно для интервью, встреч и создания субтитров — и это естественная вторая половина дубляжа, ведь перед переводом обычно нужна точная расшифровка.
Платформа агентов соединяет распознавание речи, языковую модель и синтез с низкой задержкой в систему, которая ведёт устный диалог: линии поддержки, сценарии записи, интерактивные персонажи. Здесь Flash v2.5 и оправдывает себя: разница между 75 мс и полусекундой — это разница между разговором и допросом.
Клонировать собственный голос просто. Клонировать чужой — вопрос сначала юридический и только потом технический, и об этом стоит сказать прямо.
Условия ElevenLabs требуют, чтобы голос принадлежал вам или чтобы у вас было согласие говорящего. Отдельно: всё больше штатов США приняли законы о клонировании голоса и праве на публичный образ, похожие нормы появляются и в других странах. Оплата тарифа открывает функцию, но не даёт права клонировать конкретного человека. Если голос не ваш — получите задокументированное разрешение. Это вся защита, и лежит она на вас, а не на платформе.
Озвучка без микрофона, заглушённой комнаты и перезаписи каждый раз, когда меняется сценарий. Правка одного предложения стоит секунд, а не ещё одной сессии записи.
Учебные модули и аудиокниги в объёме, где нанимать диктора под каждое обновление невыгодно. Здесь единообразие на сотнях файлов важнее, чем выдающаяся актёрская подача.
Дубляж вместе с расшифровкой превращает одноязычную библиотеку в многоязычную без подбора актёров под каждый рынок. Сохранённая голосовая идентичность и создаёт ощущение перевода, а не замены.
Голосовые агенты для телефонной поддержки, записи и первичной сортировки обращений — на моделях с низкой задержкой и с подключением к существующим системам через API.
API и SDK — причина, по которой множество приложений звучит именно так: голос гораздо чаще оказывается функцией внутри чужого продукта, чем самостоятельным местом назначения.
Тарифы считаются в кредитах, и их тратит любая генерация — речь, дубляж, расшифровка, музыка. Более качественные модели сжигают кредиты быстрее, чем Flash, поэтому фактическая стоимость зависит от выбора модели не меньше, чем от объёма. При годовой оплате счёт выставляют за десять месяцев вместо двенадцати — то есть два месяца бесплатно.
| Тариф | В месяц | Годовая (за месяц) | Кредитов в месяц | Особенности |
|---|---|---|---|---|
| Free | $0 | — | 10,000 | Без коммерции, нужна атрибуция |
| Starter | $6 | $5 | 30,000 | Коммерческие права, мгновенное клонирование |
| Creator | $22 | $18.33 | 121,000 | Профессиональное клонирование голоса |
| Pro | $99 | $82.50 | 600,000 | Больше объёма, продакшен |
| Scale | $299 | $249.17 | 1,800,000 | Команды и большие библиотеки |
| Business | $990 | $825 | 6,000,000 | Использование корпоративного масштаба |
Об этом стоит знать до того, как что-то на нём строить. Бесплатный тариф даёт 10 000 кредитов в месяц, но не несёт коммерческих прав и требует видимой атрибуции ElevenLabs во всём, что вы публикуете. Мгновенного клонирования голоса в нём тоже нет. Он по-настоящему полезен для оценки качества — и непригоден для клиентских работ, монетизируемого видео и выпущенного продукта.
Аудио, созданное на платном тарифе, сохраняет коммерческие права навсегда — в том числе после отказа от подписки. Вы лицензируете саму генерацию, а не арендуете результат, и это важно, если вы собираете библиотеку за короткий оплаченный период.
Бесплатный тариф есть — 10 000 кредитов в месяц, — но он не даёт коммерческих прав и требует атрибуции ElevenLabs. Для любой оплачиваемой или публикуемой работы нужен минимум тариф Starter за $6 в месяц.
Eleven v3 — для закадрового текста, работы с персонажами и всего, где важна подача. Flash v2.5 — для голосовых агентов и интерактивных приложений, где задержка важнее нюансов. Multilingual v2 остаётся крепким средним вариантом с предсказуемым профессиональным результатом.
Это зависит от модели, а не от платформы. Eleven v3 покрывает более 70 языков, Flash v2.5 — 32, Multilingual v2 — 29, а расшифровка Scribe — более 90.
Да. Instant Voice Cloning работает по короткому образцу и доступен начиная с тарифа Starter. Professional Voice Cloning требует более длинной записи и тарифа Creator или выше, зато даёт заметно более точное совпадение.
Только с его согласия. ElevenLabs требует, чтобы голос принадлежал вам или чтобы было разрешение, и поверх этого действуют законы о клонировании голоса в ряде юрисдикций. Подписка открывает возможность, но не право.
Да. Аудио, созданное во время платной подписки, сохраняет коммерческие права и после её отмены.
Да. Scribe делает расшифровку с метками говорящих более чем на 90 языках, а функция дубляжа воспроизводит готовое аудио на другом языке, сохраняя голосовую идентичность исходного говорящего.
ElevenLabs — выбор по умолчанию для ИИ-речи, и это место он занял подачей, а не маркетингом: ритм и ударения попадают в цель достаточно часто, чтобы результат выдерживал публикацию. С тех пор платформа разрослась до дубляжа, расшифровки, агентов и музыки, и это делает её разумным единым поставщиком для всего звукового.
Планировать придётся вокруг трёх вещей: кредитной модели, разделения на выразительные модели и модели реального времени и бесплатного уровня, который остаётся исключительно песочницей для оценки. Если вы делаете озвучку в объёме, локализуете архив или добавляете голос продукту — это тот инструмент, который остальным нужно обойти.