Speechify
lector de texto a voz y estudio de voz con IA
ElevenLabs convierte texto en voz natural en más de 70 idiomas, clona voces, dobla vídeo y alimenta agentes de voz. Explicamos los modelos, los precios reales y la trampa del plan gratuito.

ElevenLabs convierte texto en una voz que suena a persona y no a locutor. Empezó como una herramienta de texto a voz y creció hasta ser una plataforma de audio completa: narración, clonación de voz, doblaje a otros idiomas, transcripción, agentes de voz conversacionales y generación de música conviven en la misma cuenta y la misma API.
La razón por la que se adueñó de la categoría es concreta: la prosodia. La mayoría de los sintetizadores acierta con las palabras y falla en la interpretación: pronunciación correcta, ritmo plano, énfasis en el lugar equivocado. ElevenLabs maneja las pausas, el énfasis y el registro emocional lo bastante bien como para que quien escucha deje de notar que hay una máquina. Ese es todo el producto.
Elegir el modelo adecuado importa más que cualquier otro ajuste, porque los modelos intercambian calidad por latencia en direcciones opuestas. No hay uno mejor: hay uno adecuado para narración y otro para una conversación en vivo.
El modelo de voz insignia, disponible de forma general desde febrero de 2026. Admite más de 70 idiomas, gestiona diálogos con varios hablantes y entiende etiquetas de audio en línea como [laughs], [whispering] o [sarcastic], que permiten dirigir la interpretación desde el propio guion. El matiz es que v3 no es un modelo en tiempo real, así que su sitio está en la producción —audiolibros, narración de vídeo, voces de personajes— y no en un agente en vivo.
Rica en matices emocionales y consistente en 29 idiomas. Es anterior a v3 y sigue siendo una opción por defecto sensata para contenido profesional donde quieres un resultado predecible y no necesitas el rango teatral ni una cobertura de idiomas más amplia.
Unos 75 ms de latencia en 32 idiomas y alrededor de la mitad de coste por carácter que los modelos de mayor calidad. Es el modelo para agentes de voz y cualquier cosa interactiva, donde un retraso hace mucho más daño que una lectura algo menos matizada. (Turbo v2.5 es funcionalmente equivalente pero más lenta de media; ElevenLabs recomienda Flash frente a Turbo en todos los casos.)
Transcripción en más de 90 idiomas con diarización de hablantes: etiqueta quién dijo qué en lugar de producir un muro de texto indiferenciado. Una variante en tiempo real funciona con unos 150 ms, para subtitulado en directo y transcripción de reuniones.
Produce pistas instrumentales y vocales de nivel de estudio a partir de un prompt en lenguaje natural. Es la rama más nueva de la plataforma y la menos central, pero cierra el círculo para quien musicaliza un vídeo y no quiere licenciar una pista de stock.
| Modelo | Para qué sirve | Latencia | Idiomas |
|---|---|---|---|
| Eleven v3 | Voz más expresiva, etiquetas de audio, diálogos | No en tiempo real | 70+ |
| Multilingual v2 | Narración profesional, resultado predecible | Estándar | 29 |
| Flash v2.5 | Agentes de voz, apps interactivas | ~75 ms | 32 |
| Scribe v2 | Transcripción con etiquetas de hablante | Estándar | 90+ |
| Scribe v2 Realtime | Subtítulos en directo y reuniones | ~150 ms | 90+ |
| Eleven Music v2 | Música a partir de prompts de texto | No en tiempo real | Varios |
El caso de uso central: pegas un guion, eliges una voz y obtienes una lectura terminada. Cubre narración para YouTube, módulos de e-learning, audiolibros, insertos de pódcast y cuñas publicitarias. Para proyectos largos, la interfaz Studio maneja documentos de varios capítulos en lugar de obligarte a generar párrafo a párrafo.
Dos niveles. Instant Voice Cloning crea una copia utilizable a partir de una muestra corta y está disponible desde el plan Starter. Professional Voice Cloning se entrena con una grabación mucho más larga —en la práctica depende de cuánto audio limpio puedas aportar— y logra un parecido bastante mayor; requiere Creator o superior. Lo más habitual es que los creadores clonen su propia voz para escalar la narración sin grabar cada guion.
El doblaje toma un vídeo o audio existente y lo reproduce en otro idioma conservando la identidad vocal del hablante original. El resultado suena como la misma persona hablando un idioma que no habla. Para quien tiene un catálogo acumulado, esta es la función que convierte una biblioteca en varias.
Scribe convierte grabaciones en texto con etiquetas de hablante. Útil para entrevistas, reuniones y generación de subtítulos, y es la otra mitad natural del doblaje, porque normalmente necesitas una transcripción precisa antes de traducir nada.
La plataforma de agentes combina reconocimiento de voz, un modelo de lenguaje y síntesis de baja latencia en un sistema capaz de mantener una conversación hablada: líneas de soporte, flujos de reserva, personajes interactivos. Aquí es donde Flash v2.5 se gana su sitio: la diferencia entre 75 ms y medio segundo es la diferencia entre una conversación y un interrogatorio.
Clonar tu propia voz es sencillo. Clonar la de otra persona es una cuestión legal antes que técnica, y conviene decirlo sin rodeos.
Los términos de ElevenLabs exigen que la voz sea tuya o que cuentes con el consentimiento del hablante. Aparte, cada vez más estados de EE. UU. han aprobado leyes sobre clonación de voz y derechos de imagen, y están apareciendo normas similares en otros lugares. Pagar un plan desbloquea la función, no te concede el derecho a clonar a una persona concreta. Si la voz no es tuya, consigue un permiso documentado: esa es toda la salvaguarda, y recae en ti, no en la plataforma.
Narración sin micrófono, sin sala tratada acústicamente y sin volver a grabar cada vez que cambia el guion. Editar una frase cuesta segundos en lugar de otra sesión de grabación.
Módulos de cursos y audiolibros en volumen, donde contratar locutores para cada actualización no sale a cuenta. Aquí importa más la consistencia entre cientos de archivos que una interpretación memorable.
El doblaje junto con la transcripción convierte una biblioteca en un solo idioma en una multilingüe sin recastear cada mercado. La identidad vocal conservada es lo que hace que se perciba como una traducción y no como una sustitución.
Agentes de voz para soporte telefónico, reservas y triaje, construidos sobre los modelos de baja latencia y conectados a los sistemas existentes mediante la API.
La API y los SDK son la razón por la que muchas aplicaciones suenan como suenan: la voz es mucho más a menudo una función incorporada al producto de otra persona que un destino en sí mismo.
Los planes se miden en créditos, que consume cualquier tipo de generación: voz, doblaje, transcripción o música. Los modelos de mayor calidad gastan créditos más rápido que Flash, así que tu coste real depende tanto de la elección del modelo como del volumen. La facturación anual se cobra por diez meses en lugar de doce, lo que equivale a dos meses gratis.
| Plan | Mensual | Anual (por mes) | Créditos al mes | Lo destacable |
|---|---|---|---|---|
| Free | $0 | — | 10,000 | Sin uso comercial, atribución obligatoria |
| Starter | $6 | $5 | 30,000 | Derechos comerciales, clonación instantánea |
| Creator | $22 | $18.33 | 121,000 | Clonación de voz profesional |
| Pro | $99 | $82.50 | 600,000 | Mayor volumen, trabajo de producción |
| Scale | $299 | $249.17 | 1,800,000 | Equipos y bibliotecas grandes |
| Business | $990 | $825 | 6,000,000 | Uso a escala empresarial |
Este es el detalle que conviene conocer antes de construir nada sobre él. El plan gratuito da 10 000 créditos al mes, pero no incluye derechos de uso comercial y exige atribución visible a ElevenLabs en todo lo que publiques. Tampoco incluye la clonación instantánea de voz. Sirve de verdad para evaluar la calidad, y no sirve para trabajo de cliente, vídeo monetizado o un producto lanzado.
El audio que generaste estando en un plan de pago conserva sus derechos comerciales de forma permanente, incluso después de cancelar la suscripción. Estás licenciando la generación, no alquilando el resultado, lo cual importa si produces una biblioteca durante un periodo de pago corto.
Hay un plan gratuito con 10 000 créditos al mes, pero no incluye derechos de uso comercial y exige atribución a ElevenLabs. Para cualquier trabajo remunerado o publicado necesitas al menos el plan Starter por 6 $ al mes.
Usa Eleven v3 para narración, trabajo de personajes y todo aquello donde importe la interpretación. Usa Flash v2.5 para agentes de voz y aplicaciones interactivas donde la latencia pesa más que el matiz. Multilingual v2 sigue siendo una opción intermedia sólida para un resultado profesional predecible.
Depende del modelo, no de la plataforma. Eleven v3 cubre más de 70 idiomas, Flash v2.5 cubre 32, Multilingual v2 cubre 29 y la transcripción de Scribe supera los 90.
Sí. Instant Voice Cloning funciona a partir de una muestra corta y está disponible desde el plan Starter. Professional Voice Cloning necesita una grabación más larga y el plan Creator o superior, y logra un parecido notablemente mayor.
Solo con su consentimiento. ElevenLabs exige que la voz sea tuya o que tengas permiso, y por encima de eso se aplican las leyes sobre clonación de voz de varias jurisdicciones. La suscripción desbloquea la capacidad, no el derecho.
Sí. El audio generado mientras estabas en un plan de pago conserva sus derechos comerciales tras la cancelación.
Sí. Scribe realiza transcripción con etiquetas de hablante en más de 90 idiomas, y la función de doblaje reproduce el audio existente en otro idioma conservando la identidad vocal del hablante original.
ElevenLabs es la opción por defecto para voz con IA, y se ganó ese puesto por su interpretación y no por su marketing: acierta con el ritmo y el énfasis lo bastante a menudo como para que el resultado aguante en trabajo publicado. Desde entonces la plataforma se ha ampliado a doblaje, transcripción, agentes y música, lo que la convierte en un proveedor único razonable para todo lo relacionado con el audio.
Hay que planificar en torno a tres cosas: el modelo de créditos, la división entre modelos expresivos y de tiempo real, y un plan gratuito que es estrictamente un entorno de evaluación. Si produces narración en volumen, localizas un catálogo o le pones voz a un producto, esta es la herramienta a batir.