ElevenLabs

ElevenLabs convierte texto en voz natural en más de 70 idiomas, clona voces, dobla vídeo y alimenta agentes de voz. Explicamos los modelos, los precios reales y la trampa del plan gratuito.

Ir a la IA
ElevenLabs cover

¿Qué es ElevenLabs?

ElevenLabs convierte texto en una voz que suena a persona y no a locutor. Empezó como una herramienta de texto a voz y creció hasta ser una plataforma de audio completa: narración, clonación de voz, doblaje a otros idiomas, transcripción, agentes de voz conversacionales y generación de música conviven en la misma cuenta y la misma API.

La razón por la que se adueñó de la categoría es concreta: la prosodia. La mayoría de los sintetizadores acierta con las palabras y falla en la interpretación: pronunciación correcta, ritmo plano, énfasis en el lugar equivocado. ElevenLabs maneja las pausas, el énfasis y el registro emocional lo bastante bien como para que quien escucha deje de notar que hay una máquina. Ese es todo el producto.

La gama de modelos

Elegir el modelo adecuado importa más que cualquier otro ajuste, porque los modelos intercambian calidad por latencia en direcciones opuestas. No hay uno mejor: hay uno adecuado para narración y otro para una conversación en vivo.

Eleven v3: la más expresiva

El modelo de voz insignia, disponible de forma general desde febrero de 2026. Admite más de 70 idiomas, gestiona diálogos con varios hablantes y entiende etiquetas de audio en línea como [laughs], [whispering] o [sarcastic], que permiten dirigir la interpretación desde el propio guion. El matiz es que v3 no es un modelo en tiempo real, así que su sitio está en la producción —audiolibros, narración de vídeo, voces de personajes— y no en un agente en vivo.

Eleven Multilingual v2: el término medio fiable

Rica en matices emocionales y consistente en 29 idiomas. Es anterior a v3 y sigue siendo una opción por defecto sensata para contenido profesional donde quieres un resultado predecible y no necesitas el rango teatral ni una cobertura de idiomas más amplia.

Eleven Flash v2.5: hecha para tiempo real

Unos 75 ms de latencia en 32 idiomas y alrededor de la mitad de coste por carácter que los modelos de mayor calidad. Es el modelo para agentes de voz y cualquier cosa interactiva, donde un retraso hace mucho más daño que una lectura algo menos matizada. (Turbo v2.5 es funcionalmente equivalente pero más lenta de media; ElevenLabs recomienda Flash frente a Turbo en todos los casos.)

Scribe v2: voz a texto

Transcripción en más de 90 idiomas con diarización de hablantes: etiqueta quién dijo qué en lugar de producir un muro de texto indiferenciado. Una variante en tiempo real funciona con unos 150 ms, para subtitulado en directo y transcripción de reuniones.

Eleven Music v2: música generada

Produce pistas instrumentales y vocales de nivel de estudio a partir de un prompt en lenguaje natural. Es la rama más nueva de la plataforma y la menos central, pero cierra el círculo para quien musicaliza un vídeo y no quiere licenciar una pista de stock.

ModeloPara qué sirveLatenciaIdiomas
Eleven v3Voz más expresiva, etiquetas de audio, diálogosNo en tiempo real70+
Multilingual v2Narración profesional, resultado predecibleEstándar29
Flash v2.5Agentes de voz, apps interactivas~75 ms32
Scribe v2Transcripción con etiquetas de hablanteEstándar90+
Scribe v2 RealtimeSubtítulos en directo y reuniones~150 ms90+
Eleven Music v2Música a partir de prompts de textoNo en tiempo realVarios

Qué puedes construir de verdad

Narración y locución

El caso de uso central: pegas un guion, eliges una voz y obtienes una lectura terminada. Cubre narración para YouTube, módulos de e-learning, audiolibros, insertos de pódcast y cuñas publicitarias. Para proyectos largos, la interfaz Studio maneja documentos de varios capítulos en lugar de obligarte a generar párrafo a párrafo.

Clonación de voz

Dos niveles. Instant Voice Cloning crea una copia utilizable a partir de una muestra corta y está disponible desde el plan Starter. Professional Voice Cloning se entrena con una grabación mucho más larga —en la práctica depende de cuánto audio limpio puedas aportar— y logra un parecido bastante mayor; requiere Creator o superior. Lo más habitual es que los creadores clonen su propia voz para escalar la narración sin grabar cada guion.

Doblaje a otros idiomas

El doblaje toma un vídeo o audio existente y lo reproduce en otro idioma conservando la identidad vocal del hablante original. El resultado suena como la misma persona hablando un idioma que no habla. Para quien tiene un catálogo acumulado, esta es la función que convierte una biblioteca en varias.

Transcripción

Scribe convierte grabaciones en texto con etiquetas de hablante. Útil para entrevistas, reuniones y generación de subtítulos, y es la otra mitad natural del doblaje, porque normalmente necesitas una transcripción precisa antes de traducir nada.

Agentes de voz conversacionales

La plataforma de agentes combina reconocimiento de voz, un modelo de lenguaje y síntesis de baja latencia en un sistema capaz de mantener una conversación hablada: líneas de soporte, flujos de reserva, personajes interactivos. Aquí es donde Flash v2.5 se gana su sitio: la diferencia entre 75 ms y medio segundo es la diferencia entre una conversación y un interrogatorio.

Clonación de voz: la parte que exige cuidado

Clonar tu propia voz es sencillo. Clonar la de otra persona es una cuestión legal antes que técnica, y conviene decirlo sin rodeos.

Los términos de ElevenLabs exigen que la voz sea tuya o que cuentes con el consentimiento del hablante. Aparte, cada vez más estados de EE. UU. han aprobado leyes sobre clonación de voz y derechos de imagen, y están apareciendo normas similares en otros lugares. Pagar un plan desbloquea la función, no te concede el derecho a clonar a una persona concreta. Si la voz no es tuya, consigue un permiso documentado: esa es toda la salvaguarda, y recae en ti, no en la plataforma.

Quién usa ElevenLabs

Creadores de vídeo y podcasters

Narración sin micrófono, sin sala tratada acústicamente y sin volver a grabar cada vez que cambia el guion. Editar una frase cuesta segundos en lugar de otra sesión de grabación.

E-learning y edición

Módulos de cursos y audiolibros en volumen, donde contratar locutores para cada actualización no sale a cuenta. Aquí importa más la consistencia entre cientos de archivos que una interpretación memorable.

Equipos de localización

El doblaje junto con la transcripción convierte una biblioteca en un solo idioma en una multilingüe sin recastear cada mercado. La identidad vocal conservada es lo que hace que se perciba como una traducción y no como una sustitución.

Equipos de producto y soporte

Agentes de voz para soporte telefónico, reservas y triaje, construidos sobre los modelos de baja latencia y conectados a los sistemas existentes mediante la API.

Desarrolladores

La API y los SDK son la razón por la que muchas aplicaciones suenan como suenan: la voz es mucho más a menudo una función incorporada al producto de otra persona que un destino en sí mismo.

¿Cuánto cuesta ElevenLabs?

Los planes se miden en créditos, que consume cualquier tipo de generación: voz, doblaje, transcripción o música. Los modelos de mayor calidad gastan créditos más rápido que Flash, así que tu coste real depende tanto de la elección del modelo como del volumen. La facturación anual se cobra por diez meses en lugar de doce, lo que equivale a dos meses gratis.

PlanMensualAnual (por mes)Créditos al mesLo destacable
Free$010,000Sin uso comercial, atribución obligatoria
Starter$6$530,000Derechos comerciales, clonación instantánea
Creator$22$18.33121,000Clonación de voz profesional
Pro$99$82.50600,000Mayor volumen, trabajo de producción
Scale$299$249.171,800,000Equipos y bibliotecas grandes
Business$990$8256,000,000Uso a escala empresarial

El plan gratuito es una demo, no un nivel

Este es el detalle que conviene conocer antes de construir nada sobre él. El plan gratuito da 10 000 créditos al mes, pero no incluye derechos de uso comercial y exige atribución visible a ElevenLabs en todo lo que publiques. Tampoco incluye la clonación instantánea de voz. Sirve de verdad para evaluar la calidad, y no sirve para trabajo de cliente, vídeo monetizado o un producto lanzado.

Qué conservas si cancelas

El audio que generaste estando en un plan de pago conserva sus derechos comerciales de forma permanente, incluso después de cancelar la suscripción. Estás licenciando la generación, no alquilando el resultado, lo cual importa si produces una biblioteca durante un periodo de pago corto.

Limitaciones que conviene conocer

  • El mejor modelo, v3, no funciona en tiempo real: la narración expresiva y los agentes en vivo requieren modelos distintos.
  • Todas las funciones consumen créditos, así que un doblaje o una transcripción intensivos se comen el mismo presupuesto que la voz.
  • El plan gratuito no da derechos comerciales e impone atribución obligatoria.
  • La cobertura de idiomas varía mucho según el modelo: más de 70 en v3, pero 32 en Flash y 29 en Multilingual v2.
  • Clonar la voz de otra persona conlleva obligaciones legales que la suscripción no cubre.
  • La calidad es alta pero no infalible: los nombres poco comunes, las siglas y los términos técnicos siguen necesitando revisión.

Preguntas frecuentes

¿ElevenLabs es gratis?

Hay un plan gratuito con 10 000 créditos al mes, pero no incluye derechos de uso comercial y exige atribución a ElevenLabs. Para cualquier trabajo remunerado o publicado necesitas al menos el plan Starter por 6 $ al mes.

¿Qué modelo de ElevenLabs debería usar?

Usa Eleven v3 para narración, trabajo de personajes y todo aquello donde importe la interpretación. Usa Flash v2.5 para agentes de voz y aplicaciones interactivas donde la latencia pesa más que el matiz. Multilingual v2 sigue siendo una opción intermedia sólida para un resultado profesional predecible.

¿Cuántos idiomas admite ElevenLabs?

Depende del modelo, no de la plataforma. Eleven v3 cubre más de 70 idiomas, Flash v2.5 cubre 32, Multilingual v2 cubre 29 y la transcripción de Scribe supera los 90.

¿Puedo clonar mi propia voz?

Sí. Instant Voice Cloning funciona a partir de una muestra corta y está disponible desde el plan Starter. Professional Voice Cloning necesita una grabación más larga y el plan Creator o superior, y logra un parecido notablemente mayor.

¿Puedo clonar la voz de otra persona?

Solo con su consentimiento. ElevenLabs exige que la voz sea tuya o que tengas permiso, y por encima de eso se aplican las leyes sobre clonación de voz de varias jurisdicciones. La suscripción desbloquea la capacidad, no el derecho.

¿Conservo los derechos del audio si cancelo?

Sí. El audio generado mientras estabas en un plan de pago conserva sus derechos comerciales tras la cancelación.

¿ElevenLabs puede transcribir y doblar vídeo?

Sí. Scribe realiza transcripción con etiquetas de hablante en más de 90 idiomas, y la función de doblaje reproduce el audio existente en otro idioma conservando la identidad vocal del hablante original.

En resumen

ElevenLabs es la opción por defecto para voz con IA, y se ganó ese puesto por su interpretación y no por su marketing: acierta con el ritmo y el énfasis lo bastante a menudo como para que el resultado aguante en trabajo publicado. Desde entonces la plataforma se ha ampliado a doblaje, transcripción, agentes y música, lo que la convierte en un proveedor único razonable para todo lo relacionado con el audio.

Hay que planificar en torno a tres cosas: el modelo de créditos, la división entre modelos expresivos y de tiempo real, y un plan gratuito que es estrictamente un entorno de evaluación. Si produces narración en volumen, localizas un catálogo o le pones voz a un producto, esta es la herramienta a batir.

Herramientas Alternativas