Vapi

Infraestructura para agentes de voz que atienden llamadas telefónicas reales: tú eliges los modelos de habla, lenguaje y voz, y Vapi se encarga de la latencia y la telefonía.

Ir a la IA
Vapi cover

¿Qué es Vapi?

Vapi es una plataforma para desarrolladores destinada a agentes de voz que contestan y realizan llamadas telefónicas reales. No te entrega un agente terminado: te entrega la fontanería que convierte tres modelos independientes —reconocimiento de voz, modelo de lenguaje y sintetizador— en algo capaz de sostener una conversación sin las pausas que hacen colgar a quien llama.

Esa fontanería es la mayor parte del trabajo, y es la parte que se subestima. Un agente de voz debe decidir cuándo ha dejado de hablar quien llama, callarse en el instante en que este vuelve a hablar, mantener el hueco entre pregunta y respuesta lo bastante corto como para que el silencio no parezca una llamada cortada, y saber cuándo rendirse y buscar a una persona. Nada de eso se resuelve con ingeniería de prompts. Vapi se ocupa de los turnos de palabra, del streaming de audio, de la telefonía y del estado de la llamada, y te deja a ti cada decisión sobre modelos.

La compañía superó los mil millones de llamadas gestionadas en mayo de 2026, junto a una ronda de Serie B de 50 millones de dólares liderada por Peak XV con una valoración cercana a los 500 millones, con participación de M12 de Microsoft, Kleiner Perkins y Bessemer. El cliente de referencia por el que más se le pregunta es Amazon Ring, que evaluó más de cuarenta proveedores antes de encaminar su tráfico de soporte entrante por la plataforma.

Cómo funciona

Tú eliges cada modelo de la pila

Vapi es deliberadamente neutral respecto a los modelos. La transcripción puede venir de Deepgram o Gladia, el razonamiento de OpenAI, Anthropic o Google, y la voz de ElevenLabs o de otra docena de proveedores. Cualquier capa se puede sustituir sin reescribir el agente, algo que importa en un campo donde el modelo de voz que mejor suena cambia cada pocos meses.

La plataforma apunta a tiempos de respuesta por debajo de 600 milisegundos, y alcanzar esa cifra depende tanto de tus decisiones como de las suyas. Un modelo de razonamiento lento o un prompt de sistema demasiado hablador se comerán el presupuesto de latencia, y Vapi te dejará hacerlo. El control funciona en ambos sentidos: nada te impide montar una pila que suene peor que la configuración por defecto de un competidor gestionado.

Asistentes, escuadras y flujos de trabajo

La unidad más simple es un asistente: un prompt de sistema más un conjunto de herramientas. Cubre los casos evidentes: cualificar un contacto, reservar una cita, responder las preguntas que un negocio contesta cuarenta veces al día.

Una escuadra son varios asistentes que se pasan la misma llamada conservando el contexto, y así se construye la clasificación de llamadas sin un único prompt enorme que intenta ser recepcionista, agendador y primer nivel de soporte a la vez. En el otro extremo están los flujos de trabajo, para llamadas que deben seguir un camino fijo —una verificación de identidad, una confirmación de pago— donde que el modelo improvise es un riesgo y no una virtud.

Conviene entender esta distinción antes de empezar, porque los agentes basados solo en prompts se degradan de forma predecible: cada regla nueva que añades vuelve un poco menos fiables las anteriores. La solución es repartir el trabajo en una escuadra, y adaptarlo después cuesta más que empezar así.

El valor está en las herramientas

Las herramientas permiten al agente llamar a tu API, consultar una base de datos o escribir en un calendario en mitad de la conversación. Ahí está la frontera entre una demo y un producto. Un agente que solo habla es una curiosidad; uno que puede buscar un pedido, comprobar disponibilidad y cambiar una reserva está haciendo un trabajo por el que antes se pagaba a alguien.

Las llamadas llegan al agente por número de teléfono, a través de un SDK web integrado en tu propio producto, o por SIP si ya tienes acuerdos con un operador que prefieres mantener. También hay una CLI, lo que dice bastante sobre el público al que se dirige.

Cuánto cuesta

Vapi cobra por la orquestación y traslada el coste de los modelos a precio de coste. Eso hace que la tarifa de plataforma sea fácil de calcular y la factura total, difícil, porque el total depende de qué modelos hayas elegido.

ConceptoPrecioNotas
Plataforma Vapi0,05 $ por minutoSolo orquestación
Modelos de habla, lenguaje y vozA precio de costeSe factura directamente desde tus proveedores
TelefoníaA precio de costeO trae tu propio operador por SIP
SMS y chat0,005 $ por mensajeCanales de texto en el mismo agente
Concurrencia10 líneas incluidas10 $ al mes por línea adicional
Cuota gratuitaMás de 60 minutosSuficiente para probar, no para lanzar
Retención cero de datos1000 $ al mesComplemento
Cumplimiento de HIPAA2000 $ al mesComplemento
Plan ScaleContrato anualCuota fija de plataforma más volumen comprometido

En la práctica, un agente de soporte sencillo en inglés sale entre ocho y quince céntimos por minuto con todo incluido. La horquilla la marca casi por completo el modelo de lenguaje, así que la mayor palanca de coste que controlas no es el proveedor, sino si el trabajo necesita de verdad un modelo de frontera.

Quién le saca más partido

Equipos de ingeniería que quieren ver las tripas

Si al oír que una plataforma ha elegido por ti el modelo de reconocimiento de voz tu instinto es preguntar cuál y por qué, esta es tu plataforma. Todo es direccionable, todo es intercambiable, y la documentación da por hecho que sabes leer una referencia de API.

Empresas con una telefonía que no pueden mover

Traer tu propio operador por SIP significa que los números, los contratos y el enrutamiento que ya tienes se quedan donde están. Para cualquiera con un centro de contacto establecido, esto elimina la objeción que suele matar un piloto de IA de voz antes de empezar.

Soporte entrante de gran volumen

El despliegue en Amazon Ring es la prueba en la que se apoya la compañía, y tiene la forma de carga adecuada: preguntas predecibles, volumen enorme y picos estacionales que de otro modo obligarían a contratar. El precio por minuto sin cuota de plataforma encaja con un tráfico irregular más que constante.

Productos que incorporan voz

Como el SDK web se integra en tu propia aplicación, Vapi es una elección habitual de empresas de software que añaden una capa de voz a algo que ya venden, más que de negocios que compran un agente para atender su propio teléfono.

A qué prestar atención

  • La factura la montas tú. La tarifa de plataforma de 0,05 $ es la línea más pequeña, y el coste de los modelos puede triplicarla sin que te des cuenta.
  • Es una plataforma para desarrolladores, no una aplicación. Hay un panel, pero un equipo sin perfil técnico no sacará de ahí un agente en producción por su cuenta.
  • La latencia es responsabilidad tuya. La cifra de menos de 600 ms describe lo que permite la orquestación, no lo que entregará tu pila concreta.
  • El cumplimiento normativo se paga aparte y sale caro. HIPAA a 2000 $ al mes es una decisión real para un equipo pequeño, y en el plan de autoservicio no se negocia a la baja.
  • La cuota gratuita es una prueba de manejo. Sesenta minutos confirmarán que la idea funciona y no te dirán nada sobre cómo se comporta el agente a escala.
  • Los agentes de voz fallan en público. Un chatbot de texto que se equivoca es un mensaje malo; un agente telefónico que se equivoca es un cliente contando la anécdota en la cena.

Preguntas frecuentes

¿Vapi es gratis?

No. Hay una cuota gratuita de algo más de una hora de llamadas para evaluar, y después pagas 0,05 $ por minuto de plataforma más lo que cuesten los modelos y la telefonía. No existe un plan gratuito que sobreviva al contacto con tráfico real.

¿Necesito escribir código?

Para cualquier cosa que vaya más allá de un prototipo, sí. El panel bastará para que un asistente conteste el teléfono, pero las herramientas, las integraciones y el manejo de errores que hacen fiable a un agente son código. A los equipos sin ingeniero les servirá mejor una plataforma sin código.

¿En qué se diferencia de Retell AI o Bland?

Vapi orquesta modelos que eliges tú; Bland opera su propia pila de extremo a extremo y vende la fiabilidad que eso conlleva; Retell se sitúa entre ambos con un constructor visual sobre una arquitectura mixta parecida. Elige Vapi por control, Bland para cargas reguladas donde importa que el proveedor sea dueño de todo el recorrido, y Retell si quieres el término medio.

¿Puede usar mis números de teléfono actuales?

Sí. Puedes comprar números a través de la plataforma o conectar tu propio operador por SIP, que suele ser el factor decisivo para empresas con un centro de contacto ya en marcha.

¿Sirve para sanidad o finanzas?

Puede servir. El soporte de HIPAA y la retención cero de datos están disponibles como complementos de pago por 2000 $ y 1000 $ al mes respectivamente, y el plan Scale cubre SOC 2, PCI, SSO y residencia de datos. Presupuesta el cumplimiento como una partida propia en vez de dar por hecho que va incluido.

¿Qué pasa cuando el agente no puede ayudar?

El traspaso lo defines tú. Las llamadas pueden transferirse a una persona, a otro asistente de la escuadra o a un flujo fijo. Diseñar bien esa vía de escape es la diferencia entre un agente que la gente tolera y uno que le genera rechazo.

En resumen

Vapi es la plataforma de voz para quien quiere ver el cableado. Se ocupa de las partes difíciles de una conversación telefónica en tiempo real —latencia, interrupciones, telefonía, estado— y se aparta en cada decisión que define cómo suena el agente y cuánto cuesta.

Esa libertad es a la vez todo el argumento y toda la advertencia. Un equipo con un ingeniero al que esto le divierta construirá algo mejor y más barato que cualquier alternativa gestionada. Un equipo sin él construirá algo lento, gastará más de lo previsto y concluirá que la IA de voz no funciona. Averigua qué equipo eres antes de empezar.

Herramientas Alternativas