Baseten

Una plataforma de inferencia para llevar tus propios modelos a producción: entornos de ejecución optimizados, conmutación entre nubes y GPU dedicadas, junto a API de modelos ya listas.

Ir a la IA
Baseten cover

¿Qué es Baseten?

Baseten lleva modelos de IA a producción y los mantiene ahí. El argumento es la fiabilidad y no la novedad: entornos de ejecución optimizados, alta disponibilidad entre nubes y un 99,99% de disponibilidad declarado de serie, que son unos cuatro minutos de caída al mes y algo poco habitual de poner por escrito para un proveedor de inferencia.

Se sitúa entre dos cosas que la gente ya entiende. Por encima están las API de tokens, donde otro elige los modelos. Por debajo está el cómputo en bruto, donde la capa de servicio la construyes tú. Baseten es para equipos que tienen un modelo concreto que necesitan servir bien y prefieren no dedicar un trimestre a construir la infraestructura para servirlo.

La lista de clientes se lee en consecuencia: Zed Industries, Wispr, OpenEvidence, ClickUp y Writer, en autocompletado de código, transcripción, IA médica y modelos de lenguaje de dominio específico. Todos son casos donde el modelo es el producto y la latencia es una característica que los usuarios notan.

Cómo funciona

Dos vías de entrada

Las API de modelos son modelos abiertos preoptimizados a los que puedes llamar de inmediato, entre ellos variantes de GLM, DeepSeek y Kimi. Es el punto de entrada de bajo compromiso, y funciona como cualquier otra API de tokens.

Los despliegues dedicados son el producto de verdad. Traes un modelo propietario o ajustado y Baseten lo sirve sobre infraestructura dimensionada para él, con la optimización del entorno de ejecución que de otro modo sería trabajo de especialista. El entrenamiento mediante el SDK de Loops conecta con ese mismo camino, así que un modelo puede ir del ajuste a producción sin cambiar de plataforma.

El rendimiento como producto

Las afirmaciones publicadas son lo bastante concretas como para comprobarlas: más del doble de rendimiento y un 10% menos de latencia en embeddings frente a los competidores, latencia de transcripción por debajo de 300 ms sin picos impredecibles y una utilización de GPU seis veces mejor en cargas compuestas.

Merece la pena fijarse en la expresión sin picos impredecibles. En la inferencia en producción, la latencia de cola importa más que la media, porque de lo que se queja la gente es del percentil noventa y nueve. Optimizar para la consistencia en lugar de para una buena mediana es una postura de ingeniería madura y difícil de vender, y probablemente por eso pocos proveedores se molestan.

Disponibilidad entre nubes

La alta disponibilidad abarca varias nubes y no regiones dentro de una sola. La distinción es relevante: la caída de un único proveedor se lleva por delante todas las regiones entre las que te habías repartido, y la única defensa real es estar en otro sitio distinto.

También existe Baseten for Model Labs, dirigido a creadores de modelos que quieren distribución y monetización en lugar de despliegue. Es un negocio distinto del de la plataforma principal, y conviene saber que existe si estás en el lado productor de la economía de los modelos.

Cuánto cuesta

El plan Basic no tiene cuota mensual y factura el uso. Pro y Enterprise añaden descuentos por volumen y compromisos de soporte, no un producto distinto.

API del modeloEntradaEntrada en cachéSalida
GLM-5.31,40 $0,14 $4,40 $
GLM-5.3-Flash0,15 $0,03 $0,50 $
DeepSeek V4 Pro1,32 $0,132 $3,96 $
DeepSeek V4 Flash0,13 $0,028 $0,26 $
Kimi K33,00 $0,30 $15,00 $
GPT OSS 120B0,10 $0,50 $
GPU dedicadaPor hora
T40,63 $
L40,85 $
A10G1,21 $
H100 MIG3,75 $
A1004,00 $
H1006,50 $
B2009,98 $

El precio de la entrada en caché es el detalle sobre el que conviene diseñar. A una décima parte de la tarifa de entrada normal, una aplicación con un prompt de sistema largo y estable y una entrada de usuario corta y variable puede recortar drásticamente su factura, pero solo si los prompts están estructurados para que la parte compartida sea realmente reutilizable. Eso es una decisión de arquitectura, no un ajuste.

Las cuentas nuevas reciben créditos de cortesía para experimentar. El plan Basic incluye soporte por correo y chat integrado; los planes superiores añaden Slack, Zoom y contacto de ingeniería dedicado, que es lo que las empresas están comprando en realidad.

Quién le saca más partido

Empresas cuyo modelo es el producto

Si lo entrenaste, lo ajustaste o dependes de servirlo más rápido de lo que lo haría un proveedor genérico, esta es la categoría para la que se construyó Baseten. Todos los clientes mencionados están exactamente en esa situación.

Trabajo en producción sensible a la latencia

Autocompletado de código, transcripción en vivo, cualquier cosa en la que se escriba. Una latencia de cola constante vale aquí más que una media algo mejor, y es lo que la plataforma optimiza.

Cargas que no pueden caerse

La alta disponibilidad entre nubes y el 99,99% declarado son la razón para pagar a una plataforma en lugar de operar tu propio servicio. Las aplicaciones médicas y financieras son los casos evidentes.

Canalizaciones de embeddings pesadas

El doble de rendimiento en embeddings se acumula deprisa cuando indexas de forma continua. En sistemas de recuperación grandes, el rendimiento del paso de embeddings decide a menudo toda la arquitectura.

A qué prestar atención

  • Las afirmaciones de rendimiento son los propios benchmarks del proveedor frente a competidores sin nombrar. Reprodúcelos con tu modelo antes de planificar sobre ellos.
  • Las GPU dedicadas facturan por hora independientemente del tráfico. Un H100 ocioso cuesta 6,50 $ la hora lo llame alguien o no.
  • El 99,99% de disponibilidad de serie es una declaración de capacidad y no automáticamente un SLA contractual en el plan de entrada. Comprueba a qué se compromete realmente tu nivel.
  • El precio de la entrada en caché solo ayuda si los prompts están estructurados para ello. El ahorro de diez veces es real y es condicional.
  • Los precios de Pro y Enterprise no están publicados. Los descuentos por volumen implican una conversación y no una calculadora.
  • Si solo necesitas llamar al modelo de otro, esto es más plataforma de la que el trabajo requiere. Su valor está en servir el tuyo.

Preguntas frecuentes

¿Se puede probar Baseten gratis?

Las cuentas nuevas reciben créditos de cortesía para experimentar, y el plan Basic no tiene cuota mensual: pagas por el uso. No hay un plan gratuito permanente.

¿Puedo desplegar mi propio modelo?

Sí, y ese es el propósito principal. Los despliegues dedicados sirven modelos propietarios y ajustados sobre infraestructura dimensionada para ellos, con la optimización del entorno de ejecución a cargo de la plataforma.

¿En qué se diferencia de Modal?

Modal es cómputo sin servidor de propósito general donde el código que se ejecuta lo escribes tú. Baseten va específicamente de servir modelos de forma fiable, con el trabajo de optimización y disponibilidad ya hecho. Modal es más flexible; Baseten hace más por ti dentro de un alcance más estrecho.

¿Qué significa el precio de la entrada en caché?

Los prefijos de prompt repetidos se facturan a alrededor de una décima parte de la tarifa de entrada normal. Si todas las peticiones comparten un prompt de sistema largo, reestructurar para que esa parte sea cacheable es el mayor ahorro disponible.

¿Admite entrenamiento?

Sí, mediante el SDK de Loops, con despliegue directo a la inferencia en producción en la misma plataforma. Esa continuidad es parte de por qué los equipos lo eligen en lugar de montar el entrenamiento y el servicio por separado.

¿Qué GPU puedo conseguir?

Desde un T4 a 0,63 $ la hora pasando por L4, A10G, A100 y H100 hasta un B200 a 9,98 $. Una partición H100 MIG a 3,75 $ es una opción intermedia útil cuando un H100 entero es más de lo que el modelo necesita.

En resumen

Baseten es para la etapa posterior a haber decidido qué modelo usas y haber descubierto que servirlo bien es una disciplina en sí misma. Los entornos de ejecución optimizados, la disponibilidad entre nubes y una latencia de cola constante son cosas que los equipos se construyen durante meses, y son las que aquí se venden.

Las API de modelos son una vía de entrada razonable, pero no son la razón para estar aquí: hay muchos proveedores que sirven modelos abiertos por dinero parecido. Ven por los despliegues dedicados, estructura tus prompts para aprovechar la entrada en caché y verifica las afirmaciones de rendimiento con tu propio modelo antes de que se conviertan en una línea de tu plan.

Herramientas Alternativas