Fireworks AI
inferencia en producción y ajuste fino
Una plataforma de inferencia para llevar tus propios modelos a producción: entornos de ejecución optimizados, conmutación entre nubes y GPU dedicadas, junto a API de modelos ya listas.

Baseten lleva modelos de IA a producción y los mantiene ahí. El argumento es la fiabilidad y no la novedad: entornos de ejecución optimizados, alta disponibilidad entre nubes y un 99,99% de disponibilidad declarado de serie, que son unos cuatro minutos de caída al mes y algo poco habitual de poner por escrito para un proveedor de inferencia.
Se sitúa entre dos cosas que la gente ya entiende. Por encima están las API de tokens, donde otro elige los modelos. Por debajo está el cómputo en bruto, donde la capa de servicio la construyes tú. Baseten es para equipos que tienen un modelo concreto que necesitan servir bien y prefieren no dedicar un trimestre a construir la infraestructura para servirlo.
La lista de clientes se lee en consecuencia: Zed Industries, Wispr, OpenEvidence, ClickUp y Writer, en autocompletado de código, transcripción, IA médica y modelos de lenguaje de dominio específico. Todos son casos donde el modelo es el producto y la latencia es una característica que los usuarios notan.
Las API de modelos son modelos abiertos preoptimizados a los que puedes llamar de inmediato, entre ellos variantes de GLM, DeepSeek y Kimi. Es el punto de entrada de bajo compromiso, y funciona como cualquier otra API de tokens.
Los despliegues dedicados son el producto de verdad. Traes un modelo propietario o ajustado y Baseten lo sirve sobre infraestructura dimensionada para él, con la optimización del entorno de ejecución que de otro modo sería trabajo de especialista. El entrenamiento mediante el SDK de Loops conecta con ese mismo camino, así que un modelo puede ir del ajuste a producción sin cambiar de plataforma.
Las afirmaciones publicadas son lo bastante concretas como para comprobarlas: más del doble de rendimiento y un 10% menos de latencia en embeddings frente a los competidores, latencia de transcripción por debajo de 300 ms sin picos impredecibles y una utilización de GPU seis veces mejor en cargas compuestas.
Merece la pena fijarse en la expresión sin picos impredecibles. En la inferencia en producción, la latencia de cola importa más que la media, porque de lo que se queja la gente es del percentil noventa y nueve. Optimizar para la consistencia en lugar de para una buena mediana es una postura de ingeniería madura y difícil de vender, y probablemente por eso pocos proveedores se molestan.
La alta disponibilidad abarca varias nubes y no regiones dentro de una sola. La distinción es relevante: la caída de un único proveedor se lleva por delante todas las regiones entre las que te habías repartido, y la única defensa real es estar en otro sitio distinto.
También existe Baseten for Model Labs, dirigido a creadores de modelos que quieren distribución y monetización en lugar de despliegue. Es un negocio distinto del de la plataforma principal, y conviene saber que existe si estás en el lado productor de la economía de los modelos.
El plan Basic no tiene cuota mensual y factura el uso. Pro y Enterprise añaden descuentos por volumen y compromisos de soporte, no un producto distinto.
| API del modelo | Entrada | Entrada en caché | Salida |
|---|---|---|---|
| GLM-5.3 | 1,40 $ | 0,14 $ | 4,40 $ |
| GLM-5.3-Flash | 0,15 $ | 0,03 $ | 0,50 $ |
| DeepSeek V4 Pro | 1,32 $ | 0,132 $ | 3,96 $ |
| DeepSeek V4 Flash | 0,13 $ | 0,028 $ | 0,26 $ |
| Kimi K3 | 3,00 $ | 0,30 $ | 15,00 $ |
| GPT OSS 120B | 0,10 $ | — | 0,50 $ |
| GPU dedicada | Por hora |
|---|---|
| T4 | 0,63 $ |
| L4 | 0,85 $ |
| A10G | 1,21 $ |
| H100 MIG | 3,75 $ |
| A100 | 4,00 $ |
| H100 | 6,50 $ |
| B200 | 9,98 $ |
El precio de la entrada en caché es el detalle sobre el que conviene diseñar. A una décima parte de la tarifa de entrada normal, una aplicación con un prompt de sistema largo y estable y una entrada de usuario corta y variable puede recortar drásticamente su factura, pero solo si los prompts están estructurados para que la parte compartida sea realmente reutilizable. Eso es una decisión de arquitectura, no un ajuste.
Las cuentas nuevas reciben créditos de cortesía para experimentar. El plan Basic incluye soporte por correo y chat integrado; los planes superiores añaden Slack, Zoom y contacto de ingeniería dedicado, que es lo que las empresas están comprando en realidad.
Si lo entrenaste, lo ajustaste o dependes de servirlo más rápido de lo que lo haría un proveedor genérico, esta es la categoría para la que se construyó Baseten. Todos los clientes mencionados están exactamente en esa situación.
Autocompletado de código, transcripción en vivo, cualquier cosa en la que se escriba. Una latencia de cola constante vale aquí más que una media algo mejor, y es lo que la plataforma optimiza.
La alta disponibilidad entre nubes y el 99,99% declarado son la razón para pagar a una plataforma en lugar de operar tu propio servicio. Las aplicaciones médicas y financieras son los casos evidentes.
El doble de rendimiento en embeddings se acumula deprisa cuando indexas de forma continua. En sistemas de recuperación grandes, el rendimiento del paso de embeddings decide a menudo toda la arquitectura.
Las cuentas nuevas reciben créditos de cortesía para experimentar, y el plan Basic no tiene cuota mensual: pagas por el uso. No hay un plan gratuito permanente.
Sí, y ese es el propósito principal. Los despliegues dedicados sirven modelos propietarios y ajustados sobre infraestructura dimensionada para ellos, con la optimización del entorno de ejecución a cargo de la plataforma.
Modal es cómputo sin servidor de propósito general donde el código que se ejecuta lo escribes tú. Baseten va específicamente de servir modelos de forma fiable, con el trabajo de optimización y disponibilidad ya hecho. Modal es más flexible; Baseten hace más por ti dentro de un alcance más estrecho.
Los prefijos de prompt repetidos se facturan a alrededor de una décima parte de la tarifa de entrada normal. Si todas las peticiones comparten un prompt de sistema largo, reestructurar para que esa parte sea cacheable es el mayor ahorro disponible.
Sí, mediante el SDK de Loops, con despliegue directo a la inferencia en producción en la misma plataforma. Esa continuidad es parte de por qué los equipos lo eligen en lugar de montar el entrenamiento y el servicio por separado.
Desde un T4 a 0,63 $ la hora pasando por L4, A10G, A100 y H100 hasta un B200 a 9,98 $. Una partición H100 MIG a 3,75 $ es una opción intermedia útil cuando un H100 entero es más de lo que el modelo necesita.
Baseten es para la etapa posterior a haber decidido qué modelo usas y haber descubierto que servirlo bien es una disciplina en sí misma. Los entornos de ejecución optimizados, la disponibilidad entre nubes y una latencia de cola constante son cosas que los equipos se construyen durante meses, y son las que aquí se venden.
Las API de modelos son una vía de entrada razonable, pero no son la razón para estar aquí: hay muchos proveedores que sirven modelos abiertos por dinero parecido. Ven por los despliegues dedicados, estructura tus prompts para aprovechar la entrada en caché y verifica las afirmaciones de rendimiento con tu propio modelo antes de que se conviertan en una línea de tu plan.