Fireworks AI

Inferencia sin servidor, ajuste fino gestionado con precios por token publicados y GPU bajo demanda. Ojo: las tarifas de GPU suben desde el 1 de septiembre de 2026.

Ir a la IA
Fireworks AI cover

¿Qué es Fireworks AI?

Fireworks AI ejecuta modelos abiertos en producción. Inferencia sin servidor para el camino habitual, ajuste fino gestionado cuando un modelo general no es lo bastante específico, y GPU dedicadas cuando necesitas hardware que sea tuyo durante la hora.

Su costumbre distintiva es publicar los números que otros proveedores guardan detrás de un formulario. La lista de precios del ajuste fino es una cuadrícula —tamaño de modelo frente a método de entrenamiento— con una cifra en cada celda, lo que significa que puedes estimar una tanda de entrenamiento a partir de tu conjunto de datos sin hablar con nadie. En un mercado donde los costes de entrenamiento se dan bajo petición, eso es una diferencia de fondo.

Una cosa que conviene saber antes de planificar sobre cualquier cifra de aquí: la compañía ha publicado una subida de precios de las GPU bajo demanda que entra en vigor el 1 de septiembre de 2026. Las tarifas suben en toda la gama, en algunos casos un 30%. Todo lo que hayas presupuestado con los números actuales necesita revisarse contra los nuevos.

Cómo funciona

Primero, sin servidor

El camino por defecto es la inferencia por token sobre modelos abiertos, con 1 $ de créditos gratuitos para empezar. La cantidad es pequeña a propósito: basta para confirmar que la API funciona y no da para aplazar la decisión de pagar.

Los embeddings se cobran aparte y son baratos, por franjas según el tamaño del modelo: 0,008 $ por millón de tokens de entrada hasta 150M de parámetros, 0,016 $ de 150M a 350M y 0,1 $ para Qwen3 8B. En sistemas de recuperación, donde el volumen de embeddings supera con mucho al de generación, esas franjas suelen ser la cifra que decide la arquitectura.

Ajuste fino con lista de precios

El entrenamiento gestionado se factura por millón de tokens de entrenamiento, y conviene leer bien la cuadrícula porque las cifras escalan con fuerza. El LoRA supervisado cuesta 0,50 $ hasta 16B de parámetros, 3,00 $ de 16,1B a 80B, 6,00 $ de 80B a 300B y 10,00 $ por encima. El DPO duplica cada cifra, y el ajuste de parámetros completos la vuelve a duplicar.

Léelo como una diferencia de veinte veces entre el LoRA supervisado más barato y el más caro, provocada por completo por el tamaño del modelo base. El consejo práctico que se deduce no es glamuroso: prueba primero el modelo pequeño. Muchísimos proyectos de ajuste fino presupuestados sobre una base de 70B habrían funcionado con una de 8B, y la diferencia es 0,50 $ frente a 3,00 $ por millón de tokens.

GPU bajo demanda y la subida de septiembre

Cuando lo sin servidor no basta, puedes tomar GPU por horas. Hasta el 31 de agosto de 2026 un H100 o H200 cuesta 7,00 $, un B200 10,00 $, un B300 12,00 $ y un GB300 18,00 $. Desde el 1 de septiembre pasan a ser 8,00 $, 13,00 $, 15,00 $ y 20,00 $ respectivamente.

La subida más fuerte es la del B200, un 30%, y es la que más probablemente importe, ya que los B200 son hoy el caballo de batalla de la inferencia seria. Los despliegues restringidos a una región concreta llevan encima un recargo de 1,5×, fácil de pasar por alto cuando la residencia de datos se añade tarde al proyecto como requisito de cumplimiento y no como partida presupuestaria.

Cuánto cuesta

Importan dos listas de precios: cuánto cuesta el entrenamiento por millón de tokens y cuánto cuesta una GPU por hora. La que cambia es la segunda.

QuéPrecioNotas
Créditos gratuitos1 $Solo para evaluar
Embeddings hasta 150M de parámetros0,008 $Por millón de tokens de entrada
Embeddings de 150M a 350M de parámetros0,016 $Por millón de tokens de entrada
Embeddings, Qwen3 8B0,1 $Por millón de tokens de entrada
LoRA SFT hasta 16B0,50 $Por millón de tokens de entrenamiento
LoRA SFT de 16,1B a 80B3,00 $Por millón de tokens de entrenamiento
LoRA SFT de 80B a 300B6,00 $Por millón de tokens de entrenamiento
LoRA SFT por encima de 300B10,00 $Por millón de tokens de entrenamiento
SFT de parámetros completos hasta 16B1,00 $El doble de la tarifa LoRA
DPOEl doble de la tarifa SFTEn todas las franjas de tamaño
GPU H100 / H2007,00 $ → 8,00 $Por hora, sube el 1 de septiembre de 2026
GPU B20010,00 $ → 13,00 $Por hora, sube el 1 de septiembre de 2026
GPU B30012,00 $ → 15,00 $Por hora, sube el 1 de septiembre de 2026
GPU GB30018,00 $ → 20,00 $Por hora, sube el 1 de septiembre de 2026
Despliegue restringido a una región1,5×Recargo sobre las tarifas de GPU
EnterpriseContactar con ventasCondiciones a medida

La estructura de duplicaciones del entrenamiento es fácil de recordar y fácil de calcular mal. Un DPO de parámetros completos sobre un modelo de más de 300B son 40,00 $ por millón de tokens frente a 10,00 $ del LoRA equivalente: una diferencia de cuatro veces por una elección que al inicio de un proyecto suele tomarse a la ligera.

Quién le saca más partido

Equipos que presupuestan un ajuste fino

Los precios de entrenamiento por token publicados en todas las franjas de tamaño significan que puedes producir una estimación creíble a partir del tamaño de tu conjunto de datos en una tarde. Eso es poco habitual y es la razón más fuerte para mirar aquí.

Aplicaciones con mucha recuperación

El precio barato por franjas de los embeddings encaja con sistemas que indexan mucho más texto del que generan. A 0,008 $ por millón de tokens en los modelos pequeños, indexar un corpus grande deja de ser la partida que mata el proyecto.

Cargas en producción que necesitan hardware dedicado

GPU por horas con una vía de subida clara desde lo sin servidor y una gama que llega a la generación Blackwell actual. Modela con las tarifas de septiembre y no con las actuales si el despliegue no es inmediato.

Quien tiene requisitos de residencia de datos

El despliegue restringido a una región está disponible, algo que muchos proveedores de inferencia no ofrecen en absoluto. Presupuéstalo a 1,5× desde el principio en lugar de descubrir el multiplicador durante una revisión de cumplimiento.

A qué prestar atención

  • Los precios de GPU suben el 1 de septiembre de 2026, hasta un 30%. Cualquier comparativa escrita antes de esa fecha, incluidos los modelos de coste que hayas hecho tú, ya está desactualizada.
  • Un dólar de crédito gratuito es un apretón de manos, no una prueba. Cuenta con pagar antes de haber terminado de evaluar.
  • Los costes de entrenamiento escalan veinte veces con el tamaño del modelo base. Elegir la base a la ligera es la decisión más cara de un proyecto de ajuste fino.
  • La restricción por región cuesta 1,5×. Los requisitos de cumplimiento que llegan tarde moverán tu presupuesto más de lo que la mayoría espera.
  • Solo modelos abiertos. Igual que en Together y Groq, el razonamiento comercial de frontera no forma parte del catálogo.
  • Las GPU por horas facturan las uses o no. El paso desde lo sin servidor conviene calcularlo en lugar de suponerlo.

Preguntas frecuentes

¿Están subiendo los precios de Fireworks?

Las tarifas de GPU bajo demanda sí, desde el 1 de septiembre de 2026. H100 y H200 pasan de 7,00 a 8,00 $ la hora, B200 de 10,00 a 13,00 $, B300 de 12,00 a 15,00 $ y GB300 de 18,00 a 20,00 $. Los precios de inferencia sin servidor y de ajuste fino se anuncian aparte de este cambio.

¿Cuánto cuesta realmente el ajuste fino?

Multiplica tus tokens de entrenamiento por la tarifa correspondiente al tamaño de tu modelo base y al método. Un LoRA supervisado sobre un modelo de 13B con diez millones de tokens de entrenamiento sale por unos 5 $. La misma tanda sobre una base de 200B ronda los 60 $.

¿Hay un plan gratuito?

Hay 1 $ en créditos gratuitos, suficiente para confirmar que tu integración funciona. No es un plan gratuito en el sentido en que lo ofrece Groq.

¿Cómo se compara con Together AI?

Se solapan mucho. Together llega más abajo, hasta clústeres de GPU en bruto con precios reservados a largo plazo; Fireworks publica una cuadrícula de ajuste fino más clara. Si tu pregunta principal es la economía del entrenamiento, empieza aquí; si esperas alquilar clústeres, empieza allí.

¿Puedo desplegar en una región concreta?

Sí, con un recargo de 1,5× sobre la tarifa de GPU. Es una opción soportada y no una conversación reservada a empresas, algo útil de saber si tienes un requisito de residencia y tu volumen es modesto.

¿Qué diferencia hay entre LoRA y el ajuste de parámetros completos?

LoRA ajusta un pequeño conjunto de pesos añadidos y cuesta la mitad; el ajuste de parámetros completos actualiza todo el modelo. LoRA es la opción sensata por defecto y suele bastar para enseñarle a un modelo un dominio, un formato o un tono.

En resumen

Fireworks AI es la plataforma de inferencia que te dirá cuánto cuestan las cosas antes de que te comprometas. Solo la cuadrícula de ajuste fino justifica echarle un vistazo, porque convierte una pregunta que normalmente responde una llamada comercial en una aritmética que puedes hacer tú.

Haz esa aritmética con las tarifas de GPU posteriores a septiembre, no con las actuales, y prueba el modelo base más pequeño que tu tarea tolere. La plataforma es directa y los precios son honestos; los errores aquí son los que cometes eligiendo un modelo más grande del que necesitabas.

Herramientas Alternativas