Together AI
inferencia, ajuste fino y clústeres de GPU
Inferencia sin servidor, ajuste fino gestionado con precios por token publicados y GPU bajo demanda. Ojo: las tarifas de GPU suben desde el 1 de septiembre de 2026.

Fireworks AI ejecuta modelos abiertos en producción. Inferencia sin servidor para el camino habitual, ajuste fino gestionado cuando un modelo general no es lo bastante específico, y GPU dedicadas cuando necesitas hardware que sea tuyo durante la hora.
Su costumbre distintiva es publicar los números que otros proveedores guardan detrás de un formulario. La lista de precios del ajuste fino es una cuadrícula —tamaño de modelo frente a método de entrenamiento— con una cifra en cada celda, lo que significa que puedes estimar una tanda de entrenamiento a partir de tu conjunto de datos sin hablar con nadie. En un mercado donde los costes de entrenamiento se dan bajo petición, eso es una diferencia de fondo.
Una cosa que conviene saber antes de planificar sobre cualquier cifra de aquí: la compañía ha publicado una subida de precios de las GPU bajo demanda que entra en vigor el 1 de septiembre de 2026. Las tarifas suben en toda la gama, en algunos casos un 30%. Todo lo que hayas presupuestado con los números actuales necesita revisarse contra los nuevos.
El camino por defecto es la inferencia por token sobre modelos abiertos, con 1 $ de créditos gratuitos para empezar. La cantidad es pequeña a propósito: basta para confirmar que la API funciona y no da para aplazar la decisión de pagar.
Los embeddings se cobran aparte y son baratos, por franjas según el tamaño del modelo: 0,008 $ por millón de tokens de entrada hasta 150M de parámetros, 0,016 $ de 150M a 350M y 0,1 $ para Qwen3 8B. En sistemas de recuperación, donde el volumen de embeddings supera con mucho al de generación, esas franjas suelen ser la cifra que decide la arquitectura.
El entrenamiento gestionado se factura por millón de tokens de entrenamiento, y conviene leer bien la cuadrícula porque las cifras escalan con fuerza. El LoRA supervisado cuesta 0,50 $ hasta 16B de parámetros, 3,00 $ de 16,1B a 80B, 6,00 $ de 80B a 300B y 10,00 $ por encima. El DPO duplica cada cifra, y el ajuste de parámetros completos la vuelve a duplicar.
Léelo como una diferencia de veinte veces entre el LoRA supervisado más barato y el más caro, provocada por completo por el tamaño del modelo base. El consejo práctico que se deduce no es glamuroso: prueba primero el modelo pequeño. Muchísimos proyectos de ajuste fino presupuestados sobre una base de 70B habrían funcionado con una de 8B, y la diferencia es 0,50 $ frente a 3,00 $ por millón de tokens.
Cuando lo sin servidor no basta, puedes tomar GPU por horas. Hasta el 31 de agosto de 2026 un H100 o H200 cuesta 7,00 $, un B200 10,00 $, un B300 12,00 $ y un GB300 18,00 $. Desde el 1 de septiembre pasan a ser 8,00 $, 13,00 $, 15,00 $ y 20,00 $ respectivamente.
La subida más fuerte es la del B200, un 30%, y es la que más probablemente importe, ya que los B200 son hoy el caballo de batalla de la inferencia seria. Los despliegues restringidos a una región concreta llevan encima un recargo de 1,5×, fácil de pasar por alto cuando la residencia de datos se añade tarde al proyecto como requisito de cumplimiento y no como partida presupuestaria.
Importan dos listas de precios: cuánto cuesta el entrenamiento por millón de tokens y cuánto cuesta una GPU por hora. La que cambia es la segunda.
| Qué | Precio | Notas |
|---|---|---|
| Créditos gratuitos | 1 $ | Solo para evaluar |
| Embeddings hasta 150M de parámetros | 0,008 $ | Por millón de tokens de entrada |
| Embeddings de 150M a 350M de parámetros | 0,016 $ | Por millón de tokens de entrada |
| Embeddings, Qwen3 8B | 0,1 $ | Por millón de tokens de entrada |
| LoRA SFT hasta 16B | 0,50 $ | Por millón de tokens de entrenamiento |
| LoRA SFT de 16,1B a 80B | 3,00 $ | Por millón de tokens de entrenamiento |
| LoRA SFT de 80B a 300B | 6,00 $ | Por millón de tokens de entrenamiento |
| LoRA SFT por encima de 300B | 10,00 $ | Por millón de tokens de entrenamiento |
| SFT de parámetros completos hasta 16B | 1,00 $ | El doble de la tarifa LoRA |
| DPO | El doble de la tarifa SFT | En todas las franjas de tamaño |
| GPU H100 / H200 | 7,00 $ → 8,00 $ | Por hora, sube el 1 de septiembre de 2026 |
| GPU B200 | 10,00 $ → 13,00 $ | Por hora, sube el 1 de septiembre de 2026 |
| GPU B300 | 12,00 $ → 15,00 $ | Por hora, sube el 1 de septiembre de 2026 |
| GPU GB300 | 18,00 $ → 20,00 $ | Por hora, sube el 1 de septiembre de 2026 |
| Despliegue restringido a una región | 1,5× | Recargo sobre las tarifas de GPU |
| Enterprise | Contactar con ventas | Condiciones a medida |
La estructura de duplicaciones del entrenamiento es fácil de recordar y fácil de calcular mal. Un DPO de parámetros completos sobre un modelo de más de 300B son 40,00 $ por millón de tokens frente a 10,00 $ del LoRA equivalente: una diferencia de cuatro veces por una elección que al inicio de un proyecto suele tomarse a la ligera.
Los precios de entrenamiento por token publicados en todas las franjas de tamaño significan que puedes producir una estimación creíble a partir del tamaño de tu conjunto de datos en una tarde. Eso es poco habitual y es la razón más fuerte para mirar aquí.
El precio barato por franjas de los embeddings encaja con sistemas que indexan mucho más texto del que generan. A 0,008 $ por millón de tokens en los modelos pequeños, indexar un corpus grande deja de ser la partida que mata el proyecto.
GPU por horas con una vía de subida clara desde lo sin servidor y una gama que llega a la generación Blackwell actual. Modela con las tarifas de septiembre y no con las actuales si el despliegue no es inmediato.
El despliegue restringido a una región está disponible, algo que muchos proveedores de inferencia no ofrecen en absoluto. Presupuéstalo a 1,5× desde el principio en lugar de descubrir el multiplicador durante una revisión de cumplimiento.
Las tarifas de GPU bajo demanda sí, desde el 1 de septiembre de 2026. H100 y H200 pasan de 7,00 a 8,00 $ la hora, B200 de 10,00 a 13,00 $, B300 de 12,00 a 15,00 $ y GB300 de 18,00 a 20,00 $. Los precios de inferencia sin servidor y de ajuste fino se anuncian aparte de este cambio.
Multiplica tus tokens de entrenamiento por la tarifa correspondiente al tamaño de tu modelo base y al método. Un LoRA supervisado sobre un modelo de 13B con diez millones de tokens de entrenamiento sale por unos 5 $. La misma tanda sobre una base de 200B ronda los 60 $.
Hay 1 $ en créditos gratuitos, suficiente para confirmar que tu integración funciona. No es un plan gratuito en el sentido en que lo ofrece Groq.
Se solapan mucho. Together llega más abajo, hasta clústeres de GPU en bruto con precios reservados a largo plazo; Fireworks publica una cuadrícula de ajuste fino más clara. Si tu pregunta principal es la economía del entrenamiento, empieza aquí; si esperas alquilar clústeres, empieza allí.
Sí, con un recargo de 1,5× sobre la tarifa de GPU. Es una opción soportada y no una conversación reservada a empresas, algo útil de saber si tienes un requisito de residencia y tu volumen es modesto.
LoRA ajusta un pequeño conjunto de pesos añadidos y cuesta la mitad; el ajuste de parámetros completos actualiza todo el modelo. LoRA es la opción sensata por defecto y suele bastar para enseñarle a un modelo un dominio, un formato o un tono.
Fireworks AI es la plataforma de inferencia que te dirá cuánto cuestan las cosas antes de que te comprometas. Solo la cuadrícula de ajuste fino justifica echarle un vistazo, porque convierte una pregunta que normalmente responde una llamada comercial en una aritmética que puedes hacer tú.
Haz esa aritmética con las tarifas de GPU posteriores a septiembre, no con las actuales, y prueba el modelo base más pequeño que tu tarea tolere. La plataforma es directa y los precios son honestos; los errores aquí son los que cometes eligiendo un modelo más grande del que necesitabas.