Fireworks AI
inferencia en producción y ajuste fino
Inferencia sin servidor, endpoints dedicados, ajuste fino y clústeres de GPU en alquiler: un solo proveedor en todas las capas, desde los tokens hasta los H200 desnudos.

Together AI vende cómputo para modelos abiertos en todos los niveles de abstracción. Arriba envías un prompt y pagas por token. Abajo alquilas H200 por horas y haces lo que quieras con ellos. En medio están los endpoints dedicados, el ajuste fino y un entorno de ejecución de código, y la idea es que moverte entre esos niveles no implica cambiar de proveedor.
Ese abanico es poco habitual. La mayoría de compañías del sector eligen una capa: API de tokens, alquiler de GPU o entrenamiento. Together cubre la columna entera, y eso importa porque un producto de IA que funciona tiende a bajar por ella. Empiezas sin servidor porque es fácil, descubres que tu tráfico es lo bastante estable como para que la capacidad dedicada salga más barata, y luego ajustas un modelo con tus propios datos y necesitas dónde servirlo.
También es inusualmente amplio en modalidades. Junto a los modelos de chat están la generación de imágenes, la de vídeo y la transcripción de audio, todo facturado en la misma cuenta: Flux, Imagen, Veo, Sora y Seedance aparecen al lado de Llama y DeepSeek.
El punto de partida es una API por token sobre modelos abiertos. Las tarifas cubren un rango amplio: unos 0,14 $ de entrada y 0,28 $ de salida por millón de tokens en una variante rápida de DeepSeek, alrededor de 1,04 $ en ambos sentidos para Llama 3.3 70B, y 3,00 $ de entrada con 15,00 $ de salida para Kimi K3.
Una diferencia de más de veinte veces en la salida significa que la elección del modelo domina la factura, y conviene comprobar si el modelo barato realmente falla en tu tarea antes de dar por hecho que sí. La mayoría de equipos descubre que buena parte de su tráfico nunca necesitó la opción cara.
La inferencia dedicada te da un modelo sobre hardware que es tuyo durante la hora: un HGX H100 a 5,49 $, un HGX B200 a 8,99 $. La aritmética frente al precio por token es directa: el volumen alto y constante favorece la tarifa por hora, el tráfico irregular favorece el pago por token, y el punto de cruce conviene calcularlo en lugar de adivinarlo.
Por debajo están los clústeres de GPU. Bajo demanda, un H100 cuesta 3,99 $ por GPU y hora, un H200 5,99 $ y un B200 8,19 $. Reservar 181 días o más baja bastante esas cifras —el H200 a 3,99 $ y el B200 a 6,79 $—, que es la forma habitual de este mercado: la capacidad sale barata si puedes prometer que la vas a usar.
El ajuste fino se factura por millón de tokens de entrenamiento y las cifras están publicadas en lugar de darse bajo petición. Un LoRA supervisado sobre un modelo de hasta 16B cuesta 0,48 $; el DPO, 0,54 $; el entrenamiento de parámetros completos va de 1,20 a 1,35 $. Los modelos grandes y especializados cuestan bastante más: un LoRA sobre GLM-5.2 son 40,00 $ por millón de tokens.
Que esto se publique importa. El ajuste fino es justo donde los costes se vuelven opacos, y poder estimar una tanda de entrenamiento a partir del tamaño de tu conjunto de datos antes de comprometerte es la diferencia entre un experimento y una petición de presupuesto.
No hay suscripción. Pagas por lo que usas en la capa en la que lo uses, y la tabla siguiente da los puntos de referencia que anclan el resto.
| Qué | Precio | Unidad |
|---|---|---|
| DeepSeek V4 Flash | 0,14 $ entrada / 0,28 $ salida | Por millón de tokens |
| GLM-5.3-Flash | 0,15 $ entrada / 0,50 $ salida | Por millón de tokens |
| Llama 3.3 70B | 1,04 $ entrada / 1,04 $ salida | Por millón de tokens |
| Kimi K3 | 3,00 $ entrada / 15,00 $ salida | Por millón de tokens |
| Whisper Large v3 | 0,0015 $ | Por minuto de audio |
| FLUX.2 [dev] | 0,0154 $ | Por imagen |
| Sora 2 | 0,80 $ | Por vídeo |
| HGX H100 dedicado | 5,49 $ | Por hora |
| HGX B200 dedicado | 8,99 $ | Por hora |
| H100 de clúster bajo demanda | 3,99 $ | Por GPU y hora |
| H200 de clúster reservado 181+ días | 3,99 $ | Por GPU y hora |
| Ajuste LoRA hasta 16B | 0,48 $ | Por millón de tokens de entrenamiento |
| Sistema de archivos compartido | 0,16 $ | Por GiB al mes |
| Sesión de intérprete de código | 0,03 $ | Por 60 minutos |
La brecha entre reserva y bajo demanda en los clústeres es la mayor palanca aquí. Un H200 baja de 5,99 a 3,99 $ con un compromiso largo: un tercio menos a cambio de una certeza que la mayoría de equipos en fases tempranas no pueden dar honestamente.
Si prevés capacidad dedicada o un modelo propio ajustado en el próximo año, empezar en un sitio que ofrezca ambas cosas te ahorra una migración que de otro modo tendrías que programar.
Precios de entrenamiento por token publicados, una gama de tamaños de modelo base y un sitio donde servir el resultado después. Eso es un camino completo y no tres conversaciones de compra separadas.
Texto, imágenes, vídeo y transcripción en una cuenta y una factura. Para cualquier cosa que genere medios junto al texto, consolidar eso vale más que unos puntos porcentuales en cualquier tarifa concreta.
Si ya alquilas cómputo para entrenar, tener la inferencia del mismo proveedor —con precios de reserva disponibles— es un arreglo más simple que repartirlo entre un proveedor de nube y un vendedor de API.
Hay un arranque gratuito más que un plan gratuito permanente: el sitio te invita a empezar sin coste sin publicar una cantidad concreta de créditos. Tómatelo como suficiente para evaluar, no para operar.
Cuando tu tráfico sea lo bastante constante como para que una tarifa por hora salga mejor que tu gasto en tokens. Coge tu factura mensual de tokens, divídela entre las horas en que realmente sirves tráfico y compárala con los 5,49 $ de un H100. Las cargas irregulares casi siempre se quedan sin servidor.
Sí, y ese camino es la razón para elegir un proveedor que cubra varias capas. El entrenamiento se cobra por millón de tokens y el modelo resultante puede ejecutarse en infraestructura dedicada en la misma cuenta.
Sí. La generación de imágenes se cobra por imagen, desde menos de una quinta parte de céntimo con SD XL hasta seis céntimos con Imagen 4.0 Ultra, y el vídeo por clip, con Sora 2 a 0,80 $ y Veo 3.0 a 1,60 $.
Groq optimiza la velocidad pura sobre un catálogo estrecho. Fireworks se centra en la inferencia en producción y el ajuste fino. Together es el más amplio de los tres y llega hasta el alquiler de GPU en bruto: elígelo cuando esperes necesitar más que una API de tokens.
El negocio aquí es servir modelos abiertos y no mejorar los propietarios, lo que coloca los incentivos en un lugar razonable. Como siempre, lee las condiciones vigentes de tu plan concreto en lugar de fiarte de una afirmación general.
Together AI es la opción para equipos que sospechan que una API de tokens no será el final de la historia. Inferencia sin servidor para empezar, endpoints dedicados cuando el volumen lo justifique, ajuste fino con precios publicados y clústeres en bruto por debajo, todo en una cuenta, lo que elimina las migraciones que suelen jalonar el crecimiento de un producto de IA.
El catálogo son modelos abiertos, así que el razonamiento comercial más potente está en otra parte. Pero si tu trabajo es con pesos abiertos y esperas crecer hacia la infraestructura, la amplitud es la razón para elegirlo, y exige la disciplina de comprobar en cada capa que estás comprando la que realmente necesitas.