Together AI

Inferencia sin servidor, endpoints dedicados, ajuste fino y clústeres de GPU en alquiler: un solo proveedor en todas las capas, desde los tokens hasta los H200 desnudos.

Ir a la IA
Together AI cover

¿Qué es Together AI?

Together AI vende cómputo para modelos abiertos en todos los niveles de abstracción. Arriba envías un prompt y pagas por token. Abajo alquilas H200 por horas y haces lo que quieras con ellos. En medio están los endpoints dedicados, el ajuste fino y un entorno de ejecución de código, y la idea es que moverte entre esos niveles no implica cambiar de proveedor.

Ese abanico es poco habitual. La mayoría de compañías del sector eligen una capa: API de tokens, alquiler de GPU o entrenamiento. Together cubre la columna entera, y eso importa porque un producto de IA que funciona tiende a bajar por ella. Empiezas sin servidor porque es fácil, descubres que tu tráfico es lo bastante estable como para que la capacidad dedicada salga más barata, y luego ajustas un modelo con tus propios datos y necesitas dónde servirlo.

También es inusualmente amplio en modalidades. Junto a los modelos de chat están la generación de imágenes, la de vídeo y la transcripción de audio, todo facturado en la misma cuenta: Flux, Imagen, Veo, Sora y Seedance aparecen al lado de Llama y DeepSeek.

Cómo funciona

Inferencia sin servidor

El punto de partida es una API por token sobre modelos abiertos. Las tarifas cubren un rango amplio: unos 0,14 $ de entrada y 0,28 $ de salida por millón de tokens en una variante rápida de DeepSeek, alrededor de 1,04 $ en ambos sentidos para Llama 3.3 70B, y 3,00 $ de entrada con 15,00 $ de salida para Kimi K3.

Una diferencia de más de veinte veces en la salida significa que la elección del modelo domina la factura, y conviene comprobar si el modelo barato realmente falla en tu tarea antes de dar por hecho que sí. La mayoría de equipos descubre que buena parte de su tráfico nunca necesitó la opción cara.

Endpoints dedicados y clústeres en bruto

La inferencia dedicada te da un modelo sobre hardware que es tuyo durante la hora: un HGX H100 a 5,49 $, un HGX B200 a 8,99 $. La aritmética frente al precio por token es directa: el volumen alto y constante favorece la tarifa por hora, el tráfico irregular favorece el pago por token, y el punto de cruce conviene calcularlo en lugar de adivinarlo.

Por debajo están los clústeres de GPU. Bajo demanda, un H100 cuesta 3,99 $ por GPU y hora, un H200 5,99 $ y un B200 8,19 $. Reservar 181 días o más baja bastante esas cifras —el H200 a 3,99 $ y el B200 a 6,79 $—, que es la forma habitual de este mercado: la capacidad sale barata si puedes prometer que la vas a usar.

El ajuste fino como producto con precio

El ajuste fino se factura por millón de tokens de entrenamiento y las cifras están publicadas en lugar de darse bajo petición. Un LoRA supervisado sobre un modelo de hasta 16B cuesta 0,48 $; el DPO, 0,54 $; el entrenamiento de parámetros completos va de 1,20 a 1,35 $. Los modelos grandes y especializados cuestan bastante más: un LoRA sobre GLM-5.2 son 40,00 $ por millón de tokens.

Que esto se publique importa. El ajuste fino es justo donde los costes se vuelven opacos, y poder estimar una tanda de entrenamiento a partir del tamaño de tu conjunto de datos antes de comprometerte es la diferencia entre un experimento y una petición de presupuesto.

Cuánto cuesta

No hay suscripción. Pagas por lo que usas en la capa en la que lo uses, y la tabla siguiente da los puntos de referencia que anclan el resto.

QuéPrecioUnidad
DeepSeek V4 Flash0,14 $ entrada / 0,28 $ salidaPor millón de tokens
GLM-5.3-Flash0,15 $ entrada / 0,50 $ salidaPor millón de tokens
Llama 3.3 70B1,04 $ entrada / 1,04 $ salidaPor millón de tokens
Kimi K33,00 $ entrada / 15,00 $ salidaPor millón de tokens
Whisper Large v30,0015 $Por minuto de audio
FLUX.2 [dev]0,0154 $Por imagen
Sora 20,80 $Por vídeo
HGX H100 dedicado5,49 $Por hora
HGX B200 dedicado8,99 $Por hora
H100 de clúster bajo demanda3,99 $Por GPU y hora
H200 de clúster reservado 181+ días3,99 $Por GPU y hora
Ajuste LoRA hasta 16B0,48 $Por millón de tokens de entrenamiento
Sistema de archivos compartido0,16 $Por GiB al mes
Sesión de intérprete de código0,03 $Por 60 minutos

La brecha entre reserva y bajo demanda en los clústeres es la mayor palanca aquí. Un H200 baja de 5,99 a 3,99 $ con un compromiso largo: un tercio menos a cambio de una certeza que la mayoría de equipos en fases tempranas no pueden dar honestamente.

Quién le saca más partido

Productos que se le quedarán pequeños a una API de tokens

Si prevés capacidad dedicada o un modelo propio ajustado en el próximo año, empezar en un sitio que ofrezca ambas cosas te ahorra una migración que de otro modo tendrías que programar.

Equipos que ajustan modelos con sus propios datos

Precios de entrenamiento por token publicados, una gama de tamaños de modelo base y un sitio donde servir el resultado después. Eso es un camino completo y no tres conversaciones de compra separadas.

Aplicaciones multimodales

Texto, imágenes, vídeo y transcripción en una cuenta y una factura. Para cualquier cosa que genere medios junto al texto, consolidar eso vale más que unos puntos porcentuales en cualquier tarifa concreta.

Quien ya alquila GPU de todas formas

Si ya alquilas cómputo para entrenar, tener la inferencia del mismo proveedor —con precios de reserva disponibles— es un arreglo más simple que repartirlo entre un proveedor de nube y un vendedor de API.

A qué prestar atención

  • Solo modelos abiertos. Aquí no hay modelos comerciales de frontera, así que el razonamiento más potente disponible no está en la carta.
  • La amplitud tiene además un coste de complejidad. Cuatro formas de comprar cómputo son cuatro formas de elegir la equivocada y pagar más de lo necesario.
  • El precio de clúster reservado exige un compromiso de 181 días. El descuento es real y la obligación también.
  • Los precios de tokens de salida varían más de veinte veces entre modelos. Recurrir por defecto a la opción más potente es la vía más rápida a una factura sorprendente.
  • El coste del ajuste fino escala bruscamente con el tamaño del modelo. Un LoRA a 0,48 $ por millón de tokens y otro a 40,00 $ son la misma operación sobre bases distintas.
  • Los endpoints dedicados facturan por hora llegue o no tráfico. La capacidad ociosa es la forma clásica de que esto salga más caro que el modo sin servidor.

Preguntas frecuentes

¿Hay un plan gratuito?

Hay un arranque gratuito más que un plan gratuito permanente: el sitio te invita a empezar sin coste sin publicar una cantidad concreta de créditos. Tómatelo como suficiente para evaluar, no para operar.

¿Cuándo pasar de sin servidor a dedicado?

Cuando tu tráfico sea lo bastante constante como para que una tarifa por hora salga mejor que tu gasto en tokens. Coge tu factura mensual de tokens, divídela entre las horas en que realmente sirves tráfico y compárala con los 5,49 $ de un H100. Las cargas irregulares casi siempre se quedan sin servidor.

¿Puedo ajustar un modelo y luego servirlo?

Sí, y ese camino es la razón para elegir un proveedor que cubra varias capas. El entrenamiento se cobra por millón de tokens y el modelo resultante puede ejecutarse en infraestructura dedicada en la misma cuenta.

¿Maneja imágenes y vídeo?

Sí. La generación de imágenes se cobra por imagen, desde menos de una quinta parte de céntimo con SD XL hasta seis céntimos con Imagen 4.0 Ultra, y el vídeo por clip, con Sora 2 a 0,80 $ y Veo 3.0 a 1,60 $.

¿Cómo se compara con Groq o Fireworks?

Groq optimiza la velocidad pura sobre un catálogo estrecho. Fireworks se centra en la inferencia en producción y el ajuste fino. Together es el más amplio de los tres y llega hasta el alquiler de GPU en bruto: elígelo cuando esperes necesitar más que una API de tokens.

¿Se usan mis datos para entrenar?

El negocio aquí es servir modelos abiertos y no mejorar los propietarios, lo que coloca los incentivos en un lugar razonable. Como siempre, lee las condiciones vigentes de tu plan concreto en lugar de fiarte de una afirmación general.

En resumen

Together AI es la opción para equipos que sospechan que una API de tokens no será el final de la historia. Inferencia sin servidor para empezar, endpoints dedicados cuando el volumen lo justifique, ajuste fino con precios publicados y clústeres en bruto por debajo, todo en una cuenta, lo que elimina las migraciones que suelen jalonar el crecimiento de un producto de IA.

El catálogo son modelos abiertos, así que el razonamiento comercial más potente está en otra parte. Pero si tu trabajo es con pesos abiertos y esperas crecer hacia la infraestructura, la amplitud es la razón para elegirlo, y exige la disciplina de comprobar en cada capa que estás comprando la que realmente necesitas.

Herramientas Alternativas