Together AI
inferencia, ajuste fino y clústeres de GPU
Ejecuta modelos abiertos a cientos de tokens por segundo en sus propios chips LPU. El plan gratuito no pide tarjeta, y el procesamiento por lotes más la caché reducen las tarifas a alrededor de una cuarta parte.

Groq ejecuta modelos de lenguaje abiertos muy rápido. No un poco más rápido: varias veces más, a cientos de tokens por segundo, lo bastante deprisa como para que una respuesta larga termine de dibujarse antes de que hayas acabado de leer su primera línea.
Lo consigue no usando GPU. La compañía diseñó su propio chip, la Language Processing Unit, en torno a la forma concreta que tiene ejecutar un modelo de lenguaje, y no en torno a la matemática matricial general para la que se construyó el hardware gráfico. Ser dueño del silicio es la razón de que las cifras de velocidad sean las que son, y también la razón de que su catálogo de modelos sea más pequeño que el de los demás.
Ese intercambio es todo el producto. Obtienes modelos de pesos abiertos —Llama, GPT-OSS, Whisper y los propios sistemas agénticos de Groq— servidos más rápido que en ningún otro sitio, y no obtienes los modelos comerciales de frontera, porque esos no se ejecutan en hardware que sus dueños no controlan.
Las cifras de rendimiento publicadas son concretas: unos 560 tokens por segundo en Llama 3.1 8B, cerca de 280 en Llama 3.3 70B, alrededor de 500 en GPT-OSS 120B y casi 1000 en GPT-OSS 20B. Las ventanas de contexto llegan a 131 072 tokens.
Cifras así cambian lo que estás dispuesto a construir. Por debajo de cierta latencia un modelo de lenguaje deja de sentirse como una petición que esperas y empieza a sentirse como una función que llamas, y las interfaces que resultarían desagradables a dos segundos se vuelven naturales a doscientos milisegundos. Voz, edición en vivo, cualquier cosa con una persona esperando: ahí es donde esto no es presumir de benchmark sino la diferencia entre lanzar y no lanzar.
Groq Compound y Compound Mini son modelos empaquetados con búsqueda web, ejecución de código y cálculo ya integrados, funcionando a unos 450 tokens por segundo. En lugar de montar tú el uso de herramientas, llamas a un sistema que ya lo tiene.
Esto encaja de forma natural con la velocidad. Los agentes son bucles, y un bucle de diez pasos a medio segundo cada uno es un producto distinto de uno de diez pasos a tres segundos. La inferencia rápida vale más para los agentes que para el chat, un punto que la mayoría de comparativas no aprecia.
Todos los modelos están disponibles en el plan gratuito sin tarjeta, limitados por frecuencia de peticiones y no por recortes de funciones: del orden de 30 peticiones por minuto, 6000 tokens por minuto y 14 400 peticiones al día por organización.
Es suficiente para construir y enseñar una aplicación real, no solo para ejecutar un hola mundo. Añadir un método de pago cambia la cuenta a pago por uso sin cuota mensual base: el plan gratuito es una versión más pequeña de lo mismo y no un producto distinto.
El precio es por token y sin suscripción. Como son modelos de pesos abiertos servidos en hardware poco habitual, las tarifas se sitúan en el extremo barato del mercado y no en el caro.
| Qué | Precio | Notas |
|---|---|---|
| Plan gratuito | 0 $ | Todos los modelos, sin tarjeta |
| Límites del plan gratuito | ~30 peticiones/min, 6000 tokens/min | Unas 14 400 peticiones al día |
| Los modelos más pequeños | desde 0,05 $ entrada / 0,08 $ salida | Por millón de tokens |
| Llama 3.3 70B | unos 0,59 $ entrada / 0,79 $ salida | Por millón de tokens |
| Modelos más grandes | hasta unos 1,00 $ entrada / 3,00 $ salida | Por millón de tokens |
| API de lotes | 50% de descuento | Para trabajo que puede esperar |
| Caché de prompts | 50% de descuento | Sobre la entrada en caché |
| Ambos a la vez | aproximadamente el 25% de la tarifa normal | Los descuentos se acumulan |
| Cuota mensual base | Ninguno | Pago por uso |
| Enterprise | A medida | Contactar con ventas |
El descuento acumulable es el detalle sobre el que merece la pena actuar. Cualquier carga que no necesite respuesta ahora mismo —clasificación nocturna, resúmenes masivos, preparación de conjuntos de datos— puede ejecutarse a alrededor de una cuarta parte de la tarifa normal combinando lotes con caché. Es un ahorro mayor del que la mayoría consigue cambiando de proveedor.
Asistentes de voz, sugerencias en vivo, herramientas interactivas. Cuando el tiempo de respuesta forma parte de la interfaz y no es un detalle técnico, la ventaja del hardware deja de ser abstracta.
Cada paso adicional multiplica la latencia. Un modelo rápido convierte una cadena que parecía lenta en una que se siente ágil, y los sistemas Compound quitan el trabajo de cablear las herramientas tú mismo.
Etiquetado, enrutamiento, extracción, moderación. Un modelo abierto pequeño lo hace bien, el precio por token ya es bajo, y los lotes con caché lo bajan aún más.
El plan gratuito llega a todos los modelos y está limitado por frecuencia de peticiones, no por funciones recortadas. Para prototipar, enseñar y hackatones eso es una oferta apreciablemente distinta de un saldo pequeño de créditos que se agota.
Hay un plan gratuito que cubre todos los modelos sin tarjeta, limitado por peticiones y tokens por minuto en lugar de por funciones. A partir de ahí es pago por uso sin cuota mensual base.
Silicio propio. La Language Processing Unit está diseñada para ejecutar modelos de lenguaje en lugar de adaptada del hardware gráfico, y esa diferencia arquitectónica es de donde sale el rendimiento.
No. Groq sirve modelos de pesos abiertos: Llama, GPT-OSS, Whisper y sus propios sistemas Compound. Los modelos comerciales cerrados solo se ejecutan en infraestructura que controlan sus dueños.
Usa la API de lotes para todo lo que tolere retraso y estructura los prompts de modo que la parte compartida se pueda cachear. Cada cosa reduce la tarifa a la mitad y se acumulan, dejándola en torno a una cuarta parte del precio normal.
Sí, con la advertencia habitual sobre depender de un solo proveedor. Los equipos que no pueden permitirse una caída suelen ponerle delante un enrutador para tener alternativa, dejando Groq como opción rápida por defecto.
Sí: los modelos Whisper se sirven junto a los de lenguaje, y eso importa porque las aplicaciones de voz son precisamente donde más se nota la ventaja de latencia.
Groq vende una cosa y la vende extremadamente bien: velocidad en modelos abiertos, a precios que empiezan en cinco céntimos por millón de tokens y bajan a alrededor de una cuarta parte con lotes y caché. El plan gratuito sirve de verdad, y la ventaja del hardware es real y no un benchmark elegido para halagar.
El límite es igual de claro. Aquí no hay modelos comerciales de frontera, y ninguna cantidad de rendimiento compensa cuando la tarea necesita de verdad el razonamiento más potente disponible. Úsalo donde la restricción sea la latencia y un modelo abierto baste, que para una proporción sorprendente del trabajo en producción basta.