Groq

Ejecuta modelos abiertos a cientos de tokens por segundo en sus propios chips LPU. El plan gratuito no pide tarjeta, y el procesamiento por lotes más la caché reducen las tarifas a alrededor de una cuarta parte.

Ir a la IA
Groq cover

¿Qué es Groq?

Groq ejecuta modelos de lenguaje abiertos muy rápido. No un poco más rápido: varias veces más, a cientos de tokens por segundo, lo bastante deprisa como para que una respuesta larga termine de dibujarse antes de que hayas acabado de leer su primera línea.

Lo consigue no usando GPU. La compañía diseñó su propio chip, la Language Processing Unit, en torno a la forma concreta que tiene ejecutar un modelo de lenguaje, y no en torno a la matemática matricial general para la que se construyó el hardware gráfico. Ser dueño del silicio es la razón de que las cifras de velocidad sean las que son, y también la razón de que su catálogo de modelos sea más pequeño que el de los demás.

Ese intercambio es todo el producto. Obtienes modelos de pesos abiertos —Llama, GPT-OSS, Whisper y los propios sistemas agénticos de Groq— servidos más rápido que en ningún otro sitio, y no obtienes los modelos comerciales de frontera, porque esos no se ejecutan en hardware que sus dueños no controlan.

Cómo funciona

Velocidad sobre la que se puede diseñar

Las cifras de rendimiento publicadas son concretas: unos 560 tokens por segundo en Llama 3.1 8B, cerca de 280 en Llama 3.3 70B, alrededor de 500 en GPT-OSS 120B y casi 1000 en GPT-OSS 20B. Las ventanas de contexto llegan a 131 072 tokens.

Cifras así cambian lo que estás dispuesto a construir. Por debajo de cierta latencia un modelo de lenguaje deja de sentirse como una petición que esperas y empieza a sentirse como una función que llamas, y las interfaces que resultarían desagradables a dos segundos se vuelven naturales a doscientos milisegundos. Voz, edición en vivo, cualquier cosa con una persona esperando: ahí es donde esto no es presumir de benchmark sino la diferencia entre lanzar y no lanzar.

Sistemas agénticos con herramientas integradas

Groq Compound y Compound Mini son modelos empaquetados con búsqueda web, ejecución de código y cálculo ya integrados, funcionando a unos 450 tokens por segundo. En lugar de montar tú el uso de herramientas, llamas a un sistema que ya lo tiene.

Esto encaja de forma natural con la velocidad. Los agentes son bucles, y un bucle de diez pasos a medio segundo cada uno es un producto distinto de uno de diez pasos a tres segundos. La inferencia rápida vale más para los agentes que para el chat, un punto que la mayoría de comparativas no aprecia.

Un plan gratuito que de verdad sirve

Todos los modelos están disponibles en el plan gratuito sin tarjeta, limitados por frecuencia de peticiones y no por recortes de funciones: del orden de 30 peticiones por minuto, 6000 tokens por minuto y 14 400 peticiones al día por organización.

Es suficiente para construir y enseñar una aplicación real, no solo para ejecutar un hola mundo. Añadir un método de pago cambia la cuenta a pago por uso sin cuota mensual base: el plan gratuito es una versión más pequeña de lo mismo y no un producto distinto.

Cuánto cuesta

El precio es por token y sin suscripción. Como son modelos de pesos abiertos servidos en hardware poco habitual, las tarifas se sitúan en el extremo barato del mercado y no en el caro.

QuéPrecioNotas
Plan gratuito0 $Todos los modelos, sin tarjeta
Límites del plan gratuito~30 peticiones/min, 6000 tokens/minUnas 14 400 peticiones al día
Los modelos más pequeñosdesde 0,05 $ entrada / 0,08 $ salidaPor millón de tokens
Llama 3.3 70Bunos 0,59 $ entrada / 0,79 $ salidaPor millón de tokens
Modelos más grandeshasta unos 1,00 $ entrada / 3,00 $ salidaPor millón de tokens
API de lotes50% de descuentoPara trabajo que puede esperar
Caché de prompts50% de descuentoSobre la entrada en caché
Ambos a la vezaproximadamente el 25% de la tarifa normalLos descuentos se acumulan
Cuota mensual baseNingunoPago por uso
EnterpriseA medidaContactar con ventas

El descuento acumulable es el detalle sobre el que merece la pena actuar. Cualquier carga que no necesite respuesta ahora mismo —clasificación nocturna, resúmenes masivos, preparación de conjuntos de datos— puede ejecutarse a alrededor de una cuarta parte de la tarifa normal combinando lotes con caché. Es un ahorro mayor del que la mayoría consigue cambiando de proveedor.

Quién le saca más partido

Cualquier cosa con una persona esperando

Asistentes de voz, sugerencias en vivo, herramientas interactivas. Cuando el tiempo de respuesta forma parte de la interfaz y no es un detalle técnico, la ventaja del hardware deja de ser abstracta.

Agentes que dan muchos pasos

Cada paso adicional multiplica la latencia. Un modelo rápido convierte una cadena que parecía lenta en una que se siente ágil, y los sistemas Compound quitan el trabajo de cablear las herramientas tú mismo.

Trabajo de mucho volumen y poca dificultad

Etiquetado, enrutamiento, extracción, moderación. Un modelo abierto pequeño lo hace bien, el precio por token ya es bajo, y los lotes con caché lo bajan aún más.

Desarrolladores que quieren empezar sin tarjeta

El plan gratuito llega a todos los modelos y está limitado por frecuencia de peticiones, no por funciones recortadas. Para prototipar, enseñar y hackatones eso es una oferta apreciablemente distinta de un saldo pequeño de créditos que se agota.

A qué prestar atención

  • Sin modelos comerciales de frontera. Si tu trabajo necesita el razonamiento más potente disponible, no es aquí donde ocurre: el catálogo son pesos abiertos.
  • La velocidad no mejora la calidad. Un modelo de 8B rápido sigue siendo un modelo de 8B, y oírle equivocarse antes no es una mejora.
  • El plan gratuito lo limitan los límites de frecuencia, no los créditos. En general es mejor, pero un pico de tráfico choca con el techo de golpe y no de forma gradual.
  • Ser dueño del hardware significa que la capacidad la asignan ellos. Que un modelo concreto esté disponible es una decisión de suministro, no algo que puedas rodear enrutando.
  • Las cifras de rendimiento publicadas corresponden a condiciones ideales. La longitud de tu prompt y la de la salida las moverán.
  • El descuento por lotes exige que realmente agrupes en lotes. Es un 50% real y no es automático.

Preguntas frecuentes

¿Groq es gratis?

Hay un plan gratuito que cubre todos los modelos sin tarjeta, limitado por peticiones y tokens por minuto en lugar de por funciones. A partir de ahí es pago por uso sin cuota mensual base.

¿Por qué es tanto más rápido?

Silicio propio. La Language Processing Unit está diseñada para ejecutar modelos de lenguaje en lugar de adaptada del hardware gráfico, y esa diferencia arquitectónica es de donde sale el rendimiento.

¿Puedo ejecutar GPT o Claude en él?

No. Groq sirve modelos de pesos abiertos: Llama, GPT-OSS, Whisper y sus propios sistemas Compound. Los modelos comerciales cerrados solo se ejecutan en infraestructura que controlan sus dueños.

¿Cómo consigo de verdad la tarifa más barata?

Usa la API de lotes para todo lo que tolere retraso y estructura los prompts de modo que la parte compartida se pueda cachear. Cada cosa reduce la tarifa a la mitad y se acumulan, dejándola en torno a una cuarta parte del precio normal.

¿Sirve para producción?

Sí, con la advertencia habitual sobre depender de un solo proveedor. Los equipos que no pueden permitirse una caída suelen ponerle delante un enrutador para tener alternativa, dejando Groq como opción rápida por defecto.

¿Maneja voz?

Sí: los modelos Whisper se sirven junto a los de lenguaje, y eso importa porque las aplicaciones de voz son precisamente donde más se nota la ventaja de latencia.

En resumen

Groq vende una cosa y la vende extremadamente bien: velocidad en modelos abiertos, a precios que empiezan en cinco céntimos por millón de tokens y bajan a alrededor de una cuarta parte con lotes y caché. El plan gratuito sirve de verdad, y la ventaja del hardware es real y no un benchmark elegido para halagar.

El límite es igual de claro. Aquí no hay modelos comerciales de frontera, y ninguna cantidad de rendimiento compensa cuando la tarea necesita de verdad el razonamiento más potente disponible. Úsalo donde la restricción sea la latencia y un modelo abierto baste, que para una proporción sorprendente del trabajo en producción basta.

Herramientas Alternativas