Together AI
inferencia, ajuste fino y clústeres de GPU
Ejecuta tu propio código de IA en GPU en la nube añadiendo decoradores a Python. Arranques en frío por debajo del segundo, facturación por segundo y 30 $ de crédito gratis cada mes.

Modal no es una API de modelos. Es un sitio donde ejecutar tu propio código en GPU sin convertirte en la persona del equipo que entiende de Kubernetes. Escribes Python, añades decoradores que dicen qué hardware necesita la función, y se ejecuta en la nube aunque siga sintiéndose como si corriera en local.
Esa distinción lo coloca en una categoría distinta de la de los vendedores de tokens. OpenRouter, Groq y Fireworks te venden inferencia sobre modelos que ellos alojan. Modal te vende la máquina. Si tu trabajo es llamar a un modelo, no lo necesitas; si tu trabajo es entrenar algo, procesar un millón de archivos o servir un modelo que nadie más aloja, esta es la capa donde eso ocurre.
Las afirmaciones de ingeniería son concretas: arranques en frío de contenedor por debajo del segundo, autoescalado de cero a más de mil GPU y latencia inferior a 10 ms para inferencia distribuida globalmente. La primera es la que hace que el modelo funcione: las GPU sin servidor solo son útiles si arrancar una es lo bastante rápido como para permitirte no tener ninguna encendida.
La lógica de la aplicación y los requisitos de hardware viven en el mismo código. Una función se anota con lo que necesita —un tipo de GPU, memoria, una imagen de contenedor— y Modal lo aprovisiona cuando se llama a la función y lo libera cuando la llamada termina.
La consecuencia es que la infraestructura deja de ser un artefacto aparte. No hay una definición de clúster que se desincronice del código que ejecuta, porque el requisito está escrito junto a lo que lo exige. Para equipos pequeños sin ingeniero de plataforma, esta es la diferencia entre sacar una carga de GPU y posponerla.
Como los arranques en frío bajan del segundo, mantener cero capacidad ociosa es una opción por defecto viable y no una concesión. Llega tráfico, arrancan contenedores, se hace el trabajo, los contenedores paran, y te facturan los segundos que hubo en medio.
Esto encaja con la forma real de la mayoría de cargas de IA, que son irregulares y no constantes. Un trabajo por lotes que corre veinte minutos cada noche cuesta veinte minutos. En una GPU facturada por horas costaría una hora, y en una instancia reservada costaría el día entero.
La inferencia cubre servir modelos, incluidos los multimodales, en línea o por lotes. El entrenamiento cubre ajuste fino, aprendizaje por refuerzo, ejecuciones distribuidas multinodo y barridos de hiperparámetros, y este último encaja de forma natural, porque un barrido son muchos trabajos cortos e independientes y eso es justo lo que premia la facturación por segundo.
El tercero son los entornos aislados: espacios donde ejecutan los agentes de programación y otros sistemas autónomos. A medida que los agentes escriben y ejecutan código cada vez más, tener un sitio desechable donde hacerlo pasa de ser un detalle agradable a ser infraestructura, y esto se ha convertido discretamente en uno de los usos más importantes de Modal.
El cómputo se factura por segundo, y ese es el detalle que cambia la aritmética frente a los proveedores que cobran por hora. La cuota del plan va aparte y es pequeña comparada con lo que cuesta el cómputo serio.
| Recurso | Precio por segundo | Aproximadamente por hora |
|---|---|---|
| Nvidia B300 | 0,001972 $ | 7,10 $ |
| Nvidia B200 | 0,001736 $ | 6,25 $ |
| Nvidia H200 SXM | 0,001261 $ | 4,54 $ |
| Nvidia H100 SXM5 | 0,001097 $ | 3,95 $ |
| Nvidia RTX PRO 6000 | 0,000842 $ | 3,03 $ |
| Nvidia A100 80 GB | 0,000694 $ | 2,50 $ |
| Nvidia L40S | 0,000542 $ | 1,95 $ |
| Nvidia A10 | 0,000306 $ | 1,10 $ |
| Nvidia T4 | 0,000164 $ | 0,59 $ |
| Núcleo de CPU | 0,0000131 $ | Mínimo 0,125 núcleos |
| Memoria | 0,00000222 $ por GiB | Se factura junto con el cómputo |
| Volúmenes | — | 0,09 $ por GiB al mes, el primer TiB gratis |
| Plan | Cuota mensual | Créditos gratuitos |
|---|---|---|
| Starter | 0 $ más el cómputo | 30 $ al mes |
| Team | 250 $ más el cómputo | 100 $ al mes |
| Enterprise | A medida | Negociado |
El crédito mensual de 30 $ del plan gratuito merece atención porque se repite en lugar de ser único. A tarifas de T4 son unas cincuenta horas de GPU al mes, de forma permanente, suficiente para mantener un pequeño servicio personal sin pagar nunca.
Ten en cuenta que los entornos aislados y los cuadernos se facturan a tarifas de CPU y memoria más altas que las funciones normales: el triple en CPU. Si tu uso principal son los entornos para agentes, modélalos aparte en lugar de dar por buenas las cifras de portada.
Trabajos nocturnos, procesamiento periódico, cualquier cosa que trabaje intensamente unos minutos y se detenga. La facturación por segundo con arranques inferiores al segundo es exactamente la forma que quieren estas cargas, y es donde Modal gana de calle a un proveedor por horas.
Un modelo ajustado, una arquitectura poco común, algo que construiste tú. Las API de tokens no pueden ayudar; esta capa sí, y sin que tengas que escribir antes la infraestructura de despliegue.
El modelo de decoradores existe para que quienes programan en Python puedan ejecutar trabajo en GPU sin aprender orquestación. Para un equipo pequeño eso no es una comodidad sino la diferencia entre que el proyecto salga o no.
Entornos aislados y desechables donde el código generado puede ejecutarse sin tocar nada que importe. A medida que los agentes pasan de sugerir código a ejecutarlo, esto deja de ser opcional.
No. Ejecuta tu código en hardware en la nube. Si quieres enviar un prompt y recibir una respuesta, usa un proveedor de inferencia. Si quieres ejecutar en una GPU algo que has escrito tú, esta es la capa adecuada.
El plan Starter no tiene cuota mensual e incluye 30 $ de crédito de cómputo cada mes. Es una asignación recurrente y no una prueba única, lo que hace que los despliegues pequeños de aficionado salgan realmente gratis.
Gana claramente en trabajo intermitente. Una tarea de doce minutos cuesta doce minutos aquí y una hora en otro sitio. Con GPU saturadas de forma continua la diferencia desaparece en buena medida y el precio reservado de un proveedor de clústeres puede salir más barato.
Sí: ajuste fino, aprendizaje por refuerzo, entrenamiento distribuido multinodo y barridos de hiperparámetros son cargas admitidas. Los barridos encajan especialmente bien con el modelo de facturación, ya que son muchos trabajos cortos en paralelo.
Desde T4 y L4 en la gama barata pasando por A10, L40S y A100 hasta H100, H200, B200 y B300. Ese abanico permite ajustar el hardware a la tarea en lugar de pagar por una GPU grande porque era la única opción.
Las imágenes de contenedor se definen en Python junto al resto de la configuración, que es justo la idea del diseño: un solo lenguaje para la lógica, las dependencias y el hardware.
Modal se usa cuando el modelo no es el producto: cuando tienes tu propio código, tus propios pesos o un trabajo que necesita mil GPU durante cuatro minutos. La facturación por segundo y los arranques rápidos hacen que el trabajo intermitente en GPU salga a cuenta de una forma que el alquiler por horas nunca ha permitido.
Está hecho a medida de Python y no se disculpa por ello, y elimina la orquestación, no la experiencia técnica. Si eso te encaja, el crédito recurrente de 30 $ al mes significa que averiguarlo no cuesta absolutamente nada.