Modal

Ejecuta tu propio código de IA en GPU en la nube añadiendo decoradores a Python. Arranques en frío por debajo del segundo, facturación por segundo y 30 $ de crédito gratis cada mes.

Ir a la IA
Modal cover

¿Qué es Modal?

Modal no es una API de modelos. Es un sitio donde ejecutar tu propio código en GPU sin convertirte en la persona del equipo que entiende de Kubernetes. Escribes Python, añades decoradores que dicen qué hardware necesita la función, y se ejecuta en la nube aunque siga sintiéndose como si corriera en local.

Esa distinción lo coloca en una categoría distinta de la de los vendedores de tokens. OpenRouter, Groq y Fireworks te venden inferencia sobre modelos que ellos alojan. Modal te vende la máquina. Si tu trabajo es llamar a un modelo, no lo necesitas; si tu trabajo es entrenar algo, procesar un millón de archivos o servir un modelo que nadie más aloja, esta es la capa donde eso ocurre.

Las afirmaciones de ingeniería son concretas: arranques en frío de contenedor por debajo del segundo, autoescalado de cero a más de mil GPU y latencia inferior a 10 ms para inferencia distribuida globalmente. La primera es la que hace que el modelo funcione: las GPU sin servidor solo son útiles si arrancar una es lo bastante rápido como para permitirte no tener ninguna encendida.

Cómo funciona

El hardware como una línea de Python

La lógica de la aplicación y los requisitos de hardware viven en el mismo código. Una función se anota con lo que necesita —un tipo de GPU, memoria, una imagen de contenedor— y Modal lo aprovisiona cuando se llama a la función y lo libera cuando la llamada termina.

La consecuencia es que la infraestructura deja de ser un artefacto aparte. No hay una definición de clúster que se desincronice del código que ejecuta, porque el requisito está escrito junto a lo que lo exige. Para equipos pequeños sin ingeniero de plataforma, esta es la diferencia entre sacar una carga de GPU y posponerla.

Escalar desde cero

Como los arranques en frío bajan del segundo, mantener cero capacidad ociosa es una opción por defecto viable y no una concesión. Llega tráfico, arrancan contenedores, se hace el trabajo, los contenedores paran, y te facturan los segundos que hubo en medio.

Esto encaja con la forma real de la mayoría de cargas de IA, que son irregulares y no constantes. Un trabajo por lotes que corre veinte minutos cada noche cuesta veinte minutos. En una GPU facturada por horas costaría una hora, y en una instancia reservada costaría el día entero.

Tres tipos de trabajo

La inferencia cubre servir modelos, incluidos los multimodales, en línea o por lotes. El entrenamiento cubre ajuste fino, aprendizaje por refuerzo, ejecuciones distribuidas multinodo y barridos de hiperparámetros, y este último encaja de forma natural, porque un barrido son muchos trabajos cortos e independientes y eso es justo lo que premia la facturación por segundo.

El tercero son los entornos aislados: espacios donde ejecutan los agentes de programación y otros sistemas autónomos. A medida que los agentes escriben y ejecutan código cada vez más, tener un sitio desechable donde hacerlo pasa de ser un detalle agradable a ser infraestructura, y esto se ha convertido discretamente en uno de los usos más importantes de Modal.

Cuánto cuesta

El cómputo se factura por segundo, y ese es el detalle que cambia la aritmética frente a los proveedores que cobran por hora. La cuota del plan va aparte y es pequeña comparada con lo que cuesta el cómputo serio.

RecursoPrecio por segundoAproximadamente por hora
Nvidia B3000,001972 $7,10 $
Nvidia B2000,001736 $6,25 $
Nvidia H200 SXM0,001261 $4,54 $
Nvidia H100 SXM50,001097 $3,95 $
Nvidia RTX PRO 60000,000842 $3,03 $
Nvidia A100 80 GB0,000694 $2,50 $
Nvidia L40S0,000542 $1,95 $
Nvidia A100,000306 $1,10 $
Nvidia T40,000164 $0,59 $
Núcleo de CPU0,0000131 $Mínimo 0,125 núcleos
Memoria0,00000222 $ por GiBSe factura junto con el cómputo
Volúmenes0,09 $ por GiB al mes, el primer TiB gratis
PlanCuota mensualCréditos gratuitos
Starter0 $ más el cómputo30 $ al mes
Team250 $ más el cómputo100 $ al mes
EnterpriseA medidaNegociado

El crédito mensual de 30 $ del plan gratuito merece atención porque se repite en lugar de ser único. A tarifas de T4 son unas cincuenta horas de GPU al mes, de forma permanente, suficiente para mantener un pequeño servicio personal sin pagar nunca.

Ten en cuenta que los entornos aislados y los cuadernos se facturan a tarifas de CPU y memoria más altas que las funciones normales: el triple en CPU. Si tu uso principal son los entornos para agentes, modélalos aparte en lugar de dar por buenas las cifras de portada.

Quién le saca más partido

Cargas irregulares y por lotes

Trabajos nocturnos, procesamiento periódico, cualquier cosa que trabaje intensamente unos minutos y se detenga. La facturación por segundo con arranques inferiores al segundo es exactamente la forma que quieren estas cargas, y es donde Modal gana de calle a un proveedor por horas.

Servir modelos que nadie más aloja

Un modelo ajustado, una arquitectura poco común, algo que construiste tú. Las API de tokens no pueden ayudar; esta capa sí, y sin que tengas que escribir antes la infraestructura de despliegue.

Equipos sin ingeniero de plataforma

El modelo de decoradores existe para que quienes programan en Python puedan ejecutar trabajo en GPU sin aprender orquestación. Para un equipo pequeño eso no es una comodidad sino la diferencia entre que el proyecto salga o no.

Entornos aislados para agentes de programación

Entornos aislados y desechables donde el código generado puede ejecutarse sin tocar nada que importe. A medida que los agentes pasan de sugerir código a ejecutarlo, esto deja de ser opcional.

A qué prestar atención

  • Es Python. El modelo de programación es el producto, y si tu stack está en otro sitio, esta no es tu herramienta.
  • Sigues teniendo que saber qué estás desplegando. Modal elimina la orquestación, no el aprendizaje automático.
  • El cómputo en entornos aislados y cuadernos cuesta unas tres veces la tarifa estándar de CPU. Es fácil pasarlo por alto, y es el caso de uso que más crece.
  • La facturación por segundo solo sale más barata si tu trabajo es intermitente. Servir de forma continua a escala costará menos con capacidad reservada en otro sitio.
  • El plan Team son 250 $ al mes antes de cualquier cómputo. Para un equipo pequeño es un umbral real.
  • Los arranques en frío por debajo del segundo describen el contenedor. Cargar un modelo grande en la memoria de la GPU es un retraso aparte con el que hay que contar al diseñar.

Preguntas frecuentes

¿Modal es una API de modelos de IA?

No. Ejecuta tu código en hardware en la nube. Si quieres enviar un prompt y recibir una respuesta, usa un proveedor de inferencia. Si quieres ejecutar en una GPU algo que has escrito tú, esta es la capa adecuada.

¿Hay un plan gratuito?

El plan Starter no tiene cuota mensual e incluye 30 $ de crédito de cómputo cada mes. Es una asignación recurrente y no una prueba única, lo que hace que los despliegues pequeños de aficionado salgan realmente gratis.

¿Cómo se compara la facturación por segundo con la horaria?

Gana claramente en trabajo intermitente. Una tarea de doce minutos cuesta doce minutos aquí y una hora en otro sitio. Con GPU saturadas de forma continua la diferencia desaparece en buena medida y el precio reservado de un proveedor de clústeres puede salir más barato.

¿Puedo entrenar modelos en él?

Sí: ajuste fino, aprendizaje por refuerzo, entrenamiento distribuido multinodo y barridos de hiperparámetros son cargas admitidas. Los barridos encajan especialmente bien con el modelo de facturación, ya que son muchos trabajos cortos en paralelo.

¿Qué GPU hay disponibles?

Desde T4 y L4 en la gama barata pasando por A10, L40S y A100 hasta H100, H200, B200 y B300. Ese abanico permite ajustar el hardware a la tarea en lugar de pagar por una GPU grande porque era la única opción.

¿Tengo que escribir Dockerfiles?

Las imágenes de contenedor se definen en Python junto al resto de la configuración, que es justo la idea del diseño: un solo lenguaje para la lógica, las dependencias y el hardware.

En resumen

Modal se usa cuando el modelo no es el producto: cuando tienes tu propio código, tus propios pesos o un trabajo que necesita mil GPU durante cuatro minutos. La facturación por segundo y los arranques rápidos hacen que el trabajo intermitente en GPU salga a cuenta de una forma que el alquiler por horas nunca ha permitido.

Está hecho a medida de Python y no se disculpa por ello, y elimina la orquestación, no la experiencia técnica. Si eso te encaja, el crédito recurrente de 30 $ al mes significa que averiguarlo no cuesta absolutamente nada.

Herramientas Alternativas