Ollama

La forma estándar de ejecutar modelos abiertos en local: un comando, una API en el puerto 11434 y nada sale de tu máquina. El uso local es gratis e ilimitado.

Ir a la IA
Ollama cover

¿Qué es Ollama?

Ollama ejecuta modelos de lenguaje abiertos en tu propio ordenador. Escribes un comando, descarga el modelo y empieza a servirlo, y desde ese momento el modelo es un programa local como cualquier otro: no hace falta cuenta para la parte local, ninguna petición sale de la máquina y no hay factura que crezca con el uso.

La comparación a la que todo el mundo recurre es Docker, y se sostiene. Antes de Ollama, ejecutar un modelo abierto significaba elegir un formato de cuantización, compilar un motor de inferencia, encontrar los pesos y escribir tu propio bucle. Ollama comprimió todo eso en un solo comando e hizo que el resultado fuera accesible por HTTP. No inventó la inferencia local: la volvió aburrida, que es justo lo que una tecnología necesita antes de que la use gente normal.

Desde entonces le han crecido una aplicación de escritorio, una biblioteca de modelos que cubre chat, código, visión, embeddings y razonamiento y —esto es lo más discutido— un nivel en la nube para modelos demasiado grandes para caber en un portátil. La mitad local sigue siendo gratuita e ilimitada. Esa distinción es lo más importante que hay que entender del producto hoy.

Cómo funciona

Un comando y, después, una API

Ejecutar un modelo es una sola línea en la terminal. Lo que ocurre después es lo que importa: Ollama levanta un servidor en el puerto 11434 y lo mantiene ahí. A partir de ese momento, cualquier cosa en tu máquina puede hablar con un modelo de lenguaje por HTTP corriente, y por eso a tanto software le ha salido soporte de Ollama sin ruido: la integración es una URL base, no un acuerdo de colaboración.

También hay una capa compatible con OpenAI en localhost: 11434/v1, que cubre chat completions, completions, listado de modelos, embeddings y la API de Responses. La clave de API es obligatoria y se ignora: puedes pasar la palabra ollama. En la práctica esto significa que la mayoría de aplicaciones escritas contra OpenAI se pueden apuntar a tu propio hardware cambiando una línea e inventándote una clave.

La biblioteca de modelos

Los modelos se descargan por nombre desde una biblioteca curada, con la cuantización resuelta por ti. Esto es realmente útil y un poco peligroso: la comodidad esconde la elección entre un modelo pequeño y rápido que cabe cómodamente en memoria y uno grande que dejará tu portátil inservible. La biblioteca te dejará descargar encantada algo que tu máquina no puede servir bien.

El comportamiento se personaliza mediante un Modelfile, un breve archivo de texto que fija un prompt de sistema y unos parámetros a un modelo con nombre, de modo que un asistente ya configurado se puede compartir como archivo en lugar de como instrucciones. La compañía menciona además más de 40 000 integraciones de la comunidad, que es menos una función que una prueba de lo que ocurre cuando la interfaz es simplemente un número de puerto.

El nivel en la nube

Ollama aloja ahora modelos abiertos grandes —la selección actual incluye pesos abiertos de frontera que ninguna máquina de consumo puede sostener— en Estados Unidos, Europa y Singapur. Cambias entre local y nube cambiando el nombre del modelo, lo que mantiene tu código idéntico responda quien responda.

Para un proyecto construido sobre principios de local primero, esto es una tensión real, y conviene nombrarla con claridad en lugar de fingir lo contrario. La postura de Ollama es que lo local sigue siendo gratuito e ilimitado para siempre, y que los datos en la nube no se usan para entrenar. Es un acuerdo razonable. Aun así cambia lo que la herramienta es, y quien la adopte por motivos de privacidad debería tener claro qué mitad está usando.

Cuánto cuesta

Ejecutar modelos en tu propio hardware es ilimitado en todos los planes, incluido el gratuito. Todo lo que aparece en la tabla siguiente se refiere al uso en la nube.

PlanPrecioUso en la nubeModelos simultáneos
Free0 $Ligero1
Pro20 $/mes, o 200 $ al año50× el plan Free3
Max100 $/mes (altas nuevas en pausa)5× el plan Pro10
Team25 $ por puesto al mes, mínimo 5 puestosCompartido
EnterpriseA medidaNegociado

El plan gratuito no es una prueba. Incluye la CLI, la API, las aplicaciones de escritorio, modelos públicos ilimitados e inferencia local ilimitada: para muchísima gente es el producto entero, de forma permanente. Pro existe para quien quiere alcanzar modelos que su hardware no puede sostener, y 200 $ al año salen a unos 16,67 $ mensuales.

El coste real de ejecutar en local no aparece en esta página: es la máquina. Un portátil con 16 GB de memoria unificada maneja bien modelos pequeños y sufre por encima de eso; el trabajo local serio significa 32 GB o más, o una GPU dedicada. Es una compra única en lugar de una suscripción, lo que a unos presupuestos les encaja y a otros no.

Quién le saca más partido

Desarrolladores que quieren un endpoint local

Si estás construyendo algo que llama a un modelo de lenguaje, tener uno en localhost cambia cómo trabajas. Sin claves en desarrollo, sin límites de peticiones mientras iteras, sin factura por las cuatrocientas llamadas que enviaste por un bucle mal escrito.

Quien no puede sacar los datos fuera

Trabajo jurídico, médico y de seguridad interna donde el texto sencillamente no puede salir del edificio. La inferencia local es la única respuesta honesta a esa restricción, y Ollama es el camino menos doloroso hacia ella.

Quien está aprendiendo cómo se comportan los modelos

Alternar entre un modelo de 3B y uno de 70B con el mismo prompt enseña más sobre lo que estos sistemas hacen realmente que cualquier cantidad de lectura. Hacerlo contra una API medida sale caro; hacerlo en local cuesta electricidad.

Automatizaciones que funcionan sin parar

Clasificar una carpeta de correo, resumir registros, etiquetar documentos de forma programada: tareas de mucho volumen y poca dificultad. El precio por tokens castiga precisamente esta forma de trabajo, y un modelo local la hace gratis.

A qué prestar atención

  • Los modelos abiertos no son modelos de frontera. Un buen 8B local es realmente útil y no está a la altura de GPT: cuenta con una diferencia de calidad en razonamiento difícil y contexto largo.
  • Tu hardware es el techo, y es un techo duro. La memoria decide qué modelos puedes ejecutar, y ningún ajuste cambia eso.
  • La biblioteca te dejará descargar un modelo que tu máquina no puede servir. Arrancará, lentísimo, y culparás al modelo en lugar de a la RAM.
  • El local primero es ahora una opción dentro del producto y no el producto en sí. Si estás aquí por privacidad, ten claro qué modelos están alojados en la nube.
  • Es infraestructura, no una aplicación. Hay una app de escritorio, pero el sitio natural de Ollama es por detrás de otra cosa.
  • Los modelos inactivos retienen memoria. En un portátil esto se manifiesta como que todo lo demás se vuelve lento, antes de que conectes ambos hechos.

Preguntas frecuentes

¿Ollama es gratis?

Sí, para uso local, de forma permanente y sin límites. Los planes de pago compran acceso a modelos alojados en la nube demasiado grandes para el hardware personal, además de más modelos simultáneos. Si solo ejecutas modelos en tu propia máquina, nunca verás una factura.

¿Qué hardware necesito?

Los modelos pequeños funcionan en un portátil moderno con 8–16 GB de memoria. Los medianos piden 32 GB o una GPU dedicada. Apple Silicon rinde especialmente bien aquí porque la memoria es compartida con la GPU, y de ahí que tantas conversaciones sobre IA local ocurran en Macs.

¿Funciona sin conexión?

Una vez descargado el modelo, por completo. De eso se trata. Necesitas conexión para descargar modelos, para usar los de la nube y para actualizar, y para nada más.

¿Puedo usarla con mi código existente de OpenAI?

Normalmente sí. Apunta la URL base a localhost: 11434/v1, pasa cualquier cadena como clave de API y cambia el nombre del modelo. Chat completions, embeddings y la API de Responses están cubiertos; si dependes de algo poco habitual, revisa las notas de compatibilidad.

¿En qué se diferencia de LM Studio?

Ollama es un comando y un servidor; LM Studio es una aplicación de escritorio con interfaz de chat, un navegador de modelos y un servidor detrás de un interruptor. Si quieres hablar tú con un modelo, empieza por LM Studio. Si quieres que sea tu software quien hable con él, empieza por Ollama. Mucha gente usa ambos.

¿Mis datos son privados?

Con los modelos locales, nada sale de la máquina: es una propiedad de cómo funciona, no una política que pueda cambiar. Con los modelos en la nube la compañía afirma que los datos no se usan para entrenar y que se alojan en Estados Unidos, Europa o Singapur. Son dos historias de privacidad distintas y conviene mantenerlas separadas.

En resumen

Ollama es la pieza de fontanería que volvió corriente la IA local. Su logro no es la brillantez técnica sino la eliminación del roce: un comando que cualquiera puede escribir, un puerto al que cualquier cosa puede llamar y una biblioteca que esconde la cuantización a quienes no deberían tener que preocuparse por ella.

El plan gratuito es el producto de verdad y no tiene truco. Las advertencias honestas son la diferencia de calidad frente a los modelos de frontera y el hecho de que tu máquina fija un techo que ninguna suscripción levanta. Si eres técnico, si tienes curiosidad o si te atan normas sobre a dónde pueden viajar los datos, instálalo: averiguarlo cuesta una tarde.

Herramientas Alternativas