Ollama

Стандартный способ запускать открытые модели локально: одна команда, API на порту 11434, ничего не покидает вашу машину. Локальное использование бесплатно и без ограничений.

Перейти к ИИ
Ollama cover

Что такое Ollama?

Ollama запускает открытые языковые модели на вашем собственном компьютере. Вы набираете одну команду, она скачивает модель и начинает её обслуживать — и с этого момента модель становится такой же локальной программой, как любая другая: аккаунт для локальной части не нужен, ни один запрос не уходит с машины, и счёт не растёт от того, сколько вы ею пользуетесь.

Сравнение, к которому все тянутся, — Docker, и оно выдерживает проверку. До Ollama запустить открытую модель означало выбрать формат квантования, собрать движок инференса, найти веса и написать собственный цикл. Ollama свернула всё это в одну команду и сделала результат доступным по HTTP. Она не изобрела локальный инференс — она сделала его скучным, а именно это технологии и требуется, прежде чем ею начнут пользоваться обычные люди.

С тех пор у неё появились настольное приложение, библиотека моделей для чата, кода, зрения, эмбеддингов и рассуждения и — что вызывает больше споров — облачный тариф для моделей, которые не помещаются в ноутбук. Локальная половина остаётся бесплатной и безлимитной. Это различие — самое важное, что нужно понимать про продукт сегодня.

Как это работает

Одна команда, а дальше API

Запуск модели — одна строка в терминале. Важно то, что происходит дальше: Ollama поднимает сервер на порту 11434 и держит его там. Теперь что угодно на вашей машине может общаться с языковой моделью по обычному HTTP — вот почему поддержка Ollama незаметно появилась в таком количестве софта: интеграция здесь это базовый адрес, а не партнёрское соглашение.

Есть и слой, совместимый с OpenAI, по адресу localhost: 11434/v1 — он покрывает chat completions, completions, список моделей, эмбеддинги и Responses API. Ключ обязателен и при этом игнорируется: можно передать слово ollama. На практике это значит, что большинство приложений, написанных под OpenAI, направляются на ваше собственное железо изменением одной строки и выдуманным ключом.

Библиотека моделей

Модели тянутся по имени из отобранной библиотеки, квантование берут на себя за вас. Это по-настоящему полезно и слегка опасно: удобство прячет выбор между небольшой быстрой моделью, которая спокойно помещается в память, и крупной, которая сделает ноутбук непригодным для работы. Библиотека с удовольствием даст скачать то, что ваша машина толком не потянет.

Поведение настраивается через Modelfile — короткий текстовый файл, который привязывает системный промпт и параметры к именованной модели, так что готового ассистента можно передать файлом, а не инструкцией. Компания также упоминает более 40 000 интеграций от сообщества — это не столько функция, сколько свидетельство того, что бывает, когда интерфейсом становится просто номер порта.

Облачный тариф

Теперь Ollama хостит крупные открытые модели — в текущей линейке есть открытые веса переднего края, которые не поместятся ни в одну потребительскую машину, — в США, Европе и Сингапуре. Переключение между локальным и облачным делается сменой имени модели, поэтому код остаётся тем же, какая бы сторона ни отвечала.

Для проекта, построенного на принципе «сначала локально», это настоящее противоречие, и его стоит назвать прямо, а не делать вид, что его нет. Позиция Ollama такова: локальное навсегда остаётся бесплатным и безлимитным, а облачные данные не используются для обучения. Договорённость разумная. И всё же это изменение самой сути инструмента, и тому, кто берёт его ради приватности, стоит осознанно понимать, какой половиной он пользуется.

Сколько это стоит

Запуск моделей на своём железе безлимитен на любом тарифе, включая бесплатный. Всё, что в таблице ниже, относится к облаку.

ТарифЦенаОблачный лимитМоделей одновременно
Free$0Небольшой1
Pro$20/мес или $200 при оплате за год×50 к Free3
Max$100/мес (набор новых приостановлен)×5 к Pro10
Team$25 за место в месяц, минимум 5 местОбщий
EnterpriseИндивидуальноПо договорённости

Бесплатный тариф — не пробный период. В него входят CLI, API, настольные приложения, неограниченные публичные модели и неограниченный локальный инференс: для очень многих это и есть весь продукт, навсегда. Pro существует для тех, кому нужны модели, которые их железо не удержит, а $200 в год выходят примерно в $16,67 в месяц.

Настоящей стоимости локального запуска на этой странице нет. Это машина. Ноутбук с 16 ГБ единой памяти спокойно тянет небольшие модели и начинает буксовать выше; серьёзная локальная работа — это 32 ГБ и больше или отдельная видеокарта. Это разовая покупка, а не подписка, что одним бюджетам подходит, а другим нет.

Кому это выгоднее всего

Разработчикам, которым нужна точка входа на localhost

Если вы делаете что-то, что обращается к языковой модели, наличие такой модели на localhost меняет сам ход работы. Никаких ключей в разработке, никаких лимитов, пока вы перебираете варианты, никакого счёта за четыреста запросов, ушедших из-за ошибки в цикле.

Тем, кому нельзя выпускать данные наружу

Юридическая, медицинская и внутренняя работа по безопасности, где текст попросту не может покинуть здание. Локальный инференс — единственный честный ответ на такое ограничение, а Ollama — наименее болезненный путь к нему.

Тем, кто разбирается, как ведут себя модели

Переключение между моделью на 3 и на 70 миллиардов параметров на одном и том же промпте объясняет про эти системы больше, чем любое количество прочитанного. Делать это через платный API дорого; делать локально стоит электричества.

Автоматизации, которая работает постоянно

Разбор почтовой папки, сжатие логов, простановка тегов документам по расписанию — задачи, где объём большой, а сложность низкая. Оплата за токены наказывает именно такую форму работы, а локальная модель делает её бесплатно.

На что обратить внимание

  • Открытые модели — не модели переднего края. Хорошая локальная восьмимиллиардная действительно полезна и при этом не уровня GPT: ждите разрыва в качестве на сложных рассуждениях и длинном контексте.
  • Ваше железо — это потолок, причём жёсткий. Память решает, какие модели вы сможете запустить, и никакая настройка этого не изменит.
  • Библиотека позволит скачать модель, которую ваша машина не потянет. Она запустится, медленно, и вы обвините модель, а не оперативную память.
  • «Сначала локально» теперь стало выбором внутри продукта, а не самим продуктом. Если вы здесь ради приватности, знайте, какие модели живут в облаке.
  • Это инфраструктура, а не приложение. Настольная программа есть, но естественное место Ollama — за спиной чего-то другого.
  • Простаивающие модели держат память. На ноутбуке это проявляется тем, что всё остальное начинает тормозить, — и связь между двумя фактами замечаешь не сразу.

Частые вопросы

Ollama бесплатна?

Да, для локального использования — навсегда и без ограничений. Платные тарифы покупают доступ к облачным моделям, слишком большим для личного железа, и больше одновременных моделей. Если вы запускаете модели только на своей машине, счёта не увидите никогда.

Какое железо нужно?

Небольшие модели работают на современном ноутбуке с 8–16 ГБ памяти. Средним нужны 32 ГБ или отдельная видеокарта. Apple Silicon показывает себя необычно хорошо, потому что память общая с графикой, — отсюда и то, что столько разговоров про локальный ИИ ведётся на Маках.

Работает ли он офлайн?

После скачивания модели — полностью. В этом и смысл. Соединение нужно, чтобы скачивать модели, пользоваться облачными и обновляться, — больше ни для чего.

Можно ли использовать её с уже написанным кодом под OpenAI?

Обычно да. Направьте базовый адрес на localhost: 11434/v1, передайте любую строку в качестве ключа и смените имя модели. Chat completions, эмбеддинги и Responses API покрыты; если вы опираетесь на что-то необычное, загляните в заметки о совместимости.

Чем он отличается от LM Studio?

Ollama — это команда и сервер; LM Studio — настольное приложение с чатом, браузером моделей и сервером за переключателем. Хотите сами разговаривать с моделью — начинайте с LM Studio. Хотите, чтобы с моделью разговаривал ваш софт, — начинайте с Ollama. Многие держат оба.

Приватны ли мои данные?

Для локальных моделей с машины не уходит ничего — это свойство устройства, а не политика, которую могут поменять. Для облачных компания заявляет, что данные не используются для обучения и хранятся в США, Европе или Сингапуре. Это две разные истории про приватность, и держать их в голове стоит порознь.

Коротко

Ollama — та деталь сантехники, которая сделала локальный ИИ обыденностью. Её достижение не в технической гениальности, а в снятии трения: команда, которую наберёт кто угодно, порт, к которому обратится что угодно, и библиотека, прячущая квантование от людей, которым не должно быть до него дела.

Бесплатный тариф здесь и есть настоящий продукт, и подвоха в нём нет. Честные оговорки — разрыв в качестве с моделями переднего края и то, что ваша машина задаёт потолок, который не поднимет никакая подписка. Если вы технарь, если вам любопытно или если правила запрещают данным путешествовать, — ставьте: цена выяснения составляет один вечер.

Альтернативные инструменты