Modal

Запускайте собственный ИИ-код на облачных GPU, добавив декораторы к Python. Холодный старт меньше секунды, посекундная тарификация и $30 бесплатного кредита каждый месяц.

Перейти к ИИ
Modal cover

Что такое Modal?

Modal — это не API модели. Это место, где можно запустить собственный код на GPU, не становясь тем человеком в команде, который разбирается в Kubernetes. Вы пишете на Python, добавляете декораторы с описанием нужного функции железа, и всё выполняется в облаке, продолжая ощущаться как локальный запуск.

Это различие ставит его в иную категорию, чем продавцы токенов. OpenRouter, Groq и Fireworks продают вам инференс на моделях, которые хостят сами. Modal продаёт вам машину. Если ваша работа — обращаться к модели, он вам не нужен; если ваша работа — что-то обучать, обработать миллион файлов или обслуживать модель, которую больше никто не хостит, всё это происходит именно на этом слое.

Инженерные заявления конкретны: холодный старт контейнера меньше секунды, автомасштабирование с нуля до более чем тысячи GPU и задержка менее 10 мс для глобально распределённого инференса. Первое и делает всю модель рабочей: бессерверные GPU полезны только тогда, когда запуск достаточно быстр, чтобы можно было позволить себе не держать ни одной.

Как это работает

Железо как строка на Python

Логика приложения и требования к железу живут в одной кодовой базе. Функция помечается тем, что ей нужно — тип GPU, память, образ контейнера, — и Modal выделяет это при вызове и освобождает по завершении.

Следствие в том, что инфраструктура перестаёт быть отдельным артефактом. Нет описания кластера, разъезжающегося с кодом, который на нём работает, потому что требование записано рядом с тем, что его предъявляет. Для маленьких команд без платформенного инженера это разница между «выпустили GPU-нагрузку» и «отложили».

Масштабирование с нуля

Поскольку холодный старт занимает меньше секунды, держать нулевую мощность в простое — рабочий вариант по умолчанию, а не компромисс. Приходит трафик, стартуют контейнеры, делается работа, контейнеры гаснут, а вам выставляют счёт за секунды между этим.

Это соответствует реальной форме большинства ИИ-нагрузок, которые рваные, а не ровные. Пакетная задача, работающая по двадцать минут каждую ночь, стоит двадцать минут. На GPU с почасовой оплатой она стоила бы час, а на зарезервированной машине — целые сутки.

Три вида работы

Инференс покрывает обслуживание моделей, включая мультимодальные, онлайн или пакетами. Обучение покрывает дообучение, обучение с подкреплением, распределённые многоузловые прогоны и перебор гиперпараметров — последний ложится сюда естественно, потому что перебор это множество коротких независимых задач, а именно их посекундная тарификация и вознаграждает.

Третье — песочницы: изолированные среды, где выполняются кодовые агенты и другие автономные системы. По мере того как агенты всё чаще пишут и запускают код, одноразовое место для его исполнения становится инфраструктурой, а не приятным дополнением, — и это незаметно стало одним из важнейших применений Modal.

Сколько это стоит

Вычисления тарифицируются посекундно, и именно эта деталь меняет арифметику против почасовых поставщиков. Плата за тариф идёт отдельно и невелика относительно того, во что обходятся серьёзные вычисления.

РесурсЦена за секундуПримерно в час
Nvidia B300$0,001972$7,10
Nvidia B200$0,001736$6,25
Nvidia H200 SXM$0,001261$4,54
Nvidia H100 SXM5$0,001097$3,95
Nvidia RTX PRO 6000$0,000842$3,03
Nvidia A100 80 ГБ$0,000694$2,50
Nvidia L40S$0,000542$1,95
Nvidia A10$0,000306$1,10
Nvidia T4$0,000164$0,59
Ядро процессора$0,0000131Минимум 0,125 ядра
Память$0,00000222 за ГиБТарифицируется вместе с вычислениями
Тома$0,09 за ГиБ в месяц, первый ТиБ бесплатно
ТарифЕжемесячная платаБесплатные кредиты
Starter$0 плюс вычисления$30 в месяц
Team$250 плюс вычисления$100 в месяц
EnterpriseИндивидуальноПо договорённости

На ежемесячный кредит в $30 на бесплатном тарифе стоит обратить внимание, потому что он повторяется, а не выдаётся однократно. По тарифам T4 это около пятидесяти часов GPU в месяц, постоянно, — достаточно, чтобы держать небольшой личный сервис и вообще не платить.

Учтите, что песочницы и блокноты тарифицируются по более высоким ставкам за процессор и память, чем обычные функции, — втрое дороже по процессору. Если ваш основной сценарий это агентские песочницы, считайте их отдельно, а не по заголовочным цифрам.

Кому это выгоднее всего

Рваным и пакетным нагрузкам

Ночные задачи, периодическая обработка, всё, что работает интенсивно несколько минут и останавливается. Посекундная тарификация с быстрым стартом — ровно та форма, которой такие нагрузки хотят, и здесь Modal обыгрывает почасового поставщика начисто.

Обслуживанию моделей, которых больше никто не хостит

Дообученная модель, необычная архитектура, что-то собранное вами. Токеновые API здесь не помогут; помочь может этот слой, причём без того, чтобы вы сперва написали инфраструктуру развёртывания.

Командам без платформенного инженера

Модель с декораторами существует ради того, чтобы Python-разработчики могли запускать работу на GPU, не изучая оркестрацию. Для маленькой команды это не удобство, а разница между тем, состоится проект или нет.

Песочницам для кодовых агентов

Изолированные одноразовые среды, где сгенерированный код может выполняться, не касаясь ничего важного. По мере того как агенты переходят от подсказок к запуску кода, это перестаёт быть опцией.

На что обратить внимание

  • Это Python. Модель программирования и есть продукт, и если ваш стек в другом месте, инструмент не для вас.
  • Знать, что именно вы разворачиваете, всё равно придётся. Modal убирает оркестрацию, а не машинное обучение.
  • Вычисления в песочницах и блокнотах стоят примерно втрое дороже стандартной ставки за процессор. Легко упустить, а это самый быстрорастущий сценарий использования.
  • Посекундная тарификация дешевле только тогда, когда работа прерывистая. Непрерывное обслуживание на масштабе обойдётся дешевле на зарезервированных мощностях в другом месте.
  • Тариф Team стоит $250 в месяц ещё до всяких вычислений. Для маленькой команды это настоящий порог.
  • Холодный старт меньше секунды описывает контейнер. Загрузка крупной модели в память GPU — отдельная задержка, под которую надо проектировать.

Частые вопросы

Modal — это API ИИ-модели?

Нет. Он запускает ваш код на облачном железе. Если вы хотите отправить промпт и получить ответ, берите поставщика инференса. Если хотите запустить на GPU то, что написали сами, — это правильный слой.

Есть ли бесплатный тариф?

У тарифа Starter нет ежемесячной платы, и в него входит $30 вычислительного кредита каждый месяц. Это повторяющаяся квота, а не разовый пробник, и потому небольшие любительские развёртывания получаются по-настоящему бесплатными.

Как посекундная тарификация соотносится с почасовой?

На прерывистой работе она выигрывает вчистую. Двенадцатиминутная задача здесь стоит двенадцать минут, а в другом месте — час. На постоянно загруженных GPU разница почти исчезает, и резервная цена у кластерного поставщика может оказаться дешевле.

Можно ли обучать на нём модели?

Да: дообучение, обучение с подкреплением, распределённое многоузловое обучение и перебор гиперпараметров — всё это поддерживаемые нагрузки. Перебор особенно хорошо ложится на модель оплаты, поскольку это множество коротких параллельных задач.

Какие GPU доступны?

От недорогих T4 и L4 через A10, L40S и A100 до H100, H200, B200 и B300. Такой разброс позволяет подбирать железо под задачу, а не платить за большую карту просто потому, что другой не было.

Нужно ли писать Dockerfile?

Образы контейнеров описываются на Python вместе с остальной конфигурацией — в этом и замысел: один язык для логики, зависимостей и железа.

Коротко

Modal берут тогда, когда продукт — не модель: когда у вас свой код, свои веса или задача, которой нужна тысяча GPU на четыре минуты. Посекундная оплата и быстрый холодный старт делают прерывистую работу на GPU экономически осмысленной так, как почасовая аренда никогда не делала.

Он скроен под Python и не извиняется за это, и он убирает оркестрацию, а не квалификацию. Если это вам подходит, повторяющийся ежемесячный кредит в $30 означает, что выяснить это не стоит ничего.

Альтернативные инструменты