Together AI
инференс, дообучение и GPU-кластеры
Запускайте собственный ИИ-код на облачных GPU, добавив декораторы к Python. Холодный старт меньше секунды, посекундная тарификация и $30 бесплатного кредита каждый месяц.

Modal — это не API модели. Это место, где можно запустить собственный код на GPU, не становясь тем человеком в команде, который разбирается в Kubernetes. Вы пишете на Python, добавляете декораторы с описанием нужного функции железа, и всё выполняется в облаке, продолжая ощущаться как локальный запуск.
Это различие ставит его в иную категорию, чем продавцы токенов. OpenRouter, Groq и Fireworks продают вам инференс на моделях, которые хостят сами. Modal продаёт вам машину. Если ваша работа — обращаться к модели, он вам не нужен; если ваша работа — что-то обучать, обработать миллион файлов или обслуживать модель, которую больше никто не хостит, всё это происходит именно на этом слое.
Инженерные заявления конкретны: холодный старт контейнера меньше секунды, автомасштабирование с нуля до более чем тысячи GPU и задержка менее 10 мс для глобально распределённого инференса. Первое и делает всю модель рабочей: бессерверные GPU полезны только тогда, когда запуск достаточно быстр, чтобы можно было позволить себе не держать ни одной.
Логика приложения и требования к железу живут в одной кодовой базе. Функция помечается тем, что ей нужно — тип GPU, память, образ контейнера, — и Modal выделяет это при вызове и освобождает по завершении.
Следствие в том, что инфраструктура перестаёт быть отдельным артефактом. Нет описания кластера, разъезжающегося с кодом, который на нём работает, потому что требование записано рядом с тем, что его предъявляет. Для маленьких команд без платформенного инженера это разница между «выпустили GPU-нагрузку» и «отложили».
Поскольку холодный старт занимает меньше секунды, держать нулевую мощность в простое — рабочий вариант по умолчанию, а не компромисс. Приходит трафик, стартуют контейнеры, делается работа, контейнеры гаснут, а вам выставляют счёт за секунды между этим.
Это соответствует реальной форме большинства ИИ-нагрузок, которые рваные, а не ровные. Пакетная задача, работающая по двадцать минут каждую ночь, стоит двадцать минут. На GPU с почасовой оплатой она стоила бы час, а на зарезервированной машине — целые сутки.
Инференс покрывает обслуживание моделей, включая мультимодальные, онлайн или пакетами. Обучение покрывает дообучение, обучение с подкреплением, распределённые многоузловые прогоны и перебор гиперпараметров — последний ложится сюда естественно, потому что перебор это множество коротких независимых задач, а именно их посекундная тарификация и вознаграждает.
Третье — песочницы: изолированные среды, где выполняются кодовые агенты и другие автономные системы. По мере того как агенты всё чаще пишут и запускают код, одноразовое место для его исполнения становится инфраструктурой, а не приятным дополнением, — и это незаметно стало одним из важнейших применений Modal.
Вычисления тарифицируются посекундно, и именно эта деталь меняет арифметику против почасовых поставщиков. Плата за тариф идёт отдельно и невелика относительно того, во что обходятся серьёзные вычисления.
| Ресурс | Цена за секунду | Примерно в час |
|---|---|---|
| Nvidia B300 | $0,001972 | $7,10 |
| Nvidia B200 | $0,001736 | $6,25 |
| Nvidia H200 SXM | $0,001261 | $4,54 |
| Nvidia H100 SXM5 | $0,001097 | $3,95 |
| Nvidia RTX PRO 6000 | $0,000842 | $3,03 |
| Nvidia A100 80 ГБ | $0,000694 | $2,50 |
| Nvidia L40S | $0,000542 | $1,95 |
| Nvidia A10 | $0,000306 | $1,10 |
| Nvidia T4 | $0,000164 | $0,59 |
| Ядро процессора | $0,0000131 | Минимум 0,125 ядра |
| Память | $0,00000222 за ГиБ | Тарифицируется вместе с вычислениями |
| Тома | — | $0,09 за ГиБ в месяц, первый ТиБ бесплатно |
| Тариф | Ежемесячная плата | Бесплатные кредиты |
|---|---|---|
| Starter | $0 плюс вычисления | $30 в месяц |
| Team | $250 плюс вычисления | $100 в месяц |
| Enterprise | Индивидуально | По договорённости |
На ежемесячный кредит в $30 на бесплатном тарифе стоит обратить внимание, потому что он повторяется, а не выдаётся однократно. По тарифам T4 это около пятидесяти часов GPU в месяц, постоянно, — достаточно, чтобы держать небольшой личный сервис и вообще не платить.
Учтите, что песочницы и блокноты тарифицируются по более высоким ставкам за процессор и память, чем обычные функции, — втрое дороже по процессору. Если ваш основной сценарий это агентские песочницы, считайте их отдельно, а не по заголовочным цифрам.
Ночные задачи, периодическая обработка, всё, что работает интенсивно несколько минут и останавливается. Посекундная тарификация с быстрым стартом — ровно та форма, которой такие нагрузки хотят, и здесь Modal обыгрывает почасового поставщика начисто.
Дообученная модель, необычная архитектура, что-то собранное вами. Токеновые API здесь не помогут; помочь может этот слой, причём без того, чтобы вы сперва написали инфраструктуру развёртывания.
Модель с декораторами существует ради того, чтобы Python-разработчики могли запускать работу на GPU, не изучая оркестрацию. Для маленькой команды это не удобство, а разница между тем, состоится проект или нет.
Изолированные одноразовые среды, где сгенерированный код может выполняться, не касаясь ничего важного. По мере того как агенты переходят от подсказок к запуску кода, это перестаёт быть опцией.
Нет. Он запускает ваш код на облачном железе. Если вы хотите отправить промпт и получить ответ, берите поставщика инференса. Если хотите запустить на GPU то, что написали сами, — это правильный слой.
У тарифа Starter нет ежемесячной платы, и в него входит $30 вычислительного кредита каждый месяц. Это повторяющаяся квота, а не разовый пробник, и потому небольшие любительские развёртывания получаются по-настоящему бесплатными.
На прерывистой работе она выигрывает вчистую. Двенадцатиминутная задача здесь стоит двенадцать минут, а в другом месте — час. На постоянно загруженных GPU разница почти исчезает, и резервная цена у кластерного поставщика может оказаться дешевле.
Да: дообучение, обучение с подкреплением, распределённое многоузловое обучение и перебор гиперпараметров — всё это поддерживаемые нагрузки. Перебор особенно хорошо ложится на модель оплаты, поскольку это множество коротких параллельных задач.
От недорогих T4 и L4 через A10, L40S и A100 до H100, H200, B200 и B300. Такой разброс позволяет подбирать железо под задачу, а не платить за большую карту просто потому, что другой не было.
Образы контейнеров описываются на Python вместе с остальной конфигурацией — в этом и замысел: один язык для логики, зависимостей и железа.
Modal берут тогда, когда продукт — не модель: когда у вас свой код, свои веса или задача, которой нужна тысяча GPU на четыре минуты. Посекундная оплата и быстрый холодный старт делают прерывистую работу на GPU экономически осмысленной так, как почасовая аренда никогда не делала.
Он скроен под Python и не извиняется за это, и он убирает оркестрацию, а не квалификацию. Если это вам подходит, повторяющийся ежемесячный кредит в $30 означает, что выяснить это не стоит ничего.