Fireworks AI
боевой инференс и дообучение
Платформа инференса, чтобы вывести собственные модели в боевую эксплуатацию: оптимизированные среды выполнения, переключение между облаками и выделенные GPU, плюс готовые API моделей.

Baseten выводит ИИ-модели в боевую эксплуатацию и удерживает их там. Обещание тут про надёжность, а не про новизну: оптимизированные среды выполнения, высокая доступность поверх нескольких облаков и заявленные 99,99% аптайма из коробки — это примерно четыре минуты простоя в месяц и необычная вещь для поставщика инференса, чтобы записать её словами.
Он стоит между двумя вещами, которые все уже понимают. Над ним — токеновые API, где модели выбирает кто-то другой. Под ним — голые вычисления, где слой обслуживания вы строите сами. Baseten для команд, у которых есть конкретная модель, требующая нормального обслуживания, и которые предпочли бы не тратить квартал на постройку инфраструктуры под неё.
Список клиентов читается соответственно: Zed Industries, Wispr, OpenEvidence, ClickUp и Writer — автодополнение кода, расшифровка речи, медицинский ИИ и предметные языковые модели. Это всё случаи, где модель и есть продукт, а задержка — та черта, которую пользователи замечают.
API моделей — это предварительно оптимизированные открытые модели, к которым можно обратиться сразу: среди них варианты GLM, DeepSeek и Kimi. Это вход с низкими обязательствами, и работает он как любой другой токеновый API.
Настоящий продукт — выделенные развёртывания. Вы приносите проприетарную или дообученную модель, и Baseten обслуживает её на инфраструктуре подходящего размера, с оптимизацией среды выполнения, которая иначе была бы работой узкого специалиста. Обучение через Loops SDK подключается к тому же пути, так что модель проходит от дообучения до боевой эксплуатации без смены платформы.
Опубликованные заявления достаточно конкретны, чтобы их проверить: более чем двукратная пропускная способность и на 10% меньшая задержка на эмбеддингах по сравнению с конкурентами, задержка расшифровки менее 300 мс без непредсказуемых всплесков и шестикратно лучшая утилизация GPU на составных нагрузках.
Стоит заметить формулировку «без непредсказуемых всплесков». В боевом инференсе хвостовая задержка важнее средней, потому что жалуются пользователи именно на девяносто девятый процентиль. Оптимизировать под стабильность, а не под хорошую медиану — зрелая инженерная позиция, которую трудно продавать, и, вероятно, поэтому мало кто из поставщиков за неё берётся.
Высокая доступность охватывает облака, а не регионы внутри одного. Различие существенное: сбой у одного провайдера кладёт все регионы, по которым вы распределились, и единственная настоящая защита — находиться где-то совсем в другом месте.
Есть ещё Baseten for Model Labs — направление для создателей моделей, которым нужны распространение и монетизация, а не развёртывание. Это другой бизнес, нежели основная платформа, и о его существовании стоит знать, если вы находитесь на производящей стороне модельной экономики.
У тарифа Basic нет ежемесячной платы, счёт выставляется за использование. Pro и Enterprise добавляют скидки за объём и обязательства по поддержке, а не другой продукт.
| API модели | Ввод | Кэшированный вход | Вывод |
|---|---|---|---|
| GLM-5.3 | $1,40 | $0,14 | $4,40 |
| GLM-5.3-Flash | $0,15 | $0,03 | $0,50 |
| DeepSeek V4 Pro | $1,32 | $0,132 | $3,96 |
| DeepSeek V4 Flash | $0,13 | $0,028 | $0,26 |
| Kimi K3 | $3,00 | $0,30 | $15,00 |
| GPT OSS 120B | $0,10 | — | $0,50 |
| Выделенный GPU | В час |
|---|---|
| T4 | $0,63 |
| L4 | $0,85 |
| A10G | $1,21 |
| H100 MIG | $3,75 |
| A100 | $4,00 |
| H100 | $6,50 |
| B200 | $9,98 |
Цена на кэшированный вход — та деталь, под которую стоит проектировать. При десятой доле от обычной входной ставки приложение с длинным неизменным системным промптом и коротким меняющимся вводом может резко срезать счёт — но только если промпты устроены так, что общая часть действительно переиспользуется. Это архитектурное решение, а не галочка в настройках.
Новым аккаунтам выдаются пробные кредиты на эксперименты. В тариф Basic входит поддержка по почте и во встроенном чате; на старших тарифах добавляются Slack, Zoom и выделенный инженерный контакт — именно это корпоративные клиенты на самом деле и покупают.
Если вы её обучили, дообучили или зависите от того, чтобы обслуживать её быстрее, чем это сделал бы универсальный поставщик, — это та категория, под которую Baseten и строился. Все названные клиенты находятся ровно в таком положении.
Автодополнение кода, живая расшифровка, всё, во что печатают. Стабильная хвостовая задержка здесь ценнее чуть лучшей средней, и платформа оптимизируется именно под неё.
Высокая доступность поверх облаков и заявленные 99,99% — вот причина платить платформе, а не держать своё обслуживание. Медицинские и финансовые приложения — очевидные случаи.
Двукратная пропускная способность на эмбеддингах быстро накапливается, когда вы индексируете непрерывно. В крупных поисковых системах пропускная способность на шаге эмбеддинга часто определяет всю архитектуру.
Новым аккаунтам выдают пробные кредиты на эксперименты, а у тарифа Basic нет ежемесячной платы — вы платите за использование. Постоянного бесплатного тарифа нет.
Да, и это основное назначение. Выделенные развёртывания обслуживают проприетарные и дообученные модели на инфраструктуре подходящего размера, а оптимизацию среды выполнения берёт на себя платформа.
Modal — это универсальные бессерверные вычисления, где код пишете вы. Baseten конкретно про надёжное обслуживание моделей, где работа по оптимизации и доступности уже сделана. Modal гибче; Baseten делает за вас больше в более узких рамках.
Повторяющиеся начала промптов тарифицируются примерно по десятой доле обычной входной ставки. Если каждый запрос делит длинный системный промпт, перестройка так, чтобы эта часть кэшировалась, — самая крупная доступная экономия.
Да, через Loops SDK, с развёртыванием прямо в боевой инференс на той же платформе. Эта непрерывность — часть причины, по которой команды выбирают его вместо того, чтобы собирать обучение и обслуживание порознь.
От T4 за $0,63 в час через L4, A10G, A100 и H100 до B200 за $9,98. Раздел H100 MIG за $3,75 — полезный промежуточный вариант, когда целый H100 модели избыточен.
Baseten — для этапа, наступающего после того, как вы определились с моделью и обнаружили, что обслуживать её хорошо — отдельная дисциплина. Оптимизированные среды выполнения, доступность поверх облаков и стабильная хвостовая задержка — это то, что команды строят себе месяцами, и это то, что здесь продают.
API моделей — разумный вход, но не причина здесь находиться: открытые модели за схожие деньги обслуживают многие. Приходите ради выделенных развёртываний, стройте промпты так, чтобы использовать кэшированный вход, и проверьте заявления о производительности на своей модели, прежде чем они станут строкой в вашем плане.