Baseten

Платформа инференса, чтобы вывести собственные модели в боевую эксплуатацию: оптимизированные среды выполнения, переключение между облаками и выделенные GPU, плюс готовые API моделей.

Перейти к ИИ
Baseten cover

Что такое Baseten?

Baseten выводит ИИ-модели в боевую эксплуатацию и удерживает их там. Обещание тут про надёжность, а не про новизну: оптимизированные среды выполнения, высокая доступность поверх нескольких облаков и заявленные 99,99% аптайма из коробки — это примерно четыре минуты простоя в месяц и необычная вещь для поставщика инференса, чтобы записать её словами.

Он стоит между двумя вещами, которые все уже понимают. Над ним — токеновые API, где модели выбирает кто-то другой. Под ним — голые вычисления, где слой обслуживания вы строите сами. Baseten для команд, у которых есть конкретная модель, требующая нормального обслуживания, и которые предпочли бы не тратить квартал на постройку инфраструктуры под неё.

Список клиентов читается соответственно: Zed Industries, Wispr, OpenEvidence, ClickUp и Writer — автодополнение кода, расшифровка речи, медицинский ИИ и предметные языковые модели. Это всё случаи, где модель и есть продукт, а задержка — та черта, которую пользователи замечают.

Как это работает

Два входа

API моделей — это предварительно оптимизированные открытые модели, к которым можно обратиться сразу: среди них варианты GLM, DeepSeek и Kimi. Это вход с низкими обязательствами, и работает он как любой другой токеновый API.

Настоящий продукт — выделенные развёртывания. Вы приносите проприетарную или дообученную модель, и Baseten обслуживает её на инфраструктуре подходящего размера, с оптимизацией среды выполнения, которая иначе была бы работой узкого специалиста. Обучение через Loops SDK подключается к тому же пути, так что модель проходит от дообучения до боевой эксплуатации без смены платформы.

Производительность как продукт

Опубликованные заявления достаточно конкретны, чтобы их проверить: более чем двукратная пропускная способность и на 10% меньшая задержка на эмбеддингах по сравнению с конкурентами, задержка расшифровки менее 300 мс без непредсказуемых всплесков и шестикратно лучшая утилизация GPU на составных нагрузках.

Стоит заметить формулировку «без непредсказуемых всплесков». В боевом инференсе хвостовая задержка важнее средней, потому что жалуются пользователи именно на девяносто девятый процентиль. Оптимизировать под стабильность, а не под хорошую медиану — зрелая инженерная позиция, которую трудно продавать, и, вероятно, поэтому мало кто из поставщиков за неё берётся.

Доступность поверх нескольких облаков

Высокая доступность охватывает облака, а не регионы внутри одного. Различие существенное: сбой у одного провайдера кладёт все регионы, по которым вы распределились, и единственная настоящая защита — находиться где-то совсем в другом месте.

Есть ещё Baseten for Model Labs — направление для создателей моделей, которым нужны распространение и монетизация, а не развёртывание. Это другой бизнес, нежели основная платформа, и о его существовании стоит знать, если вы находитесь на производящей стороне модельной экономики.

Сколько это стоит

У тарифа Basic нет ежемесячной платы, счёт выставляется за использование. Pro и Enterprise добавляют скидки за объём и обязательства по поддержке, а не другой продукт.

API моделиВводКэшированный входВывод
GLM-5.3$1,40$0,14$4,40
GLM-5.3-Flash$0,15$0,03$0,50
DeepSeek V4 Pro$1,32$0,132$3,96
DeepSeek V4 Flash$0,13$0,028$0,26
Kimi K3$3,00$0,30$15,00
GPT OSS 120B$0,10$0,50
Выделенный GPUВ час
T4$0,63
L4$0,85
A10G$1,21
H100 MIG$3,75
A100$4,00
H100$6,50
B200$9,98

Цена на кэшированный вход — та деталь, под которую стоит проектировать. При десятой доле от обычной входной ставки приложение с длинным неизменным системным промптом и коротким меняющимся вводом может резко срезать счёт — но только если промпты устроены так, что общая часть действительно переиспользуется. Это архитектурное решение, а не галочка в настройках.

Новым аккаунтам выдаются пробные кредиты на эксперименты. В тариф Basic входит поддержка по почте и во встроенном чате; на старших тарифах добавляются Slack, Zoom и выделенный инженерный контакт — именно это корпоративные клиенты на самом деле и покупают.

Кому это выгоднее всего

Компаниям, у которых модель и есть продукт

Если вы её обучили, дообучили или зависите от того, чтобы обслуживать её быстрее, чем это сделал бы универсальный поставщик, — это та категория, под которую Baseten и строился. Все названные клиенты находятся ровно в таком положении.

Боевой работе, чувствительной к задержке

Автодополнение кода, живая расшифровка, всё, во что печатают. Стабильная хвостовая задержка здесь ценнее чуть лучшей средней, и платформа оптимизируется именно под неё.

Нагрузкам, которым нельзя падать

Высокая доступность поверх облаков и заявленные 99,99% — вот причина платить платформе, а не держать своё обслуживание. Медицинские и финансовые приложения — очевидные случаи.

Тяжёлым конвейерам эмбеддингов

Двукратная пропускная способность на эмбеддингах быстро накапливается, когда вы индексируете непрерывно. В крупных поисковых системах пропускная способность на шаге эмбеддинга часто определяет всю архитектуру.

На что обратить внимание

  • Заявления о производительности — это собственные бенчмарки поставщика против неназванных конкурентов. Воспроизведите их на своей модели, прежде чем на них опираться.
  • Выделенные GPU тарифицируются по часам независимо от трафика. Простаивающий H100 стоит $6,50 в час, звонит к нему кто-нибудь или нет.
  • «99,99% из коробки» — это заявление о возможностях, а не автоматически договорный SLA на начальном тарифе. Проверьте, что именно гарантирует ваш уровень.
  • Цена на кэшированный вход помогает только тогда, когда промпты под неё устроены. Десятикратная экономия реальна и при этом условна.
  • Цены на Pro и Enterprise не опубликованы. Скидки за объём означают разговор, а не калькулятор.
  • Если вам нужно всего лишь обращаться к чужой модели, это больше платформы, чем задача требует. Её ценность в обслуживании вашей.

Частые вопросы

Можно ли попробовать Baseten бесплатно?

Новым аккаунтам выдают пробные кредиты на эксперименты, а у тарифа Basic нет ежемесячной платы — вы платите за использование. Постоянного бесплатного тарифа нет.

Можно ли развернуть свою модель?

Да, и это основное назначение. Выделенные развёртывания обслуживают проприетарные и дообученные модели на инфраструктуре подходящего размера, а оптимизацию среды выполнения берёт на себя платформа.

Чем он отличается от Modal?

Modal — это универсальные бессерверные вычисления, где код пишете вы. Baseten конкретно про надёжное обслуживание моделей, где работа по оптимизации и доступности уже сделана. Modal гибче; Baseten делает за вас больше в более узких рамках.

Что означает цена на кэшированный вход?

Повторяющиеся начала промптов тарифицируются примерно по десятой доле обычной входной ставки. Если каждый запрос делит длинный системный промпт, перестройка так, чтобы эта часть кэшировалась, — самая крупная доступная экономия.

Поддерживает ли он обучение?

Да, через Loops SDK, с развёртыванием прямо в боевой инференс на той же платформе. Эта непрерывность — часть причины, по которой команды выбирают его вместо того, чтобы собирать обучение и обслуживание порознь.

Какие GPU можно получить?

От T4 за $0,63 в час через L4, A10G, A100 и H100 до B200 за $9,98. Раздел H100 MIG за $3,75 — полезный промежуточный вариант, когда целый H100 модели избыточен.

Коротко

Baseten — для этапа, наступающего после того, как вы определились с моделью и обнаружили, что обслуживать её хорошо — отдельная дисциплина. Оптимизированные среды выполнения, доступность поверх облаков и стабильная хвостовая задержка — это то, что команды строят себе месяцами, и это то, что здесь продают.

API моделей — разумный вход, но не причина здесь находиться: открытые модели за схожие деньги обслуживают многие. Приходите ради выделенных развёртываний, стройте промпты так, чтобы использовать кэшированный вход, и проверьте заявления о производительности на своей модели, прежде чем они станут строкой в вашем плане.

Альтернативные инструменты