Fireworks AI
боевой инференс и дообучение
Бессерверный инференс, выделенные точки входа, дообучение и аренда GPU-кластеров — один поставщик на всех уровнях, от токенов до голых H200.

Together AI продаёт вычисления для открытых моделей на всех уровнях абстракции. Наверху вы отправляете промпт и платите за токены. Внизу арендуете H200 на час и делаете с ними что хотите. Между ними — выделенные точки входа, дообучение и песочница для кода, и смысл в том, что переход между уровнями не означает смену поставщика.
Такой охват необычен. Большинство компаний в этой области выбирают один слой: токеновые API, или аренду GPU, или обучение. Together закрывает всю колонку, и это важно, потому что успешный ИИ-продукт обычно по ней спускается. Вы начинаете с бессерверного, потому что так проще, обнаруживаете, что трафик достаточно ровный и выделенные мощности выходят дешевле, затем дообучаете модель на своих данных — и её надо где-то обслуживать.
Он необычно широк и по модальностям. Рядом с чат-моделями стоят генерация изображений, генерация видео и расшифровка аудио, и всё это оплачивается с одного счёта: Flux, Imagen, Veo, Sora и Seedance соседствуют с Llama и DeepSeek.
Отправная точка — потокенный API по открытым моделям. Тарифы разбросаны широко: около $0,14 за вход и $0,28 за выход на миллион токенов у быстрой версии DeepSeek, примерно $1,04 в обе стороны у Llama 3.3 70B и $3,00 вход при $15,00 выход у Kimi K3.
Разброс более чем в двадцать раз по выходным токенам означает, что счёт определяет выбор модели, и стоит проверить, действительно ли дешёвая модель не справляется с вашей задачей, прежде чем считать, что не справляется. Большинство команд обнаруживает, что немалой доле их трафика дорогой вариант вообще не был нужен.
Выделенный инференс даёт вам модель на железе, которое ваше на час: HGX H100 за $5,49, HGX B200 за $8,99. Арифметика против потокенной оплаты прямая: ровный большой объём выгоднее по часам, рваный трафик — по токенам, и точку пересечения стоит посчитать, а не угадывать.
Ниже расположены GPU-кластеры. По требованию H100 стоит $3,99 за карту в час, H200 — $5,99, B200 — $8,19. Резервирование на 181 день и больше заметно снижает эти цифры: H200 до $3,99, B200 до $6,79. Это обычная форма этого рынка: мощности дёшевы, если вы можете пообещать, что будете их использовать.
Дообучение считается за миллион обучающих токенов, и цифры опубликованы, а не выдаются по запросу. LoRA с учителем на модели до 16B стоит $0,48; DPO — $0,54; полнопараметрическое обучение — от $1,20 до $1,35. Крупные и специализированные модели стоят заметно дороже: LoRA на GLM-5.2 обойдётся в $40,00 за миллион токенов.
То, что это опубликовано, важно. Именно на дообучении расходы обычно становятся непрозрачными, и возможность прикинуть стоимость обучения по размеру своего датасета до подписания — это разница между экспериментом и заявкой на бюджет.
Подписки нет. Вы платите за то, что использовали, на том уровне, на котором использовали, а таблица ниже даёт опорные точки для всего остального.
| Что | Цена | Единица |
|---|---|---|
| DeepSeek V4 Flash | $0,14 вход / $0,28 выход | За миллион токенов |
| GLM-5.3-Flash | $0,15 вход / $0,50 выход | За миллион токенов |
| Llama 3.3 70B | $1,04 вход / $1,04 выход | За миллион токенов |
| Kimi K3 | $3,00 вход / $15,00 выход | За миллион токенов |
| Whisper Large v3 | $0,0015 | За минуту аудио |
| FLUX.2 [dev] | $0,0154 | За изображение |
| Sora 2 | $0,80 | За видео |
| Выделенный HGX H100 | $5,49 | В час |
| Выделенный HGX B200 | $8,99 | В час |
| Кластерный H100 по требованию | $3,99 | За GPU в час |
| Кластерный H200 при резерве от 181 дня | $3,99 | За GPU в час |
| Дообучение LoRA до 16B | $0,48 | За миллион обучающих токенов |
| Общая файловая система | $0,16 | За ГиБ в месяц |
| Сессия интерпретатора кода | $0,03 | За 60 минут |
Разрыв между резервом и оплатой по требованию на кластерах — самый мощный рычаг здесь. H200 падает с $5,99 до $3,99 при долгом обязательстве: минус треть в обмен на определённость, которую большинство ранних команд честно дать не могут.
Если вы предвидите выделенные мощности или собственную дообученную модель в ближайший год, начать там, где есть и то и другое, — значит убрать миграцию, которую иначе пришлось бы планировать.
Опубликованные потокенные цены обучения, выбор базовых моделей по размеру и место, где потом обслуживать результат. Это цельный путь, а не три отдельные закупочные беседы.
Текст, изображения, видео и расшифровка на одном аккаунте и в одном счёте. Для всего, что порождает медиа вместе с текстом, такая консолидация ценнее нескольких процентов на любой отдельной позиции.
Если вы уже арендуете вычисления под обучение, получать инференс у того же поставщика — с доступным резервированием — проще, чем делить всё между облачным провайдером и продавцом API.
Есть бесплатный старт, а не постоянный бесплатный тариф: сайт приглашает начать без оплаты, не называя конкретной суммы кредитов. Считайте, что этого хватит на оценку, но не на работу.
Когда трафик достаточно ровный, чтобы часовая ставка обошлась дешевле ваших расходов на токены. Возьмите месячный счёт за токены, поделите на часы, в которые вы реально обслуживаете трафик, и сравните с $5,49 за H100. Рваная нагрузка почти всегда остаётся бессерверной.
Да, и ради этого пути и выбирают поставщика, закрывающего несколько уровней. Обучение считается за миллион токенов, а получившуюся модель можно запустить на выделенной инфраструктуре в том же аккаунте.
Да. Генерация изображений считается поштучно — от менее чем пятой доли цента за SD XL до шести центов за Imagen 4.0 Ultra, — а видео за ролик, где Sora 2 стоит $0,80, а Veo 3.0 — $1,60.
Groq оптимизируется под чистую скорость на узком каталоге. Fireworks сосредоточен на боевом инференсе и дообучении. Together — самый широкий из трёх, он спускается до аренды голых GPU: выбирайте его, если ждёте, что токенового API вам будет мало.
Бизнес здесь — обслуживать открытые модели, а не улучшать проприетарные, и это ставит стимулы в разумное положение. Как всегда, читайте действующие условия своего тарифа, а не полагайтесь на общее утверждение.
Together AI — вариант для команд, которые подозревают, что токеновым API история не закончится. Бессерверный инференс для старта, выделенные точки входа, когда объём это оправдает, дообучение с опубликованными ценами и голые кластеры внизу — всё на одном аккаунте, что убирает миграции, которыми обычно размечен рост ИИ-продукта.
Каталог — открытые модели, поэтому самое сильное коммерческое рассуждение находится в другом месте. Но если ваша работа на открытых весах и вы ожидаете дорасти до инфраструктуры, широта здесь и есть причина выбрать его — и она требует дисциплины проверять на каждом уровне, что вы покупаете именно то, что вам нужно.