Together AI
инференс, дообучение и GPU-кластеры
Бессерверный инференс, управляемое дообучение с опубликованными потокенными ценами и GPU по требованию. Учтите: с 1 сентября 2026 года цены на GPU растут.

Fireworks AI запускает открытые модели в боевой эксплуатации. Бессерверный инференс для обычного пути, управляемое дообучение, когда общей модели не хватает конкретики, и выделенные GPU, когда нужно железо, принадлежащее вам на час.
Отличительная привычка компании — публиковать цифры, которые другие держат за формой обратной связи. Прайс на дообучение здесь — это сетка «размер модели против метода обучения» с числом в каждой клетке, а значит, стоимость обучения можно прикинуть по своему датасету, ни с кем не разговаривая. На рынке, где стоимость обучения обычно называют по запросу, это разница по существу.
Одно, что нужно знать, прежде чем опираться на любую цифру отсюда: компания объявила повышение цен на GPU по требованию, вступающее в силу 1 сентября 2026 года. Тарифы растут по всей линейке, местами на 30%. Всё, что вы посчитали по нынешним числам, надо перепроверить по новым.
Путь по умолчанию — потокенный инференс по открытым моделям, с $1 бесплатных кредитов на старт. Сумма мала намеренно: её хватает, чтобы убедиться, что API работает, и не хватает, чтобы отложить решение об оплате.
Эмбеддинги считаются отдельно и дёшево, полосами по размеру модели: $0,008 за миллион входных токенов до 150 млн параметров, $0,016 от 150 до 350 млн и $0,1 для Qwen3 8B. В поисковых системах, где объём эмбеддингов на порядки больше объёма генерации, именно эти полосы часто и определяют архитектуру.
Управляемое обучение считается за миллион обучающих токенов, и сетку стоит прочитать внимательно, потому что числа растут круто. LoRA с учителем стоит $0,50 до 16B параметров, $3,00 от 16,1B до 80B, $6,00 от 80B до 300B и $10,00 свыше. DPO удваивает каждую цифру, а полнопараметрическое обучение удваивает её ещё раз.
Читайте это как двадцатикратный разброс между самой дешёвой и самой дорогой LoRA с учителем, определяемый исключительно размером базовой модели. Практический вывод отсюда неромантичен: сначала попробуйте маленькую модель. Очень многие проекты дообучения, заложенные под базу на 70B, прекрасно вышли бы на 8B, а разница — $0,50 против $3,00 за миллион токенов.
Когда бессерверного мало, можно взять GPU по часам. До 31 августа 2026 года H100 или H200 стоят $7,00, B200 — $10,00, B300 — $12,00, GB300 — $18,00. С 1 сентября это станет $8,00, $13,00, $15,00 и $20,00 соответственно.
Резче всего дорожает B200 — на 30%, и именно это, скорее всего, окажется важным, поскольку B200 сейчас рабочая лошадка серьёзного инференса. Развёртывания, ограниченные конкретным регионом, несут сверху множитель 1,5×, который легко упустить, когда требование к хранению данных появляется в проекте поздно и как пункт комплаенса, а не как строка бюджета.
Важны два прайс-листа: сколько стоит обучение за миллион токенов и сколько стоит GPU в час. Меняется второй.
| Что | Цена | Примечания |
|---|---|---|
| Бесплатные кредиты | $1 | Только на оценку |
| Эмбеддинги до 150 млн параметров | $0,008 | За миллион входных токенов |
| Эмбеддинги 150–350 млн параметров | $0,016 | За миллион входных токенов |
| Эмбеддинги, Qwen3 8B | $0,1 | За миллион входных токенов |
| LoRA SFT до 16B | $0,50 | За миллион обучающих токенов |
| LoRA SFT 16,1–80B | $3,00 | За миллион обучающих токенов |
| LoRA SFT 80–300B | $6,00 | За миллион обучающих токенов |
| LoRA SFT свыше 300B | $10,00 | За миллион обучающих токенов |
| Полнопараметрический SFT до 16B | $1,00 | Вдвое дороже LoRA |
| DPO | Вдвое дороже SFT | В каждой размерной полосе |
| GPU H100 / H200 | $7,00 → $8,00 | В час, повышение с 1 сентября 2026 года |
| GPU B200 | $10,00 → $13,00 | В час, повышение с 1 сентября 2026 года |
| GPU B300 | $12,00 → $15,00 | В час, повышение с 1 сентября 2026 года |
| GPU GB300 | $18,00 → $20,00 | В час, повышение с 1 сентября 2026 года |
| Развёртывание с привязкой к региону | 1,5× | Надбавка к тарифам GPU |
| Enterprise | Связаться с отделом продаж | Индивидуальные условия |
Структура удвоений в обучении легко запоминается и легко просчитывается неверно. Полнопараметрический DPO на модели свыше 300B стоит $40,00 за миллион токенов против $10,00 за эквивалентную LoRA — четырёхкратная разница за выбор, который в начале проекта часто делают походя.
Опубликованные потокенные цены обучения по всем размерным полосам означают, что достоверную оценку по размеру датасета можно получить за вечер. Это редкость и сильнейшая причина сюда смотреть.
Дешёвые полосы на эмбеддинги подходят системам, которые индексируют куда больше текста, чем генерируют. При $0,008 за миллион токенов на моделях поменьше индексация большого корпуса перестаёт быть той строкой расходов, которая убивает проект.
Почасовые GPU с понятным путём перехода с бессерверного варианта и линейкой, доходящей до нынешнего поколения Blackwell. Считайте по сентябрьским тарифам, а не по текущим, если развёртывание не завтра.
Развёртывание с привязкой к региону доступно, а многие поставщики инференса такого не предлагают вовсе. Закладывайте множитель 1,5× с самого начала, а не узнавайте о нём во время проверки на соответствие.
Тарифы на GPU по требованию — да, с 1 сентября 2026 года. H100 и H200 идут с $7,00 до $8,00 в час, B200 — с $10,00 до $13,00, B300 — с $12,00 до $15,00, GB300 — с $18,00 до $20,00. Цены на бессерверный инференс и дообучение объявлены отдельно от этого изменения.
Умножьте свои обучающие токены на тариф для вашего размера базовой модели и метода. LoRA с учителем на модели 13B при десяти миллионах обучающих токенов обойдётся примерно в $5. Тот же прогон на базе 200B — около $60.
Есть $1 бесплатных кредитов — этого достаточно, чтобы убедиться, что интеграция работает. Это не бесплатный тариф в том смысле, в каком он есть у Groq.
Они сильно пересекаются. Together спускается глубже, к голым GPU-кластерам с долгосрочным резервированием; Fireworks публикует более внятную сетку по дообучению. Если ваш главный вопрос — экономика обучения, начинайте отсюда; если рассчитываете арендовать кластеры — оттуда.
Да, с надбавкой 1,5× к тарифу GPU. Это поддерживаемая опция, а не разговор только для корпоративных клиентов, — что полезно знать, если требование по региону есть, а объёмы скромные.
LoRA подстраивает небольшой набор добавленных весов и стоит вдвое дешевле; полнопараметрическое обучение обновляет модель целиком. LoRA — разумный вариант по умолчанию, и его обычно достаточно, чтобы научить модель предметной области, формату или тону.
Fireworks AI — та платформа инференса, которая скажет вам стоимость до того, как вы возьмёте обязательства. Одна только сетка по дообучению оправдывает визит: она превращает вопрос, на который обычно отвечает звонок продавца, в арифметику, которую вы делаете сами.
Делайте эту арифметику по сентябрьским тарифам на GPU, а не по нынешним, и пробуйте самую маленькую базовую модель, которую задача стерпит. Платформа устроена прямолинейно, а цены честны; ошибки здесь — те, что вы делаете, выбирая модель крупнее, чем было нужно.