Fireworks AI

Бессерверный инференс, управляемое дообучение с опубликованными потокенными ценами и GPU по требованию. Учтите: с 1 сентября 2026 года цены на GPU растут.

Перейти к ИИ
Fireworks AI cover

Что такое Fireworks AI?

Fireworks AI запускает открытые модели в боевой эксплуатации. Бессерверный инференс для обычного пути, управляемое дообучение, когда общей модели не хватает конкретики, и выделенные GPU, когда нужно железо, принадлежащее вам на час.

Отличительная привычка компании — публиковать цифры, которые другие держат за формой обратной связи. Прайс на дообучение здесь — это сетка «размер модели против метода обучения» с числом в каждой клетке, а значит, стоимость обучения можно прикинуть по своему датасету, ни с кем не разговаривая. На рынке, где стоимость обучения обычно называют по запросу, это разница по существу.

Одно, что нужно знать, прежде чем опираться на любую цифру отсюда: компания объявила повышение цен на GPU по требованию, вступающее в силу 1 сентября 2026 года. Тарифы растут по всей линейке, местами на 30%. Всё, что вы посчитали по нынешним числам, надо перепроверить по новым.

Как это работает

Сначала бессерверный вариант

Путь по умолчанию — потокенный инференс по открытым моделям, с $1 бесплатных кредитов на старт. Сумма мала намеренно: её хватает, чтобы убедиться, что API работает, и не хватает, чтобы отложить решение об оплате.

Эмбеддинги считаются отдельно и дёшево, полосами по размеру модели: $0,008 за миллион входных токенов до 150 млн параметров, $0,016 от 150 до 350 млн и $0,1 для Qwen3 8B. В поисковых системах, где объём эмбеддингов на порядки больше объёма генерации, именно эти полосы часто и определяют архитектуру.

Дообучение с прайс-листом

Управляемое обучение считается за миллион обучающих токенов, и сетку стоит прочитать внимательно, потому что числа растут круто. LoRA с учителем стоит $0,50 до 16B параметров, $3,00 от 16,1B до 80B, $6,00 от 80B до 300B и $10,00 свыше. DPO удваивает каждую цифру, а полнопараметрическое обучение удваивает её ещё раз.

Читайте это как двадцатикратный разброс между самой дешёвой и самой дорогой LoRA с учителем, определяемый исключительно размером базовой модели. Практический вывод отсюда неромантичен: сначала попробуйте маленькую модель. Очень многие проекты дообучения, заложенные под базу на 70B, прекрасно вышли бы на 8B, а разница — $0,50 против $3,00 за миллион токенов.

GPU по требованию и сентябрьское повышение

Когда бессерверного мало, можно взять GPU по часам. До 31 августа 2026 года H100 или H200 стоят $7,00, B200 — $10,00, B300 — $12,00, GB300 — $18,00. С 1 сентября это станет $8,00, $13,00, $15,00 и $20,00 соответственно.

Резче всего дорожает B200 — на 30%, и именно это, скорее всего, окажется важным, поскольку B200 сейчас рабочая лошадка серьёзного инференса. Развёртывания, ограниченные конкретным регионом, несут сверху множитель 1,5×, который легко упустить, когда требование к хранению данных появляется в проекте поздно и как пункт комплаенса, а не как строка бюджета.

Сколько это стоит

Важны два прайс-листа: сколько стоит обучение за миллион токенов и сколько стоит GPU в час. Меняется второй.

ЧтоЦенаПримечания
Бесплатные кредиты$1Только на оценку
Эмбеддинги до 150 млн параметров$0,008За миллион входных токенов
Эмбеддинги 150–350 млн параметров$0,016За миллион входных токенов
Эмбеддинги, Qwen3 8B$0,1За миллион входных токенов
LoRA SFT до 16B$0,50За миллион обучающих токенов
LoRA SFT 16,1–80B$3,00За миллион обучающих токенов
LoRA SFT 80–300B$6,00За миллион обучающих токенов
LoRA SFT свыше 300B$10,00За миллион обучающих токенов
Полнопараметрический SFT до 16B$1,00Вдвое дороже LoRA
DPOВдвое дороже SFTВ каждой размерной полосе
GPU H100 / H200$7,00 → $8,00В час, повышение с 1 сентября 2026 года
GPU B200$10,00 → $13,00В час, повышение с 1 сентября 2026 года
GPU B300$12,00 → $15,00В час, повышение с 1 сентября 2026 года
GPU GB300$18,00 → $20,00В час, повышение с 1 сентября 2026 года
Развёртывание с привязкой к региону1,5×Надбавка к тарифам GPU
EnterpriseСвязаться с отделом продажИндивидуальные условия

Структура удвоений в обучении легко запоминается и легко просчитывается неверно. Полнопараметрический DPO на модели свыше 300B стоит $40,00 за миллион токенов против $10,00 за эквивалентную LoRA — четырёхкратная разница за выбор, который в начале проекта часто делают походя.

Кому это выгоднее всего

Командам, планирующим бюджет дообучения

Опубликованные потокенные цены обучения по всем размерным полосам означают, что достоверную оценку по размеру датасета можно получить за вечер. Это редкость и сильнейшая причина сюда смотреть.

Приложениям с тяжёлым поиском по документам

Дешёвые полосы на эмбеддинги подходят системам, которые индексируют куда больше текста, чем генерируют. При $0,008 за миллион токенов на моделях поменьше индексация большого корпуса перестаёт быть той строкой расходов, которая убивает проект.

Боевым нагрузкам, которым нужно выделенное железо

Почасовые GPU с понятным путём перехода с бессерверного варианта и линейкой, доходящей до нынешнего поколения Blackwell. Считайте по сентябрьским тарифам, а не по текущим, если развёртывание не завтра.

Всем, у кого есть требования к хранению данных в регионе

Развёртывание с привязкой к региону доступно, а многие поставщики инференса такого не предлагают вовсе. Закладывайте множитель 1,5× с самого начала, а не узнавайте о нём во время проверки на соответствие.

На что обратить внимание

  • Цены на GPU растут с 1 сентября 2026 года, до 30%. Любое сравнение, написанное до этой даты, — включая ваши собственные расчёты — уже устарело.
  • Один доллар бесплатного кредита — это рукопожатие, а не пробный период. Рассчитывайте начать платить раньше, чем закончите оценку.
  • Стоимость обучения растёт в двадцать раз вместе с размером базовой модели. Выбрать базу походя — самое дорогое решение в проекте дообучения.
  • Привязка к региону стоит 1,5×. Требования комплаенса, приходящие поздно, сдвинут бюджет сильнее, чем ожидает большинство.
  • Только открытые модели. Как и у Together с Groq, коммерческого рассуждения переднего края в каталоге нет.
  • Почасовые GPU тарифицируются независимо от того, пользуетесь вы ими или нет. Переход с бессерверного варианта стоит посчитать, а не предположить.

Частые вопросы

Растут ли цены Fireworks?

Тарифы на GPU по требованию — да, с 1 сентября 2026 года. H100 и H200 идут с $7,00 до $8,00 в час, B200 — с $10,00 до $13,00, B300 — с $12,00 до $15,00, GB300 — с $18,00 до $20,00. Цены на бессерверный инференс и дообучение объявлены отдельно от этого изменения.

Сколько на самом деле стоит дообучение?

Умножьте свои обучающие токены на тариф для вашего размера базовой модели и метода. LoRA с учителем на модели 13B при десяти миллионах обучающих токенов обойдётся примерно в $5. Тот же прогон на базе 200B — около $60.

Есть ли бесплатный тариф?

Есть $1 бесплатных кредитов — этого достаточно, чтобы убедиться, что интеграция работает. Это не бесплатный тариф в том смысле, в каком он есть у Groq.

Как он соотносится с Together AI?

Они сильно пересекаются. Together спускается глубже, к голым GPU-кластерам с долгосрочным резервированием; Fireworks публикует более внятную сетку по дообучению. Если ваш главный вопрос — экономика обучения, начинайте отсюда; если рассчитываете арендовать кластеры — оттуда.

Можно ли развернуть в конкретном регионе?

Да, с надбавкой 1,5× к тарифу GPU. Это поддерживаемая опция, а не разговор только для корпоративных клиентов, — что полезно знать, если требование по региону есть, а объёмы скромные.

В чём разница между LoRA и полнопараметрическим обучением?

LoRA подстраивает небольшой набор добавленных весов и стоит вдвое дешевле; полнопараметрическое обучение обновляет модель целиком. LoRA — разумный вариант по умолчанию, и его обычно достаточно, чтобы научить модель предметной области, формату или тону.

Коротко

Fireworks AI — та платформа инференса, которая скажет вам стоимость до того, как вы возьмёте обязательства. Одна только сетка по дообучению оправдывает визит: она превращает вопрос, на который обычно отвечает звонок продавца, в арифметику, которую вы делаете сами.

Делайте эту арифметику по сентябрьским тарифам на GPU, а не по нынешним, и пробуйте самую маленькую базовую модель, которую задача стерпит. Платформа устроена прямолинейно, а цены честны; ошибки здесь — те, что вы делаете, выбирая модель крупнее, чем было нужно.

Альтернативные инструменты