Together AI

Бессерверный инференс, выделенные точки входа, дообучение и аренда GPU-кластеров — один поставщик на всех уровнях, от токенов до голых H200.

Перейти к ИИ
Together AI cover

Что такое Together AI?

Together AI продаёт вычисления для открытых моделей на всех уровнях абстракции. Наверху вы отправляете промпт и платите за токены. Внизу арендуете H200 на час и делаете с ними что хотите. Между ними — выделенные точки входа, дообучение и песочница для кода, и смысл в том, что переход между уровнями не означает смену поставщика.

Такой охват необычен. Большинство компаний в этой области выбирают один слой: токеновые API, или аренду GPU, или обучение. Together закрывает всю колонку, и это важно, потому что успешный ИИ-продукт обычно по ней спускается. Вы начинаете с бессерверного, потому что так проще, обнаруживаете, что трафик достаточно ровный и выделенные мощности выходят дешевле, затем дообучаете модель на своих данных — и её надо где-то обслуживать.

Он необычно широк и по модальностям. Рядом с чат-моделями стоят генерация изображений, генерация видео и расшифровка аудио, и всё это оплачивается с одного счёта: Flux, Imagen, Veo, Sora и Seedance соседствуют с Llama и DeepSeek.

Как это работает

Бессерверный инференс

Отправная точка — потокенный API по открытым моделям. Тарифы разбросаны широко: около $0,14 за вход и $0,28 за выход на миллион токенов у быстрой версии DeepSeek, примерно $1,04 в обе стороны у Llama 3.3 70B и $3,00 вход при $15,00 выход у Kimi K3.

Разброс более чем в двадцать раз по выходным токенам означает, что счёт определяет выбор модели, и стоит проверить, действительно ли дешёвая модель не справляется с вашей задачей, прежде чем считать, что не справляется. Большинство команд обнаруживает, что немалой доле их трафика дорогой вариант вообще не был нужен.

Выделенные точки входа и голые кластеры

Выделенный инференс даёт вам модель на железе, которое ваше на час: HGX H100 за $5,49, HGX B200 за $8,99. Арифметика против потокенной оплаты прямая: ровный большой объём выгоднее по часам, рваный трафик — по токенам, и точку пересечения стоит посчитать, а не угадывать.

Ниже расположены GPU-кластеры. По требованию H100 стоит $3,99 за карту в час, H200 — $5,99, B200 — $8,19. Резервирование на 181 день и больше заметно снижает эти цифры: H200 до $3,99, B200 до $6,79. Это обычная форма этого рынка: мощности дёшевы, если вы можете пообещать, что будете их использовать.

Дообучение как товар с ценником

Дообучение считается за миллион обучающих токенов, и цифры опубликованы, а не выдаются по запросу. LoRA с учителем на модели до 16B стоит $0,48; DPO — $0,54; полнопараметрическое обучение — от $1,20 до $1,35. Крупные и специализированные модели стоят заметно дороже: LoRA на GLM-5.2 обойдётся в $40,00 за миллион токенов.

То, что это опубликовано, важно. Именно на дообучении расходы обычно становятся непрозрачными, и возможность прикинуть стоимость обучения по размеру своего датасета до подписания — это разница между экспериментом и заявкой на бюджет.

Сколько это стоит

Подписки нет. Вы платите за то, что использовали, на том уровне, на котором использовали, а таблица ниже даёт опорные точки для всего остального.

ЧтоЦенаЕдиница
DeepSeek V4 Flash$0,14 вход / $0,28 выходЗа миллион токенов
GLM-5.3-Flash$0,15 вход / $0,50 выходЗа миллион токенов
Llama 3.3 70B$1,04 вход / $1,04 выходЗа миллион токенов
Kimi K3$3,00 вход / $15,00 выходЗа миллион токенов
Whisper Large v3$0,0015За минуту аудио
FLUX.2 [dev]$0,0154За изображение
Sora 2$0,80За видео
Выделенный HGX H100$5,49В час
Выделенный HGX B200$8,99В час
Кластерный H100 по требованию$3,99За GPU в час
Кластерный H200 при резерве от 181 дня$3,99За GPU в час
Дообучение LoRA до 16B$0,48За миллион обучающих токенов
Общая файловая система$0,16За ГиБ в месяц
Сессия интерпретатора кода$0,03За 60 минут

Разрыв между резервом и оплатой по требованию на кластерах — самый мощный рычаг здесь. H200 падает с $5,99 до $3,99 при долгом обязательстве: минус треть в обмен на определённость, которую большинство ранних команд честно дать не могут.

Кому это выгоднее всего

Продуктам, которые перерастут токеновый API

Если вы предвидите выделенные мощности или собственную дообученную модель в ближайший год, начать там, где есть и то и другое, — значит убрать миграцию, которую иначе пришлось бы планировать.

Командам, дообучающим на своих данных

Опубликованные потокенные цены обучения, выбор базовых моделей по размеру и место, где потом обслуживать результат. Это цельный путь, а не три отдельные закупочные беседы.

Мультимодальным приложениям

Текст, изображения, видео и расшифровка на одном аккаунте и в одном счёте. Для всего, что порождает медиа вместе с текстом, такая консолидация ценнее нескольких процентов на любой отдельной позиции.

Всем, кто и так арендует GPU

Если вы уже арендуете вычисления под обучение, получать инференс у того же поставщика — с доступным резервированием — проще, чем делить всё между облачным провайдером и продавцом API.

На что обратить внимание

  • Только открытые модели. Коммерческих моделей переднего края здесь нет, так что самое сильное доступное рассуждение в меню отсутствует.
  • Широта — это ещё и плата сложностью. Четыре способа купить вычисления означают четыре способа выбрать не тот и заплатить больше, чем нужно было.
  • Резервная цена на кластеры требует обязательства на 181 день. Скидка настоящая, и обязательство тоже.
  • Цены на выходные токены различаются между моделями более чем в двадцать раз. Брать по умолчанию самый сильный вариант — быстрейший путь к неожиданному счёту.
  • Стоимость дообучения резко растёт с размером модели. LoRA за $0,48 за миллион токенов и LoRA за $40,00 — это одна и та же операция на разных основах.
  • Выделенные точки входа тарифицируются по часам независимо от того, идёт ли трафик. Простаивающие мощности — классический способ сделать это дороже бессерверного варианта.

Частые вопросы

Есть ли бесплатный тариф?

Есть бесплатный старт, а не постоянный бесплатный тариф: сайт приглашает начать без оплаты, не называя конкретной суммы кредитов. Считайте, что этого хватит на оценку, но не на работу.

Когда переходить с бессерверного на выделенное?

Когда трафик достаточно ровный, чтобы часовая ставка обошлась дешевле ваших расходов на токены. Возьмите месячный счёт за токены, поделите на часы, в которые вы реально обслуживаете трафик, и сравните с $5,49 за H100. Рваная нагрузка почти всегда остаётся бессерверной.

Можно ли дообучить и потом обслуживать результат?

Да, и ради этого пути и выбирают поставщика, закрывающего несколько уровней. Обучение считается за миллион токенов, а получившуюся модель можно запустить на выделенной инфраструктуре в том же аккаунте.

Работает ли он с изображениями и видео?

Да. Генерация изображений считается поштучно — от менее чем пятой доли цента за SD XL до шести центов за Imagen 4.0 Ultra, — а видео за ролик, где Sora 2 стоит $0,80, а Veo 3.0 — $1,60.

Как он соотносится с Groq и Fireworks?

Groq оптимизируется под чистую скорость на узком каталоге. Fireworks сосредоточен на боевом инференсе и дообучении. Together — самый широкий из трёх, он спускается до аренды голых GPU: выбирайте его, если ждёте, что токенового API вам будет мало.

Используются ли мои данные для обучения?

Бизнес здесь — обслуживать открытые модели, а не улучшать проприетарные, и это ставит стимулы в разумное положение. Как всегда, читайте действующие условия своего тарифа, а не полагайтесь на общее утверждение.

Коротко

Together AI — вариант для команд, которые подозревают, что токеновым API история не закончится. Бессерверный инференс для старта, выделенные точки входа, когда объём это оправдает, дообучение с опубликованными ценами и голые кластеры внизу — всё на одном аккаунте, что убирает миграции, которыми обычно размечен рост ИИ-продукта.

Каталог — открытые модели, поэтому самое сильное коммерческое рассуждение находится в другом месте. Но если ваша работа на открытых весах и вы ожидаете дорасти до инфраструктуры, широта здесь и есть причина выбрать его — и она требует дисциплины проверять на каждом уровне, что вы покупаете именно то, что вам нужно.

Альтернативные инструменты