Together AI
инференс, дообучение и GPU-кластеры
Гоняет открытые модели на сотнях токенов в секунду на собственных чипах LPU. Бесплатный тариф без карты, а батчинг вместе с кэшированием снижают цену примерно вчетверо.

Groq запускает открытые языковые модели очень быстро. Не немного быстрее — в несколько раз, на сотнях токенов в секунду, так что длинный ответ дорисовывается прежде, чем вы дочитаете первую строку.
Добивается он этого тем, что не использует видеокарты. Компания спроектировала собственный чип — Language Processing Unit — под конкретную форму работы языковой модели, а не под общую матричную математику, ради которой создавалась графика. Владение кремнием и объясняет, почему цифры скорости выглядят так, — и оно же объясняет, почему каталог моделей меньше, чем у всех остальных.
Этот размен и есть весь продукт. Вы получаете модели с открытыми весами — Llama, GPT-OSS, Whisper и собственные агентские системы Groq — обслуживаемые быстрее, чем где-либо ещё, и не получаете коммерческих моделей переднего края, потому что те не запускаются на железе, которым их владельцы не управляют.
Опубликованные цифры пропускной способности конкретны: около 560 токенов в секунду на Llama 3.1 8B, примерно 280 на Llama 3.3 70B, порядка 500 на GPT-OSS 120B и почти 1000 на GPT-OSS 20B. Контекстное окно доходит до 131 072 токенов.
Такие цифры меняют то, что вы готовы строить. Ниже определённой задержки языковая модель перестаёт ощущаться как запрос, которого ждут, и начинает ощущаться как функция, которую вызывают: интерфейсы, неприятные при двух секундах, становятся естественными при двухстах миллисекундах. Голос, живое редактирование, всё, где ждёт человек, — вот случаи, где это не хвастовство бенчмарком, а разница между «выпустили» и «не выпустили».
Groq Compound и Compound Mini — это модели, уже собранные вместе с веб-поиском, исполнением кода и вычислениями, работающие примерно на 450 токенах в секунду. Вместо того чтобы собирать работу с инструментами самому, вы обращаетесь к системе, где она уже есть.
Это естественно сочетается со скоростью. Агенты — это циклы, и цикл из десяти шагов по полсекунды каждый — совсем другой продукт, чем цикл из десяти шагов по три секунды. Быстрый инференс ценнее для агентов, чем для чата, и в большинстве сравнений этот момент недооценивают.
Все модели доступны на бесплатном тарифе без карты, ограничение идёт по частоте запросов, а не по урезанным функциям: порядка 30 запросов в минуту, 6000 токенов в минуту и 14 400 запросов в сутки на организацию.
Этого хватает, чтобы собрать и показать настоящее приложение, а не только запустить «hello world». Добавление способа оплаты переводит аккаунт на оплату по факту без ежемесячной базовой платы — бесплатный тариф здесь уменьшенная версия того же самого, а не другой продукт.
Цена считается за токены, подписки нет. Поскольку модели с открытыми весами обслуживаются на необычном железе, тарифы стоят у дешёвого края рынка, а не у дорогого.
| Что | Цена | Примечания |
|---|---|---|
| Бесплатный тариф | $0 | Все модели, карта не нужна |
| Лимиты бесплатного тарифа | ~30 запросов/мин, 6000 токенов/мин | Около 14 400 запросов в сутки |
| Самые маленькие модели | от $0,05 вход / $0,08 выход | За миллион токенов |
| Llama 3.3 70B | около $0,59 вход / $0,79 выход | За миллион токенов |
| Модели покрупнее | примерно до $1,00 вход / $3,00 выход | За миллион токенов |
| Batch API | Скидка 50% | Для работы, которая может подождать |
| Кэширование промптов | Скидка 50% | На кэшированном входе |
| Оба сразу | примерно 25% от обычного тарифа | Скидки складываются |
| Ежемесячная базовая плата | Нет | Оплата по факту |
| Enterprise | Индивидуально | Связаться с отделом продаж |
Складывающаяся скидка — та деталь, ради которой стоит что-то сделать. Любая нагрузка, которой не нужен ответ сию секунду — ночная классификация, массовое сжатие текстов, подготовка датасета, — может идти примерно по четверти обычного тарифа, если совместить батчинг с кэшированием. Это экономия больше той, которую большинство получает от смены провайдера.
Голосовые ассистенты, живые подсказки, интерактивные инструменты. Когда время отклика — часть интерфейса, а не техническая деталь, преимущество железа перестаёт быть абстрактным.
Каждый лишний шаг умножает задержку. Быстрая модель превращает цепочку, которая казалась вязкой, в отзывчивую, а системы Compound снимают работу по самостоятельному подключению инструментов.
Разметка, маршрутизация, извлечение данных, модерация. Небольшая открытая модель справляется с этим хорошо, цена за токен и так низкая, а батчинг с кэшированием опускают её ещё ниже.
Бесплатный тариф дотягивается до всех моделей и ограничен частотой запросов, а не урезанными функциями. Для прототипирования, обучения и хакатонов это заметно другое предложение, чем маленький кредитный баланс, который заканчивается.
Есть бесплатный тариф, покрывающий все модели, без карты, ограниченный запросами и токенами в минуту, а не функциями. Дальше — оплата по факту без ежемесячной базовой платы.
Собственный кремний. Language Processing Unit спроектирован под запуск языковых моделей, а не приспособлен из графического железа, и вся пропускная способность берётся из этой архитектурной разницы.
Нет. Groq обслуживает модели с открытыми весами — Llama, GPT-OSS, Whisper и собственные системы Compound. Закрытые коммерческие модели работают только на инфраструктуре, которой управляют их владельцы.
Пользуйтесь Batch API для всего, что терпит задержку, и стройте промпты так, чтобы общую часть можно было кэшировать. Каждое из двух вдвое снижает тариф, и они складываются, давая примерно четверть обычной цены.
Да, с обычной оговоркой про зависимость от единственного поставщика. Команды, которым нельзя простаивать, часто ставят перед ним роутер, чтобы иметь запасной вариант, оставляя Groq быстрым вариантом по умолчанию.
Да: модели Whisper обслуживаются рядом с языковыми, и это важно, потому что именно голосовые приложения сильнее всего выигрывают от низкой задержки.
Groq продаёт одну вещь и делает это отлично: скорость на открытых моделях по ценам, которые начинаются с пяти центов за миллион токенов и падают примерно до четверти этого при батчинге и кэшировании. Бесплатным тарифом действительно можно пользоваться, а преимущество железа настоящее, а не бенчмарк, подобранный для красоты.
Ограничение столь же ясное. Коммерческих моделей переднего края здесь нет, и никакая пропускная способность не компенсирует задачу, которой действительно нужно самое сильное доступное рассуждение. Используйте его там, где ограничением служит задержка, а открытой модели достаточно, — а для удивительно большой доли боевой работы её достаточно.