Groq

Гоняет открытые модели на сотнях токенов в секунду на собственных чипах LPU. Бесплатный тариф без карты, а батчинг вместе с кэшированием снижают цену примерно вчетверо.

Перейти к ИИ
Groq cover

Что такое Groq?

Groq запускает открытые языковые модели очень быстро. Не немного быстрее — в несколько раз, на сотнях токенов в секунду, так что длинный ответ дорисовывается прежде, чем вы дочитаете первую строку.

Добивается он этого тем, что не использует видеокарты. Компания спроектировала собственный чип — Language Processing Unit — под конкретную форму работы языковой модели, а не под общую матричную математику, ради которой создавалась графика. Владение кремнием и объясняет, почему цифры скорости выглядят так, — и оно же объясняет, почему каталог моделей меньше, чем у всех остальных.

Этот размен и есть весь продукт. Вы получаете модели с открытыми весами — Llama, GPT-OSS, Whisper и собственные агентские системы Groq — обслуживаемые быстрее, чем где-либо ещё, и не получаете коммерческих моделей переднего края, потому что те не запускаются на железе, которым их владельцы не управляют.

Как это работает

Скорость, под которую можно проектировать

Опубликованные цифры пропускной способности конкретны: около 560 токенов в секунду на Llama 3.1 8B, примерно 280 на Llama 3.3 70B, порядка 500 на GPT-OSS 120B и почти 1000 на GPT-OSS 20B. Контекстное окно доходит до 131 072 токенов.

Такие цифры меняют то, что вы готовы строить. Ниже определённой задержки языковая модель перестаёт ощущаться как запрос, которого ждут, и начинает ощущаться как функция, которую вызывают: интерфейсы, неприятные при двух секундах, становятся естественными при двухстах миллисекундах. Голос, живое редактирование, всё, где ждёт человек, — вот случаи, где это не хвастовство бенчмарком, а разница между «выпустили» и «не выпустили».

Агентские системы со встроенными инструментами

Groq Compound и Compound Mini — это модели, уже собранные вместе с веб-поиском, исполнением кода и вычислениями, работающие примерно на 450 токенах в секунду. Вместо того чтобы собирать работу с инструментами самому, вы обращаетесь к системе, где она уже есть.

Это естественно сочетается со скоростью. Агенты — это циклы, и цикл из десяти шагов по полсекунды каждый — совсем другой продукт, чем цикл из десяти шагов по три секунды. Быстрый инференс ценнее для агентов, чем для чата, и в большинстве сравнений этот момент недооценивают.

Бесплатный тариф, которым правда можно пользоваться

Все модели доступны на бесплатном тарифе без карты, ограничение идёт по частоте запросов, а не по урезанным функциям: порядка 30 запросов в минуту, 6000 токенов в минуту и 14 400 запросов в сутки на организацию.

Этого хватает, чтобы собрать и показать настоящее приложение, а не только запустить «hello world». Добавление способа оплаты переводит аккаунт на оплату по факту без ежемесячной базовой платы — бесплатный тариф здесь уменьшенная версия того же самого, а не другой продукт.

Сколько это стоит

Цена считается за токены, подписки нет. Поскольку модели с открытыми весами обслуживаются на необычном железе, тарифы стоят у дешёвого края рынка, а не у дорогого.

ЧтоЦенаПримечания
Бесплатный тариф$0Все модели, карта не нужна
Лимиты бесплатного тарифа~30 запросов/мин, 6000 токенов/минОколо 14 400 запросов в сутки
Самые маленькие моделиот $0,05 вход / $0,08 выходЗа миллион токенов
Llama 3.3 70Bоколо $0,59 вход / $0,79 выходЗа миллион токенов
Модели покрупнеепримерно до $1,00 вход / $3,00 выходЗа миллион токенов
Batch APIСкидка 50%Для работы, которая может подождать
Кэширование промптовСкидка 50%На кэшированном входе
Оба сразупримерно 25% от обычного тарифаСкидки складываются
Ежемесячная базовая платаНетОплата по факту
EnterpriseИндивидуальноСвязаться с отделом продаж

Складывающаяся скидка — та деталь, ради которой стоит что-то сделать. Любая нагрузка, которой не нужен ответ сию секунду — ночная классификация, массовое сжатие текстов, подготовка датасета, — может идти примерно по четверти обычного тарифа, если совместить батчинг с кэшированием. Это экономия больше той, которую большинство получает от смены провайдера.

Кому это выгоднее всего

Всему, где ждёт человек

Голосовые ассистенты, живые подсказки, интерактивные инструменты. Когда время отклика — часть интерфейса, а не техническая деталь, преимущество железа перестаёт быть абстрактным.

Агентам, которые делают много шагов

Каждый лишний шаг умножает задержку. Быстрая модель превращает цепочку, которая казалась вязкой, в отзывчивую, а системы Compound снимают работу по самостоятельному подключению инструментов.

Объёмной, но несложной работе

Разметка, маршрутизация, извлечение данных, модерация. Небольшая открытая модель справляется с этим хорошо, цена за токен и так низкая, а батчинг с кэшированием опускают её ещё ниже.

Разработчикам, которые хотят начать без карты

Бесплатный тариф дотягивается до всех моделей и ограничен частотой запросов, а не урезанными функциями. Для прототипирования, обучения и хакатонов это заметно другое предложение, чем маленький кредитный баланс, который заканчивается.

На что обратить внимание

  • Никаких коммерческих моделей переднего края. Если работе нужно самое сильное доступное рассуждение, происходит это не здесь: каталог — открытые веса.
  • Скорость не повышает качество. Быстрая восьмимиллиардная модель остаётся восьмимиллиардной, и услышать её ошибку быстрее — не улучшение.
  • Бесплатный тариф ограничен частотой запросов, а не кредитами. В целом это лучше, но всплеск трафика упирается в потолок сразу, а не постепенно.
  • Владение железом означает, что мощности распределяют они. Доступность конкретной модели — это их решение о поставке, а не то, что можно обойти маршрутизацией.
  • Опубликованные цифры пропускной способности получены в идеальных условиях. Длина вашего промпта и длина ответа их сдвинут.
  • Скидка за батчинг требует, чтобы вы действительно батчили. Это настоящие 50%, и они не включаются сами.

Частые вопросы

Groq бесплатный?

Есть бесплатный тариф, покрывающий все модели, без карты, ограниченный запросами и токенами в минуту, а не функциями. Дальше — оплата по факту без ежемесячной базовой платы.

Почему он настолько быстрее?

Собственный кремний. Language Processing Unit спроектирован под запуск языковых моделей, а не приспособлен из графического железа, и вся пропускная способность берётся из этой архитектурной разницы.

Можно ли запустить на нём GPT или Claude?

Нет. Groq обслуживает модели с открытыми весами — Llama, GPT-OSS, Whisper и собственные системы Compound. Закрытые коммерческие модели работают только на инфраструктуре, которой управляют их владельцы.

Как на самом деле получить самую низкую цену?

Пользуйтесь Batch API для всего, что терпит задержку, и стройте промпты так, чтобы общую часть можно было кэшировать. Каждое из двух вдвое снижает тариф, и они складываются, давая примерно четверть обычной цены.

Годится ли он для боевой эксплуатации?

Да, с обычной оговоркой про зависимость от единственного поставщика. Команды, которым нельзя простаивать, часто ставят перед ним роутер, чтобы иметь запасной вариант, оставляя Groq быстрым вариантом по умолчанию.

Умеет ли он работать с речью?

Да: модели Whisper обслуживаются рядом с языковыми, и это важно, потому что именно голосовые приложения сильнее всего выигрывают от низкой задержки.

Коротко

Groq продаёт одну вещь и делает это отлично: скорость на открытых моделях по ценам, которые начинаются с пяти центов за миллион токенов и падают примерно до четверти этого при батчинге и кэшировании. Бесплатным тарифом действительно можно пользоваться, а преимущество железа настоящее, а не бенчмарк, подобранный для красоты.

Ограничение столь же ясное. Коммерческих моделей переднего края здесь нет, и никакая пропускная способность не компенсирует задачу, которой действительно нужно самое сильное доступное рассуждение. Используйте его там, где ограничением служит задержка, а открытой модели достаточно, — а для удивительно большой доли боевой работы её достаточно.

Альтернативные инструменты