Nvidia представила стойку Groq 3 LPX и независимый бенчмарк на 3431 токен/с
Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Nvidia представила на Hot Chips 2026 стойку для инференса Groq 3 LPX и опубликовала независимый бенчмарк: 3431 выходной токен в секунду на модели Gemma 4 31B с контекстом 100K. Стойка уже запущена в производство на базе чипа LP30, полученного в результате сделки с Groq за 20 млрд долларов. Показатель примерно в четыре раза выше ближайшего публичного эндпоинта, хотя сравнение проводилось на частном предрелизном эндпоинте при одиночных запросах.
Ключевые факты
- Artificial Analysis измерила производительность стойки Groq 3 LPX на уровне 3431 выходного токена в секунду на модели Gemma 4 31B с контекстом 100K.
- Ближайший публичный эндпоинт показал 870 токенов в секунду, то есть стойка LPX примерно в четыре раза быстрее.
- Демонстрация Nvidia на сцене показала 10 996 токенов в секунду на той же модели, но вице-президент Nvidia Игорь Арсовски отметил, что это самостоятельная оценка.
- Каждый чип LP30 несёт около 500 МБ встроенной SRAM и не имеет HBM, поэтому полная стойка LPX из 256 чипов имеет 128 ГБ памяти и 40 ПБ/с совокупной пропускной способности.
- Стойка LPX обеспечивает 315 PFLOPS вычислений FP8 с задержкой между чипами 350 нс в жидкостном охлаждении MGX, совместимом с Vera Rubin.
Методология бенчмарка
Artificial Analysis проводила сравнение на частном предрелизном эндпоинте Gemma 4 31B, развёрнутом в Google Cloud, беря медиану из 50 последовательных клиентских запросов при параллелизме один. Публичные провайдеры, с которыми проводилось сравнение, использовали общие production serverless эндпоинты, поэтому условие одиночного запроса даёт максимальную скорость на пользователя, которую может показать оборудование. Демонстрация Nvidia на сцене показала более высокий результат — 10 996 токенов в секунду на той же модели 31B, который Игорь Арсовски, вице-президент Nvidia по аппаратному обеспечению, отметил как самостоятельную оценку. Арсовски сказал аудитории, что цель — независимые проверенные бенчмарки, которым можно доверять.
Архитектура LP30
Каждый LP30 несёт примерно 500 МБ встроенной SRAM и не имеет HBM, поэтому полная стойка LPX из 256 чипов содержит 128 ГБ памяти с совокупной пропускной способностью 40 ПБ/с. Стойка обеспечивает 315 PFLOPS вычислений FP8 с задержкой между чипами 350 нс в жидкостном охлаждении MGX, совместимом с Vera Rubin, и масштабируется более чем на 1000 LPU. Хранение весов модели в SRAM вместо потоковой передачи из HBM устраняет задержку доступа к памяти, которая доминирует при декодировании одного токена. В конструкции отсутствуют кэши, предсказание переходов и внеочередное исполнение; вместо этого используется полностью детерминированный конвейер, который компилятор планирует с точностью до такта. Архитектура напрямую происходит от Tensor Streaming Processor, который Groq, основанная бывшим инженером Google TPU Джонатаном Россом, описала в статье ISCA 2020 года под названием Think Fast.
Статус производства
Игорь Арсовски, ныне вице-президент Nvidia по аппаратному обеспечению, заявил, что стойка уже запущена в производство на базе чипа LP30, полученного Nvidia в результате сделки с Groq на 20 млрд долларов в декабре 2025 года. Эта же сделка вытеснила Rubin CPX, который она заменила, из дорожной карты Nvidia. Gemma 4 31B — плотная модель, достаточно малая, чтобы поместиться в одной стойке LPX, а картина в масштабе триллионных параметров mixture-of-experts, где основным ограничением становится ёмкость памяти, осталась без ответа.
6 источников
Nvidia представила стойку Groq 3 LPX и независимый бенчмарк на 3431 токен/с



