mimile
Басты бетке

Nvidia Groq 3 LPX сөресін және 3431 токен/с тәуелсіз бенчмаркін таныстырды

ЖИ-дайджест

Материал бірнеше дереккөз негізінде жасанды интеллектпен дайындалды — түпнұсқаларға сілтемелер төменде.

Nvidia Groq 3 LPX сөресін және 3431 токен/с тәуелсіз бенчмаркін таныстырды

Nvidia Hot Chips 2026 көрмесінде Groq 3 LPX инференс сөресін таныстырып, Gemma 4 31B моделінде 100K контекстпен секундына 3431 шығыс токенін көрсететін тәуелсіз бенчмарк жариялады. Сөре Groq-пен 20 млрд долларлық мәміле нәтижесінде алынған LP30 чипі негізінде өндіріске енгізілген. Көрсеткіш ең жақын жария эндпоинттен шамамен төрт есе жоғары, дегенмен салыстыру жеке алдын ала шығарылым эндпоинтінде бір реттік сұраныстармен жүргізілді.

Негізгі фактілер

  • Artificial Analysis Groq 3 LPX сөресінің өнімділігін Gemma 4 31B моделінде 100K контекстпен секундына 3431 шығыс токені деңгейінде өлшеді.
  • Ең жақын жария эндпоинт секундына 870 токен көрсетті, яғни LPX сөресі шамамен төрт есе жылдамырақ.
  • Nvidia-ның сахнадағы демонстрациясы сол модельде секундына 10 996 токен көрсетті, бірақ Nvidia аппараттық қамтамасыз ету жөніндегі вице-президенті Игорь Арсовски бұл дербес бағалау екенін атап өтті.
  • Әрбір LP30 чипі шамамен 500 МБ кірістірілген SRAM алып жүреді және HBM жоқ, сондықтан 256 чиптен тұратын толық LPX сөресінде 128 ГБ жады және 40 ПБ/с жиынтық өткізу қабілеті бар.
  • LPX сөресі Vera Rubin-мен үйлесімді MGX сұйықтық салқындатуында чиптер арасындағы 350 нс кідіріспен 315 PFLOPS FP8 есептеу қуатын қамтамасыз етеді.

Бенчмарк әдіснамасы

Artificial Analysis салыстыруды Google Cloud-та орналастырылған Gemma 4 31B жеке алдын ала шығарылым эндпоинтінде жүргізіп, параллелизм бір болғанда 50 дәйекті клиенттік сұраныстың медианасын алды. Салыстыру жүргізілген жария провайдерлер жалпы production serverless эндпоинттерін пайдаланды, сондықтан бір реттік сұраныс шарты жабдық көрсете алатын пайдаланушыға шаққандағы ең жоғары жылдамдықты береді. Nvidia-ның сахнадағы демонстрациясы сол 31B моделінде секундына 10 996 токен деген жоғары нәтиже көрсетті, оны Nvidia аппараттық қамтамасыз ету жөніндегі вице-президенті Игорь Арсовски дербес бағалау ретінде атап өтті. Арсовски аудиторияға мақсат — сенуге болатын тәуелсіз тексерілген бенчмарктер екенін айтты.

LP30 архитектурасы

Әрбір LP30 шамамен 500 МБ кірістірілген SRAM алып жүреді және HBM жоқ, сондықтан 256 чиптен тұратын толық LPX сөресінде 128 ГБ жады және 40 ПБ/с жиынтық өткізу қабілеті бар. Сөре Vera Rubin-мен үйлесімді MGX сұйықтық салқындатуында чиптер арасындағы 350 нс кідіріспен 315 PFLOPS FP8 есептеу қуатын қамтамасыз етеді және 1000-нан астам LPU-ға дейін масштабталады. Модель салмақтарын HBM-нен ағынмен жіберудің орнына SRAM-да сақтау бір токенді декодтау кезінде басым болатын жадыға қол жеткізу кідірісін жояды. Конструкцияда кэштер, тармақ болжау және ретсіз орындау жоқ; оның орнына компилятор такт дәлдігімен жоспарлайтын толық детерминирленген конвейер қолданылады. Архитектура тікелей Tensor Streaming Processor-ден шыққан, оны Google TPU бұрынғы инженері Джонатан Росс негізін қалаған Groq ISCA 2020 жылғы Think Fast атты мақаласында сипаттаған.

Өндіріс мәртебесі

Қазір Nvidia аппараттық қамтамасыз ету жөніндегі вице-президенті Игорь Арсовски сөре Nvidia 2025 жылғы желтоқсанда Groq-пен 20 млрд долларлық мәміле нәтижесінде алған LP30 чипі негізінде өндіріске енгізілгенін мәлімдеді. Дәл осы мәміле ол алмастырған Rubin CPX-ті Nvidia жол картасынан ығыстырды. Gemma 4 31B — бір LPX сөресіне сыйып кететіндей кішкентай тығыз модель, ал жады сыйымдылығы негізгі шектеуге айналатын триллиондық параметрлі mixture-of-experts масштабындағы жағдай жауапсыз қалды.

6 дереккөз

Nvidia Groq 3 LPX сөресін және 3431 токен/с тәуелсіз бенчмаркін таныстырды