mimile
Басты бетке

Z.ai мен Alibaba бір күн айырмашылықпен дерлік бірдей MoE модельдерін шығарды

ЖИ-дайджест

Материал бірнеше дереккөз негізінде жасанды интеллектпен дайындалды — түпнұсқаларға сілтемелер төменде.

Z.ai мен Alibaba бір күн айырмашылықпен дерлік бірдей MoE модельдерін шығарды

Z.ai GLM-5.3-Flash мультимодальды MoE моделін шығарды, оның 320B параметрі бар, ал Alibaba Qwen4-тің алдын алатын 125B параметрлі Qwen3.8-Flash-Next моделін бір күн айырмашылықпен таныстырды. Екі модель де 3:1 қатынасындағы сызықтық және толық назар аудару гибридіне, 2048 токен лимиті бар қысылған контекст индексаторына және Muon оптимизаторына тәуелсіз түрде қол жеткізді. GLM-5.3-Flash миллион кіріс токені үшін $0.15 тұрады, ал Qwen3.8-Flash-Next Qwen3.7-Plus-қа қарағанда шамамен тоғыз есе аз есептеуді қажет етті.

Негізгі фактілер

  • GLM-5.3-Flash — 320B параметрі бар, 18B белсенді параметрі бар мультимодальды MoE моделі, Hugging Face-те MIT лицензиясымен шығарылды.
  • Qwen3.8-Flash-Next — 125B параметрі бар, 6B белсенді параметрі бар модель, Qwen4 архитектурасын алдын алады және 51B қосымша n-грамм кестесін қамтиды.
  • Екі модель де 3:1 қатынасындағы сызықтық және толық назар аудару гибридін, 2048 токен лимиті бар қысылған контекст индексаторын және Muon оптимизаторын пайдаланады.
  • GLM-5.3-Flash 30T токеннен тұратын мультимодальды корпуста оқытылды және 1M токендік контекст терезесін қолдайды.
  • Qwen3.8-Flash-Next 262 144 токендік табиғи контекст терезесіне ие, оны YaRN арқылы 1M-ге дейін кеңейтуге болады, және Qwen3.7-Plus-қа қарағанда шамамен тоғыз есе аз есептеуді қажет етті.

Екі релиз

GLM-5.3-Flash — GLM-5 сериясындағы алғашқы табиғи мультимодальды модель, Hugging Face-те MIT лицензиясымен шығарылды. Z.ai оны OpenRouter-де Ox Alpha ретінде анонимді түрде сынады, онда ол аптаның ең танымал моделі болды. Z.ai модель GLM-5.2-ден бенчмарктер бойынша асып түседі және бағасы он есе төмен, кодтау және агенттік сценарийлерде Claude Opus 4.8-ге жақындайды деп мәлімдейді. Бағасы миллион кіріс токені үшін $0.15 және миллион шығыс токені үшін $0.50 құрайды. Qwen3.8-Flash-Next Qwen3-Next-тің Qwen3.5 үшін атқарған рөлін атқарады: келесі архитектуралар отбасының ерте жария алдын ала көрінісі.

Конвергентті архитектуралық шешімдер

GLM-5.3-Flash жарияланған конфигурацияға сәйкес 45 қабаттан тұрады: 34 сызықтық назар аудару қабаты және 11 толық назар аудару қабаты. Qwen3.8-Flash-Next vLLM рецептіне сәйкес 3 Gated DeltaNet қабаты мен 1 Qwen Sparse Attention қабатынан тұратын қайталанатын блокта 48 қабаттан тұрады. Екі модель де сызықтық және толық назар аудару қабаттары арасындағы 3:1 қатынасына келеді. Сызықтық қабаттар бүкіл тарихты тұрақты өлшемді рекуррентті күйге қысады, контекст ұзындығына қарамастан токенге есептеуді тұрақты етіп сақтайды. GLM Moonshot AI-дің Kimi Linear-інде ұсынылған Kimi Delta Attention (KDA) пайдаланады, ал Qwen бас деңгейінде гейтингі бар өзінің Gated DeltaNet (GDN) пайдаланады.

1 дереккөз

Z.ai мен Alibaba бір күн айырмашылықпен дерлік бірдей MoE модельдерін шығарды