mimile
Басты бетке

Alibaba Qwen Qwen3.8-Flash-Next шығарды — 125B MoE, 6B белсенді параметр

ЖИ-дайджест

Материал бірнеше дереккөз негізінде жасанды интеллектпен дайындалды — түпнұсқаларға сілтемелер төменде.

Alibaba Qwen Qwen3.8-Flash-Next шығарды — 125B MoE, 6B белсенді параметр

Alibaba-ның Qwen командасы Qwen3.8-Flash-Next ашық мультимодальды модельді шығарды, оның жалпы параметрлері 125 млрд, бір токенге белсендісі 6 млрд. Модель Qwen4 архитектурасының алдын ала көрінісі ретінде қызмет етеді және Qwen3.7-Plus оқыту құнының шамамен тоғыздан біріне жетеді. Ол гибридті назарды, gated residual, N-gram эмбеддингтерін және Muon оптимизаторын ұсынады.

Негізгі фактілер

  • Qwen3.8-Flash-Next жалпы параметрлері 125 млрд, оның ішінде бір токенге тек 6 млрд белсенді.
  • Модель жүйелік жадыда жұмыс істей алатын 51 млрд параметрлі N-gram эмбеддинг қабатын қамтиды.
  • Qwen командасының мәліметінше, оқыту құны Qwen3.7-Plus-қа қарағанда шамамен тоғыз есе төмен.
  • FP8 чекпойнті 172,78 ГиБ, ал BF16 — 335,28 ГиБ орын алады.
  • Өндірістік нұсқа Qwen3.8-Flash ретінде QwenCloud арқылы миллион кіріс токеніне $0,16 және миллион шығыс токеніне $0,47 бағамен шығады.

Архитектуралық инновациялар

Модель 125 млрд параметрлі негізді 51 млрд N-gram эмбеддинг кестесімен және 4 млрд бірнеше токенді болжау модулімен біріктіреді, дискіде барлығы 180 млрд. Әрбір төрт қабаттың үшеуі Gated DeltaNet — тарихты тұрақты өлшемді рекуррентті күйге сығатын сызықтық назар қабатын пайдаланады. Төртінші қабат Qwen Sparse Attention қолданады, ол контекстті микроблок деңгейінде 512 блок немесе 2048 токен бюджетімен таңдайды. Қалдық ағын 4 параллель тармаққа кеңейеді, әр тармақта поэлементтік оқу гейті және скалярлық жазу гейті бар, тар жердің рангі 320. N-gram эмбеддинг қабаты — 2-қабаттағы 20 000 000 жазбадан тұратын биграмм/триграмм кестесі, оны асинхронды алдын ала жүктеу арқылы хост жадына түсіруге болады.

Бенчмарк нәтижелері

Qwen DeepSWE 1.1-де 58,7, SWE-bench Pro-да 62,5 және SWE-bench Multilingual-де 81,0 көрсетеді. Агенттік тапсырмаларда модель CoWorkBench-те 73,9, JobBench-те 55,7 және Toolathlon Verified-те 73,5 жинайды. Мультимодальды нәтижелерге AndroidWorld-та 84,5, LVBench-те 76,6 және RealWorldQA-да 88,5 кіреді. Claude Opus 4.6 (Max) HLE-де 40,0-пен Qwen-нің 35,9-ынан алда, ал DeepSeek-V4-Flash-0731 NL2Repo-Bench-те 54,2-мен 48,1-ден алда.

Орналастыру талаптары

FP8 чекпойнті 172,78 ГиБ, ал BF16 — 335,28 ГиБ орын алады. vLLM рецепттеріне сәйкес, GB300-де TP2 — FP8 үшін тексерілген ең аз конфигурация, TP4 ұсынылады. 8×H200 түйінінде TEP8 қолданыңыз; қарапайым TP8 чекпойнттегі ені 128 кванттау блоктарымен үйлеспейді. Модель 262 144 токендік контекст терезесін табиғи қолдайды және YaRN арқылы бір миллион токенге дейін масштабтала алады. Салмақтар Hugging Face және ModelScope-та қолжетімді, техникалық есеп GitHub-та.

2 дереккөз

Alibaba Qwen Qwen3.8-Flash-Next шығарды — 125B MoE, 6B белсенді параметр