mimile
На главную

Z.ai и Alibaba выпустили почти идентичные MoE-модели с разницей в день

AI-дайджест

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Z.ai и Alibaba выпустили почти идентичные MoE-модели с разницей в день

Z.ai выпустила GLM-5.3-Flash, мультимодальную MoE-модель на 320B параметров, а Alibaba — Qwen3.8-Flash-Next, модель на 125B, предваряющую Qwen4, с разницей в один день. Обе модели независимо пришли к гибриду линейного и полного внимания в соотношении 3:1, сжатому индексатору контекста с лимитом 2048 токенов и оптимизатору Muon. GLM-5.3-Flash стоит $0.15 за миллион входных токенов, а Qwen3.8-Flash-Next потребовала примерно в девять раз меньше вычислений, чем Qwen3.7-Plus.

Ключевые факты

  • GLM-5.3-Flash — мультимодальная MoE-модель на 320B параметров с 18B активными параметрами, выпущенная под лицензией MIT на Hugging Face.
  • Qwen3.8-Flash-Next — модель на 125B параметров с 6B активными параметрами, предваряющая архитектуру Qwen4 и включающая дополнительную таблицу n-грамм на 51B.
  • Обе модели используют гибрид линейного и полного внимания в соотношении 3:1, сжатый индексатор контекста с лимитом 2048 токенов и оптимизатор Muon.
  • GLM-5.3-Flash обучена на мультимодальном корпусе из 30T токенов и поддерживает контекстное окно в 1M токенов.
  • Qwen3.8-Flash-Next имеет нативное контекстное окно 262 144 токена, расширяемое до 1M с помощью YaRN, и потребовала примерно в девять раз меньше вычислений, чем Qwen3.7-Plus.

Два релиза

GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5, выпущенная под лицензией MIT на Hugging Face. Z.ai тестировала её анонимно как Ox Alpha на OpenRouter, где она стала самой популярной моделью недели. Z.ai заявляет, что модель превосходит GLM-5.2 по бенчмаркам при цене в десять раз ниже, приближаясь к Claude Opus 4.8 в задачах кодирования и агентных сценариях. Цена составляет $0.15 за миллион входных токенов и $0.50 за миллион выходных токенов. Qwen3.8-Flash-Next играет ту же роль, что Qwen3-Next для Qwen3.5: ранний публичный предпросмотр следующего семейства архитектур.

Конвергентные архитектурные решения

GLM-5.3-Flash содержит 45 слоёв: 34 слоя линейного внимания и 11 слоёв полного внимания, согласно опубликованной конфигурации. Qwen3.8-Flash-Next содержит 48 слоёв в повторяющемся блоке из 3 слоёв Gated DeltaNet и 1 слоя Qwen Sparse Attention, согласно рецепту vLLM. Обе модели приходят к одному и тому же соотношению 3:1 между линейными и полными слоями внимания. Линейные слои сжимают всю историю в рекуррентное состояние фиксированного размера, сохраняя вычисления на токен постоянными независимо от длины контекста. GLM использует Kimi Delta Attention (KDA), представленную в Kimi Linear от Moonshot AI, а Qwen — собственный Gated DeltaNet (GDN) с гейтингом на уровне голов.

1 источник

Z.ai и Alibaba выпустили почти идентичные MoE-модели с разницей в день