Alibaba Qwen выпускает Qwen3.8-Flash-Next — 125B MoE с 6B активными параметрами
Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Команда Qwen из Alibaba выпустила Qwen3.8-Flash-Next — открытую мультимодальную модель со смесью экспертов, имеющую 125 млрд общих параметров и 6 млрд активных на токен. Модель служит предварительным просмотром архитектуры Qwen4 и достигает примерно одной девятой стоимости обучения Qwen3.7-Plus. Она представляет гибридное внимание, gated residual, N-gram эмбеддинги и оптимизатор Muon.
Ключевые факты
- Qwen3.8-Flash-Next имеет 125 млрд общих параметров, из которых только 6 млрд активны на токен.
- Модель включает слой N-gram эмбеддингов на 51 млрд параметров, который может работать в системной памяти.
- Стоимость обучения примерно в девять раз ниже, чем у Qwen3.7-Plus, по данным команды Qwen.
- Чекпоинт FP8 занимает 172,78 ГиБ, а BF16 — 335,28 ГиБ.
- Производственная версия выходит как Qwen3.8-Flash через QwenCloud по цене $0,16 за миллион входных токенов и $0,47 за миллион выходных.
Архитектурные инновации
Модель сочетает основу на 125 млрд параметров с таблицей N-gram эмбеддингов на 51 млрд и модулем предсказания нескольких токенов на 4 млрд, всего 180 млрд на диске. Три из каждых четырёх слоёв используют Gated DeltaNet — слой линейного внимания, сжимающий историю в рекуррентное состояние фиксированного размера. Четвёртый слой использует Qwen Sparse Attention, который выбирает контекст на уровне микроблоков с бюджетом 512 блоков или 2048 токенов. Остаточный поток расширяется на 4 параллельные ветви с поэлементным gate чтения и скалярным gate записи на ветвь при ранге узкого места 320. Слой N-gram эмбеддингов — это таблица биграмм/триграмм на 20 000 000 записей на слое 2, которую можно выгружать в память хоста с асинхронной предвыборкой.
Результаты бенчмарков
Qwen сообщает 58,7 на DeepSWE 1.1, 62,5 на SWE-bench Pro и 81,0 на SWE-bench Multilingual. В агентных задачах модель набирает 73,9 на CoWorkBench, 55,7 на JobBench и 73,5 на Toolathlon Verified. Мультимодальные результаты включают 84,5 на AndroidWorld, 76,6 на LVBench и 88,5 на RealWorldQA. Claude Opus 4.6 (Max) лидирует на HLE с 40,0 против 35,9 у Qwen, а DeepSeek-V4-Flash-0731 лидирует на NL2Repo-Bench с 54,2 против 48,1.
Требования к развёртыванию
Чекпоинт FP8 занимает 172,78 ГиБ, а BF16 — 335,28 ГиБ. Согласно рецептам vLLM, TP2 — минимальная проверенная конфигурация FP8 на GB300, рекомендуется TP4. На узле 8×H200 используйте TEP8; обычный TP8 несовместим с блоками квантования шириной 128 в чекпоинте. Модель нативно поддерживает контекстное окно 262 144 токена и может масштабироваться до одного миллиона токенов с помощью YaRN. Веса доступны на Hugging Face и ModelScope, технический отчёт — на GitHub.
2 источника
Alibaba Qwen выпускает Qwen3.8-Flash-Next — 125B MoE с 6B активными параметрами



