Alibaba представила Qwen3.8-Flash-Next с открытыми весами и она уже обходит Claude Opus 4.6 Max сразу в нескольких тестах.
Это ещё не полноценная Qwen4, а раннее превью её архитектуры.
125 млрд параметров основной модели плюс 51 млрд параметров n-граммных представлений, при этом на каждый токен активируется всего 6 млрд параметров.
Обучение обошлось примерно в 9 раз дешевле Qwen3.7-Plus, но в программировании и офисных задачах модель оказалась сильнее.
Основные результаты:
• SWE-bench Pro — 62,5 против 53,4 у Claude Opus 4.6 Max
• SWE-bench Multilingual — 81,0
• CoWorkBench — 73,9
• JobBench — 55,7
• Toolathlon — 73,5
• LiveCodeBench — 91,9
• GPQA Diamond — 91,7
• IFBench — 81,3
Нативный контекст 256K токенов, через YaRN расширяется до 1 млн.
На контексте в 1 млн токенов предварительная обработка ускоряется до 7,6 раза, а генерация — до 4,9 раза.
Всего 6 млрд активных параметров на токен, а уровень уже сопоставим с Opus в агентских задачах и программировании.
Совсем скоро модель появится через API, по цене $0,16 за 1 млн входных токенов и $0,47 за 1 млн выходных.😈