Семейство моделей

Qwen 3.8

Обновлено 17.09.2026

Коротко

Qwen 3.8 — семейство моделей команды Qwen, выложенное на Hugging Face в августе 2026 года. Открытых вариантов три — Qwen3.8-27B, Qwen3.8-Flash-Next и Qwen3.8-2.4T-A95B, которую собственная карточка называет Qwen3.8-Max. На одной видеокарте реально запускать только 27B. Её веса занимают 55,6 ГБ в исходной точности и 30,9 ГБ в FP8, а сторонние сборки GGUF начинаются примерно с 19 ГБ за Q4_K_M. Лицензии разные — Apache 2.0 только у 27B.

Паспорт Qwen3.8-27B

Репозиторий
Qwen/Qwen3.8-27B[2]
Лицензия
Apache 2.0[2]
Параметров в файлах
27,78 млрд[2]
Что принимает
текст и изображения[2]
Контекст
262 144 токена[3]
Доступ к весам
открытый, без заявки[2]
Прогон Modelium
не проводился

Размер файлов весов

27B, исходная точность BF16
55,6 ГБ · расчёт · сумма файлов .safetensors[2]
27B, FP8
30,9 ГБ · расчёт · сумма файлов .safetensors[5]
27B, GGUF Q8_0
28,6 ГБ · сторонняя сборка ggml-org[12]
27B, GGUF Q4_K_M
19,0 ГБ · сторонняя сборка ggml-org[12]
Flash-Next, BF16 и FP8
360,0 и 185,5 ГБ · расчёт · сумма файлов .safetensors[6]
2.4T-A95B, BF16 и FP8
4 892 и 2 496 ГБ · расчёт · сумма файлов .safetensors[8]

Мы это не запускали. Размеры, параметры и условия лицензий взяты из файлов и карточек репозиториев Hugging Face на 17 сентября 2026 года, у каждого указана ревизия. Результаты тестов — заявления автора, Modelium их не воспроизводил.

Что входит в семейство

На 17 сентября 2026 года у организации Qwen на Hugging Face шесть репозиториев с «3.8» в имени: три модели и их версии в точности FP8 [1]. Все открыты для скачивания без заявки.

Модель Параметров в файлах Файлы весов Что принимает Лицензия Создан
Qwen3.8-27B 27,78 млрд [2] 55,6 ГБ; FP8 — 30,9 ГБ [2] [5] текст и изображения Apache 2.0 05.08.2026
Qwen3.8-Flash-Next 180,0 млрд [6] 360,0 ГБ; FP8 — 185,5 ГБ [6] текст и изображения Qwen Community License 1.0 24.08.2026
Qwen3.8-2.4T-A95B 2 446 млрд [8] 4 892 ГБ; FP8 — 2 496 ГБ [8] текст Qwen3.8-Max License 08.08.2026

Карточки описывают состав так. Qwen3.8-27B — плотная модель на 27 млрд параметров [4]. Qwen3.8-2.4T-A95B — модель со смесью экспертов: 2,4 трлн параметров всего и 95 млрд активных на токен, 512 экспертов [9]. Qwen3.8-Flash-Next — 125 млрд параметров при 6 млрд активных, плюс 51 млрд в n-граммных эмбеддингах и 4 млрд в модуле MTP [7].

Где Max, Plus и Flash

Люди ищут «qwen 3.8 max», «plus» и «flash», но репозиториев с такими именами нет. Вот что есть на самом деле.

  • Max — это Qwen3.8-2.4T-A95B. В имени репозитория слова «Max» нет, но так модель называет её собственная карточка, а файл лицензии озаглавлен «Qwen3.8-Max License» [9] [10]. Прямой фразы «этот репозиторий и есть Qwen3.8-Max» в карточке нет — это вывод из трёх совпадающих признаков.
  • Flash — это Qwen3.8-Flash-Next. Карточка называет её экспериментальным показом архитектуры, на которой будет построен Qwen4: «experimental preview of the architecture that will underpin Qwen4» [7].
  • Plus — открытых весов нет. Репозитория с «Plus» в имени у организации Qwen на Hugging Face на дату проверки не найдено [1].

Сколько памяти нужно

Размер файлов весов — нижняя граница: столько памяти уходит только на загрузку модели. Поверх неё идут кэш контекста и служебные расходы программы запуска. Считали просто — сложили размеры файлов весов по данным API.

Для одной видеокарты или рабочей станции из всего семейства подходит только Qwen3.8-27B:

Вариант Файлы весов Откуда
BF16, исходная точность 55,6 ГБ официальный репозиторий [2]
FP8 30,9 ГБ официальный репозиторий [5]
GGUF Q8_0 28,6 ГБ сторонняя сборка ggml-org [12]
GGUF Q4_K_M 19,0 ГБ сторонняя сборка ggml-org [12]
GGUF от Q2 до Q3 9,8–13,2 ГБ сторонняя сборка unsloth [13]

Чтобы модель понимала изображения, к GGUF нужен ещё отдельный файл проектора mmproj — от 0,6 до 0,9 ГБ [12].

Flash-Next и 2.4T-A95B — серверный класс: 185,5 ГБ и 2 496 ГБ даже в FP8 [6] [8]. Как сильно падает качество ответов на низких квантизациях, мы не измеряли.

GGUF, Ollama и LM Studio

Официальных GGUF для версии 3.8 нет. Среди 54 GGUF-репозиториев организации Qwen ни один не относится к семейству 3.8 [15]. В карточках трёх моделей GGUF, llama.cpp и Ollama не упоминаются [4].

Зато есть сторонние сборки. По числу скачиваний на 17 сентября 2026 года первыми идут unsloth/Qwen3.8-27B-GGUF, затем несколько вариантов со снятыми ограничениями, lmstudio-community/Qwen3.8-27B-GGUF и ggml-org/Qwen3.8-27B-GGUF [14]. Все они помечены как квантизации Qwen/Qwen3.8-27B и наследуют лицензию Apache 2.0 [14]. Это сборки третьих лиц: за их содержимое команда Qwen не отвечает, и мы их не проверяли.

В библиотеке Ollama модель есть. Теги — qwen3.8:27b и qwen3.8:27b-mlx; размер — 18 ГБ, окно контекста — 256 тыс. токенов, на входе текст и изображения [16].

Контекст

В config.json у всех трёх моделей max_position_embeddings равно 262 144 токена [3]. Карточка Qwen3.8-27B заявляет больше: «262,144 natively and extensible up to 1,000,000 tokens» — расширение делается методом YaRN, и для него в карточке приведены команды для vLLM, SGLang и TokenSpeed [4].

Лицензии — три разные

Это самое важное для коммерческого использования, и тут легко ошибиться: у одного семейства три лицензии.

  • Qwen3.8-27B и её FP8-версия — Apache 2.0 [2].
  • Qwen3.8-2.4T-A95B — «Qwen3.8-Max License» [10]. Текст разрешает использовать, изменять, распространять, продавать и дообучать модель, но с двумя условиями. Если у вашего продукта больше 100 млн активных пользователей в месяц или выручка больше 20 млн долларов в месяц — нужно показывать название модели. Если вы ведёте бизнес «модель как услуга» или «ИИ-помощник для работы» и совокупная выручка превышает 50 млн долларов за 12 месяцев — нужна отдельная лицензия [10].
  • Qwen3.8-Flash-Next — «Qwen Community License 1.0» [11]. Порог про 100 млн пользователей и 20 млн долларов тот же, но отдельная лицензия для бизнеса «модель как услуга» и «ИИ-помощник для работы» требуется без порога выручки [11].

В обеих лицензиях второе условие не касается внутреннего использования, при котором сама модель, её ответы и возможности недоступны третьим лицам [10] [11]. «Модель как услуга» лицензии определяют как доступ третьих лиц к инференсу или дообучению модели, например через API.

Это пересказ условий своими словами, а не юридическое заключение. Перед коммерческим использованием прочитайте сам текст лицензии — ссылки в источниках.

Как запускают — по карточке автора

Карточка Qwen3.8-27B называет совместимые средства: «compatible with Hugging Face Transformers, vLLM, SGLang, TokenSpeed» — и для рабочих нагрузок советует отдельные движки: SGLang, vLLM или TokenSpeed [4]. У Flash-Next в списке рекомендованных есть ещё KTransformers [7]. Минимальная версия библиотеки transformers в карточках не указана.

Режим рассуждения у моделей включён по умолчанию, а карточки дают разные параметры генерации для режима рассуждения и обычного ответа [4].

Русский язык

Списка поддерживаемых языков в карточках нет, поле языков в метаданных всех шести репозиториев пустое [2]. Поддержка русского не заявлена и не опровергнута. Качество на русском мы не проверяли.

Что автор заявляет о качестве

Цифры из карточек моделей. Их получил сам автор; таблицы в разных карточках сравнивают модель с разными соперниками и в разных условиях, поэтому сопоставлять строки между собой нужно осторожно. На ваших задачах результат может быть другим.

Тест 27B [4] Flash-Next [7] 2.4T-A95B [9]
GPQA Diamond 89,2 91,7 92,6
SWE-bench Pro 61,7 62,5 67,7
Terminal Bench 2.1 73,0 86,6
LiveCodeBench v6 90,3 91,9
HLE 30,8 43,6

Прочерк значит, что мы не выписывали это значение, а не что теста не было.

Чего на этой странице нет

Нет скорости генерации, сравнения квантизаций по качеству и оценки на русском языке — собственных замеров у Modelium нет. Нет и совета «брать или не брать»: он зависит от вашей задачи и требует проверки на ваших данных.

Источники

  1. Hugging Face API — репозитории Qwen с «3.8» в имени. Получено 17.09.2026.
  2. Hugging Face API — Qwen/Qwen3.8-27B, метаданные и файлы. Получено 17.09.2026, ревизия 1d4bf0f2ff60.
  3. Qwen3.8-27B — config.json. Получено 17.09.2026, ревизия 1d4bf0f2ff60.
  4. Qwen3.8-27B — карточка модели (README.md). Получено 17.09.2026, ревизия 1d4bf0f2ff60.
  5. Hugging Face API — Qwen/Qwen3.8-27B-FP8, метаданные и файлы. Получено 17.09.2026, ревизия 017b9c7af6b5.
  6. Hugging Face API — Qwen/Qwen3.8-Flash-Next и Flash-Next-FP8, метаданные и файлы — FP8-версия — репозиторий Qwen/Qwen3.8-Flash-Next-FP8, ревизия 236dfdf28582. Получено 17.09.2026, ревизия de4b8e4d43b9.
  7. Qwen3.8-Flash-Next — карточка модели (README.md). Получено 17.09.2026, ревизия de4b8e4d43b9.
  8. Hugging Face API — Qwen/Qwen3.8-2.4T-A95B и 2.4T-A95B-FP8, метаданные и файлы — FP8-версия — репозиторий Qwen/Qwen3.8-2.4T-A95B-FP8, ревизия d2dc35658bcf. Получено 17.09.2026, ревизия 207bd685a7e3.
  9. Qwen3.8-2.4T-A95B — карточка модели (README.md). Получено 17.09.2026, ревизия 207bd685a7e3.
  10. Qwen3.8-2.4T-A95B — файл LICENSE («Qwen3.8-Max License»). Получено 17.09.2026, ревизия 207bd685a7e3.
  11. Qwen3.8-Flash-Next — файл LICENSE («Qwen Community License 1.0»). Получено 17.09.2026, ревизия de4b8e4d43b9.
  12. Hugging Face API — ggml-org/Qwen3.8-27B-GGUF, файлы и размеры — сторонняя сборка, не от команды Qwen. Получено 17.09.2026, ревизия 0669b98607d4.
  13. Hugging Face API — unsloth/Qwen3.8-27B-GGUF, файлы и размеры — сторонняя сборка, не от команды Qwen. Получено 17.09.2026, ревизия 4ca720788d1e.
  14. Hugging Face API — поиск GGUF-сборок Qwen3.8-27B по числу скачиваний. Получено 17.09.2026.
  15. Hugging Face API — GGUF-репозитории организации Qwen. Получено 17.09.2026.
  16. Библиотека Ollama — qwen3.8. Получено 17.09.2026.

Следующий шаг

Для Qwen3.8-27B в библиотеке Ollama есть готовый тег. Установка, видеокарты и память — на странице инструмента.

Как запустить через Ollama