Семейство моделей
Qwen 3.8
Коротко
Qwen 3.8 — семейство моделей команды Qwen, выложенное на Hugging Face в августе 2026 года. Открытых вариантов три — Qwen3.8-27B, Qwen3.8-Flash-Next и Qwen3.8-2.4T-A95B, которую собственная карточка называет Qwen3.8-Max. На одной видеокарте реально запускать только 27B. Её веса занимают 55,6 ГБ в исходной точности и 30,9 ГБ в FP8, а сторонние сборки GGUF начинаются примерно с 19 ГБ за Q4_K_M. Лицензии разные — Apache 2.0 только у 27B.
Размер файлов весов
- 27B, исходная точность BF16
- 55,6 ГБ · расчёт · сумма файлов .safetensors[2]
- 27B, FP8
- 30,9 ГБ · расчёт · сумма файлов .safetensors[5]
- 27B, GGUF Q8_0
- 28,6 ГБ · сторонняя сборка ggml-org[12]
- 27B, GGUF Q4_K_M
- 19,0 ГБ · сторонняя сборка ggml-org[12]
- Flash-Next, BF16 и FP8
- 360,0 и 185,5 ГБ · расчёт · сумма файлов .safetensors[6]
- 2.4T-A95B, BF16 и FP8
- 4 892 и 2 496 ГБ · расчёт · сумма файлов .safetensors[8]
Мы это не запускали. Размеры, параметры и условия лицензий взяты из файлов и карточек репозиториев Hugging Face на 17 сентября 2026 года, у каждого указана ревизия. Результаты тестов — заявления автора, Modelium их не воспроизводил.
Что входит в семейство
На 17 сентября 2026 года у организации Qwen на Hugging Face шесть репозиториев с «3.8» в имени: три модели и их версии в точности FP8 [1]. Все открыты для скачивания без заявки.
| Модель | Параметров в файлах | Файлы весов | Что принимает | Лицензия | Создан |
|---|---|---|---|---|---|
| Qwen3.8-27B | 27,78 млрд [2] | 55,6 ГБ; FP8 — 30,9 ГБ [2] [5] | текст и изображения | Apache 2.0 | 05.08.2026 |
| Qwen3.8-Flash-Next | 180,0 млрд [6] | 360,0 ГБ; FP8 — 185,5 ГБ [6] | текст и изображения | Qwen Community License 1.0 | 24.08.2026 |
| Qwen3.8-2.4T-A95B | 2 446 млрд [8] | 4 892 ГБ; FP8 — 2 496 ГБ [8] | текст | Qwen3.8-Max License | 08.08.2026 |
Карточки описывают состав так. Qwen3.8-27B — плотная модель на 27 млрд параметров [4]. Qwen3.8-2.4T-A95B — модель со смесью экспертов: 2,4 трлн параметров всего и 95 млрд активных на токен, 512 экспертов [9]. Qwen3.8-Flash-Next — 125 млрд параметров при 6 млрд активных, плюс 51 млрд в n-граммных эмбеддингах и 4 млрд в модуле MTP [7].
Где Max, Plus и Flash
Люди ищут «qwen 3.8 max», «plus» и «flash», но репозиториев с такими именами нет. Вот что есть на самом деле.
- Max — это Qwen3.8-2.4T-A95B. В имени репозитория слова «Max» нет, но так модель называет её собственная карточка, а файл лицензии озаглавлен «Qwen3.8-Max License» [9] [10]. Прямой фразы «этот репозиторий и есть Qwen3.8-Max» в карточке нет — это вывод из трёх совпадающих признаков.
- Flash — это Qwen3.8-Flash-Next. Карточка называет её экспериментальным показом архитектуры, на которой будет построен Qwen4: «experimental preview of the architecture that will underpin Qwen4» [7].
- Plus — открытых весов нет. Репозитория с «Plus» в имени у организации Qwen на Hugging Face на дату проверки не найдено [1].
Сколько памяти нужно
Размер файлов весов — нижняя граница: столько памяти уходит только на загрузку модели. Поверх неё идут кэш контекста и служебные расходы программы запуска. Считали просто — сложили размеры файлов весов по данным API.
Для одной видеокарты или рабочей станции из всего семейства подходит только Qwen3.8-27B:
| Вариант | Файлы весов | Откуда |
|---|---|---|
| BF16, исходная точность | 55,6 ГБ | официальный репозиторий [2] |
| FP8 | 30,9 ГБ | официальный репозиторий [5] |
| GGUF Q8_0 | 28,6 ГБ | сторонняя сборка ggml-org [12] |
| GGUF Q4_K_M | 19,0 ГБ | сторонняя сборка ggml-org [12] |
| GGUF от Q2 до Q3 | 9,8–13,2 ГБ | сторонняя сборка unsloth [13] |
Чтобы модель понимала изображения, к GGUF нужен ещё отдельный файл проектора mmproj — от 0,6 до 0,9 ГБ [12].
Flash-Next и 2.4T-A95B — серверный класс: 185,5 ГБ и 2 496 ГБ даже в FP8 [6] [8]. Как сильно падает качество ответов на низких квантизациях, мы не измеряли.
GGUF, Ollama и LM Studio
Официальных GGUF для версии 3.8 нет. Среди 54 GGUF-репозиториев организации Qwen ни один не относится к семейству 3.8 [15]. В карточках трёх моделей GGUF, llama.cpp и Ollama не упоминаются [4].
Зато есть сторонние сборки. По числу скачиваний на 17 сентября 2026 года первыми идут unsloth/Qwen3.8-27B-GGUF, затем несколько вариантов со снятыми ограничениями, lmstudio-community/Qwen3.8-27B-GGUF и ggml-org/Qwen3.8-27B-GGUF [14]. Все они помечены как квантизации Qwen/Qwen3.8-27B и наследуют лицензию Apache 2.0 [14]. Это сборки третьих лиц: за их содержимое команда Qwen не отвечает, и мы их не проверяли.
В библиотеке Ollama модель есть. Теги — qwen3.8:27b и qwen3.8:27b-mlx; размер — 18 ГБ, окно контекста — 256 тыс. токенов, на входе текст и изображения [16].
Контекст
В config.json у всех трёх моделей max_position_embeddings равно 262 144 токена [3]. Карточка Qwen3.8-27B заявляет больше: «262,144 natively and extensible up to 1,000,000 tokens» — расширение делается методом YaRN, и для него в карточке приведены команды для vLLM, SGLang и TokenSpeed [4].
Лицензии — три разные
Это самое важное для коммерческого использования, и тут легко ошибиться: у одного семейства три лицензии.
- Qwen3.8-27B и её FP8-версия — Apache 2.0 [2].
- Qwen3.8-2.4T-A95B — «Qwen3.8-Max License» [10]. Текст разрешает использовать, изменять, распространять, продавать и дообучать модель, но с двумя условиями. Если у вашего продукта больше 100 млн активных пользователей в месяц или выручка больше 20 млн долларов в месяц — нужно показывать название модели. Если вы ведёте бизнес «модель как услуга» или «ИИ-помощник для работы» и совокупная выручка превышает 50 млн долларов за 12 месяцев — нужна отдельная лицензия [10].
- Qwen3.8-Flash-Next — «Qwen Community License 1.0» [11]. Порог про 100 млн пользователей и 20 млн долларов тот же, но отдельная лицензия для бизнеса «модель как услуга» и «ИИ-помощник для работы» требуется без порога выручки [11].
В обеих лицензиях второе условие не касается внутреннего использования, при котором сама модель, её ответы и возможности недоступны третьим лицам [10] [11]. «Модель как услуга» лицензии определяют как доступ третьих лиц к инференсу или дообучению модели, например через API.
Это пересказ условий своими словами, а не юридическое заключение. Перед коммерческим использованием прочитайте сам текст лицензии — ссылки в источниках.
Как запускают — по карточке автора
Карточка Qwen3.8-27B называет совместимые средства: «compatible with Hugging Face Transformers, vLLM, SGLang, TokenSpeed» — и для рабочих нагрузок советует отдельные движки: SGLang, vLLM или TokenSpeed [4]. У Flash-Next в списке рекомендованных есть ещё KTransformers [7]. Минимальная версия библиотеки transformers в карточках не указана.
Режим рассуждения у моделей включён по умолчанию, а карточки дают разные параметры генерации для режима рассуждения и обычного ответа [4].
Русский язык
Списка поддерживаемых языков в карточках нет, поле языков в метаданных всех шести репозиториев пустое [2]. Поддержка русского не заявлена и не опровергнута. Качество на русском мы не проверяли.
Что автор заявляет о качестве
Цифры из карточек моделей. Их получил сам автор; таблицы в разных карточках сравнивают модель с разными соперниками и в разных условиях, поэтому сопоставлять строки между собой нужно осторожно. На ваших задачах результат может быть другим.
| Тест | 27B [4] | Flash-Next [7] | 2.4T-A95B [9] |
|---|---|---|---|
| GPQA Diamond | 89,2 | 91,7 | 92,6 |
| SWE-bench Pro | 61,7 | 62,5 | 67,7 |
| Terminal Bench 2.1 | 73,0 | — | 86,6 |
| LiveCodeBench v6 | 90,3 | 91,9 | — |
| HLE | 30,8 | — | 43,6 |
Прочерк значит, что мы не выписывали это значение, а не что теста не было.
Чего на этой странице нет
Нет скорости генерации, сравнения квантизаций по качеству и оценки на русском языке — собственных замеров у Modelium нет. Нет и совета «брать или не брать»: он зависит от вашей задачи и требует проверки на ваших данных.
Связанное
Источники
- Hugging Face API — репозитории Qwen с «3.8» в имени. Получено 17.09.2026.
- Hugging Face API — Qwen/Qwen3.8-27B, метаданные и файлы. Получено 17.09.2026, ревизия
1d4bf0f2ff60. - Qwen3.8-27B — config.json. Получено 17.09.2026, ревизия
1d4bf0f2ff60. - Qwen3.8-27B — карточка модели (README.md). Получено 17.09.2026, ревизия
1d4bf0f2ff60. - Hugging Face API — Qwen/Qwen3.8-27B-FP8, метаданные и файлы. Получено 17.09.2026, ревизия
017b9c7af6b5. - Hugging Face API — Qwen/Qwen3.8-Flash-Next и Flash-Next-FP8, метаданные и файлы — FP8-версия — репозиторий Qwen/Qwen3.8-Flash-Next-FP8, ревизия 236dfdf28582. Получено 17.09.2026, ревизия
de4b8e4d43b9. - Qwen3.8-Flash-Next — карточка модели (README.md). Получено 17.09.2026, ревизия
de4b8e4d43b9. - Hugging Face API — Qwen/Qwen3.8-2.4T-A95B и 2.4T-A95B-FP8, метаданные и файлы — FP8-версия — репозиторий Qwen/Qwen3.8-2.4T-A95B-FP8, ревизия d2dc35658bcf. Получено 17.09.2026, ревизия
207bd685a7e3. - Qwen3.8-2.4T-A95B — карточка модели (README.md). Получено 17.09.2026, ревизия
207bd685a7e3. - Qwen3.8-2.4T-A95B — файл LICENSE («Qwen3.8-Max License»). Получено 17.09.2026, ревизия
207bd685a7e3. - Qwen3.8-Flash-Next — файл LICENSE («Qwen Community License 1.0»). Получено 17.09.2026, ревизия
de4b8e4d43b9. - Hugging Face API — ggml-org/Qwen3.8-27B-GGUF, файлы и размеры — сторонняя сборка, не от команды Qwen. Получено 17.09.2026, ревизия
0669b98607d4. - Hugging Face API — unsloth/Qwen3.8-27B-GGUF, файлы и размеры — сторонняя сборка, не от команды Qwen. Получено 17.09.2026, ревизия
4ca720788d1e. - Hugging Face API — поиск GGUF-сборок Qwen3.8-27B по числу скачиваний. Получено 17.09.2026.
- Hugging Face API — GGUF-репозитории организации Qwen. Получено 17.09.2026.
- Библиотека Ollama — qwen3.8. Получено 17.09.2026.
Следующий шаг
Для Qwen3.8-27B в библиотеке Ollama есть готовый тег. Установка, видеокарты и память — на странице инструмента.
Как запустить через Ollama