Семейство моделей

DeepSeek V4

Обновлено 17.09.2026

Коротко

DeepSeek V4 — серия открытых моделей DeepSeek. В ней V4-Pro (по заявлению автора 1,6 трлн параметров, 49 млрд активных) и V4-Flash (284 млрд, 13 млрд активных), обе с контекстом до 1 млн токенов; веса распространяются по лицензии MIT. 10 сентября 2026 года добавилась мультимодальная V4.1-Flash. Одной видеокарты для них не хватит — даже у младшей V4-Flash файлы весов занимают около 160 ГБ. Для работы на одной видеокарте подходят дистилляты DeepSeek-R1 размером от 1,5 до 70 млрд параметров.

Паспорт серии

Разработчик
deepseek-ai[1]
Лицензия
MIT — и код, и веса[5]
Контекст
1 048 576 токенов[3]
Доступ к весам
открытый, без заявки[2]
Самая новая модель
V4.1-Flash, 10.09.2026[8]
Прогон Modelium
не проводился

Размер файлов весов

V4-Flash
159,6 ГБ · расчёт · сумма файлов .safetensors[2]
V4.1-Flash
510,3 ГБ · расчёт · сумма файлов .safetensors[8]
V4-Pro
864,7 ГБ · расчёт · сумма файлов .safetensors[6]
DeepSeek-R1
688,6 ГБ · расчёт · сумма файлов .safetensors[11]

Мы это не запускали. Размеры, параметры и команды взяты из файлов и карточек репозиториев Hugging Face на 17 сентября 2026 года, у каждого указана ревизия. Результаты тестов — заявления автора, Modelium их не воспроизводил.

Что входит в серию

На 17 сентября 2026 года у организации deepseek-ai на Hugging Face десять репозиториев с «V4» в имени [1]. Отдельного репозитория «DeepSeek-V4» без суффикса нет — серия состоит из вариантов.

Модель Параметры: всего и активных, по карточке Тензоров в файлах, по API Файлы весов Тип
DeepSeek-V4-Flash 284 млрд, 13 млрд [5] 290,9 млрд [2] 159,6 ГБ [2] текст
DeepSeek-V4-Pro 1,6 трлн, 49 млрд [5] 1 598,8 млрд [6] 864,7 ГБ [6] текст
DeepSeek-V4.1-Flash 552 млрд основы; 8 млрд на чтении запроса, 16 млрд на генерации [9] 763,2 млрд [8] 510,3 ГБ [8] текст и изображения

Первые две модели появились 22 апреля 2026 года и обновлялись 22 июня [2] [6]; авторы называют их предварительной версией серии — «a preview version of DeepSeek-V4 series» [5]. V4.1-Flash выложена 10 сентября 2026 года [8].

Остальные репозитории серии: базовые версии без дообучения (V4-Flash-Base, V4-Pro-Base), датированные сборки V4-Flash-0731 и V4-Pro-0813, варианты DSpark и экспериментальная V4-Flash-Vision-Exp [1].

«V4 Pro Max» и «V4 Flash Max» — не отдельные модели. Так карточка называет режим максимального усилия рассуждения у V4-Pro и V4-Flash: «the maximum reasoning effort mode» [5].

Про расхождение у V4.1-Flash. Карточка называет 552 млрд параметров основы и отдельно 196 млрд параметров памяти Engram [9], а в файлах репозитория API насчитывает 763,2 млрд [8]. Мы приводим оба числа и не сводим их в одно.

Сколько памяти нужно

Размер файлов весов — нижняя граница: столько памяти нужно только для того, чтобы загрузить модель в той точности, в какой она выложена. Поверх неё идут кэш контекста и служебные расходы программы запуска. Считали мы просто — сложили размеры всех файлов .safetensors в репозитории по данным API.

  • V4-Flash — 159,6 ГБ [2]. Авторская инструкция запуска рассчитана на четыре ускорителя: MP=4 [4].
  • V4-Pro — 864,7 ГБ [6]. В авторской инструкции — восемь ускорителей: MP=8 [7].
  • V4.1-Flash — 510,3 ГБ [8].

Это серверный класс, а не настольный. Сколько памяти потребуется сверх весов при вашем окне контекста, мы не измеряли.

Контекст

В config.json и у V4-Flash, и у V4-Pro значение max_position_embeddings равно 1 048 576 токенов [3]. Карточка говорит то же словами: обе модели поддерживают контекст в один миллион токенов [5]. Для режима максимального рассуждения авторы советуют окно не меньше 384 тыс. токенов [5].

Авторы также заявляют, что на контексте в миллион токенов V4-Pro требует 27 % вычислений на токен и 10 % кэша контекста от того, что нужно DeepSeek-V3.2 [5]. Это заявление автора.

Лицензия

В репозиториях V4-Pro, V4-Flash и V4.1-Flash лежит файл LICENSE с текстом лицензии MIT [10]; отдельного файла с лицензией на веса в них нет [6]. Карточка формулирует это одной фразой: «This repository and the model weights are licensed under the MIT License» [5]. Текст MIT разрешает использовать, изменять, распространять и продавать копии при сохранении уведомления об авторских правах [10]. Юридическую оценку для вашего случая мы не даём.

Как запускают — по инструкции автора

Авторская инструкция состоит из двух шагов: конвертация весов под нужное число ускорителей и запуск генерации [7].

export EXPERTS=384   # у V4-Flash — 256
export MP=8          # у V4-Flash — 4
export CONFIG=config.json
python convert.py --hf-ckpt-path ${HF_CKPT_PATH} --save-path ${SAVE_PATH} --n-experts ${EXPERTS} --model-parallel ${MP}
torchrun --nproc-per-node ${MP} generate.py --ckpt-path ${SAVE_PATH} --config ${CONFIG} --interactive

Значения для V4-Flash — из её собственной инструкции [4]. По карточке веса выложены в смешанной точности FP4 + FP8 [5]; чтобы работать целиком в FP8, авторы советуют убрать "expert_dtype": "fp4" из config.json и передать --expert-dtype fp8 при конвертации [7]. Рекомендуемые параметры генерации — temperature = 1.0, top_p = 1.0 [5].

Что автор заявляет о качестве

Это цифры из карточек моделей. Они получены автором в режиме максимального усилия рассуждения; независимой проверки у нас нет, и на ваших задачах результат может быть другим.

Тест V4-Pro, режим Max [5] V4.1-Flash, режим Max [9]
GPQA Diamond, Pass@1 90,1 90,9
Codeforces, рейтинг 3206 3471
MMLU-Pro, EM 87,5
LiveCodeBench, Pass@1 93,5
SWE Verified, Resolved 80,6
Terminal-Bench 2.1, Pass@1 90,6

Прочерк значит, что мы не выписывали это значение из карточки, а не что теста не было.

Если нужна модель для одной видеокарты

Большие модели DeepSeek на одну видеокарту не помещаются, и это касается не только V4: у DeepSeek-R1 файлы весов занимают 688,6 ГБ [11]. Для небольших машин автор выложил дистилляты R1 — плотные модели, дообученные на ответах R1 [12]:

Дистиллят На какой модели основан
DeepSeek-R1-Distill-Qwen-1.5B Qwen2.5-Math-1.5B
DeepSeek-R1-Distill-Qwen-7B Qwen2.5-Math-7B
DeepSeek-R1-Distill-Llama-8B Llama-3.1-8B
DeepSeek-R1-Distill-Qwen-14B Qwen2.5-14B
DeepSeek-R1-Distill-Qwen-32B Qwen2.5-32B
DeepSeek-R1-Distill-Llama-70B Llama-3.3-70B-Instruct

Для них в карточке есть готовая команда запуска через vLLM: vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager [12].

Лицензия у дистиллятов сложнее, чем метка в репозитории. Сам R1 распространяется по MIT, но карточка отдельно оговаривает: дистилляты на Qwen2.5 изначально лицензированы по Apache 2.0, дистиллят на Llama-3.1-8B — по лицензии llama3.1, на Llama-3.3-70B — по лицензии llama3.3 [12]. Для коммерческого использования моделей на основе Llama читайте именно эти лицензии.

В Ollama. Для дистиллятов R1 в библиотеке Ollama есть готовые теги с такими размерами файлов: deepseek-r1:1.5b — 1,1 ГБ, 7b — 4,7 ГБ, 8b — 5,2 ГБ, 14b — 9,0 ГБ, 32b — 20 ГБ, 70b — 43 ГБ; полная 671b — 404 ГБ [14]. Модель deepseek-v4-flash в библиотеке тоже есть, но только с тегом cloud — она выполняется в облаке Ollama, а не на вашей машине [15].

У самого R1 карточка указывает контекст 128 тыс. токенов [12], а в config.json значение max_position_embeddings равно 163 840 [13]. Приводим оба.

Чего на этой странице нет

Нет скорости генерации, стоимости и качества на русском языке: собственных замеров у Modelium нет. Нет и совета «какую модель взять» — он зависит от задачи, и для него нужна проверка на ваших данных.

Источники

  1. Hugging Face API — репозитории deepseek-ai с «V4» в имени. Получено 17.09.2026.
  2. Hugging Face API — deepseek-ai/DeepSeek-V4-Flash, метаданные и файлы. Получено 17.09.2026, ревизия 60d8d70770c6.
  3. DeepSeek-V4-Flash — config.json. Получено 17.09.2026, ревизия 60d8d70770c6.
  4. DeepSeek-V4-Flash — инструкция запуска (inference/README.md). Получено 17.09.2026, ревизия 60d8d70770c6.
  5. DeepSeek-V4-Pro — карточка модели (README.md). Получено 17.09.2026, ревизия b5968e9190ef.
  6. Hugging Face API — deepseek-ai/DeepSeek-V4-Pro, метаданные и файлы. Получено 17.09.2026, ревизия b5968e9190ef.
  7. DeepSeek-V4-Pro — инструкция запуска (inference/README.md). Получено 17.09.2026, ревизия b5968e9190ef.
  8. Hugging Face API — deepseek-ai/DeepSeek-V4.1-Flash, метаданные и файлы. Получено 17.09.2026, ревизия dba1be0a40aa.
  9. DeepSeek-V4.1-Flash — карточка модели (README.md). Получено 17.09.2026, ревизия dba1be0a40aa.
  10. DeepSeek-V4-Pro — файл LICENSE. Получено 17.09.2026, ревизия b5968e9190ef.
  11. Hugging Face API — deepseek-ai/DeepSeek-R1, метаданные и файлы. Получено 17.09.2026, ревизия 56d4cbbb4d29.
  12. DeepSeek-R1 — карточка модели (README.md). Получено 17.09.2026, ревизия 56d4cbbb4d29.
  13. DeepSeek-R1 — config.json. Получено 17.09.2026, ревизия 56d4cbbb4d29.
  14. Библиотека Ollama — deepseek-r1. Получено 17.09.2026.
  15. Библиотека Ollama — deepseek-v4-flash. Получено 17.09.2026.

Следующий шаг

Если нужна модель на одной видеокарте, начните с инструмента запуска и дистиллятов R1.

Как запускать модели у себя