Инструмент запуска
Ollama
Коротко
Ollama — открытая программа (лицензия MIT) для запуска языковых моделей на своём компьютере или сервере. Одной командой она скачивает модель и поднимает локальный API на порту 11434. Работает на macOS, Windows, Linux и в Docker, ускоряется на видеокартах NVIDIA, AMD и на Apple Silicon, а без видеокарты считает на процессоре. Общей таблицы «сколько памяти нужно» в её документации нет — ориентиром служит размер файла модели.
Мы это не запускали. Команды и требования ниже приведены по официальной документации Ollama на 17 сентября 2026 года. Modelium не проверял их на своём оборудовании и не измерял скорость.
Что это
Сами авторы описывают проект так: «Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other models» [1]. По сути Ollama делает три вещи: скачивает готовую модель из своей библиотеки, загружает её в память компьютера и открывает локальный API, к которому подключаются чат, редактор кода или ваша программа.
Код открыт под лицензией MIT [1]. Последний выпуск на дату проверки — v0.34.1, опубликован 14 сентября 2026 года [2].
Установка
| Система | Команда или требование |
|---|---|
| macOS и Linux | curl -fsSL https://ollama.com/install.sh | sh [3] |
| Windows (PowerShell) | irm https://ollama.com/install.ps1 | iex [3] |
| Docker, только процессор | docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama [5] |
| Docker, видеокарта NVIDIA | docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama [5] |
| Docker, видеокарта AMD | docker run -d --device /dev/kfd --device /dev/dri -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama:rocm [5] |
Требования к системе: macOS Sonoma (14) или новее [14], Windows 10 22H2 или новее [15]. В Docker Desktop на macOS ускорение на видеокарте недоступно — только процессор [6].
Поддержка видеокарт
- NVIDIA — видеокарты с compute capability 5.0 и выше и драйвером версии 550 и новее. Для карт с compute capability от 5.0 до 6.2 нужен драйвер 570 или новее [4].
- AMD — нужен драйвер ROCm v7, на Linux и на Windows [4].
- Apple — ускорение через Metal [4].
Если видеопамяти не хватает, Ollama задействует оперативную память, но ответы становятся медленнее — так сказано в быстром старте [13]. Как разложилась загруженная модель, показывает команда ollama ps: значение 100% CPU означает, что модель целиком лежит в оперативной памяти [6].
Какие модели доступны
Модели берутся из библиотеки Ollama. На 17 сентября 2026 года страница библиотеки ссылается на 240 моделей; первыми на ней стоят llama3.1, deepseek-r1, nomic-embed-text, llama3.2, gemma3, qwen2.5, qwen3, mistral, gemma2 и llama3 [16].
Конкретная сборка выбирается тегом: сначала имя модели, после двоеточия — размер, вариант и квантизация. Примеры со страницы тегов llama3.1: llama3.1:8b, llama3.1:70b, llama3.1:8b-instruct-q4_K_M, llama3.1:8b-instruct-q5_0 [17]. Чем ниже разрядность квантизации (q2, q3, q4), тем меньше файл и тем меньше памяти нужно — ценой качества ответа.
Сколько памяти нужно
Общей таблицы «модель такого-то размера требует столько-то памяти» в документации Ollama нет: на дату проверки её нет ни в README, ни в вопросах и ответах, ни в разделе о железе, ни в быстром старте. Опор три.
- Пример из быстрого старта. Для модели
gemma4:e2bскачивание занимает около 7,2 ГБ, и авторы рекомендуют 8 ГБ свободной видеопамяти или общей памяти на Mac. Там же сказано, что большее окно контекста требует больше памяти [13]. - Параллельные запросы. Потребность в памяти растёт пропорционально произведению
OLLAMA_NUM_PARALLELнаOLLAMA_CONTEXT_LENGTH[6]. По умолчанию это один запрос и окно в 4096 токенов [6]. - Фактическая загрузка.
ollama psпоказывает размер загруженной модели и долю, попавшую на видеокарту [6].
Отсюда практическое чтение — наше, не из документации: смотрите на размер файла выбранного тега. Он должен поместиться в видеопамять с запасом на контекст; если не помещается, модель заработает в оперативной памяти, но медленно.
Основные команды
| Команда | Что делает |
|---|---|
ollama run gemma4 |
скачивает модель при первом вызове и открывает диалог [7] |
ollama pull gemma4 |
только скачивает модель [7] |
ollama ls |
список скачанных моделей [7] |
ollama ps |
модели, загруженные в память сейчас [7] |
ollama create -f Modelfile |
собирает свою модель по описанию [7] |
ollama serve |
запускает сервер без окна приложения [7] |
В актуальной справке список моделей выводит именно ollama ls: формы ollama list в ней нет [7].
API
Сервер слушает адрес 127.0.0.1:11434 [6]. Собственный API находится по адресу http://localhost:11434/api, совместимый с OpenAI — по адресу http://localhost:11434/v1 [8].
| Адрес | Назначение |
|---|---|
POST /api/generate |
продолжение текста [10] |
POST /api/chat |
диалог [10] |
POST /api/embed |
эмбеддинги; прежний /api/embeddings помечен как заменённый [10] |
Совместимость с OpenAI авторы называют частичной: «Ollama supports a subset of the OpenAI API» [9]. Значит, программу, написанную под OpenAI, можно переключить на локальную модель заменой адреса, но не все возможности API будут доступны.
Свои модели, GGUF и квантизация
Ollama работает с весами в формате GGUF [10]. Модель можно собрать из другой модели, из каталога safetensors или из файлов GGUF [10]. Описание сборки хранится в файле Modelfile — «the blueprint to create and share customized models using Ollama» [12].
Важная деталь: при импорте GGUF Ollama сама модель не квантует. Квантизацию нужно выполнить заранее сторонним инструментом, например llama-quantize из llama.cpp [11].
Отдельно настраивается квантизация кэша контекста — переменная OLLAMA_KV_CACHE_TYPE, по умолчанию f16 [6]. Это другой механизм, не квантизация весов модели.
Настройки для работы в компании
| Переменная | Что задаёт | По умолчанию |
|---|---|---|
OLLAMA_HOST |
адрес и порт сервера [6] | 127.0.0.1:11434 |
OLLAMA_MODELS |
каталог хранения моделей [6] | — |
OLLAMA_KEEP_ALIVE |
сколько модель остаётся в памяти после запроса [6] | 5 минут |
OLLAMA_NUM_PARALLEL |
число параллельных запросов на модель [6] | 1 |
OLLAMA_MAX_LOADED_MODELS |
сколько моделей загружено одновременно [6] | 3 на каждую видеокарту, 3 на процессоре |
OLLAMA_MAX_QUEUE |
длина очереди запросов [6] | 512 |
OLLAMA_CONTEXT_LENGTH |
окно контекста [6] | 4096 токенов |
OLLAMA_ORIGINS |
сайты, которым разрешён доступ из браузера [6] | только 127.0.0.1 и 0.0.0.0 |
HTTPS_PROXY |
прокси для скачивания моделей [6] | — |
По умолчанию сервер доступен только с той же машины. Чтобы открыть его в сети, меняют OLLAMA_HOST — например, на 0.0.0.0:11434 [6]. Учтите, что локальные запросы ключа не требуют: «Cloud requests need an API key. Local requests do not» [8]. Поэтому открытый в сеть порт доступен всем, кто до него дотянется; сама документация предлагает выставлять сервер через прокси вроде Nginx [6].
Данные и работа без интернета
Заявление авторов: «Ollama runs locally. We don't see your prompts or data when you run locally» [6]. Это их слова; независимой проверки мы не проводили.
В Ollama есть и облачные модели. Их можно отключить совсем: переменной OLLAMA_NO_CLOUD=1 или настройкой disable_ollama_cloud в файле ~/.ollama/server.json [6]. Для контура, где данные не должны уходить наружу, это первая настройка, которую стоит проверить. Интернет после этого нужен только чтобы скачать модель; за прокси помогает HTTPS_PROXY [6].
Чего на этой странице нет
Мы не сравниваем Ollama с другими инструментами и не приводим скорость генерации: собственных замеров у Modelium нет, а чужие зависят от модели, квантизации и железа. Нет здесь и списка «лучших моделей для Ollama» — состав библиотеки меняется, актуальный список есть на её странице.
Связанное
Источники
- GitHub API — метаданные репозитория ollama/ollama. Получено 17.09.2026.
- GitHub API — последний выпуск ollama/ollama. Получено 17.09.2026.
- ollama/ollama — README, ветка main. Получено 17.09.2026.
- Документация Ollama — поддержка железа (docs/gpu.mdx). Получено 17.09.2026.
- Документация Ollama — Docker (docs/docker.mdx). Получено 17.09.2026.
- Документация Ollama — вопросы и ответы (docs/faq.mdx). Получено 17.09.2026.
- Документация Ollama — команды (docs/cli.mdx). Получено 17.09.2026.
- Документация Ollama — введение в API (docs/api/introduction.mdx). Получено 17.09.2026.
- Документация Ollama — совместимость с OpenAI (docs/api/openai-compatibility.mdx). Получено 17.09.2026.
- Документация Ollama — справочник API (docs/api.md) — файл помечен авторами как переезжающий на docs.ollama.com/api. Получено 17.09.2026.
- Документация Ollama — импорт моделей (docs/import.mdx). Получено 17.09.2026.
- Документация Ollama — Modelfile (docs/modelfile.mdx). Получено 17.09.2026.
- Документация Ollama — быстрый старт (docs/quickstart.mdx). Получено 17.09.2026.
- Документация Ollama — macOS (docs/macos.mdx). Получено 17.09.2026.
- Документация Ollama — Windows (docs/windows.mdx). Получено 17.09.2026.
- Библиотека моделей Ollama — страница получена без выполнения скриптов; порядок карточек в браузере может отличаться. Получено 17.09.2026.
- Библиотека Ollama — теги модели llama3.1. Получено 17.09.2026.
Следующий шаг
Инструмент — половина дела. Посмотрите паспорта моделей: размер, лицензию и то, что известно о запуске.
Выбрать модель