Инструмент запуска

Ollama

Обновлено 17.09.2026

Коротко

Ollama — открытая программа (лицензия MIT) для запуска языковых моделей на своём компьютере или сервере. Одной командой она скачивает модель и поднимает локальный API на порту 11434. Работает на macOS, Windows, Linux и в Docker, ускоряется на видеокартах NVIDIA, AMD и на Apple Silicon, а без видеокарты считает на процессоре. Общей таблицы «сколько памяти нужно» в её документации нет — ориентиром служит размер файла модели.

Паспорт

Лицензия
MIT[1]
Последняя версия
v0.34.1 от 14.09.2026[2]
Адрес API по умолчанию
127.0.0.1:11434[6]
Формат весов
GGUF[10]
Совместимость с OpenAI API
частичная · заявление автора[9]

Поддержка железа

NVIDIA
compute capability 5.0+, драйвер 550+[4]
AMD
драйвер ROCm v7, Linux и Windows[4]
Apple
ускорение через Metal; macOS 14+[14]
Windows
10 22H2 или новее[15]
Без видеокарты
работает в оперативной памяти, медленнее · заявление автора[13]

Мы это не запускали. Команды и требования ниже приведены по официальной документации Ollama на 17 сентября 2026 года. Modelium не проверял их на своём оборудовании и не измерял скорость.

Что это

Сами авторы описывают проект так: «Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other models» [1]. По сути Ollama делает три вещи: скачивает готовую модель из своей библиотеки, загружает её в память компьютера и открывает локальный API, к которому подключаются чат, редактор кода или ваша программа.

Код открыт под лицензией MIT [1]. Последний выпуск на дату проверки — v0.34.1, опубликован 14 сентября 2026 года [2].

Установка

Система Команда или требование
macOS и Linux curl -fsSL https://ollama.com/install.sh | sh [3]
Windows (PowerShell) irm https://ollama.com/install.ps1 | iex [3]
Docker, только процессор docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama [5]
Docker, видеокарта NVIDIA docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama [5]
Docker, видеокарта AMD docker run -d --device /dev/kfd --device /dev/dri -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama:rocm [5]

Требования к системе: macOS Sonoma (14) или новее [14], Windows 10 22H2 или новее [15]. В Docker Desktop на macOS ускорение на видеокарте недоступно — только процессор [6].

Поддержка видеокарт

  • NVIDIA — видеокарты с compute capability 5.0 и выше и драйвером версии 550 и новее. Для карт с compute capability от 5.0 до 6.2 нужен драйвер 570 или новее [4].
  • AMD — нужен драйвер ROCm v7, на Linux и на Windows [4].
  • Apple — ускорение через Metal [4].

Если видеопамяти не хватает, Ollama задействует оперативную память, но ответы становятся медленнее — так сказано в быстром старте [13]. Как разложилась загруженная модель, показывает команда ollama ps: значение 100% CPU означает, что модель целиком лежит в оперативной памяти [6].

Какие модели доступны

Модели берутся из библиотеки Ollama. На 17 сентября 2026 года страница библиотеки ссылается на 240 моделей; первыми на ней стоят llama3.1, deepseek-r1, nomic-embed-text, llama3.2, gemma3, qwen2.5, qwen3, mistral, gemma2 и llama3 [16].

Конкретная сборка выбирается тегом: сначала имя модели, после двоеточия — размер, вариант и квантизация. Примеры со страницы тегов llama3.1: llama3.1:8b, llama3.1:70b, llama3.1:8b-instruct-q4_K_M, llama3.1:8b-instruct-q5_0 [17]. Чем ниже разрядность квантизации (q2, q3, q4), тем меньше файл и тем меньше памяти нужно — ценой качества ответа.

Сколько памяти нужно

Общей таблицы «модель такого-то размера требует столько-то памяти» в документации Ollama нет: на дату проверки её нет ни в README, ни в вопросах и ответах, ни в разделе о железе, ни в быстром старте. Опор три.

  1. Пример из быстрого старта. Для модели gemma4:e2b скачивание занимает около 7,2 ГБ, и авторы рекомендуют 8 ГБ свободной видеопамяти или общей памяти на Mac. Там же сказано, что большее окно контекста требует больше памяти [13].
  2. Параллельные запросы. Потребность в памяти растёт пропорционально произведению OLLAMA_NUM_PARALLEL на OLLAMA_CONTEXT_LENGTH [6]. По умолчанию это один запрос и окно в 4096 токенов [6].
  3. Фактическая загрузка. ollama ps показывает размер загруженной модели и долю, попавшую на видеокарту [6].

Отсюда практическое чтение — наше, не из документации: смотрите на размер файла выбранного тега. Он должен поместиться в видеопамять с запасом на контекст; если не помещается, модель заработает в оперативной памяти, но медленно.

Основные команды

Команда Что делает
ollama run gemma4 скачивает модель при первом вызове и открывает диалог [7]
ollama pull gemma4 только скачивает модель [7]
ollama ls список скачанных моделей [7]
ollama ps модели, загруженные в память сейчас [7]
ollama create -f Modelfile собирает свою модель по описанию [7]
ollama serve запускает сервер без окна приложения [7]

В актуальной справке список моделей выводит именно ollama ls: формы ollama list в ней нет [7].

API

Сервер слушает адрес 127.0.0.1:11434 [6]. Собственный API находится по адресу http://localhost:11434/api, совместимый с OpenAI — по адресу http://localhost:11434/v1 [8].

Адрес Назначение
POST /api/generate продолжение текста [10]
POST /api/chat диалог [10]
POST /api/embed эмбеддинги; прежний /api/embeddings помечен как заменённый [10]

Совместимость с OpenAI авторы называют частичной: «Ollama supports a subset of the OpenAI API» [9]. Значит, программу, написанную под OpenAI, можно переключить на локальную модель заменой адреса, но не все возможности API будут доступны.

Свои модели, GGUF и квантизация

Ollama работает с весами в формате GGUF [10]. Модель можно собрать из другой модели, из каталога safetensors или из файлов GGUF [10]. Описание сборки хранится в файле Modelfile — «the blueprint to create and share customized models using Ollama» [12].

Важная деталь: при импорте GGUF Ollama сама модель не квантует. Квантизацию нужно выполнить заранее сторонним инструментом, например llama-quantize из llama.cpp [11].

Отдельно настраивается квантизация кэша контекста — переменная OLLAMA_KV_CACHE_TYPE, по умолчанию f16 [6]. Это другой механизм, не квантизация весов модели.

Настройки для работы в компании

Переменная Что задаёт По умолчанию
OLLAMA_HOST адрес и порт сервера [6] 127.0.0.1:11434
OLLAMA_MODELS каталог хранения моделей [6]
OLLAMA_KEEP_ALIVE сколько модель остаётся в памяти после запроса [6] 5 минут
OLLAMA_NUM_PARALLEL число параллельных запросов на модель [6] 1
OLLAMA_MAX_LOADED_MODELS сколько моделей загружено одновременно [6] 3 на каждую видеокарту, 3 на процессоре
OLLAMA_MAX_QUEUE длина очереди запросов [6] 512
OLLAMA_CONTEXT_LENGTH окно контекста [6] 4096 токенов
OLLAMA_ORIGINS сайты, которым разрешён доступ из браузера [6] только 127.0.0.1 и 0.0.0.0
HTTPS_PROXY прокси для скачивания моделей [6]

По умолчанию сервер доступен только с той же машины. Чтобы открыть его в сети, меняют OLLAMA_HOST — например, на 0.0.0.0:11434 [6]. Учтите, что локальные запросы ключа не требуют: «Cloud requests need an API key. Local requests do not» [8]. Поэтому открытый в сеть порт доступен всем, кто до него дотянется; сама документация предлагает выставлять сервер через прокси вроде Nginx [6].

Данные и работа без интернета

Заявление авторов: «Ollama runs locally. We don't see your prompts or data when you run locally» [6]. Это их слова; независимой проверки мы не проводили.

В Ollama есть и облачные модели. Их можно отключить совсем: переменной OLLAMA_NO_CLOUD=1 или настройкой disable_ollama_cloud в файле ~/.ollama/server.json [6]. Для контура, где данные не должны уходить наружу, это первая настройка, которую стоит проверить. Интернет после этого нужен только чтобы скачать модель; за прокси помогает HTTPS_PROXY [6].

Чего на этой странице нет

Мы не сравниваем Ollama с другими инструментами и не приводим скорость генерации: собственных замеров у Modelium нет, а чужие зависят от модели, квантизации и железа. Нет здесь и списка «лучших моделей для Ollama» — состав библиотеки меняется, актуальный список есть на её странице.

Источники

  1. GitHub API — метаданные репозитория ollama/ollama. Получено 17.09.2026.
  2. GitHub API — последний выпуск ollama/ollama. Получено 17.09.2026.
  3. ollama/ollama — README, ветка main. Получено 17.09.2026.
  4. Документация Ollama — поддержка железа (docs/gpu.mdx). Получено 17.09.2026.
  5. Документация Ollama — Docker (docs/docker.mdx). Получено 17.09.2026.
  6. Документация Ollama — вопросы и ответы (docs/faq.mdx). Получено 17.09.2026.
  7. Документация Ollama — команды (docs/cli.mdx). Получено 17.09.2026.
  8. Документация Ollama — введение в API (docs/api/introduction.mdx). Получено 17.09.2026.
  9. Документация Ollama — совместимость с OpenAI (docs/api/openai-compatibility.mdx). Получено 17.09.2026.
  10. Документация Ollama — справочник API (docs/api.md) — файл помечен авторами как переезжающий на docs.ollama.com/api. Получено 17.09.2026.
  11. Документация Ollama — импорт моделей (docs/import.mdx). Получено 17.09.2026.
  12. Документация Ollama — Modelfile (docs/modelfile.mdx). Получено 17.09.2026.
  13. Документация Ollama — быстрый старт (docs/quickstart.mdx). Получено 17.09.2026.
  14. Документация Ollama — macOS (docs/macos.mdx). Получено 17.09.2026.
  15. Документация Ollama — Windows (docs/windows.mdx). Получено 17.09.2026.
  16. Библиотека моделей Ollama — страница получена без выполнения скриптов; порядок карточек в браузере может отличаться. Получено 17.09.2026.
  17. Библиотека Ollama — теги модели llama3.1. Получено 17.09.2026.

Следующий шаг

Инструмент — половина дела. Посмотрите паспорта моделей: размер, лицензию и то, что известно о запуске.

Выбрать модель