Четверг, 24 сентября 2026 г.

Документы · Руководство

Ollama для работы с текстами: локальный запуск, облачные модели и приватность по официальной документации

Как установить Ollama, чем локальные модели отличаются от облачных Ollama Cloud, что заявляет вендор о конфиденциальности, как включить режим «только локально» и почему контекстное окно по умолчанию 4096 токенов важно при работе с длинными документами.

Иллюстрация к статье «Ollama для работы с текстами: локальный запуск, облачные модели и приватность по официальной документации» с сайта ISMARTANJI CREATIONS
Изображение: ISMARTANJI CREATIONS. Источник: ismartanji.com.

Когда в работе встречаются чувствительные тексты — черновики договоров, внутренние отчёты, персональные данные, — возникает вопрос: куда именно уходит текст, который вы вставляете в запрос к ИИ. Ollama — инструмент, позволяющий запускать языковые модели на собственном компьютере, и его официальная документация даёт достаточно конкретных ответов, чтобы разобрать этот вопрос без маркетинговых формулировок.

В этом материале — только факты из документации Ollama (quickstart и FAQ), по состоянию на момент её прочтения. Заявления о приватности — это слова самого поставщика о собственных практиках, и мы приводим их именно в таком качестве: их стоит воспринимать как отправную точку, а не как независимую проверку.

Установка и первый запуск

По официальному quickstart, установка выглядит так:

Иллюстрация к разделу «Установка и первый запуск» с сайта RobWillis.info
Изображение: RobWillis.info. Источник: www.robwillis.info.
  • Скачайте Ollama для macOS, Windows или Linux и откройте приложение.
  • Следуйте подсказкам установки; чтобы использовать облачные модели, нужно войти в аккаунт, а для локальной модели вход не требуется.
  • Запустите модель командой «ollama run gemma4:e2b» — Ollama скачает модель и начнёт чат на вашем компьютере; выход из чата — команда «/bye».
  • Загрузка модели gemma4:e2b занимает около 7,2 ГБ; вендор рекомендует 8 ГБ доступной видеопамяти (или объединённой памяти на Mac). При меньшем объёме Ollama может использовать системную RAM, но ответы могут быть медленнее.

Требования к железу — это практическое ограничение, о котором стоит помнить заранее: локальный запуск работает настолько хорошо, насколько хватает памяти на вашей машине, и с ростом контекстного окна потребность в памяти растёт.

Локальные и облачные модели: два разных сценария

Ollama поддерживает оба варианта. Локальная модель выполняется на вашем компьютере и, по формулировке quickstart, не требует API-ключа. Облачные модели (Ollama Cloud) вызываются с API-ключом, причём, как указано в документации, для облачных запросов установка Ollama не требуется; совместимость с OpenAI и Anthropic покрывает лишь часть оригинального API.

Для работы с документами выбор сводится к компромиссу: локальная модель означает, что текст не покидает машину (в пределах того, что заявляет вендор), но требует памяти и, возможно, будет медленнее; облачная модель снимает ограничения железа, но текст передаётся сервису. Документация описывает, что именно при этом происходит с данными.

Что вендор заявляет о приватности

В FAQ Ollama даёт прямое заявление: «Ollama runs locally. We don’t see your prompts or data when you run locally» — при локальном запуске вендор не видит ваши промпты и данные. Для облачных моделей сказано другое: компания обрабатывает промпты и ответы, чтобы предоставлять сервис, но, по её заявлению, не хранит и не логирует это содержимое и не обучает на нём модели. Дополнительно вендор сообщает, что собирает базовую информацию об аккаунте и ограниченные метаданные использования, не включающие содержимое промптов и ответов, и что данные не продаются.

Это заявление поставщика о собственных практиках: его можно принять во внимание, но для по-настоящему чувствительных документов самый надёжный вариант — не полагаться на обещания облака, а вообще не отправлять текст наружу. Именно для такого случая в документации есть отдельная настройка.

Режим «только локально»

Ollama можно перевести в режим, в котором облачные функции отключены. Согласно FAQ, при этом теряется доступ к облачным моделям и веб-поиску. Включается он двумя способами:

Иллюстрация к разделу «Режим «только локально»» с сайта GitHub
Изображение: GitHub. Источник: github.com.
  • Установить «disable_ollama_cloud»: true в файле ~/.ollama/server.json.
  • Либо задать переменную окружения OLLAMA_NO_CLOUD=1.
  • После изменения конфигурации нужно перезапустить Ollama; в логах появится строка «Ollama cloud disabled: true», по которой видно, что режим действует.

Дополнительный штрих: по умолчанию Ollama слушает только адрес 127.0.0.1 на порту 11434, то есть сервис не доступен из сети, пока вы сами не измените адрес привязки через переменную OLLAMA_HOST. Для сценария «работаю с документами на своём ноутбуке» это значит, что типовая конфигурация не открывает доступ к вашим запросам другим устройствам в сети.

Контекстное окно: почему 4096 токенов — это мало для документов

По умолчанию Ollama использует контекстное окно 4096 токенов. Для чата с короткими вопросами этого достаточно, но при работе с отчётами и длинными документами окно легко переполнить: модель в такой ситуации может терять начало текста. Окно можно изменить несколькими способами, описанными в FAQ.

  • Переменной окружения OLLAMA_CONTEXT_LENGTH при запуске сервера (например, OLLAMA_CONTEXT_LENGTH=8192 ollama serve).
  • В интерактивном чате — командой «/set parameter num_ctx 4096» с нужным значением.
  • Через API — параметром num_ctx в запросе.

Учтите, что большее окно требует больше памяти — это прямо сказано и в quickstart применительно к локальному запуску. Конкретные значения подбираются под объём ваших документов и доступную память; универсальной цифры в документации нет.

Как проверить результат самостоятельно

После настройки убедитесь, что система ведёт себя так, как вы ожидаете. Во-первых, после включения режима «только локально» перезапустите Ollama и найдите в логах строку «Ollama cloud disabled: true». Во-вторых, попробуйте задать модели вопрос о содержимом вашего документа локально и проверьте, что ответы формируются без обращения к сети — например, гипотетически можно временно отключить интернет и убедиться, что локальный запрос всё равно работает. В-третьих, если вы работаете через облачную модель, перечитайте актуальную версию FAQ и условий сервиса: заявления о хранении и обучении на данных относятся к моменту их публикации и могут меняться. Наконец, фактические требования к памяти проверяйте на своей машине: скачайте модель, увеличьте окно до нужного размера и посмотрите, хватает ли ресурсов.

Источники

  1. FAQ - Ollama documentation
  2. Quickstart - Ollama documentation

Материал подготовлен по перечисленным источникам и проверен редакцией. Заметили неточность? Напишите нам: исправления вносятся с сохранением адреса и даты.