Блог
Сколько RAM и диска нужно, чтобы крутить Ollama и Open WebUI на своём VPS, когда хватает CPU и когда уже пора смотреть GPU.
Локальная нейросеть на своём сервере — уже не эксперимент энтузиастов. В 2026 году так делают, чтобы не отдавать документы в чужой чат, не платить за каждый токен и не зависеть от того, что облачный API сегодня «временно недоступен в вашем регионе». На практике это почти всегда VPS с Ollama (или аналогом) и веб-интерфейсом вроде Open WebUI.
Ниже — сколько памяти закладывать под размер модели, чем CPU-инференс отличается от GPU и где смотреть VPS для ИИ.
«Поставить нейросеть» — слишком широкая формулировка. От задачи зависит тариф:
Для первого пункта хватает обычного VPS. Для картинок и комфортной скорости больших моделей — нет.
Веса модели должны помещаться в память. Если не помещаются, сервер начнёт свопиться, и ответ на один вопрос растянется на минуты.
Грубые ориентиры для квантованных моделей (Q4/Q5), плюс 2–4 ГБ на систему, контекст и Open WebUI:
Контекст тоже ест память. Длинный чат и большой num_ctx легко добавляют несколько гигабайт сверх веса модели. Если планируете скармливать модели договоры и переписки — берите запас, а не цифру «впритык».
Правило: не покупайте 8 vCPU и 4 ГБ RAM «потому что нейросеть любит процессор». На CPU она любит память и пропускную способность RAM. Ядра влияют на скорость токенов, но модель, которая не влезла, не ускорить ничем.
Как вообще читать строку тарифа — в отдельном разборе CPU, RAM, диск и канал.
На центральном процессоре локальная модель отвечает медленнее, чем в привычном облачном чате. Для 8B на приличном VPS это часто 5–20 токенов в секунду. Для черновика письма, разбора тикета или внутреннего поиска по базе — нормально. Для «печатает как ChatGPT» на модели 32B — нет.
CPU имеет смысл, если:
Смотрите тип виртуализации. KVM предсказуемее по CPU, чем контейнерные схемы с жёстким лимитом: на перепроданной ноде «6 ядер» в прайсе превращаются в долгие паузы между токенами. В каталоге есть отдельный рейтинг KVM.
Одна квантованная 8B — это примерно 4–6 ГБ. 14B — около 8–10 ГБ. Плюс Open WebUI, логи, векторный индекс, бэкап.
Практичный минимум:
Тип диска важнее объёма на бумаге. Модель читается в RAM при старте: на HDD это десятки секунд или минуты, на NVMe — заметно быстрее. Для базы эмбеддингов медленный диск ещё и тормозит поиск.
Не ставьте модели на крошечный системный раздел «на 20 ГБ под ОС». Место заканчивается в самый неудачный момент — на середине ollama pull.
Open WebUI — это сайт. Ему нужны:
Локация влияет меньше, чем для обычного сайта: узкое место — генерация токенов, а не пинг. Но панель и загрузка моделей качаются с внешних реестров, поэтому «VPS без исходящего трафика» или с жёстким лимитом скорости неприятно удивит на первом же скачивании весов.
Если чатом пользуются коллеги из одного офиса — имеет смысл закрыть интерфейс VPN или basic auth, а не публиковать его как лендинг.
Переходите на GPU VPS, если:
Для чисто текстовой 8B GPU часто избыточен по деньгам: месяц видеокарты стоит как несколько обычных VPS, а выигрыш чувствуется в основном в интерактиве. Подробнее про VRAM и сценарии — в статье когда нужна видеокарта.
Веса модели можно скачать заново. Нельзя безболезненно потерять:
Достаточно ежедневного снимка тома с данными и отдельной копии наружу (свой S3, другой сервер, архив у провайдера). Снимок всего диска на 80 ГБ «вместе с моделями» тоже работает, но восстанавливается дольше и стоит дороже.
Локальная модель не делает сервер безопасным. Наоборот: на нём лежат документы, которые вы как раз не хотели отдавать наружу.
Минимум:
docker run, а в файле с правами, которые не читает кто попало.Провайдер с вменяемой поддержкой здесь полезнее «самого дешёвого на рынке»: когда нода перезагружается посреди загрузки модели на 20 ГБ, хочется тикет, а не форум.
Откройте рейтинг VPS для ИИ и рядом — обычный рейтинг VPS, если нужен просто большой объём RAM без маркетинговой пометки «AI». Дальше:
Если бюджет и задача ещё плавают — мастер подбора сузит список до того, как вы начнёте сравнивать 32 ГБ с 8 ГБ «на глаз».
Итог: рабочий VPS для локальной нейросети — это в первую очередь память под конкретный размер модели, быстрый диск и закрытый интерфейс. Число ядер и слово «AI» в названии тарифа вторичны. Начните с рейтинга VPS для ИИ, возьмите конфиг под 8B или 14B помесячно и уже по реальной скорости токенов решайте, оставаться на CPU или переезжать на GPU.