+7 995 789-54-84da@raish.ru
Заявка

Связаться с нами

Получить бесплатный аудит
AI для бизнеса

Локальная нейросеть для компании: когда нужна своя модель на сервере и сколько это стоит

Своя нейросеть на сервере компании нужна в двух случаях: данные нельзя передавать третьим лицам ни при каких условиях (медицинская, банковская, адвокатская тайна, оборонные заказы, жёсткие требования крупного заказчика) или запросов так много, что облако обходится дороже своего железа. Для большинства задач малого бизнеса это переплата: облачная модель российского провайдера с договором и хранением данных в России закрывает те же требования закона, стоит в разы дешевле на старте и отвечает лучше небольшой локальной модели. Ниже — чем отличаются варианты, какое железо нужно под модели разного размера, что говорят законы, какие открытые модели доступны и как посчитать, когда своя модель окупается.

Боитесь отдавать данные в облако? Посчитаем, нужна ли вам своя нейросетьСтудия Спичка: внедряем AI-агентов для продаж, записи и сайта. Подбор под ваш бизнес — бесплатно.
Посчитать свою модель

Коротко

  • Локальная модель — нейросеть, которая работает на вашем сервере или на арендованном сервере под вашим контролем. Данные никуда не уходят.
  • Между «публичный чат-бот» и «свой сервер» есть средний вариант: облачная модель российского провайдера по договору. Для многих задач его достаточно.
  • Модели на 7–10 млрд параметров запускаются на одной видеокарте, но по качеству заметно уступают большим облачным моделям. Большие открытые модели требуют серверов стоимостью в миллионы.
  • Открытые модели с разрешением коммерческого использования есть и у российских компаний: Сбер выложил GigaChat 3 под лицензией MIT, Яндекс — YandexGPT 5 Lite под собственной лицензией.
  • Своя модель окупается при большом и стабильном объёме запросов или когда облако запрещено. Иначе стоит начинать с облака.

Три варианта: публичный сервис, облако по договору, свой сервер

Публичный чат-бот Облачная модель по договору (API) Своя модель на сервере
Где обрабатываются данные У провайдера, условия — пользовательское соглашение У провайдера, условия — договор, часто можно выбрать хранение в России У вас или на арендованном сервере под вашим контролем
Качество ответов Высокое Высокое Зависит от размера модели и железа
Стартовые затраты Нет Небольшие От сотен тысяч рублей до нескольких миллионов
Ежемесячные расходы Подписка Оплата за объём текста Электричество, обслуживание, специалист
Кто обновляет модель Провайдер Провайдер Вы
Подходит для персональных данных Обычно нет Да, при правильном договоре Да

Средний вариант часто упускают. Облачные модели YandexGPT и GigaChat доступны через API по договору с юрлицом. У Yandex AI Studio, например, есть возможность отключить логирование запросов, чтобы данные не сохранялись для улучшения сервиса. Сравнение провайдеров по условиям — в статье YandexGPT, GigaChat или ChatGPT.

Что говорит закон: 152-ФЗ и коммерческая тайна

Персональные данные. Закон о персональных данных не запрещает облачные нейросети. Он требует оснований для обработки, договора поручения с тем, кто обрабатывает данные по вашему заданию, и мер защиты. Отдельные правила — для передачи данных за рубеж: статья 12 закона № 152-ФЗ требует заранее уведомить Роскомнадзор о трансграничной передаче. Для российского облака с хранением в России трансграничной передачи нет.

Особый случай — специальные категории данных, например сведения о здоровье. Для них требования строже, и многие клиники предпочитают не выпускать такие данные за периметр вовсе. Подробно о том, что можно загружать в нейросеть, — в статье нейросети и персональные данные по 152-ФЗ.

Коммерческая тайна. По статье 10 закона № 98-ФЗ режим коммерческой тайны требует ограничить доступ к информации и регулировать её использование в отношениях с контрагентами. Передача такой информации облачному провайдеру возможна, но только по договору с условиями конфиденциальности. Если внутренние правила компании или требования заказчика запрещают это вовсе, остаётся своя модель.

Вывод: закон сам по себе редко требует локальную модель. Её требуют внутренние политики, отраслевые правила и крупные заказчики.

Железо: что нужно под модели разного размера

Главный ресурс для нейросети — память видеокарты. Модель должна поместиться в неё целиком вместе с запасом на обработку текста.

Ориентир для расчёта: модель с N миллиардами параметров в полной точности занимает около 2 × N гигабайт. После квантизации — сжатия чисел модели до 4 бит с небольшой потерей качества — около 0,6 × N гигабайт. Плюс запас на контекст.

Размер модели Память в полной точности Память после квантизации до 4 бит Типичное железо
7–10 млрд параметров около 16–20 ГБ около 5–7 ГБ Одна видеокарта на 16–24 ГБ
30–35 млрд около 60–70 ГБ около 20–24 ГБ Видеокарта на 24–48 ГБ
70 млрд около 140 ГБ около 40–45 ГБ Две видеокарты по 24–48 ГБ или серверная карта
Сотни миллиардов сотни ГБ сотни ГБ Сервер с несколькими серверными видеокартами

Это оценки для понимания порядка, а не спецификация. Точные требования зависят от архитектуры модели, длины контекста и числа одновременных пользователей.

Сколько стоит. Ориентиры на рынке в 2026 году сильно колеблются из-за курса и поставок:

  • рабочая станция или сервер с одной видеокартой на 24 ГБ — от нескольких сотен тысяч рублей;
  • сервер под модели на 70 млрд параметров — от одного до нескольких миллионов рублей;
  • сервер под самые большие открытые модели — десятки миллионов.

Альтернатива покупке — аренда сервера с видеокартой в российском облаке или дата-центре. Это дороже в пересчёте на годы, но не требует вложений сразу и позволяет проверить идею.

Открытые модели: что можно запустить у себя

Открытая модель — нейросеть, веса которой выложены в открытый доступ: её можно скачать и запустить на своём сервере. Важно читать лицензию: не все открытые модели разрешают коммерческое использование без условий.

Российские варианты:

  • GigaChat 3. Сбер выложил две модели: GigaChat 3 Lightning (10 млрд параметров, из них 1,8 млрд активны при обработке каждого слова, контекст до 256 тысяч токенов) и GigaChat 3 Ultra Preview (около 702 млрд параметров). Обе — под лицензией MIT с разрешением коммерческого использования, по данным репозитория Сбера. Lightning запускается на одной видеокарте, Ultra требует серьёзного сервера.
  • YandexGPT 5 Lite. Модель на 8 млрд параметров, оптимизированная для русского языка, выложена на Hugging Face под собственной лицензией Яндекса. Коммерческое использование разрешено с условиями, в том числе при объёме больше 10 млн токенов ответов в месяц нужно связаться с Яндексом.

Есть и зарубежные открытые семейства моделей, которые работают на русском языке. Их можно запускать локально, но качество русского у небольших версий бывает неровным.

О качестве. Модель на 8–10 млрд параметров хорошо справляется с узкими задачами: классификация обращений, извлечение данных из документов, ответы по базе знаний. Для сложных текстов, рассуждений и длинных документов она заметно уступает большим облачным моделям. Это главный компромисс локального варианта для малого бизнеса.

Если вы взвешиваете, нужна ли своя модель или хватит облака с правильным договором, — это стоит посчитать на ваших задачах до покупки железа.

Кто будет это обслуживать

Сервер с моделью — не коробка, которую поставили и забыли. Его нужно обслуживать так же, как любую критичную систему, и это часто забывают посчитать.

Что требует внимания:

  • Обновления моделей. Открытые модели выходят новыми версиями несколько раз в год. Каждую новую версию нужно проверить на ваших задачах перед заменой.
  • Безопасность. Сервер с доступом к внутренним данным — цель для атак. Доступы, журналы, обновления системы.
  • Мониторинг. Если модель перестала отвечать ночью, кто об этом узнает и кто поднимет?
  • Нагрузка. Когда пользователей становится больше, ответы замедляются. Нужно следить и вовремя добавлять мощности.

Ещё один пункт — резервирование. Если на модели держится работа колл-центра или обработка документов, один сервер без замены — точка отказа. Либо второй сервер, либо резервный вариант через облако на время ремонта.

В малой компании это обычно часть работы системного администратора или подрядчика на абонентском обслуживании. Закладывайте эти часы в расчёт с самого начала.

Когда своя модель оправдана

  1. Данные нельзя выпускать за периметр по внутренним правилам, отраслевым требованиям или условиям крупного заказчика.
  2. Большой стабильный объём запросов: обработка тысяч документов в день, круглосуточный анализ звонков крупного колл-центра.
  3. Узкая задача, где хватает небольшой модели: классификация, извлечение полей, ответы по ограниченной базе знаний.
  4. Нужна дообученная модель на ваших данных, и вы не хотите передавать данные для обучения провайдеру.
  5. Работа без интернета: производство, удалённые объекты.

Когда это переплата

  • Запросов немного: десятки или сотни в день. Облако обойдётся в тысячи рублей в месяц.
  • Нужны сложные тексты и рассуждения: небольшая локальная модель справится хуже облачной.
  • Нет специалиста, который будет обслуживать сервер, обновлять модель и следить за безопасностью.
  • Требования закона закрываются договором с российским облачным провайдером.
  • Задача ещё не проверена пилотом. Покупать сервер под непроверенную идею — дорогой способ узнать, что идея не работала.

Условный пример: как посчитать окупаемость

Условный пример, не кейс студии. Сеть медицинских лабораторий хочет разбирать обращения пациентов: классифицировать, вытаскивать номер заказа, готовить черновик ответа. Объём — около 3 000 обращений в день.

Статья Облако по договору Свой сервер
Стартовые затраты Интеграция Сервер с видеокартой + интеграция + настройка модели
Ежемесячно Оплата за объём текста, растёт с числом обращений Электричество, размещение, часть зарплаты администратора
Качество Большая модель Модель на 8–10 млрд параметров, нужна проверка на своих данных
Риск по данным Договор поручения, хранение в России Данные не покидают периметр

Порядок расчёта:

  1. Посчитайте средний объём текста одного обращения и ответа.
  2. Умножьте на число обращений в месяц и на цену провайдера за объём текста по его официальным тарифам.
  3. Посчитайте годовые расходы на свой сервер: покупка, делённая на срок службы (обычно 3–4 года), плюс размещение, электричество и обслуживание.
  4. Сравните. Добавьте в сравнение разницу в качестве: если локальная модель ошибается чаще, исправления людьми тоже стоят денег.

В нашем условном примере решающим оказывается не цена, а требование не выпускать сведения о здоровье пациентов за периметр. Тогда выбор между облаком и своим сервером снимается, и вопрос только в том, какая модель справится с задачей.

С чего начать

  1. Сформулируйте задачу и метрику. «Своя нейросеть» без задачи — дорогая игрушка.
  2. Проверьте задачу на облачной модели с обезличенными данными. Это покажет, решается ли она вообще.
  3. Проверьте ту же задачу на открытой модели нужного размера на арендованном сервере. Так вы увидите разницу в качестве до покупки железа.
  4. Посчитайте экономику на своём объёме.
  5. Только после этого покупайте или арендуйте сервер надолго.

Отдельно продумайте гибридную схему. Часто разумно держать небольшую локальную модель для задач с чувствительными данными — например, для обезличивания обращений и извлечения полей — и отправлять в облачную модель уже обезличенный текст для сложной обработки. Так данные не покидают периметр, а качество ответов остаётся высоким. Такая схема дешевле полностью локальной и закрывает большую часть требований службы безопасности.

Если модель нужна для ответов по внутренним документам, важнее модели часто оказывается база знаний — как её собрать, мы разбирали в статье база знаний для чат-бота. Ориентиры по стоимости проектов в целом — в статье сколько стоит внедрение ИИ.

Если хотите понять, что выгоднее в вашем случае — облако или свой сервер, — оставьте контакты, посчитаем на ваших объёмах.

Частые вопросы

Что такое локальная нейросеть?

Это нейросеть, которая работает на вашем собственном или арендованном сервере. Запросы и данные не уходят к внешнему провайдеру. Обычно используют открытые модели, которые можно скачать и запустить у себя.

Обязывает ли 152-ФЗ использовать локальную нейросеть?

Нет. Закон требует оснований для обработки, договора с тем, кто обрабатывает данные по вашему поручению, и мер защиты, а для передачи за рубеж — уведомления Роскомнадзора. Облачная модель российского провайдера по договору может этим требованиям соответствовать.

Какое железо нужно для своей нейросети?

Для модели на 7–10 млрд параметров после сжатия хватит одной видеокарты на 16–24 ГБ. Для моделей на 70 млрд параметров нужно 40 ГБ видеопамяти и больше. Самые большие открытые модели требуют серверов с несколькими серверными видеокартами.

Какие открытые модели можно использовать в компании?

Из российских — GigaChat 3 от Сбера под лицензией MIT и YandexGPT 5 Lite под собственной лицензией Яндекса с условиями для коммерческого использования. Перед запуском всегда читайте лицензию конкретной модели.

Локальная модель работает так же хорошо, как облачная?

Небольшие модели, которые запускаются на одной видеокарте, заметно уступают большим облачным моделям в сложных задачах. С узкими задачами — классификацией, извлечением данных, ответами по базе знаний — они справляются хорошо. Проверяйте качество на своих данных до покупки сервера.

Радик Ишкиняев

Радик Ишкиняев

Руководитель студии Спичка

10+ лет делаю сайты и запускаю рекламу, вместе с командой запустили больше 500 проектов. Пишу о том, что проверили на практике.

Задать вопрос в Telegram →

Сайт и реклама с AI для целевых заявок

Разработаем сайт с AI и запустим Яндекс Директ от 60 000 ₽.
В стоимость входят 30 дней ведения рекламы.

🎁 Получить аудит
и план запуска бесплатно

Подготовим в течение рабочего дня
без навязчивых звонков

Получить аудит и план запуска

Оставьте контакты — мы уточним задачу и подготовим для вас следующий шаг

АудитСтруктура сайтаДизайн первого экрана
Как с вами связаться?
Посчитать свою модель