Коротко
- LLM — нейросеть, которая предсказывает следующий фрагмент текста. Из этого простого механизма вырастают ответы, письма, анализ документов.
- Модель считает текст в токенах — кусочках слов. От числа токенов зависят цена и объём текста, который модель «держит в голове».
- Контекстное окно — сколько текста модель видит за раз: ваш вопрос, документы, историю диалога. У разных моделей оно отличается в десятки раз.
- Галлюцинации — уверенные выдумки модели. Их снижают база знаний, запрет отвечать без источника и проверка человеком.
- Модели отличаются качеством на русском, размером контекста, скоростью, ценой и тем, где обрабатываются данные.
Что такое LLM простыми словами
Представьте человека, который прочитал огромную библиотеку: книги, статьи, форумы, инструкции. Он не помнит каждую книгу дословно, но хорошо чувствует, как устроен язык, какие слова идут рядом и как обычно отвечают на такие вопросы. Если начать фразу «Доставка по Казани занимает…», он продолжит что-то вроде «от одного до трёх дней».
Большая языковая модель работает похоже, только «библиотека» — это огромные объёмы текста, а «чутьё» — миллиарды числовых параметров внутри нейросети.
Почему «большая»:
- большой объём данных — модель обучают на огромных массивах текста;
- большое число параметров — настроек внутри нейросети, их миллиарды;
- широкие способности — одна модель решает тысячи разных задач без отдельного обучения под каждую.
LLM — частный случай генеративного ИИ, который создаёт новый контент. Шире про генеративные модели — в статье генеративный ИИ, а про ИИ в целом — в статье искусственный интеллект простыми словами.
Как устроена большая языковая модель
Без математики, в четыре шага:
- Предобучение. Модели показывают огромное количество текста и учат угадывать следующий фрагмент. Ошиблась — внутренние параметры немного поправляются. После миллиардов таких поправок модель хорошо «чувствует» язык и усваивает много знаний о мире.
- Дообучение на инструкциях. Модель учат отвечать на вопросы и выполнять задания, а не просто продолжать текст. Для этого используют примеры «запрос — хороший ответ».
- Настройка по оценкам людей. Люди сравнивают ответы модели и выбирают лучшие. Модель учится быть полезной, вежливой и отказываться от вредных просьб.
- Ответ на ваш запрос. Модель получает ваш текст и по фрагменту строит ответ, каждый раз выбирая наиболее подходящее продолжение с учётом всего, что уже написано.
Главный вывод для бизнеса: модель не ищет ответ в базе данных и не «знает» факты так, как их знает справочник. Она строит правдоподобный текст. Отсюда и сила, и главная слабость.
Токены: в чём LLM считает текст
Модель читает текст не по буквам и не по словам, а по токенам — частым сочетаниям символов. Короткое слово может быть одним токеном, длинное — несколькими.
Это важно по двум причинам:
- цена — платные API берут деньги за токены на входе и на выходе;
- лимиты — объём текста, который модель обработает за раз, тоже измеряется в токенах.
Токенизатор у каждой модели свой, и на русском языке разница заметна. По данным Yandex AI Studio, один и тот же русский текст длиной 501 символ занимает 96 токенов у YandexGPT Pro, 109 у gpt-oss-120b и 139 у Qwen3 235B. То есть одна модель тратит на русский текст почти в полтора раза больше токенов, чем другая. При сравнении цен это нужно учитывать: дешёвый токен у модели, которая плохо «упаковывает» русский, может оказаться не таким уж дешёвым.
Контекстное окно: сколько модель держит в голове
Контекст — это всё, что модель видит при ответе: инструкция, ваш вопрос, загруженные документы, история диалога. Всё, что не помещается, модель просто не видит.
Размеры отличаются в десятки раз. Например, в списке моделей Yandex AI Studio:
| Модель | Контекстное окно | Примерный объём русского текста |
|---|---|---|
| YandexGPT Pro 5.1 | 32 768 токенов | несколько десятков страниц |
| Alice AI LLM | 131 072 токена | объём небольшой книги |
| Qwen3 235B | 262 144 токена | несколько договоров с приложениями |
| DeepSeek V4 Flash | 1 048 576 токенов | архив документов |
Объём текста — ориентир: он зависит от токенизатора и плотности текста.
Что это значит на практике:
- для ответов клиентам обычно хватает небольшого окна: инструкция, фрагмент базы знаний и последние сообщения;
- для анализа длинного договора или пачки документов нужно большое окно;
- большое окно ≠ точность. Чем больше текста в контексте, тем выше риск, что модель упустит деталь из середины. Для базы знаний надёжнее подавать модели только релевантные фрагменты, а не всё сразу.
Последний пункт — основа технологии, когда модель сначала ищет нужные фрагменты в ваших документах и только потом отвечает. Как собрать такую базу, разобрали в статье база знаний для чат-бота.
Если вы выбираете модель под конкретную задачу и не уверены, какой контекст и какая цена вам нужны, — мы разберём задачу и подберём модель с расчётом стоимости.
Галлюцинации: почему LLM выдумывает факты
Галлюцинация — это уверенный, гладкий и неверный ответ. Модель называет несуществующую статью закона, придумывает характеристику товара или цитату.
Почему так происходит: модель обучена строить правдоподобный текст. Если она не знает ответа, правдоподобное продолжение всё равно существует — и модель его пишет. Она не отличает «знаю» от «похоже на правду» так, как это делает человек.
Где риск выше всего:
- точные цифры, даты, цены, номера документов;
- редкие темы, о которых мало текстов;
- свежие события после даты обучения модели;
- вопросы о вашей компании, если вы не дали ей данных.
Как снизить риск:
- Давать источник. Модель отвечает по вашей базе знаний, а не по памяти.
- Запрещать отвечать без источника. В инструкции: «если ответа нет в документах — скажи, что уточнишь у менеджера».
- Просить ссылку на фрагмент. Ответ с цитатой из документа легче проверить.
- Проверять человеком всё, что касается денег, законов и обязательств.
- Тестировать на сложных вопросах до запуска: что модель ответит на вопрос, которого нет в базе.
Чем отличаются LLM-модели между собой
| Параметр | Что это | Почему важно бизнесу |
|---|---|---|
| Качество на русском | Насколько естественно модель пишет и понимает русский | Ответы клиентам и тексты для сайта |
| Размер контекста | Сколько текста видит за раз | Работа с длинными документами |
| Режим рассуждений | Умеет ли модель «думать» по шагам перед ответом | Сложные задачи: анализ, расчёты, логика |
| Скорость | Как быстро приходит ответ | Чат с клиентом, голосовые помощники |
| Цена | Стоимость за 1 000 токенов | Массовые задачи с тысячами запросов |
| Где обрабатываются данные | Страна и условия хранения | 152-ФЗ и коммерческая тайна |
| Открытость | Можно ли скачать и запустить у себя | Работа в своём контуре без отправки данных |
Обычно у одного провайдера есть линейка: лёгкая модель — быстрая и дешёвая, флагманская — точнее и дороже. Для классификации заявок и коротких ответов хватает лёгкой, для анализа договоров нужна флагманская. Обзор моделей, доступных в России, — в статье российские нейросети, а сравнение по оплате и данным — в материале YandexGPT, GigaChat или ChatGPT.
Открытые и закрытые LLM: в чём разница
Ещё одно деление, о котором стоит знать, — как модель распространяется.
Закрытые модели доступны только через сервис или API разработчика. Вы отправляете запрос на его серверы и получаете ответ. Так работают Алиса AI, GigaChat, ChatGPT. Плюсы: не нужно своё железо, модель обновляется сама, платите только за использование. Минусы: данные уходят провайдеру, условия и цены может поменять он, а не вы.
Открытые модели можно скачать и запустить на своём сервере. Например, Т-Банк выложил модель T-Pro 2.0 под лицензией Apache 2.0, которая разрешает бесплатно использовать и дообучать её. Плюсы: данные не покидают компанию, нет платы за токены. Минусы: нужен сервер с мощной видеокартой, специалист для настройки и обновлений, и качество может уступать флагманским закрытым моделям.
Есть и промежуточный вариант: открытые модели, развёрнутые у облачного провайдера в России. Например, в Yandex AI Studio кроме моделей Яндекса доступны Qwen, DeepSeek и gpt-oss. Вы пользуетесь ими как сервисом, а данные обрабатываются в российском облаке.
| Вариант | Данные | Затраты | Кому подходит |
|---|---|---|---|
| Закрытая модель через сервис | У провайдера | Оплата за токены или подписка | Большинству малых компаний |
| Открытая модель в российском облаке | У облачного провайдера в России | Оплата за токены | Когда нужна конкретная модель без отправки данных за рубеж |
| Открытая модель на своём сервере | Внутри компании | Сервер, специалист, электричество | Медицина, финансы, закрытые разработки |
Для компании на 5–50 человек свой сервер чаще всего избыточен. Но если вы работаете с медицинскими или банковскими данными, этот вариант стоит посчитать.
Как знание об LLM помогает выбрать сервис
Условный пример: ассистент для ответов клиентам
Пример условный, цифры для иллюстрации. Сеть автосервисов получает 4 000 сообщений в месяц. Вопросы типовые: цены, запись, сроки ремонта.
Что следует из устройства LLM:
- контекст большой не нужен: инструкция + фрагмент прайса + последние 10 сообщений помещаются в 3 000 токенов;
- модель подойдёт лёгкая и быстрая: задача простая, важна скорость ответа;
- галлюцинации опасны в ценах — значит, цены должны приходить из прайса, а модели запрещено их придумывать;
- данные — в сообщениях есть номера телефонов и госномера машин, поэтому нужен провайдер с обработкой в России и договором.
Расчёт: 4 000 сообщений × 3 300 токенов (вход и ответ) = 13,2 млн токенов в месяц. На лёгкой модели по цене около 0,2 ₽ за 1 000 токенов — около 2 600 ₽ в месяц. На флагманской — в несколько раз дороже без заметной разницы в качестве для этой задачи.
Без понимания устройства LLM компания часто выбирает самую мощную модель «на всякий случай» и переплачивает, а сэкономить могла бы на базе знаний и тестах — там, где действительно решается качество.
Если хотите сделать такой расчёт для своей задачи, — оставьте контакты, разберём и посчитаем.
Частые вопросы
LLM и нейросеть — это одно и то же?
LLM — это вид нейросети, обученный на текстах. Нейросети бывают и другие: для распознавания изображений, речи, прогнозов. Когда говорят о чат-ботах вроде Алисы AI или GigaChat, имеют в виду именно LLM.
Чем LLM отличается от чат-бота?
LLM — это «движок», модель. Чат-бот — интерфейс, через который с ней общаются: сайт, приложение, бот в мессенджере. Один и тот же чат-бот может работать на разных моделях, а одна модель — стоять за многими сервисами.
Почему LLM даёт разные ответы на один вопрос?
При построении ответа модель выбирает продолжение с элементом случайности, чтобы текст не был шаблонным. В API эту случайность можно уменьшить настройкой. Для деловых задач её обычно снижают, чтобы ответы были стабильнее.
Может ли LLM обучиться на моих данных?
Можно двумя способами: дообучить модель на ваших примерах или, что чаще и дешевле, подавать ей нужные документы при каждом запросе. Для большинства задач малого бизнеса хватает второго способа: база знаний обновляется без переобучения. Как правильно ставить задачу модели — в статье промпты для бизнеса.
Что такое «параметры» модели и чем больше, тем лучше?
Параметры — внутренние числовые настройки нейросети. Больше параметров обычно означает больше знаний и способностей, но и выше цена и медленнее работа. Для простых задач модель поменьше часто справляется не хуже и стоит в разы дешевле.
Знает ли LLM свежие новости и актуальные цены?
Сама модель знает только то, что было в текстах до даты её обучения. Свежие данные она получает, если у сервиса есть поиск в интернете или вы сами вставили нужный документ. Поэтому цены, тарифы и изменения в законах всегда проверяйте по первоисточнику, даже если модель ответила уверенно.




