+7 995 789-54-84da@raish.ru
Заявка

Связаться с нами

Получить бесплатный аудит
Обложка статьи: LLM: что такое большая языковая модель простыми словами и зачем это знать владельцу бизнеса
AI для бизнеса

LLM: что такое большая языковая модель простыми словами и зачем это знать владельцу бизнеса

LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромном объёме текстов, которая умеет понимать и писать текст: отвечать на вопросы, составлять письма, сокращать документы, переводить, писать код. Простыми словами, LLM постоянно угадывает, какое слово должно идти дальше, и делает это настолько хорошо, что получается осмысленный ответ. На LLM работают Алиса AI, GigaChat, ChatGPT и почти все современные чат-боты. Ниже — как устроена модель, что такое токены и контекст, почему она иногда выдумывает факты и как эти знания помогают выбрать сервис и не переплатить.

Не знаете, какая LLM подойдёт под вашу задачу? Подберём модель бесплатноСтудия Спичка: внедряем AI-агентов для продаж, записи и сайта. Подбор под ваш бизнес — бесплатно.
Подобрать модель

Коротко

  • LLM — нейросеть, которая предсказывает следующий фрагмент текста. Из этого простого механизма вырастают ответы, письма, анализ документов.
  • Модель считает текст в токенах — кусочках слов. От числа токенов зависят цена и объём текста, который модель «держит в голове».
  • Контекстное окно — сколько текста модель видит за раз: ваш вопрос, документы, историю диалога. У разных моделей оно отличается в десятки раз.
  • Галлюцинации — уверенные выдумки модели. Их снижают база знаний, запрет отвечать без источника и проверка человеком.
  • Модели отличаются качеством на русском, размером контекста, скоростью, ценой и тем, где обрабатываются данные.

Что такое LLM простыми словами

Представьте человека, который прочитал огромную библиотеку: книги, статьи, форумы, инструкции. Он не помнит каждую книгу дословно, но хорошо чувствует, как устроен язык, какие слова идут рядом и как обычно отвечают на такие вопросы. Если начать фразу «Доставка по Казани занимает…», он продолжит что-то вроде «от одного до трёх дней».

Большая языковая модель работает похоже, только «библиотека» — это огромные объёмы текста, а «чутьё» — миллиарды числовых параметров внутри нейросети.

Почему «большая»:

  • большой объём данных — модель обучают на огромных массивах текста;
  • большое число параметров — настроек внутри нейросети, их миллиарды;
  • широкие способности — одна модель решает тысячи разных задач без отдельного обучения под каждую.

LLM — частный случай генеративного ИИ, который создаёт новый контент. Шире про генеративные модели — в статье генеративный ИИ, а про ИИ в целом — в статье искусственный интеллект простыми словами.

Как устроена большая языковая модель

Без математики, в четыре шага:

  1. Предобучение. Модели показывают огромное количество текста и учат угадывать следующий фрагмент. Ошиблась — внутренние параметры немного поправляются. После миллиардов таких поправок модель хорошо «чувствует» язык и усваивает много знаний о мире.
  2. Дообучение на инструкциях. Модель учат отвечать на вопросы и выполнять задания, а не просто продолжать текст. Для этого используют примеры «запрос — хороший ответ».
  3. Настройка по оценкам людей. Люди сравнивают ответы модели и выбирают лучшие. Модель учится быть полезной, вежливой и отказываться от вредных просьб.
  4. Ответ на ваш запрос. Модель получает ваш текст и по фрагменту строит ответ, каждый раз выбирая наиболее подходящее продолжение с учётом всего, что уже написано.

Главный вывод для бизнеса: модель не ищет ответ в базе данных и не «знает» факты так, как их знает справочник. Она строит правдоподобный текст. Отсюда и сила, и главная слабость.

Токены: в чём LLM считает текст

Модель читает текст не по буквам и не по словам, а по токенам — частым сочетаниям символов. Короткое слово может быть одним токеном, длинное — несколькими.

Это важно по двум причинам:

  • цена — платные API берут деньги за токены на входе и на выходе;
  • лимиты — объём текста, который модель обработает за раз, тоже измеряется в токенах.

Токенизатор у каждой модели свой, и на русском языке разница заметна. По данным Yandex AI Studio, один и тот же русский текст длиной 501 символ занимает 96 токенов у YandexGPT Pro, 109 у gpt-oss-120b и 139 у Qwen3 235B. То есть одна модель тратит на русский текст почти в полтора раза больше токенов, чем другая. При сравнении цен это нужно учитывать: дешёвый токен у модели, которая плохо «упаковывает» русский, может оказаться не таким уж дешёвым.

Контекстное окно: сколько модель держит в голове

Контекст — это всё, что модель видит при ответе: инструкция, ваш вопрос, загруженные документы, история диалога. Всё, что не помещается, модель просто не видит.

Размеры отличаются в десятки раз. Например, в списке моделей Yandex AI Studio:

Модель Контекстное окно Примерный объём русского текста
YandexGPT Pro 5.1 32 768 токенов несколько десятков страниц
Alice AI LLM 131 072 токена объём небольшой книги
Qwen3 235B 262 144 токена несколько договоров с приложениями
DeepSeek V4 Flash 1 048 576 токенов архив документов

Объём текста — ориентир: он зависит от токенизатора и плотности текста.

Что это значит на практике:

  • для ответов клиентам обычно хватает небольшого окна: инструкция, фрагмент базы знаний и последние сообщения;
  • для анализа длинного договора или пачки документов нужно большое окно;
  • большое окно ≠ точность. Чем больше текста в контексте, тем выше риск, что модель упустит деталь из середины. Для базы знаний надёжнее подавать модели только релевантные фрагменты, а не всё сразу.

Последний пункт — основа технологии, когда модель сначала ищет нужные фрагменты в ваших документах и только потом отвечает. Как собрать такую базу, разобрали в статье база знаний для чат-бота.

Если вы выбираете модель под конкретную задачу и не уверены, какой контекст и какая цена вам нужны, — мы разберём задачу и подберём модель с расчётом стоимости.

Галлюцинации: почему LLM выдумывает факты

Галлюцинация — это уверенный, гладкий и неверный ответ. Модель называет несуществующую статью закона, придумывает характеристику товара или цитату.

Почему так происходит: модель обучена строить правдоподобный текст. Если она не знает ответа, правдоподобное продолжение всё равно существует — и модель его пишет. Она не отличает «знаю» от «похоже на правду» так, как это делает человек.

Где риск выше всего:

  • точные цифры, даты, цены, номера документов;
  • редкие темы, о которых мало текстов;
  • свежие события после даты обучения модели;
  • вопросы о вашей компании, если вы не дали ей данных.

Как снизить риск:

  1. Давать источник. Модель отвечает по вашей базе знаний, а не по памяти.
  2. Запрещать отвечать без источника. В инструкции: «если ответа нет в документах — скажи, что уточнишь у менеджера».
  3. Просить ссылку на фрагмент. Ответ с цитатой из документа легче проверить.
  4. Проверять человеком всё, что касается денег, законов и обязательств.
  5. Тестировать на сложных вопросах до запуска: что модель ответит на вопрос, которого нет в базе.

Чем отличаются LLM-модели между собой

Параметр Что это Почему важно бизнесу
Качество на русском Насколько естественно модель пишет и понимает русский Ответы клиентам и тексты для сайта
Размер контекста Сколько текста видит за раз Работа с длинными документами
Режим рассуждений Умеет ли модель «думать» по шагам перед ответом Сложные задачи: анализ, расчёты, логика
Скорость Как быстро приходит ответ Чат с клиентом, голосовые помощники
Цена Стоимость за 1 000 токенов Массовые задачи с тысячами запросов
Где обрабатываются данные Страна и условия хранения 152-ФЗ и коммерческая тайна
Открытость Можно ли скачать и запустить у себя Работа в своём контуре без отправки данных

Обычно у одного провайдера есть линейка: лёгкая модель — быстрая и дешёвая, флагманская — точнее и дороже. Для классификации заявок и коротких ответов хватает лёгкой, для анализа договоров нужна флагманская. Обзор моделей, доступных в России, — в статье российские нейросети, а сравнение по оплате и данным — в материале YandexGPT, GigaChat или ChatGPT.

Открытые и закрытые LLM: в чём разница

Ещё одно деление, о котором стоит знать, — как модель распространяется.

Закрытые модели доступны только через сервис или API разработчика. Вы отправляете запрос на его серверы и получаете ответ. Так работают Алиса AI, GigaChat, ChatGPT. Плюсы: не нужно своё железо, модель обновляется сама, платите только за использование. Минусы: данные уходят провайдеру, условия и цены может поменять он, а не вы.

Открытые модели можно скачать и запустить на своём сервере. Например, Т-Банк выложил модель T-Pro 2.0 под лицензией Apache 2.0, которая разрешает бесплатно использовать и дообучать её. Плюсы: данные не покидают компанию, нет платы за токены. Минусы: нужен сервер с мощной видеокартой, специалист для настройки и обновлений, и качество может уступать флагманским закрытым моделям.

Есть и промежуточный вариант: открытые модели, развёрнутые у облачного провайдера в России. Например, в Yandex AI Studio кроме моделей Яндекса доступны Qwen, DeepSeek и gpt-oss. Вы пользуетесь ими как сервисом, а данные обрабатываются в российском облаке.

Вариант Данные Затраты Кому подходит
Закрытая модель через сервис У провайдера Оплата за токены или подписка Большинству малых компаний
Открытая модель в российском облаке У облачного провайдера в России Оплата за токены Когда нужна конкретная модель без отправки данных за рубеж
Открытая модель на своём сервере Внутри компании Сервер, специалист, электричество Медицина, финансы, закрытые разработки

Для компании на 5–50 человек свой сервер чаще всего избыточен. Но если вы работаете с медицинскими или банковскими данными, этот вариант стоит посчитать.

Как знание об LLM помогает выбрать сервис

Условный пример: ассистент для ответов клиентам

Пример условный, цифры для иллюстрации. Сеть автосервисов получает 4 000 сообщений в месяц. Вопросы типовые: цены, запись, сроки ремонта.

Что следует из устройства LLM:

  • контекст большой не нужен: инструкция + фрагмент прайса + последние 10 сообщений помещаются в 3 000 токенов;
  • модель подойдёт лёгкая и быстрая: задача простая, важна скорость ответа;
  • галлюцинации опасны в ценах — значит, цены должны приходить из прайса, а модели запрещено их придумывать;
  • данные — в сообщениях есть номера телефонов и госномера машин, поэтому нужен провайдер с обработкой в России и договором.

Расчёт: 4 000 сообщений × 3 300 токенов (вход и ответ) = 13,2 млн токенов в месяц. На лёгкой модели по цене около 0,2 ₽ за 1 000 токенов — около 2 600 ₽ в месяц. На флагманской — в несколько раз дороже без заметной разницы в качестве для этой задачи.

Без понимания устройства LLM компания часто выбирает самую мощную модель «на всякий случай» и переплачивает, а сэкономить могла бы на базе знаний и тестах — там, где действительно решается качество.

Если хотите сделать такой расчёт для своей задачи, — оставьте контакты, разберём и посчитаем.

Частые вопросы

LLM и нейросеть — это одно и то же?

LLM — это вид нейросети, обученный на текстах. Нейросети бывают и другие: для распознавания изображений, речи, прогнозов. Когда говорят о чат-ботах вроде Алисы AI или GigaChat, имеют в виду именно LLM.

Чем LLM отличается от чат-бота?

LLM — это «движок», модель. Чат-бот — интерфейс, через который с ней общаются: сайт, приложение, бот в мессенджере. Один и тот же чат-бот может работать на разных моделях, а одна модель — стоять за многими сервисами.

Почему LLM даёт разные ответы на один вопрос?

При построении ответа модель выбирает продолжение с элементом случайности, чтобы текст не был шаблонным. В API эту случайность можно уменьшить настройкой. Для деловых задач её обычно снижают, чтобы ответы были стабильнее.

Может ли LLM обучиться на моих данных?

Можно двумя способами: дообучить модель на ваших примерах или, что чаще и дешевле, подавать ей нужные документы при каждом запросе. Для большинства задач малого бизнеса хватает второго способа: база знаний обновляется без переобучения. Как правильно ставить задачу модели — в статье промпты для бизнеса.

Что такое «параметры» модели и чем больше, тем лучше?

Параметры — внутренние числовые настройки нейросети. Больше параметров обычно означает больше знаний и способностей, но и выше цена и медленнее работа. Для простых задач модель поменьше часто справляется не хуже и стоит в разы дешевле.

Знает ли LLM свежие новости и актуальные цены?

Сама модель знает только то, что было в текстах до даты её обучения. Свежие данные она получает, если у сервиса есть поиск в интернете или вы сами вставили нужный документ. Поэтому цены, тарифы и изменения в законах всегда проверяйте по первоисточнику, даже если модель ответила уверенно.

Радик Ишкиняев

Радик Ишкиняев

Руководитель студии Спичка

10+ лет делаю сайты и запускаю рекламу, вместе с командой запустили больше 500 проектов. Пишу о том, что проверили на практике.

Задать вопрос в Telegram →

Сайт и реклама с AI для целевых заявок

Разработаем сайт с AI и запустим Яндекс Директ от 60 000 ₽.
В стоимость входят 30 дней ведения рекламы.

🎁 Получить аудит
и план запуска бесплатно

Подготовим в течение рабочего дня
без навязчивых звонков

Получить аудит и план запуска

Оставьте контакты — мы уточним задачу и подготовим для вас следующий шаг

АудитСтруктура сайтаДизайн первого экрана
Как с вами связаться?
Подобрать модель