Термос Беспалова
Уровень · Базовый

Что такое LLM простыми словами: как устроена языковая модель

Без формул: как большая языковая модель превращает ваш вопрос в ответ, откуда она «знает» и почему уверенно ошибается, и что из этого следует для работы с ChatGPT, Claude, YandexGPT и GigaChat.

LLM (large language model, большая языковая модель) — нейросеть, обученная на огромном объёме текста предсказывать, какой фрагмент текста должен идти следующим. Из этой простой задачи вырастает всё, что умеют ChatGPT, Claude, Gemini, YandexGPT и GigaChat: отвечать на вопросы, писать письма, переводить, разбирать документы, писать код. Модель не ищет ответ в базе данных — она строит его фрагмент за фрагментом, выбирая на каждом шаге наиболее подходящее продолжение.

Понимать это устройство полезно не ради теории. Почти все особенности работы с нейросетями — почему важна формулировка вопроса, почему модель уверенно выдумывает, почему она «не знает» вчерашних новостей, почему русский текст обходится дороже — прямо следуют из того, как LLM устроена. Короткое определение есть в словаре терминов, здесь — подробный разбор без формул.

LLM простыми словами

Представьте человека, который прочитал огромную библиотеку — книги, статьи, форумы, документацию, код — и так хорошо запомнил, как устроен текст, что по началу любой фразы угадывает её продолжение. Он не помнит каждую книгу дословно, но уловил закономерности: какие слова идут вместе, как строятся рассуждения, как отвечают на вопросы, как выглядит договор или программа. Если спросить его о чём-то, он не ищет ответ на полке — он продолжает текст так, как, по его опыту, такие тексты обычно продолжаются.

Технически модель работает с токенами — кусочками текста. Получив ваш вопрос, она вычисляет вероятности для всех возможных следующих токенов, выбирает один, добавляет его к тексту и повторяет, пока ответ не будет готов. Именно поэтому ответ в чате появляется постепенно: модель действительно пишет его по кусочку. Что такое токены и почему за них платят, разобрано в гайде что такое токены в нейросетях.

Слово «большая» в названии относится к двум вещам: к объёму данных для обучения — это сотни миллиардов и триллионы токенов текста — и к числу параметров модели. Для сравнения: GPT-3, представленная OpenAI в 2020 году, имела 175 млрд параметров, и именно с моделей такого масштаба языковые модели начали уверенно справляться с задачами, которым их специально не учили.

Как модель учится: три этапа

1. Предобучение. Модель получает огромный корпус текстов и учится предсказывать следующий токен. Ей показывают начало фрагмента, она угадывает продолжение, сверяется с настоящим текстом и немного подстраивает параметры, чтобы в следующий раз ошибиться меньше. Это повторяется триллионы раз. Этап самый дорогой — месяцы вычислений на тысячах специализированных процессоров. На выходе получается модель, которая хорошо продолжает любой текст, но ещё не умеет вести диалог: на вопрос она может ответить списком похожих вопросов, потому что в интернете такое тоже встречается.

2. Дообучение на инструкциях. Модели показывают тысячи примеров «запрос — хороший ответ», составленных людьми: вопрос и развёрнутый ответ, просьба и её выполнение, задача и решение. Модель учится не просто продолжать текст, а выполнять то, о чём просят. После этого этапа она становится похожей на ассистента.

3. Обучение с обратной связью. Люди сравнивают несколько ответов модели на один вопрос и отмечают, какой лучше: точнее, полезнее, безопаснее. По этим оценкам модель дообучают предпочитать хорошие ответы. Метод называют RLHF — обучение с подкреплением на основе отзывов людей; одна из самых известных работ о нём — статья OpenAI об InstructGPT 2022 года, а 30 ноября того же года вышел ChatGPT. Именно этот этап делает модель вежливой, отказывающейся от опасных просьб и старающейся быть полезной — а заодно, как выяснилось позже, склонной отвечать уверенно даже тогда, когда она не знает ответа.

Модель после обучения не меняется. Когда вы разговариваете с ChatGPT или GigaChat, модель не учится на вашем разговоре в реальном времени. Она помнит только то, что есть в текущем контексте. Если провайдер использует переписки для обучения следующих версий, это отдельный процесс, который обычно можно отключить в настройках.

Что внутри: параметры, трансформер, внимание

Параметры — это числа внутри модели, которые настраиваются при обучении. В них и хранится всё, что модель усвоила о языке и мире: не в виде фактов в таблице, а в виде сложных связей. Больше параметров — больше «памяти» и способностей, но и дороже каждый ответ. Поэтому у провайдеров обычно есть линейка: большая модель для сложных задач и младшие — быстрые и дешёвые.

Трансформер — архитектура, на которой построены все современные LLM. Её описали исследователи Google в статье «Attention Is All You Need» в 2017 году. Главная идея — механизм внимания: при обработке каждого токена модель смотрит на все остальные токены в контексте и решает, какие из них важны для понимания текущего. В предложении «Мастер приехал к клиенту, но он не открыл дверь» внимание помогает связать «он» с «клиентом», а не с «мастером».

Внимание объясняет и главное ограничение модели — контекстное окно. Модель может одновременно учитывать только ограниченное число токенов: у современных флагманов это сотни тысяч, у части моделей — до миллиона и больше. Всё, что не помещается в окно, для модели не существует. Почему это важно в длинных разговорах и как с этим работать, разобрано в гайде контекстное окно нейросети.

Откуда модель «знает» и почему ошибается

Знания модели — это закономерности, усвоенные из обучающих текстов до определённой даты, которую называют датой отсечения знаний. О событиях после неё модель не знает, если не подключён поиск. Она может уверенно описывать правила, которые уже изменились: налоговые ставки, интерфейсы сервисов, законы. Поэтому для свежих фактов нужен поиск или документ в контексте, а не память модели.

Вторая особенность — модель не хранит факты с источниками. Когда она пишет «по данным исследования 2021 года», она не открывает исследование, а порождает правдоподобный текст. Если в обучающих данных было много похожих формулировок, ответ, скорее всего, верный. Если мало — модель всё равно напишет что-то гладкое, и это будет выдумка. Это явление называют галлюцинациями, и оно следует прямо из устройства: модель оптимизирована писать правдоподобно, а правдоподобное не всегда правда. Подробный разбор причин и способов защиты — в гайде галлюцинации нейросетей.

Третья — модель не считает, а угадывает результат вычислений, если не запускает код. Числа для неё — такие же кусочки текста, и сложение двух больших чисел она делает по аналогии с виденными примерами. Современные чат-боты обходят это, запуская код для расчётов, — и тогда результату можно доверять больше, чем тексту.

Четвёртая особенность — ответы на один и тот же вопрос каждый раз немного разные. На каждом шаге модель выбирает следующий токен не всегда самый вероятный, а случайно из нескольких вероятных, и степень этой случайности задаёт параметр температура. При низкой температуре ответы предсказуемее и суше, при высокой — разнообразнее и чаще уходят в сторону. В чатах температуру обычно не показывают, а через API её можно задать: для извлечения данных из документов её ставят низкой, для генерации идей — повыше.

Практический вывод: если ответ важен, спросите дважды — расхождение между ответами хороший признак того, что модель не уверена. Если два ответа совпадают по сути, это не гарантия правоты, но повод доверять им чуть больше.

Весь этот путь занял меньше десяти лет. Ниже — ключевые даты, которые помогают понять, почему ещё недавно нейросети «не умели» того, что сейчас кажется обычным.

КогдаЧто произошло
2017исследователи Google описывают архитектуру трансформер
2020OpenAI представляет GPT-3 со 175 млрд параметров
март 2022работа OpenAI об InstructGPT: обучение по оценкам людей
30 ноября 2022выходит ChatGPT
24 апреля 2023Сбер открывает закрытое тестирование GigaChat
17 мая 2023Яндекс добавляет YandexGPT в Алису
сентябрь 2024OpenAI выпускает o1 — первую широко известную рассуждающую модель

За это время изменилось не только качество ответов. Контекстное окно выросло с нескольких тысяч токенов у первых моделей до сотен тысяч и больше у нынешних, модели научились работать с изображениями, звуком и файлами, а цена за миллион токенов у сопоставимых по качеству моделей заметно снизилась. Поэтому советы двухлетней давности о том, «чего нейросети не умеют», часто уже устарели — проверяйте их на текущих версиях.

Какие бывают LLM

Моделей десятки, но для практики их удобно делить на несколько групп. Внутри каждой — свои лидеры, которые меняются каждые несколько месяцев, поэтому полезнее понимать различия между группами, чем запоминать названия версий.

ГруппаПримерыКогда нужна
Флагманыстаршие модели Claude, GPT, Geminiсложные задачи, длинные документы, код
Младшие и быстрыеClaude Haiku, облегчённые версии GPT и Geminiклассификация, извлечение полей, массовые задачи
Рассуждающиережимы размышления у флагманованализ, математика, многошаговые задачи
РоссийскиеYandexGPT, Alice AI, GigaChatдоступ без VPN, оплата в рублях, данные в России
ОткрытыеLlama, Qwen, DeepSeekзапуск на своём сервере, закрытый контур

Рассуждающие модели — заметный сдвиг последних двух лет. Первой широко известной стала o1 от OpenAI в сентябре 2024 года; сейчас такой режим есть у большинства флагманов. Перед ответом модель пишет внутреннюю цепочку рассуждений и только потом формулирует итог. Это улучшает результат в задачах, где нужно несколько шагов, но делает ответ медленнее и дороже. Открытые модели можно скачать и запустить у себя — это важно для компаний, которым нельзя отправлять данные во внешние сервисы. Как выбрать модель под задачу, разобрано в гайде какую модель выбрать.

LLM, чат-бот, поиск и агент: в чём разница

Эти слова часто используют как синонимы, хотя это разные уровни. LLM — двигатель: сама модель, которая получает текст и выдаёт текст. Чат-бот вроде ChatGPT или GigaChat — продукт вокруг двигателя: интерфейс, история разговоров, загрузка файлов, иногда поиск и запуск кода. Одна и та же LLM может работать в разных продуктах, а один продукт — переключаться между разными моделями.

Поисковая система находит существующие документы и показывает ссылки. LLM пишет новый текст. Когда поиск и модель объединяют — как в Нейро от Яндекса, Perplexity или поиске внутри ChatGPT, — модель сначала находит страницы, а потом пишет ответ по ним со ссылками. Такой ответ проверить проще, чем ответ из памяти модели.

ИИ-агент — LLM, которой дали инструменты и право действовать: искать, читать файлы, запускать код, отправлять письма, работать с CRM. Модель сама решает, какой инструмент вызвать и что делать дальше, пока задача не будет выполнена. Подробно об агентах и их отличии от чат-ботов — в статье блога что такое ИИ-агент, а о том, как собрать своего, — в гайде свои агенты и субагенты.

Что это значит на практике

Из устройства LLM следует несколько правил, которые делают работу с любой моделью заметно лучше. Модель продолжает ваш текст — значит, чем точнее и полнее начало, тем точнее продолжение: роль, задача, контекст, ограничения и формат ответа в запросе дают больше, чем любые хитрые приёмы. Как это делать, разобрано в гайде как писать промпты.

Модель знает закономерности, а не проверенные факты, — значит, факты для важного ответа нужно давать ей в контексте: документ, выгрузку, статью, а не надеяться на память. Модель не считает — значит, для цифр нужен режим с запуском кода. Модель не знает свежих событий — значит, для актуальных вопросов нужен поиск. Модель учитывает только то, что в окне контекста, — значит, длинный разговор лучше начинать заново с кратким резюме.

И последнее: модель пишет правдоподобно, а не обязательно верно. Это не дефект, который скоро исправят, а свойство самого подхода, хотя с каждым поколением ошибок становится меньше. Работа с LLM — это всегда работа «модель предлагает, человек проверяет», и чем выше цена ошибки, тем строже проверка. Проверка не обязана быть долгой: для письма достаточно перечитать, для цифр — пересчитать, для фактов — открыть источник. Если вы только начинаете, следующий шаг — гайд первый разговор с нейросетью.

Автор: Артём Беспалов, маркетинговое ИИ-агентство «Термос Беспалова», Калининград.

Источники: Vaswani и соавторы, «Attention Is All You Need», 2017 · Brown и соавторы, «Language Models are Few-Shot Learners» (GPT-3), 2020 · Ouyang и соавторы, InstructGPT, 2022 (проверено 26.09.2026).

Гайды 2026

Разобрано до шаблонов: три гайда по 490 ₽

Всё, что в статьях идёт по верхам, здесь собрано в PDF: пошаговые схемы, готовые промпты и шаблоны, которые можно взять и применить в тот же день.

Обложка гайда «Промпты, которые работают: система и 60 готовых шаблонов»

Промпты, которые работают: система и 60 готовых шаблонов

Как писать запросы к нейросетям так, чтобы ответы можно было брать в работу без переписывания

  • Формула промпта из семи элементов с разбором «плохо / хорошо»
  • Работа с контекстом и файлами: как кормить модель данными
  • Итерации: как дорабатывать ответ, а не начинать заново
  • Few-shot и цепочки промптов со схемами

PDF, 57 стр., A4

Посмотреть фрагмент (PDF)
Обложка гайда «Свой ИИ-агент за выходные: пошагово, с кодом и без»

Свой ИИ-агент за выходные: пошагово, с кодом и без

Три рабочих проекта, выбор платформы, безопасность, стоимость и тесты: от агента в конструкторе до Python-кода с MCP

  • Цикл агента и пять архитектур со схемами
  • Честный раздел «когда агент не нужен» и дерево решений
  • Сравнение платформ no-code и кода по девяти критериям
  • Три проекта пошагово: секретарь заявок, аналитик отчёта, агент на коде

PDF, 51 стр., A4

Посмотреть фрагмент (PDF)
Обложка гайда «Claude с нуля: от первого чата до скиллов и Claude Code»

Claude с нуля: от первого чата до скиллов и Claude Code

Модели, проекты, 18 сценариев с промптами, скиллы, MCP и Claude Code для тех, кто не пишет код

  • Как выбрать модель Claude по задаче (актуально на 25.09.2026)
  • Схема интерфейса и разбор возможностей: проекты, артефакты, поиск, память, рассуждение
  • Формула запроса и приёмы, которые работают именно у Claude
  • 18 рабочих сценариев с готовыми промптами: письма, договоры, презентации, таблицы, исследования

PDF, 42 стр., A4

Посмотреть фрагмент (PDF)

Оплата на стороне платёжного сервиса. После оплаты вы вернётесь на сайт, и файл откроется сразу. Оплачивая, вы принимаете оферту.

Дальше

Что почитать дальше

Токены в нейросетях

Как модель режет текст, почему русский дороже английского и как считать стоимость.

Открыть

Галлюцинации нейросетей

Почему модель уверенно выдумывает и как ловить ошибки до того, как они навредят.

Открыть

Какую модель выбрать

Подбор модели от задачи: тексты, документы, картинки, код и поиск.

Открыть
Вопросы

Частые вопросы

Что такое LLM простыми словами?
Большая языковая модель — нейросеть, обученная на огромном объёме текста предсказывать следующий фрагмент текста. Из этой задачи вырастают все её умения: отвечать на вопросы, писать, переводить, разбирать документы и код. Ответ она строит по кусочку, а не ищет в базе.
Чем LLM отличается от ChatGPT?
LLM — сама модель, двигатель, который получает текст и выдаёт текст. ChatGPT — продукт вокруг модели: интерфейс, история разговоров, загрузка файлов, поиск, запуск кода. Одна модель может работать в разных продуктах, а продукт может переключаться между моделями.
Как обучают языковые модели?
В три этапа: предобучение на огромном корпусе текстов предсказывать следующий токен, дообучение на примерах «запрос — хороший ответ» и обучение с обратной связью от людей, которые сравнивают ответы модели. Последний этап подробно описан, например, в работе OpenAI об InstructGPT 2022 года.
Почему нейросеть не знает свежих новостей?
Модель знает то, что было в обучающих текстах до даты отсечения знаний, и после обучения не меняется. О более поздних событиях она может узнать только из поиска или из документа, который вы ей передали. Без этого она уверенно описывает устаревшую картину.
Что такое параметры модели?
Числа внутри нейросети, которые настраиваются при обучении и хранят всё, что модель усвоила о языке и мире. Например, у GPT-3 в 2020 году их было 175 млрд. Больше параметров — больше способностей, но медленнее и дороже каждый ответ.
Чем LLM отличается от ИИ-агента?
Агент — это LLM, которой дали инструменты и право действовать: искать, читать и менять файлы, запускать код, работать с CRM или почтой. Модель сама решает, какой инструмент вызвать, и работает, пока задача не выполнена. Сама по себе LLM только пишет текст.

Хотите применить языковые модели в своей компании?

Понимать, как устроена LLM, — половина дела. Вторая половина — выбрать задачи, где она окупится, и встроить её в процесс с проверкой результатов. В «Термос Беспалова» начинаем с разбора ваших процессов и считаем эффект до разработки.

Получить консультацию

Пн–Вс, 10:00–20:00. Отвечаю лично.