LLM (large language model, большая языковая модель) — нейросеть, обученная на огромном объёме текста предсказывать, какой фрагмент текста должен идти следующим. Из этой простой задачи вырастает всё, что умеют ChatGPT, Claude, Gemini, YandexGPT и GigaChat: отвечать на вопросы, писать письма, переводить, разбирать документы, писать код. Модель не ищет ответ в базе данных — она строит его фрагмент за фрагментом, выбирая на каждом шаге наиболее подходящее продолжение.
Понимать это устройство полезно не ради теории. Почти все особенности работы с нейросетями — почему важна формулировка вопроса, почему модель уверенно выдумывает, почему она «не знает» вчерашних новостей, почему русский текст обходится дороже — прямо следуют из того, как LLM устроена. Короткое определение есть в словаре терминов, здесь — подробный разбор без формул.
LLM простыми словами
Представьте человека, который прочитал огромную библиотеку — книги, статьи, форумы, документацию, код — и так хорошо запомнил, как устроен текст, что по началу любой фразы угадывает её продолжение. Он не помнит каждую книгу дословно, но уловил закономерности: какие слова идут вместе, как строятся рассуждения, как отвечают на вопросы, как выглядит договор или программа. Если спросить его о чём-то, он не ищет ответ на полке — он продолжает текст так, как, по его опыту, такие тексты обычно продолжаются.
Технически модель работает с токенами — кусочками текста. Получив ваш вопрос, она вычисляет вероятности для всех возможных следующих токенов, выбирает один, добавляет его к тексту и повторяет, пока ответ не будет готов. Именно поэтому ответ в чате появляется постепенно: модель действительно пишет его по кусочку. Что такое токены и почему за них платят, разобрано в гайде что такое токены в нейросетях.
Слово «большая» в названии относится к двум вещам: к объёму данных для обучения — это сотни миллиардов и триллионы токенов текста — и к числу параметров модели. Для сравнения: GPT-3, представленная OpenAI в 2020 году, имела 175 млрд параметров, и именно с моделей такого масштаба языковые модели начали уверенно справляться с задачами, которым их специально не учили.
Как модель учится: три этапа
1. Предобучение. Модель получает огромный корпус текстов и учится предсказывать следующий токен. Ей показывают начало фрагмента, она угадывает продолжение, сверяется с настоящим текстом и немного подстраивает параметры, чтобы в следующий раз ошибиться меньше. Это повторяется триллионы раз. Этап самый дорогой — месяцы вычислений на тысячах специализированных процессоров. На выходе получается модель, которая хорошо продолжает любой текст, но ещё не умеет вести диалог: на вопрос она может ответить списком похожих вопросов, потому что в интернете такое тоже встречается.
2. Дообучение на инструкциях. Модели показывают тысячи примеров «запрос — хороший ответ», составленных людьми: вопрос и развёрнутый ответ, просьба и её выполнение, задача и решение. Модель учится не просто продолжать текст, а выполнять то, о чём просят. После этого этапа она становится похожей на ассистента.
3. Обучение с обратной связью. Люди сравнивают несколько ответов модели на один вопрос и отмечают, какой лучше: точнее, полезнее, безопаснее. По этим оценкам модель дообучают предпочитать хорошие ответы. Метод называют RLHF — обучение с подкреплением на основе отзывов людей; одна из самых известных работ о нём — статья OpenAI об InstructGPT 2022 года, а 30 ноября того же года вышел ChatGPT. Именно этот этап делает модель вежливой, отказывающейся от опасных просьб и старающейся быть полезной — а заодно, как выяснилось позже, склонной отвечать уверенно даже тогда, когда она не знает ответа.
Модель после обучения не меняется. Когда вы разговариваете с ChatGPT или GigaChat, модель не учится на вашем разговоре в реальном времени. Она помнит только то, что есть в текущем контексте. Если провайдер использует переписки для обучения следующих версий, это отдельный процесс, который обычно можно отключить в настройках.
Что внутри: параметры, трансформер, внимание
Параметры — это числа внутри модели, которые настраиваются при обучении. В них и хранится всё, что модель усвоила о языке и мире: не в виде фактов в таблице, а в виде сложных связей. Больше параметров — больше «памяти» и способностей, но и дороже каждый ответ. Поэтому у провайдеров обычно есть линейка: большая модель для сложных задач и младшие — быстрые и дешёвые.
Трансформер — архитектура, на которой построены все современные LLM. Её описали исследователи Google в статье «Attention Is All You Need» в 2017 году. Главная идея — механизм внимания: при обработке каждого токена модель смотрит на все остальные токены в контексте и решает, какие из них важны для понимания текущего. В предложении «Мастер приехал к клиенту, но он не открыл дверь» внимание помогает связать «он» с «клиентом», а не с «мастером».
Внимание объясняет и главное ограничение модели — контекстное окно. Модель может одновременно учитывать только ограниченное число токенов: у современных флагманов это сотни тысяч, у части моделей — до миллиона и больше. Всё, что не помещается в окно, для модели не существует. Почему это важно в длинных разговорах и как с этим работать, разобрано в гайде контекстное окно нейросети.
Откуда модель «знает» и почему ошибается
Знания модели — это закономерности, усвоенные из обучающих текстов до определённой даты, которую называют датой отсечения знаний. О событиях после неё модель не знает, если не подключён поиск. Она может уверенно описывать правила, которые уже изменились: налоговые ставки, интерфейсы сервисов, законы. Поэтому для свежих фактов нужен поиск или документ в контексте, а не память модели.
Вторая особенность — модель не хранит факты с источниками. Когда она пишет «по данным исследования 2021 года», она не открывает исследование, а порождает правдоподобный текст. Если в обучающих данных было много похожих формулировок, ответ, скорее всего, верный. Если мало — модель всё равно напишет что-то гладкое, и это будет выдумка. Это явление называют галлюцинациями, и оно следует прямо из устройства: модель оптимизирована писать правдоподобно, а правдоподобное не всегда правда. Подробный разбор причин и способов защиты — в гайде галлюцинации нейросетей.
Третья — модель не считает, а угадывает результат вычислений, если не запускает код. Числа для неё — такие же кусочки текста, и сложение двух больших чисел она делает по аналогии с виденными примерами. Современные чат-боты обходят это, запуская код для расчётов, — и тогда результату можно доверять больше, чем тексту.
Четвёртая особенность — ответы на один и тот же вопрос каждый раз немного разные. На каждом шаге модель выбирает следующий токен не всегда самый вероятный, а случайно из нескольких вероятных, и степень этой случайности задаёт параметр температура. При низкой температуре ответы предсказуемее и суше, при высокой — разнообразнее и чаще уходят в сторону. В чатах температуру обычно не показывают, а через API её можно задать: для извлечения данных из документов её ставят низкой, для генерации идей — повыше.
Практический вывод: если ответ важен, спросите дважды — расхождение между ответами хороший признак того, что модель не уверена. Если два ответа совпадают по сути, это не гарантия правоты, но повод доверять им чуть больше.
Весь этот путь занял меньше десяти лет. Ниже — ключевые даты, которые помогают понять, почему ещё недавно нейросети «не умели» того, что сейчас кажется обычным.
| Когда | Что произошло |
| 2017 | исследователи Google описывают архитектуру трансформер |
| 2020 | OpenAI представляет GPT-3 со 175 млрд параметров |
| март 2022 | работа OpenAI об InstructGPT: обучение по оценкам людей |
| 30 ноября 2022 | выходит ChatGPT |
| 24 апреля 2023 | Сбер открывает закрытое тестирование GigaChat |
| 17 мая 2023 | Яндекс добавляет YandexGPT в Алису |
| сентябрь 2024 | OpenAI выпускает o1 — первую широко известную рассуждающую модель |
За это время изменилось не только качество ответов. Контекстное окно выросло с нескольких тысяч токенов у первых моделей до сотен тысяч и больше у нынешних, модели научились работать с изображениями, звуком и файлами, а цена за миллион токенов у сопоставимых по качеству моделей заметно снизилась. Поэтому советы двухлетней давности о том, «чего нейросети не умеют», часто уже устарели — проверяйте их на текущих версиях.
Какие бывают LLM
Моделей десятки, но для практики их удобно делить на несколько групп. Внутри каждой — свои лидеры, которые меняются каждые несколько месяцев, поэтому полезнее понимать различия между группами, чем запоминать названия версий.
| Группа | Примеры | Когда нужна |
| Флагманы | старшие модели Claude, GPT, Gemini | сложные задачи, длинные документы, код |
| Младшие и быстрые | Claude Haiku, облегчённые версии GPT и Gemini | классификация, извлечение полей, массовые задачи |
| Рассуждающие | режимы размышления у флагманов | анализ, математика, многошаговые задачи |
| Российские | YandexGPT, Alice AI, GigaChat | доступ без VPN, оплата в рублях, данные в России |
| Открытые | Llama, Qwen, DeepSeek | запуск на своём сервере, закрытый контур |
Рассуждающие модели — заметный сдвиг последних двух лет. Первой широко известной стала o1 от OpenAI в сентябре 2024 года; сейчас такой режим есть у большинства флагманов. Перед ответом модель пишет внутреннюю цепочку рассуждений и только потом формулирует итог. Это улучшает результат в задачах, где нужно несколько шагов, но делает ответ медленнее и дороже. Открытые модели можно скачать и запустить у себя — это важно для компаний, которым нельзя отправлять данные во внешние сервисы. Как выбрать модель под задачу, разобрано в гайде какую модель выбрать.
LLM, чат-бот, поиск и агент: в чём разница
Эти слова часто используют как синонимы, хотя это разные уровни. LLM — двигатель: сама модель, которая получает текст и выдаёт текст. Чат-бот вроде ChatGPT или GigaChat — продукт вокруг двигателя: интерфейс, история разговоров, загрузка файлов, иногда поиск и запуск кода. Одна и та же LLM может работать в разных продуктах, а один продукт — переключаться между разными моделями.
Поисковая система находит существующие документы и показывает ссылки. LLM пишет новый текст. Когда поиск и модель объединяют — как в Нейро от Яндекса, Perplexity или поиске внутри ChatGPT, — модель сначала находит страницы, а потом пишет ответ по ним со ссылками. Такой ответ проверить проще, чем ответ из памяти модели.
ИИ-агент — LLM, которой дали инструменты и право действовать: искать, читать файлы, запускать код, отправлять письма, работать с CRM. Модель сама решает, какой инструмент вызвать и что делать дальше, пока задача не будет выполнена. Подробно об агентах и их отличии от чат-ботов — в статье блога что такое ИИ-агент, а о том, как собрать своего, — в гайде свои агенты и субагенты.
Что это значит на практике
Из устройства LLM следует несколько правил, которые делают работу с любой моделью заметно лучше. Модель продолжает ваш текст — значит, чем точнее и полнее начало, тем точнее продолжение: роль, задача, контекст, ограничения и формат ответа в запросе дают больше, чем любые хитрые приёмы. Как это делать, разобрано в гайде как писать промпты.
Модель знает закономерности, а не проверенные факты, — значит, факты для важного ответа нужно давать ей в контексте: документ, выгрузку, статью, а не надеяться на память. Модель не считает — значит, для цифр нужен режим с запуском кода. Модель не знает свежих событий — значит, для актуальных вопросов нужен поиск. Модель учитывает только то, что в окне контекста, — значит, длинный разговор лучше начинать заново с кратким резюме.
И последнее: модель пишет правдоподобно, а не обязательно верно. Это не дефект, который скоро исправят, а свойство самого подхода, хотя с каждым поколением ошибок становится меньше. Работа с LLM — это всегда работа «модель предлагает, человек проверяет», и чем выше цена ошибки, тем строже проверка. Проверка не обязана быть долгой: для письма достаточно перечитать, для цифр — пересчитать, для фактов — открыть источник. Если вы только начинаете, следующий шаг — гайд первый разговор с нейросетью.
Автор: Артём Беспалов, маркетинговое ИИ-агентство «Термос Беспалова», Калининград.
Источники: Vaswani и соавторы, «Attention Is All You Need», 2017 · Brown и соавторы, «Language Models are Few-Shot Learners» (GPT-3), 2020 · Ouyang и соавторы, InstructGPT, 2022 (проверено 26.09.2026).