Галлюцинация нейросети — ответ, который звучит уверенно и правдоподобно, но не соответствует действительности: несуществующая цитата, выдуманное судебное решение, неверная дата, число, которого не было в документе, функция программы, которой нет в библиотеке. Модель не «врёт» намеренно и не знает, что ошибается. Она пишет самое правдоподобное продолжение текста — а правдоподобное не всегда правда.
Галлюцинации — не редкий сбой, который скоро исправят, а свойство того, как устроены языковые модели. С каждым поколением их становится меньше, но полностью они не исчезли ни у одной модели. Поэтому уметь их ловить нужно каждому, кто использует нейросети в работе. Короткое определение есть в словаре терминов, здесь — механизм, реальные случаи и рабочие способы защиты.
Что такое галлюцинации нейросетей
Языковая модель строит ответ по кусочку, выбирая на каждом шаге наиболее вероятное продолжение с учётом всего предыдущего текста. Она не сверяется с базой фактов и не хранит источники. Когда в обучающих данных было много надёжного текста по теме, вероятное продолжение почти всегда верное. Когда данных мало, они противоречивы или вопрос касается чего-то после даты обучения, модель всё равно пишет гладкий текст — и он может оказаться выдумкой.
Коварство галлюцинаций в том, что по форме они неотличимы от верных ответов. Та же уверенная интонация, та же структура, те же детали: номер дела, страница, процент, имя автора. Более того, конкретика делает выдумку убедительнее. Человек, который не знает ответа, обычно сомневается вслух; модель по умолчанию не сомневается. Если спросить её «ты уверена?», она может извиниться и выдать другую выдумку или, наоборот, подтвердить первую.
Отсюда главное правило: уверенность ответа ничего не говорит о его правильности. Проверять нужно не то, что звучит подозрительно, а то, от чего зависит решение. Как устроена языковая модель и почему ответ появляется по кусочку, разобрано в гайде что такое LLM простыми словами.
Почему модели выдумывают
Первая причина — сама задача, на которой обучена модель: продолжать текст правдоподобно. У модели нет отдельного механизма «я этого не знаю», есть только вероятности продолжений. Если для вопроса о малоизвестном факте ни одно продолжение не выделяется, модель всё равно выберет одно из них.
Вторая причина — то, как модели учат и оценивают. В сентябре 2025 года OpenAI опубликовала исследование «Why language models hallucinate». Его главный довод: большинство тестов, по которым сравнивают модели, засчитывают только точные ответы, а ответ «не знаю» получает ноль — ровно как неверный. В таких условиях угадывать выгоднее, чем признаваться. Авторы приводят пример с днём рождения: если модель не знает дату, но назовёт случайную, у неё 1 шанс из 365 угадать, а «не знаю» гарантирует ноль. На тысячах вопросов модель, которая угадывает, выглядит в рейтингах лучше осторожной.
В той же публикации OpenAI приводит показательное сравнение двух своих моделей на тесте SimpleQA — наборе коротких вопросов на знание фактов. Более новая модель чаще отказывается отвечать и поэтому формально чуть реже даёт правильный ответ, но ошибается втрое реже.
| Показатель на SimpleQA | gpt-5-thinking-mini | OpenAI o4-mini |
| Отказ отвечать («не знаю») | 52% | 1% |
| Правильный ответ | 22% | 24% |
| Неверный ответ (галлюцинация) | 26% | 75% |
По привычному рейтингу «доля правильных ответов» старая модель выглядит лучше — 24% против 22%. Но она почти никогда не признаётся в незнании и в трёх случаях из четырёх отвечает неверно. Для работы это важный урок: модель, которая чаще говорит «не знаю», полезнее той, что всегда отвечает уверенно, — и такое поведение можно отчасти включить инструкцией в промпте.
Третья причина — нехватка или конфликт информации в контексте. Если нужного факта нет в переданном документе или он потерялся в середине длинного контекста, модель достраивает ответ из общих знаний. Именно так бот поддержки «придумывает» условия возврата, которых нет в правилах магазина. Как модель теряет информацию в длинном тексте, разобрано в гайде контекстное окно нейросети.
Галлюцинации уменьшаются, но не исчезают. OpenAI в той же работе пишет, что новые модели ошибаются заметно реже, особенно в режиме рассуждений, но галлюцинации остаются фундаментальной проблемой всех больших языковых моделей. Планировать работу так, будто модель не ошибается, нельзя ни с одной из них.
Три случая, которые стоили денег
Выдуманные судебные решения. В деле Mata v. Avianca в федеральном суде Нью-Йорка адвокаты в 2023 году сослались на шесть решений, найденных через ChatGPT. Ни одного из них не существовало. Когда суд запросил тексты, адвокаты спросили у ChatGPT, настоящие ли это дела, и получили подтверждение. Суд наложил штраф 5000 долларов. Подробно — в гайде нейросети для юриста.
Несуществующие условия от чат-бота. Чат-бот Air Canada сообщил пассажиру, что скидку в связи со смертью родственника можно оформить задним числом, хотя правила этого не допускали. 14 февраля 2024 года трибунал Британской Колумбии обязал авиакомпанию компенсировать разницу: компания отвечает за информацию на своём сайте, от кого бы она ни исходила. Подробно — в гайде нейросети для поддержки клиентов.
Выдуманные программные пакеты. Исследование, представленное на USENIX Security 2025, проверило 16 моделей, которые пишут код, и нашло, что в среднем не меньше 5,2% предложенных пакетов у коммерческих моделей и 21,7% у открытых не существуют. Злоумышленники регистрируют такие названия с вредоносным кодом, и разработчик, установивший «рекомендованный» пакет, получает вирус в проекте. Подробно — в гайде нейросети для разработчика.
Во всех трёх случаях общая деталь: люди приняли уверенный ответ модели за проверенный факт и не сверились с первоисточником — базой судебных решений, правилами компании, реестром пакетов. Проверка заняла бы минуты, а ошибка обошлась в штраф, компенсацию и репутацию.
Какие бывают галлюцинации
Удобно различать галлюцинации по тому, откуда модель взяла неверное, — от этого зависит способ проверки.
| Вид | Пример | Как ловить |
| Выдуманный факт | неверная дата, несуществующий закон или событие | первоисточник |
| Выдуманный источник | ссылка на исследование, статью или решение, которых нет | открыть источник по ссылке |
| Искажение документа | в пересказе договора срок 10 дней стал 14 | сверка с исходным текстом |
| Ошибка в расчёте | неверная сумма или процент по таблице | формула или код |
| Выдуманная функция | метод или параметр, которого нет в библиотеке | запуск кода, документация |
| Додуманное обещание | бот назвал условие, которого нет в правилах | ответ только по базе знаний |
Особо стоит выделить искажение документа. Кажется, что если модель работает с загруженным файлом, она не может ошибиться — ведь текст перед ней. Но при пересказе, сокращении и извлечении данных модели обобщают: «до 3 рабочих дней» превращается в «быстро», «кроме тарифа Базовый» теряется, две похожие суммы меняются местами. Такие ошибки опаснее выдуманных фактов, потому что их не ждут.
Как снизить число выдумок
Давать факты, а не спрашивать память. Самый действенный способ — передать модели документ, выгрузку или статью и попросить отвечать только по ним. Бот поддержки, который отвечает по найденным статьям базы знаний (этот подход называют RAG), ошибается заметно реже бота, который отвечает «из головы». Для актуальных вопросов нужен режим с поиском: тогда модель сначала находит источники, а потом пишет по ним со ссылками.
Разрешить сказать «не знаю». Модель по умолчанию стремится дать ответ. Прямая инструкция меняет это поведение: «если ответа нет в документе, так и напиши», «если не уверен, пометь это». Ещё лучше — дать формат для пробелов: «[нет в документе]», «[нужно уточнить]». Пустое место с пометкой полезнее правдоподобной выдумки.
Так не надокакие штрафы предусмотрены в этом договоре?
Так лучшеВыпиши все штрафы и неустойки из договора ниже. Для каждой — номер пункта и дословная цитата. Ничего не добавляй из общих знаний о договорах. Если какой-то вид ответственности, который обычно бывает в таких договорах, здесь отсутствует, перечисли его отдельно с пометкой «в договоре нет».
Требовать цитаты и ссылки. Номер пункта, дословная цитата, ссылка на страницу — всё это превращает ответ в проверяемый. Цитату легко найти в документе, ссылку — открыть. Если модель не может привести цитату, это сигнал, что ответ не опирается на текст.
Снижать случайность. При работе через API для задач с фактами — извлечения данных, ответов по документу, классификации — ставьте низкую температуру: модель чаще выбирает самое вероятное продолжение и реже «фантазирует». Высокая температура уместна для идей и черновиков, где разнообразие важнее точности. В обычных чатах этого параметра обычно не видно, но тот же эффект даёт формулировка: «ответь кратко и только по документу» работает строже, чем «расскажи, что думаешь». Подробнее о температуре — в гайде что такое LLM.
Считать кодом. Для чисел используйте режим, в котором модель пишет и выполняет код: результат вычисления надёжнее числа, «прочитанного» из таблицы. Выбирать подходящую модель: рассуждающие режимы ошибаются реже на многошаговых задачах, а модели с поиском — на вопросах о свежих событиях. И спрашивать дважды: если два независимых ответа на один вопрос расходятся, модель не уверена, и ответ нужно проверить.
Как проверять ответы
Проверять всё подряд невозможно и не нужно. Разумный подход — проверять пропорционально цене ошибки. Черновик поста в соцсетях достаточно перечитать. Письмо клиенту с условиями, отчёт руководителю, документ в суд, код в продакшн — проверяются по первоисточнику каждый факт, число и ссылка, от которых зависит решение.
Практический порядок проверки удобно держать в виде короткого списка шагов. Модель может помочь и здесь — попросите её перечислить все проверяемые утверждения в своём ответе, и такой список удобно пройти по пунктам.
| Шаг | Что проверяем | Чем |
| 1 | числа, суммы, проценты | исходные данные, формула или код |
| 2 | ссылки и цитаты | открыть каждую, найти цитату в источнике |
| 3 | факты, от которых зависит вывод | закон, документация, реестр, сайт ведомства |
| 4 | пропуски при пересказе | сверка условий и исключений с документом |
| 5 | обещания и сроки | утверждённые правила и договорённости |
В бизнес-процессах проверка должна быть встроена, а не зависеть от внимательности сотрудника. Ответы бота — только по утверждённой базе знаний, с передачей сложных случаев человеку. Автоматически извлечённые данные — с выборочной проверкой каждую неделю. Решения с деньгами и обязательствами — с подтверждением человеком. Все ответы модели — в журнале, чтобы в споре было видно, что именно она сказала. Как тестировать такие функции перед запуском, разобрано в гайде нейросети для тестировщика.
С чего начать прямо сейчас: добавьте в свои промпты разрешение говорить «не знаю» и требование цитат, а для важных ответов заведите привычку открывать хотя бы одну ссылку и пересчитывать хотя бы одно число. Это простые привычки, но именно их не хватило во всех трёх историях выше. Как строить промпты целиком, разобрано в гайде как писать промпты.
Автор: Артём Беспалов, маркетинговое ИИ-агентство «Термос Беспалова», Калининград.
Источники: OpenAI, «Why language models hallucinate», 05.09.2025 · решение по делу Mata v. Avianca, 22.06.2023 · ABA о деле Moffatt v. Air Canada · «We Have a Package for You!», USENIX Security 2025 (проверено 26.09.2026).