Почему ИИ уверенно ошибается
Почему модель выдаёт выдуманный факт тем же тоном, что и верный: механика генерации, пять типовых промахов в лицо, три приёма привязки ответа к источнику и границы, за которыми эти приёмы не работают.
Ситуация, с которой это обычно начинается
Вы загрузили в чат договор поставки и спросили: какой срок оплаты и есть ли пеня за просрочку. Ответ пришёл ровный и деловой: оплата в течение десяти рабочих дней с даты подписания акта, пеня — установленный процент за каждый день просрочки, ссылка на пункт 4.3.
Вы отправляете это коллеге. Через час коллега пишет: пункта 4.3 в договоре нет, а срок оплаты привязан не к акту, а к дате поставки.
Подвела не сложность вопроса — вопрос был простой. Не отсутствие данных — договор был приложен целиком. Подвела форма ответа. Он был написан так же, как пишут верные ответы: конкретно, со ссылкой на пункт, без оговорок. По тексту ответа невозможно отличить случай «модель нашла это в документе» от случая «модель дописала то, что обычно бывает в таких договорах».
Это не редкий сбой и не «плохая модель», а следствие того, как устроена генерация текста. Механика объясняет, почему приёмы из второй половины статьи работают, а привычное «будь внимательнее и не выдумывай» — нет.
Что модель делает на самом деле
Языковая модель не ищет ответ и не сверяется с источником истины. Она продолжает текст: получив ваш запрос, она шаг за шагом подбирает следующий фрагмент так, чтобы получившееся целое выглядело правдоподобным продолжением. Правдоподобность оценивается по тому, как устроены тексты вообще, а не по тому, что написано именно в вашем договоре.
Отсюда три следствия.
Форма и содержание производятся одним и тем же процессом. Уверенный тон — не отчёт о том, что модель проверила факт. Это стилистическая характеристика: деловой ответ про договор выглядит вот так. Модель воспроизводит форму делового ответа независимо от того, есть ли за ней содержание.
Пропуск в данных заполняется типичным значением. Если в приложенном тексте нужного пункта нет, шаг генерации всё равно должен что-то выдать. Самое правдоподобное продолжение фразы «оплата производится в течение» — это обычный для таких договоров срок. Он и появляется. С номером пункта то же самое: «4.3» — типичный номер для раздела о расчётах.
Ошибка сохраняет форму правды. Выдуманный факт получается похожим на правду не случайно — похожесть на правду и есть критерий, по которому он выбран. Поэтому такие ошибки труднее заметить, чем откровенную чепуху: чепуха видна сразу, а правдоподобная подмена проходит проверку взглядом.
Почему нет сигнала «я не уверен»
Почему модель просто не напишет, что не знает?
Внутренний сигнал уверенности в каком-то виде существует, но наружу выходит плохо, и причина скорее в процедурах обучения и оценки, чем в устройстве самой сети. Авторы работы «Why Language Models Hallucinate» описывают это через аналогию с экзаменом: студент, который на трудном вопросе пишет «не знаю», получает ноль гарантированно, а студент, который угадывает, иногда попадает. Если оценка устроена так, стратегия угадывания выигрывает. Распространённые способы измерять качество моделей устроены именно так: считают долю правильных ответов и не вознаграждают отказ. Модель оптимизируется быть хорошим экзаменуемым, а не осторожным экспертом.
Практический вывод: по умолчанию модель настроена отвечать, а не воздерживаться. Право не отвечать нужно выдать ей явно — иначе она им не воспользуется.
Как это выглядит на практике
Все примеры ниже синтетические.
- Несуществующая ссылка. Номер пункта, статьи, страницы или документа, который выглядит правильно и которого нет. Ссылка создаёт впечатление проверяемости и поэтому останавливает проверку.
- Склейка двух реальных фрагментов. Срок из одного раздела и условие из другого соединяются в одно утверждение, которого нет ни там, ни там. Обе половины проверяются успешно, целое — ложно.
- Правдоподобное число. Процент, срок, объём — там, где в исходнике их не было. Число почти всегда попадает в разумный диапазон, поэтому не вызывает подозрений.
- Согласие с ложной посылкой. Вы спрашиваете «почему в договоре запрещена досрочная оплата», а такого запрета там нет. Вместо возражения вы получите объяснение запрета, которого не существует.
- Тихое расширение вопроса. Вы просили выписать условия из документа, а получили условия из документа плюс общие соображения о том, как обычно бывает. Граница между ними в ответе не обозначена.
Общее у всех пяти — ошибка не выделяется на фоне остального текста ни тоном, ни оформлением.
Приём первый: ограничить источник
Отделите вопрос «что ты знаешь вообще» от вопроса «что написано вот здесь». Пока источник не ограничен, модель свободно смешивает приложенный текст со своим общим представлением о таких текстах, и в ответе эти два слоя неразличимы.
Формулировка простая: работать только с приложенным текстом, внешние знания не использовать. Это не гарантия, а сужение поля, на котором может возникнуть выдумка.
Тот же принцип лежит в основе поисковых надстроек над моделями: сначала найти релевантные фрагменты, потом отвечать по ним. Отличие в том, что здесь вы делаете это руками и точно знаете, какой текст был на входе.
Приём второй: разрешить не знать
Раз по умолчанию модель настроена отвечать, дайте ей явную альтернативу и опишите её так же конкретно, как сам вопрос: если данных нет — написать, что их нет, и остановиться.
«Не выдумывай» — плохая инструкция: она описывает, чего не делать, но не даёт, что делать вместо этого. Рабочая инструкция задаёт конкретное поведение: какую фразу выдать, где остановиться, что перечислить отдельным списком.
У приёма есть побочный эффект. Когда отказ разрешён, ответ «в приложенном тексте этого нет» становится сигналом: вопрос сформулирован не под этот документ, приложен не тот документ или нужного раздела в нём действительно нет.
Приём третий: требовать привязку к тексту
Просите не вывод, а вывод вместе с дословной цитатой и указанием места — номер пункта, раздела, страницы.
Цитата превращает непроверяемое утверждение в проверяемое: вы берёте её и ищете в исходном документе поиском по тексту. Либо она там есть, либо её там нет. Промежуточного состояния не бывает — а именно в промежуточном состоянии живут все ошибки из списка выше.
Выдумку это не отменяет: цитату тоже можно сгенерировать. Но проверка переносится с уровня «звучит правдоподобно» на уровень «нашлось или не нашлось».
Готовый промпт: три приёма в одном запросе
Пункт 4 закрывает согласие с ложной посылкой — случай, когда ошибка приходит из вашего же вопроса.
Проверка после такого запроса одна: берёте каждую цитату и ищете её в исходном файле. Утверждения без цитаты считайте неподтверждёнными независимо от того, насколько разумно они звучат.
Где это ломается
У приёмов есть границы. Ниже — случаи, в которых ответ проходит все три проверки и всё равно оказывается неверным.
Цитата точная — вывод неверный. Модель может дословно процитировать нужный пункт и сделать из него вывод, которого там нет. Привязка к тексту защищает от выдуманного источника, но не от неверного толкования верного источника. Читайте цитату, а не только вывод под ней.
Источник сам содержит ошибку. Ответ, строго привязанный к приложенному тексту, воспроизведёт ошибку этого текста и придаст ей вид проверенного факта. Приём гарантирует соответствие источнику, а не истине. Ответственность за качество источника остаётся на вас.
Длинный документ обрабатывается не целиком. Если текста много, часть его может не попасть в обработку или потерять вес. Тогда честное «в приложенном тексте этого нет» будет ложным — в тексте это есть, но не дошло. Признак: ответ «нет» на вопрос, ответ на который вы точно видели своими глазами. Лечится дроблением документа на разделы и отдельными запросами по каждому.
Скан и распознавание. Если файл — фотография или скан, цитата будет точной по распознанному тексту, а не по бумаге. Подмена цифры на этапе распознавания пройдёт все ваши проверки. Сверяйте числа с оригиналом глазами.
Ложные отказы. Жёсткий запрет достраивать иногда приводит к отказу там, где ответ был. Вы получите «этого нет» вместо нужного фрагмента и потеряете время на повторный запрос. Это плата за приём; сравнивать её нужно со стоимостью одной незамеченной выдумки в вашей задаче.
Задачи, где сверять не с чем. Оценка, прогноз, идеи, формулировки, черновик письма — здесь привязки к тексту не существует, потому что нет исходника. Приёмы из статьи на такие задачи не распространяются; там работает другая проверка — вы сами.
Поиск в интернете не отменяет проблему. Модель с доступом к сети может неточно пересказать найденную страницу или сослаться на неё не по делу. Правило то же: смотрите не на ссылку, а на то, что по ней написано.
Что сделать сегодня
Возьмите документ, с которым вы уже работали через ИИ, и задайте по нему тот же вопрос ещё раз — промптом из этой статьи. Проверьте поиском по тексту каждую цитату из нового ответа.
Запишите два числа: сколько утверждений подкреплено найденной цитатой и сколько цитат не нашлось. Второе число — ваш замер риска при работе без привязки к источнику. Его стоит знать до того, как очередной ответ уйдёт коллеге или клиенту.
Источники
- https://arxiv.org/abs/2509.04664 проверено 2026-08-03
- https://arxiv.org/abs/2311.05232 проверено 2026-08-03
- https://arxiv.org/abs/2005.11401 проверено 2026-08-03
Дальше — система, а не отдельный приём
Статья даёт один метод. В курсе — шесть модулей: от постановки задачи до сборки своего помощника, с готовыми промптами и разбором ошибок. Первый модуль открыт бесплатно.