Почему она уверенно выдумывает
Галлюцинация — не сбой, а та же операция, что и правильный ответ, только без везения. Отсюда: уверенность ничего не значит, а проверять надо по цене ошибки.
Ты просишь десять источников по теме и получаешь десять: авторы, названия, годы, журналы. Восемь существуют. Двух нет — и, если приглядеться, как раз эти два выглядят аккуратнее остальных.
Именно на этом обжигаются сильнее всего, потому что провал никак себя не выдаёт. Ничто не запинается, не оговаривается, не подсвечивается предупреждением. И это не баг, который через год залатают: он растёт из той же машинерии, что выдаёт хорошие ответы.
Та же операция, только без везения
Вернёмся к рельефу. Модель выдаёт правдоподобное продолжение — больше она ничего не делает. Когда земля под вопросом густо натоптана материалом, который случился правдой, правдоподобное продолжение оказывается и правильным. Когда не натоптана — шарик всё равно катится. Он катится всегда. Обрыва с табличкой «здесь данных нет» в рельефе не предусмотрено.
Значит, правильный ответ и выдуманный — это одно и то же действие: правдоподобно продолжить. Одно попало в реальность, другое нет. И внутри модели их ничто не различает, потому что отдельной способности «проверить, знаю ли я это» у неё нет: вспомнить и сочинить изнутри — одна операция.
Отсюда следствие, которое стоит выделить: уверенность ответа — это свойство стиля письма, а не наличия оснований. Гладко, структурно и убеждённо — так эта система пишет и когда права, и когда выдумывает. Считать надёжность по поверхности нельзя, а инстинкт пытаться натренирован на людях, у которых заминка действительно означает сомнение.
Отличник, которому нельзя оставить пустую клетку
Вот картинка, которую стоит забрать.
Представь отличника на экзамене с одним необычным правилом: оставлять клетку пустой запрещено, а за неверный ответ ничего не снимают. Пусто — ноль; мимо — ноль; угадал — полный балл. Какая стратегия оптимальна? Заполнять все клетки всегда, самым правдоподобным из доступного. И тем же ровным почерком, что и клетки, которые знаешь наверняка, — почерк ведь не оценивают.
У модели нет пустой клетки. Есть только заполненная.
Это не только метафора. В 2025 году Адам Калаи с коллегами выпустили работу с прямолинейным названием Why Language Models Hallucinate, где ровно это и доказывается: галлюцинации держатся не потому, что никто не починил баг, а потому, что способ обучения и оценки моделей вознаграждает угадывание сильнее, чем признание незнания. Стандартные бенчмарки ставят «верно/неверно», и «не знаю» получает тот же ноль, что и ошибка, — значит, модель, настроенная набирать баллы, учится всегда что-нибудь выдавать. Отличника таким сделал экзамен.
Заодно это подсказывает, что помогает: поменять локальный стимул. Если явно разрешить и попросить «не знаю», его становится заметно больше. Это формулировка, которую ты можешь написать сам, — до неё дойдём.
Сколько стоит не проверить
В 2023 году нью-йоркский адвокат, готовя документы по делу Mata v. Avianca, попросил у ChatGPT судебную практику в поддержку позиции — и получил: названия дел, решения судов, цитаты, ссылки. Шести из этих дел не существовало. Когда противоположная сторона не смогла их найти, адвокат спросил у модели, настоящие ли это дела; та заверила, что настоящие. Документ ушёл в суд. В июне того же года судья Кевин Кастел оштрафовал юристов на пять тысяч долларов, и с тех пор история повторялась с другими профессионалами много раз.
Поучительна тут не выдумка, а шаг проверки. Он ведь проверил. Проверил, спросив у той же системы, которая ответ и породила, — то есть не проверил никак. Отсюда переходим к двум движениям, которые ощущаются проверкой и ею не являются.
Две фальшивые проверки
«Ты уверена?» Ты уже знаешь, почему это не работает: модель обучена на человеческих предпочтениях, а нажим — сильнейший из возможных сигналов, что человек хочет другой ответ. Обычно ты получишь разворот — иногда с неверного ответа, иногда с верного. Информации о правде в этом развороте почти нет. Если нужен настоящий второй взгляд, проси рассуждение, а не вердикт: «разбери по шагам, существует ли эта ссылка, и скажи, чем её можно подтвердить».
«Дай источник». Источник порождается тем же процессом, что и утверждение. Просьба к модели, которая только что выдумала факт, подтвердить его ссылкой очень часто даёт выдуманную ссылку: правдоподобный автор, правдоподобный журнал, правдоподобный год, иногда настоящий DOI от совсем другой статьи. Ссылка становится доказательством только после того, как ты по ней прошёл. Неоткрытая ссылка — это украшение.
Где живёт риск
Галлюцинации распределены неравномерно. Они сгущаются на тонком рельефе — там, где конкретно, редко, свежо или точно:
- точные числа, даты, статистика, цены, дозировки;
- дословные цитаты — форма цитаты даётся легко, точные слова нет;
- ссылки, URL, номера страниц, названия файлов, судебные дела, частности законов;
- факты о конкретных людях, особенно не знаменитых, и биографии вообще;
- детали API, параметры функций, версии библиотек, флаги конфигурации: формат натоптан, специфика нет;
- всё, что после границы знаний;
- узкие, нишевые и сильно специальные области, где земля почти не топтана.
И ещё один триггер, менее очевидный, но ловящий постоянно: ложная предпосылка в твоём собственном вопросе. Спроси «почему Эйнштейн провалил математику в школе» — и невнимательная модель объяснит то, чего не было, потому что твой вопрос уже поставил эту лощину перед шариком. Когда ты добываешь информацию, не протаскивай допущение внутрь вопроса. Сначала «было ли X?», потом «почему X?».
Что действительно снижает риск
Ни один способ не идеален. Каждый лучше, чем надежда.
Клади материал на стол. Модель, отвечающая по документу, который ты дал, занимается чем-то куда более близким к чтению, чем к припоминанию. Закрепи это требованием прослеживаемости: «на каждое утверждение процитируй точное предложение из текста, а если его там нет — так и скажи».
Включай поиск для всего, что чувствительно ко времени, — и всё равно открывай ссылки. Опора на найденные страницы существенно снижает выдумывание, но не устраняет неверное прочтение, и настоящая ссылка вполне может стоять под утверждением, которого в ней нет.
Разрешай незнание вслух. «Если не уверена — так и скажи. Ответ „не знаю“ лучше, чем догадка». Поразительная доля выдумок — это вежливость под давлением необходимости что-то выдать.
Проси разделить по уверенности. «Раздели на: в чём ты уверена, в чём сомневаешься, что нужно проверить снаружи». Разложить по этим корзинам модели удаётся заметно лучше, чем самой оговариваться посреди текста.
Проверяй вне контура. Любая проверка, оставшаяся внутри того же разговора, — не проверка. Ищи отдельно, открывай источник, запускай код, спрашивай человека.
Калибровка, а не недоверие
Смысл всего этого не в том, чтобы не доверять модели: коллега, которого перепроверяешь во всём, не экономит тебе ничего. Смысл в том, чтобы тратить проверку там, где она окупается.
Сортируй работу по цене ошибки. Там, где ошибка дешёвая — мозговой штурм, черновик, объяснение понятия, которое ты всё равно будешь применять, код, который ты сейчас запустишь, разбор собственных путаных мыслей, — неверный ответ стоит тридцати секунд и обнаружится сам. Не проверяй, работай. Там, где ошибка дорогая — цифра в отчёте, ссылка в публикации, всё юридическое, медицинское и финансовое, всё, что запускает необратимое действие, всё, что прочитает клиент, — ошибка стоит репутации, а иногда больше. Проверяй каждую конкретику, каждый раз.
Большинство делает ровно наоборот: допрашивает модель о мозговом штурме и вставляет ссылку в документ не глядя.
И последнее — прямой мостик к сфере «Как учиться». Гладкий, хорошо разложенный текст создаёт у читателя сильное ощущение понимания: ту самую иллюзию компетентности, что и перечитывание учебника с маркером. Когда модель складно тебе что-то объясняет, ты почувствуешь, что понял. Лечится тем же, что и там: закрой ответ и воспроизведи сам. Не получилось — ты получил не понимание, а ощущение.
На практике
Никогда не проверяй ответ у той же модели. Проверка — только снаружи: источник, поиск, запуск, человек.
Открывай каждую ссылку, прежде чем отдать текст дальше. Неоткрытая ссылка — не ссылка.
Сначала «было ли», потом «почему». Не подсовывай предпосылку, которую сам хочешь проверить.
Проговаривай «„не знаю“ — нормальный ответ», когда результат важен.
Сортируй по цене ошибки, а не по важности темы. Дёшево — не проверяй, работай. Дорого — проверяй каждую конкретику всегда.
Проверь себя
Закрой статью и ответь своими словами:
- Почему галлюцинация — не поломка, а та же операция, что и правильный ответ?
- Что объясняет метафора экзамена без пустых клеток и что показали Калаи с коллегами про способ оценки моделей?
- Почему «ты уверена?» и «дай источник» не являются проверкой?
- Назови пять зон, где риск выдумки резко растёт. Почему именно они?
- Что не так с вопросом «почему Эйнштейн провалил математику»?
- Какие четыре приёма реально снижают выдумывание и почему ни один не убирает её полностью?
- Как решать, что проверять, а что нет?
Коротко
- Галлюцинация — то же действие, что и правильный ответ: выдать правдоподобное продолжение. Одно совпало с реальностью, другое нет, и внутри модели их ничто не различает.
- Уверенность — стиль письма, а не основание. Гладкость одинакова и над глубокой колеёй, и над пустотой.
- Why Language Models Hallucinate (Калаи и др., 2025): обучение и бенчмарки поощряют угадывание, потому что «не знаю» получает тот же ноль, что и ошибка.
- Mata v. Avianca (2023): шесть выдуманных дел в судебном документе и штраф — причём юрист «проверил» их у той же модели.
- «Ты уверена?» включает угодливость, «дай источник» может выдумать и источник. Ни то ни другое не проверка.
- Риск сгущается на конкретном, редком, свежем и точном: числа, цитаты, ссылки, имена, детали API. Отдельный триггер — ложная предпосылка в твоём вопросе.
- Помогают: материал на столе с требованием точных цитат, поиск с открыванием ссылок, явное разрешение «не знаю», просьба разделить уверенное и сомнительное. Всё это частично.
- Проверяй по цене ошибки, а не по теме. И помни: складное объяснение даёт ту же иллюзию компетентности, что и учебник с маркером, — закрой и воспроизведи.
- У модели нет пустой клетки. Есть только заполненная.