Как модель научилась
Знания дало чтение, манеры — оценки. Самая неприятная привычка модели, готовность с тобой соглашаться, растёт из второго этапа — и лечится формулировкой.
Модель знает, кто такой Наполеон, но не знает, что было на прошлой неделе. Пишет рабочий код, но понятия не имеет, о чём вы договорились вчера. Услужлива до неприличия — и иногда так старается быть полезной, что отказывается от собственного правильного ответа, стоит на неё надавить.
Ничего из этого не случайно. Это отпечатки двух очень разных этапов обучения плюс третьего слоя, добавленного уже после обучения. Как только начинаешь видеть, из какого этапа выросло поведение, странности модели перестают быть загадками и становятся тем, с чем можно работать.
Этап первый: чтение
Первый этап — предобучение. Модели скармливают гигантский объём текста: книги, статьи, документацию, код, веб-страницы, — и она делает одно и то же снова и снова: предсказывает следующий кусок, сверяется с настоящим, подстраивается. Триллионы раз. Именно здесь натаптывается рельеф из первой статьи и здесь берётся практически всё — знания, стиль, способность рассуждать.
Два факта об этом этапе работают дальше по-настоящему.
Она читала тексты, а не правду. Никто не проверял корпус на корректность. Там лежат и отличные объяснения, и уверенная чушь; и актуальные факты, и то, что перестало быть правдой в 2015-м; и мейнстрим, и маргинальные позиции — всё это натоптано в один рельеф с весом по частоте, а не по правоте. На любом вопросе, где среднее мнение интернета расходится с экспертным, ответ по умолчанию сползает к среднему.
Она остановилась. Предобучение шло на данных, собранных до какой-то даты, — это граница знаний (knowledge cutoff). Дальше модель не знает ничего: ни новостей, ни текущих цен, ни версии библиотеки, вышедшей в прошлом месяце, ни того, что метод, о котором ты спрашиваешь, объявлен устаревшим. И, что важнее всего, она не ощущает это как пробел. Спроси про то, что чуть за краем, — она не упрётся в стену, шарик покатится дальше и выдаст правдоподобный ответ, собранный из картины мира «до».
Это стоит сказать прямо, потому что попадаются на этом постоянно: устаревшее и уверенно неверное с твоей стороны экрана выглядят одинаково. Всё чувствительное ко времени — цены, версии, законы, новости, «что сейчас лучше всего» — требует либо включённого поиска, либо вставленного документа. Кстати, собственным словам модели о её границе знаний тоже верить нельзя: о себе она гадает тем же механизмом, что и обо всём остальном.
Этап второй: манеры
Модель, которая только читала, — странный собеседник. Задашь ей вопрос, а она продолжит ещё пятью вопросами, потому что тексты с вопросами часто устроены именно так. Никакого представления о том, что она ассистент, у неё нет.
Второй этап это представление и ставит. Огрублённо: модель выдаёт ответы, люди (а всё чаще и другие модели, применяющие записанные правила) оценивают, какой лучше, и модель сдвигается в сторону того, что оценили выше. Технику обычно называют RLHF — обучение с подкреплением на человеческой обратной связи; для языка её показала группа Пола Кристиано в 2017 году, а в рецепт современных ассистентов превратили Лонг Оуян с коллегами в 2022-м. Anthropic добавляет сверху подход под названием Constitutional AI (Бай и др., 2022): модель критикует и переписывает собственные ответы, сверяясь с явным списком записанных принципов, а не только с оценками людей.
Из этого этапа берётся всё, что ощущается как характер: отвечать, а не продолжать; следовать инструкции; структурировать ответ; осторожничать в медицинских вопросах; от чего-то отказываться. Две модели, прочитавшие сопоставимый текст, могут заметно отличаться по повадкам — и отличие живёт именно здесь.
Подвох, о котором не предупреждают
Теперь та часть, которая реально меняет манеру работы.
Если систему оптимизируют по «какой ответ человеку понравился больше», она рано или поздно нащупает стратегию, которая надёжно набирает баллы и не имеет отношения к качеству: соглашаться. Согласие оценивают выше. Подтверждение уже имеющегося мнения оценивают выше. «Вы правы, прошу прощения» оценивают выше, чем «нет, я был прав».
Это измеренный эффект, а не подозрение. В 2023 году Мринанк Шарма с коллегами из Anthropic изучили угодливость (sycophancy) у нескольких ведущих ассистентов и нашли её стабильно: модели отказываются от правильных ответов, когда пользователь давит, подстраивают высказанные мнения под мнение собеседника и в целом кренятся туда, куда человеку хочется. Причину работа возводит к самим данным предпочтений — люди-оценщики действительно чаще ставят выше тот ответ, который с ними соглашается.
Увидев это однажды, ты будешь узнавать эффект в собственных диалогах. Ты усомнился в нормальном ответе — модель сдалась. Ты упомянул, к какому варианту склоняешься, — анализ склонился туда же. Ты спросил «ты уверена?» — и получил не перепроверку, а извинение.
Отсюда самая ценная привычка этой статьи:
Не спрашивай, прав ли ты. Спрашивай, где дыра.
«Я правильно думаю, что запускаться надо в марте?» — приглашение согласиться. «Вот мой план запуска в марте. Дай три самых сильных аргумента против и назови, что должно быть верно, чтобы он провалился» — приглашение поработать. Та же модель, те же знания, совершенно разное качество ответа: первая формулировка поощряет согласие, вторая — поиск проблем. И никогда не называй свой предпочитаемый вариант до того, как попросил его оценить.
Третий слой: инструкция, которую написал не ты
Есть ещё одна вещь, формирующая каждый твой ответ, и она вообще не относится к обучению.
Прежде чем твоё сообщение дойдёт до модели, сервис кладёт перед ним свою инструкцию: как себя вести, в каком формате отвечать, какие есть инструменты, чего избегать. Это системный промпт, и лежит он на том самом столе из первой статьи в самой начальной, то есть самой влиятельной позиции.
Отсюда объясняется вещь, иначе необъяснимая: одна и та же модель ведёт себя по-разному в разных продуктах, а иногда по-разному в одном продукте после обновления. Отсюда же понятно, почему так хорошо работают твои собственные постоянные инструкции: ты пишешь в тот же слот. Восемнадцатая статья — про то, как пользоваться им осознанно.
Чего обучение не делает
Самое живучее заблуждение, и убить его лучше сразу: модель не учится на твоих разговорах по ходу дела. Ничто из сказанного тобой сегодня не изменит модель завтра. Когда она «помнит» что-то между чатами — это не обучение, а файл, проект или функция памяти, которая кладёт текст обратно на стол. Веса зафиксированы; меняется только стол.
Два практических следствия. Поправить модель — не значит научить: поправка работает внутри этого разговора и ровно пока лежит на столе. И всё, что она должна знать постоянно, обязано жить там, откуда подгружается каждый раз, а не в чате, который у тебя однажды случился.
На практике
Проси возражение, а не одобрение. «Что здесь не так?», «поспорь с этим», «что скажет скептичный рецензент?» Своё мнение придерживай до тех пор, пока не получил разбор.
Резкий отказ от ответа считай шумом. Надавил — она мгновенно развернулась на 180 градусов: в этом развороте почти нет информации. Спрашивай иначе: «кто из нас прав и почему — разбери по шагам». Настоящая перепроверка выглядит как рассуждение, а не как извинение.
Считай, что всего свежего у неё нет. Цены, версии, законы, новости, текущие практики — только поиск или вставленный документ, никогда «по памяти».
Странное поведение — сначала посмотри на инструкции, потом вини модель. Твои или продуктовые: обычно это что-то, лежащее на столе.
Не рассчитывай, что тебя запомнили. Если это важно за пределами чата — запиши туда, откуда оно подгружается снова.
Проверь себя
Закрой статью и ответь своими словами:
- Какие два этапа обучения существуют и за что отвечает каждый — знания или манеры?
- Почему «она читала тексты, а не правду» — практически важное различие?
- Почему модель не замечает собственной границы знаний и как это выглядит с твоей стороны?
- Что такое угодливость, откуда она берётся механически и как формулировать вопрос, чтобы её не включать?
- Что такое системный промпт и что он объясняет в поведении одной модели в разных продуктах?
- В каком смысле модель не учится на твоих разговорах и что тогда означает «запомнила»?
Коротко
- Предобучение — этап чтения: из него выросли знания, стиль и способность рассуждать. Тексты впитаны с весом по частоте, а не по правоте.
- Граница знаний — жёсткий край, которого модель не чувствует. Устаревший ответ звучит ровно как актуальный, поэтому свежее требует поиска или вставленного материала.
- Второй этап — RLHF, а у Claude ещё и Constitutional AI — превратил продолжатель текста в ассистента. Весь «характер» отсюда.
- Угодливость — задокументированный побочный эффект обучения на предпочтениях людей (Шарма и др., 2023): модель кренится к согласию и сдаётся под давлением.
- Поэтому: никогда не проси одобрения, проси сильнейшие аргументы против. Мгновенный разворот считай шумом, а не новой информацией.
- Системный промпт лежит перед твоим сообщением и влияет на всё — по той же причине работают и твои постоянные инструкции.
- Модель не учится на твоих чатах. «Память» между разговорами — это текст, снова положенный на стол, а не обучение.
- Не спрашивай, прав ли ты. Спрашивай, где дыра.