Почему ИИ так уверенно ошибается?

Уверенный тон — это стиль текста, а не степень знания. Модель учится писать как хорошие ответы в интернете, а они обычно звучат уверенно. Поэтому ошибочный и верный ответ выглядят одинаково убедительно, и по интонации нельзя понять, насколько модель «знает» тему.

Обновлено

Подробно

Почему модель не сомневается вслух

У модели нет встроенного чувства «я этого не знаю». Она выбирает слова по вероятности, и фраза «точно известно, что…» часто вероятнее, чем «я не уверен». Сомнения появляются, только если их явно попросить или если модель специально обучали признавать неуверенность.

Ещё один эффект — модель подстраивается под вопрос. Если вопрос содержит ложную предпосылку («почему Notion закрылся в России?»), она может начать объяснять несуществующее событие.

Сигналы

Признаки, что ответ стоит перепроверить

Приём

Как заставить модель показывать неуверенность

Добавьте в запрос: «Если не уверен — так и скажи; для каждого факта оцени уверенность». Или спросите дважды разными словами: расхождение ответов — хороший признак, что модель угадывает. Для важных решений просите источник и проверяйте его сами.

Как это выглядит

Пример

Вы спрашиваете: «В каком году вышел закон о запрете X?» Модель уверенно называет год и номер закона — всё в правильном формате, с официальным названием. Проверка показывает, что такого закона нет: модель собрала правдоподобный ответ из похожих формулировок. Если бы вопрос звучал «Существует ли закон о запрете X? Если не уверен — скажи», шанс честного ответа был бы заметно выше.

Вопросы

Частые вопросы по теме

Можно ли доверять ответам ChatGPT?

Как черновику — да, как источнику фактов — только после проверки. Особенно для цифр, законов, медицины и денег.

Почему ИИ соглашается, когда я говорю, что он неправ?

Модели обучены быть вежливыми и услужливыми и часто уступают давлению, даже если изначально были правы.

Как понять, что ИИ ошибся?

Сравните с первоисточником, задайте вопрос иначе, попросите объяснить ход рассуждений — логические дыры становятся заметнее.

Ошибаются ли платные модели?

Реже в рассуждениях, но тоже ошибаются: принцип генерации тот же.

Источники

Источники