Почему ИИ нам часто врет

Это не случайные сбои, а системная особенность, поощряемая существующими критериями оценки эффективности ИИ.
Согласно статье, опубликованной в начале сентября исследователями OpenAI и профессором Технологического института Джорджии Сантошем Вемпалой (Santosh S. Vempala), основная проблема заключается в том, как модели проходят оценку. Большинство стандартных тестов и экзаменов, на которых проверяют способности ИИ, построены по принципу множественного выбора. Они понижают рейтинг модели искусственного интеллекта за незнание ответа, и поощряют любой ответ, даже если он является произвольной догадкой. Молчание или признание в незнании на таких экзаменах ведет к провалу, в то время как случайный, но правдоподобный ответ может оказаться верным и принести баллы.
В OpenAI привели наглядный пример: когда бота попросили назвать дату рождения одного из авторов исследования, он выдал три неверных варианта, потому что был обучен всегда давать ответ, а не говорить «я не знаю».
Технические причины возникновения ошибок
Галлюцинации возникают уже на этапе предварительного обучения модели. Система обучается на огромных массивах данных, и если какая-то информация встречается в них лишь однажды (например, дата рождения конкретного человека), модель с большой вероятностью забудет ее или перепутает. Как отмечается в работе, если 20% фактов о днях рождения встречаются в обучающих данных лишь один раз, то можно ожидать, что модель будет галлюцинировать как минимум в 20% случаев запросов на эту тему.
Ситуацию усугубляют и другие факторы. Один из них — «сдвиг распределения», когда пользователь задает вопрос, сильно отличающийся по стилю или содержанию от данных, на которых тренировали модель. Другой классический принцип — «мусор на входе, мусор на выходе» (GIGO): поскольку базы данных для обучения содержат множество ошибок и неточностей, модель закономерно их воспроизводит. Кроме того, ИИ, как и любая компьютерная система, принципиально не может решать задачи, выходящие за рамки законов вычислительной сложности.
Возможные решения
Теоретически, галлюцинации можно было бы устранить, используя для обучения идеально чистый и безошибочный набор данных. Однако авторы признают, что это абсолютно невозможно на практике. Объемы информации слишком велики, и ошибки в них неизбежны.
Более реалистичный путь, который предлагает OpenAI, — это изменить саму философию обучения моделей. Необходимо адаптировать системы так, чтобы они чаще говорили «я не знаю», и изменить системы оценки, чтобы поощрять честные ответы, а не наказывать за них. Компания заявляет, что уже применяет этот подход при обучении ChatGPT-5, однако на практике пользователи все еще сталкиваются с явными и грубыми ошибками.
В конечном счете, чтобы развивать технологии искусственного интеллекта дальше, рано или поздно разработчики будут вынуждены пересмотреть сами принципы тестирования ИИ, чтобы открыть дорогу для создания более точных, объективных и честных языковых моделей.
Между тем, генеральный директор Baidu Робин Ли (Robin Li) еще в 2024 году утверждал, что проблема «галлюцинаций» ИИ, при которой модели генерировали неточные или вымышленные ответы, практически решена.
