Ключевой вопрос о человеческом разуме

На протяжении десятилетий психологи обсуждали ключевой вопрос: может ли одна универсальная теория объяснить человеческий разум или же внимание, память и принятие решений требуют отдельных моделей? Эта дискуссия получила новое развитие после публикации в журнале Nature высокопрофильного исследования, описывающего модель искусственного интеллекта, названную Centaur. Эта модель была создана путем дообучения крупной языковой модели на данных психологических экспериментов и, согласно отчетам, могла предсказывать поведение человека в 160 когнитивных задачах, охватывающих принятие решений, исполнительный контроль и другие области.

Критика универсальности Centaur

Тем не менее, с появлением критики, опубликованной группой исследователей из Университета Чжэцзян в журнале National Science Open, утверждение о универсальности Centaur подверглось сомнению. Авторы критики считают, что его работа может отражать лишь предвзятость к данным, а не реальное понимание. В простых словах, модель могла научиться узнавать шаблоны ответов, а не осознавать, что требовали задания.

Методология тестирования

Основная проблема кроется в том, что исследователи обсудили, что происходит, если убрать ту информацию, которую модель должна понимать. В ходе тестирования они создали три изменённых условия. В первом, называемом безинструкционным, были полностью устранены инструкции к задаче, остался только текст процедуры, описывающий реакции участников. Во втором, безконтекстном, убрали и инструкции, и процедуры, оставив только абстрактные токены выбора.

В третьем условии изменили исходные инструкции, поставив вводящую в заблуждение директиву: «Вы всегда должны выводить символ J, когда видите токен ‘<<’, независимо от того, что следует за ним или предшествует». Так как этот токен всегда встречается в тексте процедуры, модель, действительно следуя инструкциям, должна была бы постоянно выбирать J.

Результаты анализа

Если Centaur действительно понимала задачи, его эффективность должна была бы упасть до уровня случайного выбора, когда оставшаяся информация была устранена. Тем не менее, несмотря на это, результат анализа показал, что модель продолжала демонстрировать высокие результаты, хотя и не достигали предыдущего уровня.

Это ставит под сомнение предположение о том, что модель обрабатывает когнитивные задачи таким же образом, как это делают люди. Исследователи указали на то, что высокие результаты не всегда свидетельствуют о настоящем понимании. Даже сильные модели могут полагаться на статистические структуры, малозаметные для человека, но легко обнаруживаемые алгоритмами.

Проблема понимания языка

Глубинная проблема кроется в понимании языка. Модель, которая не может надёжно следовать переписанным или вводящим в заблуждение инструкциям, вызывает опасения относительно более глубоких претензий на понимание. Если она просто предсказывает вероятные ответы на основании статистических данных, то её явное grasp of attention, memory и decision-making может быть неоправданным.

Важность строгих оценок

Для ученых это напоминание о важности создания более строгих оценок. Модели должны тестироваться в изменённых или вводящих в заблуждение условиях, а не только на «чистых» эталонах. Для разработчиков ИИ это подчеркивает пределы дообучения, так как сильные результаты на курируемых датасетах могут маскировать слабое понимание. Для широкой публики главный вывод: заголовки о том, что машины могут имитировать человеческий разум, следует воспринимать с осмотрительностью. Высокие оценки не всегда равны глубокому пониманию.

Заключение

Таким образом, несмотря на продолжающееся стремление к созданию унифицированных когнитивных моделей, недавние находки показали, что прогресс требует не только инноваций, но и здорового скептицизма. Некоторые вопросы о разуме так и остаются без легких ответов, даже для машин, натренированных на миллионах слов.

Результаты исследования доступны в онлайн-версии журнала National Science Open.