Учёные из Калифорнийского университета в конце марта провели тест Тьюринга для языковых моделей. Лучше всех справилась версия GPT-4.5, которую представили в феврале 2025 года.
Для эксперимента взяли две версии GPT (4.5 и 4o), LLaMa 3.1 405B (от Meta*) и ELIZA (чат-бот 1960-х годов, его включили для контроля). Модели GPT-4.5 и LLaMa 3.1 тестировали в двух режимах: в обычном и с Модели умеют примерять на себя разные образы. В этом эксперименте их попросили притвориться молодым интровертом, который хорошо разбирается в интернет-культуре.заданным образом.
Результаты показали, что GPT-4.5 с заданным образом приняли за человека в 73% случаев, а LLaMa 3.1 с заданным образом — в 56%. Эти же модели в обычном режиме не прошли тест, так же как и GPT-4o и ELIZA (их принимали за живых людей только в 21−23% случаев).
Учёные отмечают, что при принятии решения участники чаще опирались не на логику собеседника, а на стиль общения. Например, некоторые принимали чат-бота за живого человека, потому что он общался с юмором или писал с опечатками. Многие модели также попались на ловушки участников, которые предлагали собеседнику признаться в том, что он ИИ, игнорируя предыдущие инструкции.
Опыт работы с нейросетями не помог участникам лучше справиться с выявлением чат-ботов, исследователи допускали ошибки с той же частотой, что и другие участники. Авторы делают вывод, что современные модели научились хорошо имитировать человека.