Это официально: искусственный интеллект (AI), в частности GPT-4.5, прошел тест Тьюринга.
Исследование, проведенное Университетом Сан-Диего , показало, что GPT-4.5, продвинутая языковая модель, разработанная OpenAI, была признана человеком чаще, чем сами люди.
Summary
В 73% случаев участники считали, что GPT-4.5 был человеком: новая эра для ИИ после прохождения теста Тьюринга
Созданный в 1950 году Аланом Тьюрингом, одноименный тест стремится ответить на революционный вопрос: могут ли машины думать? В тесте оценщик взаимодействует с двумя собеседниками, одним человеческим, другим искусственным, не зная их идентичности.
Если не удается отличить, кто из них человек, машина прошла тест.
Тест не измеряет сознание, а способность машины правдоподобно имитировать человеческое поведение. До сегодняшнего дня ни одна система не проходила этот тест так убедительно.
Исследователи привлекли две группы оценщиков — студентов университетов и пользователей платформы Prolific — которым было предложено взаимодействовать в текстовых беседах с реальным человеком и искусственным интеллектом.
В конце чата они должны были выбрать, кто из них настоящий человек.
Системы AI, подвергнутые испытанию, включали:
- ELIZA – символический чат-бот 60-х годов
- GPT-4o – модель OpenAI, оптимизированная для мультимодального использования
- LLaMa 3.1 – open-source модель от Meta
- GPT-4.5 – самая продвинутая версия OpenAI, здесь протестирована с и без «persona»
Определяющим фактором в эксперименте было использование двух типов подсказок:
- NO-PERSONA: нейтральные, стандартные ответы;
- PERSONA: ответы с определённой личностью, чтобы казаться более человечными.
Каждый оценщик видел этот интерфейс после разговора. Он должен был указать, кто из двух «свидетелей» является настоящим человеком, также указав уровень уверенности в своем выборе. Во многих случаях выбор падал на искусственный интеллект.
GPT-4.5 с “persona”: 73% успехов
Модель GPT-4.5-PERSONA достигла впечатляющего процентного показателя побед в 73%, оказываясь более убедительной как человеческое существо по сравнению с человеческим участником почти в трех взаимодействиях из четырех.
Системы с «persona» показали значительно более высокие результаты, демонстрируя, что добавление искусственной личности увеличивает восприятие человечности.
Гистограмма показывает win rate каждой модели. GPT-4.5-PERSONA доминирует как среди участников Prolific, так и среди студентов университетов.
Справа, другой график указывает на уровень безопасности, выраженный оценщиками: часто, самые продвинутые AI принимались за людей с удивительно высокой уверенностью.
Что позволило GPT-4.5 достичь этого исторического результата? Не только большая языковая способность, но и утонченная способность имитировать человеческую несовершенность: колебания, менее совершенные ответы, стратегическая вежливость.
Элементы, которые делают взаимодействие более естественным и правдоподобным.
А сейчас?
Если машина сможет казаться более человечной, чем сам человек, как изменится наше доверие к AI? Последствия огромны, не только в технологической области, но и в этической и социальной.
- Понадобится ли четко маркировать AI в общественных контекстах?
- Сможем ли мы отличить разговор с человеком от разговора с машиной?
- Что меняется, когда наш искусственный собеседник становится более эмпатичным, последовательным и внимательным?
Превышение теста Тьюринга GPT-4.5 представляет собой веху в эволюции искусственного интеллекта. Это не доказательство того, что AI обладает сознанием, но что он научился «казаться человеческим» настолько изысканно, что может обмануть даже самих людей.
Готовы ли мы к миру, в котором больше не будем уверены, говорим ли мы с реальным человеком?

