GPT-4 passe le test de Turing avec succès
Dans leur étude intitulée "People cannot distinguish GPT-4 from a human in a Turing test", Benjamin K. Bergen, chercheur principal au laboratoire de langage et cognition de l'UC et Cameron R. Jones, qui y est doctorant, ont évalué 3 systèmes d'IA (ELIZA, GPT-3.5 et GPT-4) dans un test de Turing randomisé, contrôlé et préenregistré. Les chercheurs ont recruté 500 participants sur la plateforme en ligne Prolific qui ont été répartis de manière aléatoire en cinq groupes distincts. Le premier avait pour mission de démontrer à ses interlocuteurs qu'il était réellement un humain, les quatre autres de déterminer après une conversation de cinq minutes, s'ils avaient interagi avec un humain ou un système d'IA.Les chiffres de l'étude
Seulement 22 % des participants ont cru qu'ELIZA était humain. Ce programme informatique historique développé par Joseph Weizenbaum entre 1964 et 1966 simule une conversation de psychothérapeute, ses réponses sont prédéfinies en utilisant des mots-clés dans les interactions avec les patients. GPT-3,5 a obtenu un score plus qu'honorable avec 50%, mais GPT-4 l'a surpassé avec 54%. Ils sont toutefois en deça du groupe humain qui a réussi à convaincre les autres participants à l'étude qu'il était bien un humain (67%).Implications
Pour les chercheurs, les résultats suggèrent que les facteurs stylistiques et socio-émotionnels sont plus déterminants pour la réussite du test de Turing que les notions traditionnelles d'intelligence. La manière dont une IA communique, son style et sa capacité à gérer les aspects émotionnels des conversations jouent donc un rôle crucial dans la perception de son humanité. Ces résultats alimentent les débats sur ce qui constitue réellement l'intelligence artificielle. Si une IA peut être perçue comme humaine sans atteindre une intelligence générale équivalente à celle des humains, cela soulève des questions sur les critères d'intelligence et de conscience. D'autre part, ils suggèrent que la tromperie des systèmes d’IA actuels pourrait passer inaperçue, entraînant des risques de mésinformation et de manipulation. D'ailleurs, une récente étude de l’École polytechnique fédérale de Lausanne (EPFL) a mis en lumière le pouvoir de persuasion des grands modèles de langage (LLM) lors des interactions en ligne. Les chercheurs ont démontré que lorsqu’on fournissait des informations personnelles à GPT-4 sur son interlocuteur, le modèle adaptait ses arguments de façon bien plus efficace qu’un être humain pour le faire changer d’avis. Références de l'article : "People cannot distinguish GPT-4 from a human in a Turing test", arXiv :2405.08007 Auteurs et affiliations: Benjamin K. Bergen et Cameron R. Jones, Département des sciences cognitives de l'Université de Californie à San DiegoNos articles remonteront en priorité dans « À la une » de Google.
