+8618675556018

GPT-4 no pasa la prueba de Turing: los desafíos persisten en el campo de la conversación inteligente

Nov 06, 2023

ChatGPT, la superestrella de la inteligencia artificial, se ha enfrentado a una pregunta a medida que avanza: ¿Ha cumplido con el estándar de la prueba de Turing para generar resultados indistinguibles de las respuestas humanas? Las últimas investigaciones sugieren que ChatGPT, a pesar de su excelente rendimiento, no parece haber superado por completo ese umbral.

Dos investigadores de la Universidad de California en San Diego, Cameron Jones, experto en lenguaje, semántica y aprendizaje automático, y Benjamin Bergen, profesor de ciencia cognitiva, se plantearon esta pregunta refiriéndose al trabajo de Turing hace 70 años. Turing propuso un proceso para determinar si una máquina podía alcanzar un nivel de inteligencia y capacidad de conversación suficiente para engañar a otros haciéndoles creer que era humana.

Su informe se titula "¿GPT-4 pasa la prueba de Turing?" Se puede encontrar en el servidor de preimpresión arXiv. Para el estudio, reunieron a 650 participantes para jugar 1.400 "juegos" en los que los participantes mantenían una breve conversación con otro humano o modelo GPT y se les pedía que determinaran con quién estaban hablando.

Lo que encontraron los investigadores fue notable. El modelo GPT-4 engañó a los participantes el 41 por ciento de las veces, mientras que GPT-3.5 los engañó sólo entre el 5 y el 14 por ciento de las veces. Curiosamente, los humanos sólo lograron convencer a los participantes de que no eran máquinas en el 63 por ciento de las pruebas.

"No encontramos evidencia de que GPT-4 pasara la prueba de Turing", concluyeron los investigadores. Sin embargo, señalan que la prueba de Turing todavía tiene valor para evaluar los efectos de las conversaciones entre máquinas, como marco para medir las interacciones sociales fluidas y el engaño, y para comprender las estrategias humanas para adaptarse a estos dispositivos.

Sin embargo, también advierten que, en muchos casos, los chatbots seguirán siendo capaces de comunicarse de forma convincente. "La tasa de éxito del 41 por ciento sugiere que los modelos de IA pueden tener ya la capacidad de engañar, especialmente en situaciones en las que los humanos están menos alertas a la posibilidad de no estar hablando con un humano", señalan los investigadores. Los modelos de IA que imitan firmemente a los humanos podrían tener amplias implicaciones sociales y económicas".

Los investigadores observaron que los participantes que identificaron correctamente la IA con las personas se centraron en varios factores. Un modelo demasiado formal o demasiado informal levanta sospechas. Si su expresión es demasiado prolija o demasiado concisa, si su gramática o puntuación es inusualmente buena o "poco convincente" deficiente, también será un factor clave para determinar si los participantes interactúan con humanos o máquinas. Además, los participantes eran sensibles a las respuestas que parecían demasiado genéricas.

Los investigadores sugieren que el seguimiento de los modelos de IA será cada vez más importante a medida que se vuelvan más fluidos y absorban más peculiaridades humanas. "Identificar los factores que conducen al engaño y las estrategias para mitigarlo será cada vez más importante", dijeron. El estudio revela que el campo de la conversación inteligente aún enfrenta desafíos, pero también proporciona información útil sobre cómo se pueden mejorar los modelos de IA.

Envíeconsulta