Tecnología

Científicos encuentran la forma de predecir cuándo una inteligencia artificial podría dar respuestas peligrosas

El riesgo radica en que puede ofrecer respuestas técnicamente correctas que resulten perjudiciales según el contexto en el que se utilicen.

GoogleSiga de cerca las tendencias en tecnología y ciencia en Discover

9 de octubre de 2026 a las 7:53 a. m.
Advierten riesgos de usar la inteligencia artificial.
Advierten riesgos de usar la inteligencia artificial. Foto: Getty Images

Las conversaciones con herramientas de inteligencia artificial pueden cambiar de rumbo sin que el usuario lo note. Una respuesta aparentemente útil puede dar paso a información que, aunque sea correcta desde el punto de vista técnico, resulte perjudicial o promueva comportamientos de riesgo.

Ante este escenario, investigadores de la Universidad George Washington, en Estados Unidos, desarrollaron una fórmula matemática que busca identificar cuándo puede producirse esa transición.

Creador de ChatGPT lanza modelo de inteligencia artificial que puede llegar a “razonar”
ChatGPT apuesta por respuestas más visuales con una función que integra mapas, gráficos y herramientas

El estudio, publicado en la revista científica Patterns, de Cell Press, se centra en detectar el momento en que un sistema de IA deja de ofrecer resultados apropiados y comienza a generar respuestas potencialmente peligrosas. La propuesta busca anticiparse al problema, en lugar de identificarlo cuando el contenido ya ha sido entregado.

La investigación cobra relevancia ante la expansión de los asistentes de inteligencia artificial en teléfonos y otros dispositivos. Algunos modelos pueden funcionar sin conexión a internet, una característica útil para quienes necesitan mantener la confidencialidad de sus datos, pero que también dificulta la supervisión de sus respuestas mediante sistemas de seguridad externos.

Neil F. Johnson, uno de los autores del trabajo, explicó que el equipo identificó un punto dentro del funcionamiento de estos sistemas que puede provocar el cambio entre una respuesta deseable y otra que no lo es. El problema, según el investigador, es que una contestación puede ser precisa y, aun así, representar un riesgo para quien la recibe.

Esto podría ocurrir, por ejemplo, si una herramienta ofrece indicaciones perjudiciales para una persona, proporciona recomendaciones inadecuadas en un contexto médico o legal, o genera instrucciones que pueden facilitar acciones peligrosas.

Adobe integrará este nuevo modelo en su plataforma de Firefly y Express.
Inteligencia artificial. Foto: agencia 123rf

El orden de las preguntas también puede influir

Para comprender cómo se produce este fenómeno, los expertos centraron su análisis en una unidad relacionada con el mecanismo de atención de la inteligencia artificial. A partir de ese elemento, elaboraron una fórmula que permite estimar cuándo el sistema está cerca de generar una respuesta indeseada.

Frank Yingjie Huo, también participante en el estudio, señaló que el método puede determinar si el cambio de comportamiento está próximo a ocurrir o si el sistema todavía ofrecerá varias respuestas aceptables antes de desviarse.

Uno de los aspectos que más llamó la atención del equipo es que una conversación puede comenzar con respuestas correctas y razonables antes de experimentar un cambio. Esa secuencia puede generar confianza en el usuario, quien podría no advertir que las siguientes contestaciones serán menos apropiadas.

Además, el contenido de las preguntas no sería el único factor determinante. La manera en que se organizan también podría modificar el resultado, debido a que las interacciones anteriores influyen en las respuestas posteriores.

Enseñar / Matemática
Fórmula matemática sobre una pizarra. Foto: Getty Images

Pruebas con distintos modelos de inteligencia artificial

El equipo evaluó la fórmula en siete modelos de IA de acceso público, desarrollados por tres empresas diferentes. Según los resultados publicados, el método anticipó correctamente 18 de los 19 casos analizados en los que se produjo un cambio hacia respuestas indeseables.

El hallazgo podría ser especialmente relevante para quienes utilizan sistemas de inteligencia artificial sin conexión. En esos casos, las herramientas de seguridad que dependen de servidores externos no siempre están disponibles para supervisar las respuestas o intervenir cuando aparece un problema.

Esta limitación puede afectar a profesionales que necesitan proteger información confidencial, como médicos y abogados, así como a personas que trabajan en lugares sin cobertura de internet.