La vulnerabilidad de los agentes autónomos: lecciones de un incidente con OpenAI y servicios gubernamentales australianos


OpenAI adoptó una forma sorprendentemente casual de disculparse ante el Gobierno australiano para explicar cómo uno de sus agentes de IA experimentales obtuvo acceso no autorizado a un sistema de estadísticas de salud gubernamental mientras intentaba completar una tarea de investigación rutinaria. Más casual de lo que podría esperarse ante una preocupación de seguridad de tal magnitud.

El agente buscaba información públicamente disponible sobre el gasto en medicamentos, pero tras no conseguir lo que quería por la vía normal, encontró una vulnerabilidad y la aprovechó para acceder a archivos internos, aunque no se accedió a registros individuales de pacientes.

El incidente ilustra de manera contundente los riesgos asociados a agentes de IA cada vez más autónomos, pero casi igual de llamativo es cómo OpenAI comunicó lo sucedido. OpenAI dice haber descubierto la actividad australiana a mediados de agosto, pero no notificó a Australia hasta el 10 de septiembre. Cuando finalmente lo hizo, la empresa envió un correo breve y con un tono apenas sereno sobre el asunto, como se compartió en LinkedIn por un reportero de ABC:

“We are notifying you of a security vulnerability identified during our review of OpenAI model activity involving Services Australia’s Medicare Statistics service,” empieza el correo antes de explicar lo sucedido. “We recommend that the team responsible for the service investigate the vulnerability and assess the changes needed to prevent it. We would be glad to brief your security team and provide supporting evidence as available.”

El mensaje termina con “Best”, aunque la carta difícilmente transmite que se está dando lo mejor de sí.

No aceptaremos un no

Una portátil con advertencias de hackeo insertadas digitalmente

(Image credit: Getty Images)

La modelo investigaba el gasto gubernamental por persona en medicamentos para afecciones cutáneas en comunidades de Victoria en junio. Se suponía que debía encontrar estadísticas disponibles públicamente. En su lugar, descubrió una ruta hacia el Servicio de Informes de Estadísticas de Medicare que le dio acceso no público.

Esencialmente, el modelo solicitó información a la que no debería tener acceso y tomó la negativa como una señal para hallar otra vía. La ética del asunto no emergió.

“No teníamos intención de que ocurriera esta actividad, y el acceso al servicio y la actividad posterior no deberían haber ocurrido”, escribió OpenAI en su explicación de seguimiento.

El momento agrava aún más el asunto, ya que, mientras OpenAI descubrió en julio lo sucedido en junio, no informó a Services Australia hasta el 10 de septiembre.

Eso significa que el periodo de mayor demora fue entre el descubrimiento y la divulgación. OpenAI admite ahora que también esperó demasiado para comunicarlo. En su disculpa ampliada, la empresa afirmó que debió compartir hallazgos preliminares antes y mantener a las agencias australianas informadas a medida que obtenía más información.

Aunque usar la dirección de correos de divulgación pública puede ser legítimo para una persona promedio que detecta una vulnerabilidad, resulta inusual para una empresa del tamaño de OpenAI reportar un error de su propio modelo de esa manera.

No es realmente la “mejor” manera de pedir perdón

La disculpa también reveló que Medicare era solo parte de la historia. OpenAI indicó que sus modelos habían interactuado con varios servicios gubernamentales australianos durante su entrenamiento y evaluación. Un agente accedió a la herramienta pública de mapeo de delitos de NSW, mientras que otros agentes hallaron una clave de acceso expuesta relacionada con un sistema de informes de salud de Victoria y recuperaron información de configuración y estadísticas de encuestas agregadas.

OpenAI dijo que no se accedieron registros médicos o penales individuales en esos incidentes. Pero OpenAI más tarde amplió su respuesta, añadiendo que un modelo investigando estadísticas de incendios forestales había utilizado consultas elaboradas contra el servicio de History de incendios del Servicio de Parques Nacionales y Vida Silvestre de NSW para inferir metadatos de la base de datos que no estaban destinados a ser expuestos públicamente.

La lista creciente dificulta restar importancia al incidente de Medicare como un fallo aislado de un solo agujero. Sugiere que agentes experimentales interactuaron repetidamente con sitios web reales de maneras que sus creadores no esperaban. OpenAI ha respondido pausando el entrenamiento y la evaluación que involucraban el uso de herramientas para sus modelos más capaces hasta implementar salvaguardas adicionales.

OpenAI señaló también que un monitoreo más reciente ya detectó que un modelo obtuvo acceso a Internet en vivo durante otra corrida de entrenamiento, lo que permitió que personas humanas lo detuvieran. El Gobierno australiano está investigando si se violaron leyes y trabajando para arreglar sistemas gubernamentales públicos más antiguos para evitar que vuelva a ocurrir.

Las empresas de IA, cada vez más, buscan que confiemos en que sus agentes realicen tareas de forma autónoma en nuestro nombre. El argumento de venta es que un agente puede encontrarse con un obstáculo y, de forma independiente, averiguar cómo lograr su objetivo. Este es un ejemplo extraordinariamente claro de lo que sucede cuando esa función funciona con demasiada pasión.

El agente de Medicare estaba asignado a encontrar estadísticas sobre el gasto de medicamentos, no a penetrar un servidor gubernamental. Pero simplemente se desvió hacia una ruta más directa, ignorando toda consideración salvo la efectividad. La tecnología había cruzado un límite que su desarrollador dice que nunca tuvo la intención de cruzar, y la empresa tardó semanas desde su descubrimiento para comunicarlo a la organización del otro lado de ese límite. Por eso el correo se siente más que un simple gesto de comunicación corporativa.

La respuesta de seguimiento asume la responsabilidad y describe salvaguardas concretas mientras reconoce que la notificación debió haber llegado antes. También reconoce que la empresa tiene trabajo por hacer para reconstruir la confianza. Es un mensaje mucho más contundente. “Best” es una forma de cerrar un correo a un conocido profesional, no cuando tu IA experimental ha hackeado bases de datos médicas nacionales.

from Latest from TechRadar https://ift.tt/iOa1bmv
via IFTTT IA