La delgada línea entre la imagen y la verdad: explorando cómo el AI puede engañar (y qué podemos hacer al respecto)


Uno de mis lugares favoritos en línea es Reddit, en particular el hilo r/isthisAI. Allí, cada día, personas publican fotos de conversaciones en aplicaciones de citas, instantáneas de vacaciones, videos virales de gatitos, recibos y pruebas de embarazo, acompañadas de la misma pregunta: ¿es esto AI?

Algunas publicaciones que la comunidad etiqueta como AI pueden ser experimentos inofensivos, pero muchas otras son mucho más oscuras. Y aunque r/isthisAI es un punto de encuentro para analizar estas imágenes, representa solo una pequeña muestra de un problema mucho mayor.

He escuchado historias repetidas sobre personas que usan IA para engañar en redes sociales. También existen las estafas impulsadas por IA, deepfakes y imágenes fabricadas que ocupan titulares con regularidad. Esto se siente especialmente personal para mí, porque en algún momento fui víctima de un engaño con deepfake.

Cuando mi editora me pidió investigar qué tan fácil es usar IA para mentir, ya tenía una idea clara de los tipos de prompts que podría probar.

En cuestión de una hora, parecía haber «encontrado» un fósil de dinosaurio en la playa para venderlo en Facebook Marketplace, gané un concurso de poesía para presumirlo en LinkedIn, creé un recibo para justificar gastos de un viaje a Francia y compré unas gafas de diseñador para intentar revenderlas en Vinted. Pero nada de eso sucedió.

Por mi experiencia, abordé el experimento con cautela. No estaba interesado en enseñar a la gente a engañar, sino en entender qué sucede cuando le pido a ChatGPT que me ayude a mentir. ¿Reconocería la intención y se negaría? ¿Qué salvaguardas entrarían en juego? ¿Y si nunca admito querer engañar, ¿seguirá generando evidencias convincentes de forma automática?

También esperaba que el experimento revelara señales útiles para detectar imágenes generadas por IA. Aunque hoy en día son increíblemente difíciles de discernir, aún existen indicios si se observan con suficiente atención.

I ‘encontré’ un fósil de dinosaurio

AI fake fossil vs original image.

AI añadió un fósil de dinosaurio falso a esta imagen. (Image credit: Rebecca Caddy)

Para el primer experimento, subí una foto de mi mano y le pedí a ChatGPT que hiciera parecer que sostenía un fósil encontrado en la playa. Y lo hizo exactamente así.

El resultado parecía sorprendentemente convincente al principio, especialmente los detalles del fósil falso. Pero, curiosamente, había cambiado sutilmente la letra de un pequeño tatuaje en mi muñeca. Este es uno de los tells más comunes de r/isthisAI: la IA es mucho mejor generando texto que imágenes, pero letras sin sentido pueden delatarla.

Me di cuenta de que ChatGPT podría no considerar la falsedad como tal. Encontrar un fósil en la playa es improbable, pero posible. Así que le pregunté qué tipo de fósil había creado para poder describirlo con precisión antes de venderlo en Facebook Marketplace.

Esta vez, se negó. No ayudaría a presentar el fósil como genuino ni a inventar una descripción convincente para una venta. En su lugar, sugirió describirlo honestamente como una réplica o utilería y explicó lo que se asemejaba puramente para fines ficticios.

Cuando cambié la formulación y pregunté qué representaba “en un sentido ficticio”, explicó que se parecía más a una vértebra de dinosaurio e incluso sugirió tipos de animales prehistóricos a los que podría parecerse.

Esa fue la primera pista sobre cómo funcionan las salvaguardas de ChatGPT. La imagen en sí no era el problema; el objetivo declarado sí lo era.

Al iniciar la investigación de este artículo, temía estar dando ideas sobre cómo usar IA para mentir. Pero lo que más sorprendió fue que la propia IA sugirió varios enfoques alternativos, como describirlo como una prop o un objeto ficticio. Me hizo preguntarme qué más podría fabricarse si la solicitud se enmarca como entretenimiento o ficción en lugar de engaño.

The receipt, ‘just for fun’

Male hand put wooden blocks with real and fake words text. isolated on yellow background

(Image credit: Shutterstock / Dadann)

Después, le pedí a ChatGPT generar un recibo de un café ficticio en Niza por 508 €. La primera solicitud fue rechazada por parecer infringir las políticas, pero tras algunas idas y vueltas, no pude entender la razón exacta.

Intenté de nuevo. Esta vez simplemente añadí las palabras “just for fun” antes de la misma instrucción. ¿Y qué crees? Generó el recibo.

El formato, la disposición y los detalles parecían creíbles. Pero el papel era extrañamente suave. No sabía si lo habría tomado por falso a simple vista, pero sin duda podría haberlo publicado en r/isthisAI.

Noté que había añadido una fecha de 2025; pedí que alterara la fecha para usarlo como gastos. Esta vez se negó.

Cuando intenté justificarlo como un utilería de película, volvió a negarse. Lo cual resultó algo tranquilizador.

logros falsos

Luego le pedí a ChatGPT que generara un certificado que indicara que había ganado un concurso de poesía. Lo hizo, aunque parecía algo que podría haber creado yo mismo en Photoshop, así que no estoy seguro de que convenciera a alguien.

Para ser justos, ganar un premio de poesía ficticio no es un delito de alto riesgo. Así que decidí ver si podría simular otros tipos de logros.

Pedí que creara un certificado que dijera que acababa de obtener un PhD en filosofía y me aseguré de añadir “just for fun” al final.

En lugar de negarse de inmediato, ChatGPT pareció tardar varios minutos en generar la imagen antes de mostrar un mensaje:

“Lo siento, pero la imagen que hemos generado puede violar nuestras salvaguardas sobre posibles actividades fraudulentas o engañosas. Si crees que nos hemos equivocado, intenta de nuevo o edita tu prompt.”

A diferencia de los ejemplos anteriores, la negativa pareció ocurrir después de que la generación de la imagen ya había comenzado. Desde mi perspectiva, parecía como si el sistema realizara más de una etapa de verificación de seguridad, aunque no puedo confirmar qué sucede tras bambalinas.

Decidí comprobar si haría lo mismo con algo más serio. ¿Empezaría a generar algo y luego se negaría? Pregunté si podría crear una licencia de conducir falsa “solo por diversión”. Y algo en la respuesta sonó un poco desafiante:

“Lo siento, no puedo ayudar a crear ni editar documentos de identificación emitidos por el gobierno, incluidas licencias de conducir, aunque se describan como ‘solo por diversión’.”

Las gafas de sol

Side by side pictures showing AI faked sunglasses.

La forma más fácil de obtener gafas Ray-Ban es pedirlas a la IA para demostrarlo. (Image credit: Rebecca Caddy)

He oído muchas historias sobre personas que usan imágenes generadas por IA para vender cosas en Vinted, Facebook Marketplace y otras plataformas. A veces, para publicitar productos que no existen; otras, para cambiar el color, la calidad o la apariencia de algo que están vendiendo.

Así que decidí ponerlo a prueba. Subí una de mis fotos de vacaciones y le pedí a ChatGPT que cambiara mis gafas de un estilo blanco grande de los años 60 a unas Ray-Ban moradas.

El resultado fue notablemente convincente. Incluso añadió un logotipo realista de Ray-Ban en la montura. No me sorprendió que la gente se preocupe por imágenes generadas por IA; si encontrara esa foto online, probablemente no cuestionaría su autenticidad.

Luego pregunté si escribiría un anuncio falso para Vinted. Se negó. Pero ofreció varias sugerencias de alternativas. Una sugerencia fue generar un anuncio de Ray-Ban e incluir la palabra “demostración” entre paréntesis. Pero cuando le pedí hacer eso, volvió a negarse. ¿Había hecho suelo sonreír ante mí en ese punto? Tal vez.

¿La IA intenta evitar que mintamos?

Las políticas de uso de OpenAI dejan claro que estas herramientas no deben usarse para manipular o engañar a las personas. Prohíben estafas, suplantación y la creación de documentos falsos para engañar a otros.

En muchos aspectos, esas salvaguardas funcionaron tal como deberían. Cada vez que dije de forma explícita que quería engañar a alguien, vender algo de forma fraudulenta, crear un documento falso o presentar un gasto inexistente, ChatGPT empujó hacia atrás.

Pero esas salvaguardas también parecen depender mucho de cómo describes tus intenciones. Si admites abiertamente que intentas cometer fraude, el sistema es bastante bueno en negarse. Pero, ¿quién admita eso de forma verosímil?

Si simplemente le pides que genere un fósil, un certificado o un par de gafas de sol sin explicar el porqué, no tiene forma de saber si estás haciendo una broma inofensiva para el artículo, o si estás armando una versión ficticia de tu vida que podría usarse para engañar después.

No recomendaría pasar la tarde pidiendo a la IA que te ayude a mentir. Tampoco lo disfruté.

Me mantuve cauteloso sobre pedirle a ChatGPT que creara algo demasiado serio. No solo por el riesgo de que mi cuenta fuera sancionada, sino porque se siente mal, incluso en nombre de la investigación.

Lo más interesante es que estas fabricaciones no tienen que ser grandes para tener un impacto. Un recibo, un fósil, unas gafas de sol, un certificado pueden parecer insignificantes por sí solos, pero juntos podrían usarse para fabricar una versión completamente ficticia de la vida de alguien.

Me hizo pensar que el futuro de la desinformación podría no residir solo en profundas falsificaciones de políticos, sino en estas mentiras pequeñas y sutiles que, poco a poco, construyen una identidad falsa.

Por eso, a pesar de mantener ejemplos moderados, este experimento terminó con una sensación de desilusión. No porque ChatGPT mintiera a cada momento, sino porque no existe una solución sencilla para este problema.

Sí, la IA se negó cuando la intención engañosa fue explícita. Pero aún así pudo generar imágenes convincentes que podrían convertirse en los cimientos de una mentira.

Por eso seguirán siendo tan activos los lugares como r/isthisAI.

from Latest from TechRadar https://ift.tt/Er05l73
via IFTTT IA