ChatGPT Images 2.5: rendimiento, nitidez y el dilema de la granularidad en la generación de imágenes



OpenAI lanzó ChatGPT Images 2.5 esta semana, destacando mejoras notables en el creador de imágenes impulsado por IA. El nuevo modelo promete detalles más nítidos, iluminación más natural y texturas más ricas, al tiempo que preserva mejor personas y objetos a partir de fotos de referencia. También se afirma que puede generar imágenes hasta un 50% más rápido y seguir instrucciones visuales complejas de forma más fiable.

Entre las novedades útiles se incluye Sketch para convertir bocetos en imágenes terminadas, plantillas para carteles y fotografía de productos, y la posibilidad de dejar comentarios directamente en una imagen al solicitar ediciones. OpenAI lo presenta como su modelo de imágenes de última generación, lo cual establece una barrera alta para algo que, inevitablemente, a veces se ve obligado a dibujar dragones antes del desayuno.

La reacción inicial, sin embargo, no es tan ordenada. Un usuario de Reddit dejó quizá la reseña más memorable hasta ahora: “The noise patterns are awful”. Otro comentó, al evaluar una generación de IA, “This…looks terrible.” La queja es fácil de entender: todo se trata del ruido.

Todo es más nítido, incluido el problema

El ruido es una crítica un poco resbaladiza cuando se habla de imágenes generadas por IA. En fotografía, generalmente describe el granulado que aparece cuando la iluminación y la técnica fotográfica no encajan. Pero las imágenes generadas por IA pueden mostrar algo similar sin haber pasado por una cámara. Todo adquiere un aspecto áspero, arenoso, y, por alguna razón, nada parece limpio.

El ruido resulta especialmente perjudicial porque puede disfrazarse de detalle. Los modelos generativos han aprendido que las fotografías contienen grano, textura, variaciones mínimas de color e imperfecciones ocasionales. Las imágenes 2.5 parecen especialmente ansiosas por reproducir esas señales, a veces dispersándolas por cielos, piel, plumas y fondos de estudio.

Eso va en contra de los supuestos de “detalles más nítidos” y “texturas más ricas” prometidos por OpenAI. A pesar de enfatizar una iluminación y texturas más naturales, algunos usuarios consideran que ChatGPT Images 2.5 ha retrocedido.

“Deben eliminar estos artefactos ruidosos. Hace que, en su mayoría, sea inútil para la producción,” escribió una persona. Hay elogios mezclados con quejas, pero está lejos de ser aclamado universalmente.

Quise comprobar si el problema sobrevivía fuera de capturas de Reddit, así que probé varias imágenes con sujetos altamente detallados y áreas que deberían permanecer visualmente suaves, para ver si aparecía algo de grano. Incluso ajusté mis indicaciones para pedir gradientes suaves y la eliminación de cualquier ruido visual.

Resultados y observaciones

Comencé con una imagen de una taza en un estudio fotográfico. Al principio, la efigie del pavo real, flores, frutas y paisaje que rodean la cerámica virtual es impresionante. Pero al mirar más de cerca, el fondo gris del estudio conserva una textura granular persistente, y algunos de los patrones más pequeños se desvanecen en un antialias confuso. El modelo genera una gran cantidad de información visual sin decidir siempre qué partes merecen claridad.

Un problema similar ocurrió cuando solicité una lechuza de granja al atardecer. Las plumas son un motivo perfecto para la complejidad, y las Images 2.5 las manejan bien. Las estructuras individuales permanecen visibles en las alas y la cara, las garras son convincentes, y el animal evita la calidad plástica que solían tener las imágenes de fauna IA.

Detrás de ello, un cielo que debería ser como una hoja en blanco presenta un grano fino evidente. No arruina la foto, pero una vez que lo notas, no puedes dejar de notarlo.

Otra prueba mostró que una escena de fantasía con un caballo alado y un dragón coexistiendo con un arcoíris en un lago alpino funciona con coherencia, aunque la textura granosa es visible de inmediato. El cielo azul pálido tiene una calidad texturizada sutil en lugar de un degradado limpio, y las montañas, árboles y detalles de la criatura presentan un aspecto crujiente y fuertemente sharp. No es un desastre, pero parece una fotografía demasiado procesada.

También quedé impresionado con una escena de dos amigos en una azotea al atardecer: las expresiones son convincentes y se percibe una gravedad real en la forma en que se mueven sus prendas. Pero al observar durante más de un minuto, el grano que recorre el cielo crepuscular y sus cabellos y piel resulta evidente. Si la luz era adecuada, ese grano parece un artefacto de la generación más que una limitación física de la toma en condiciones difíciles.

Conclusión

Al evaluar estas imágenes, la IA muestra rendimiento rápido, adaptabilidad y competencia en muchos aspectos. Sin embargo, su preferencia por una textura granular debilitada la realismo que busca emular. Tal vez la próxima actualización reconozca que lo más impresionante que puede aportar un generador de imágenes IA a una parte de una imagen es, en esencia, nada.

Qué opinas tú? Participa en nuestra encuesta para compartir tu punto de vista.

from Latest from TechRadar https://ift.tt/lD6bZ3f
via IFTTT IA