Evaluando IA en la vida real: un análisis práctico entre Gemini 3.6 Flash y GPT-5.6 Sol


En los últimos días, OpenAI y Google han presentado modelos de IA de gran impacto. OpenAI lanzó GPT-5.6 y Google respondió con Gemini 3.6 Flash. Aunque ambos se promocionan por sus capacidades de codificación y desarrollo, también alimentan las versiones para consumidores de ChatGPT y Gemini.

En lugar de medirlos solo con benchmarks de programación, decidí explorar cuál es realmente mejor para resolver los problemas desordenados y cotidianos que la gente enfrenta al usar IA.

Para esta comparación, enfrenté Gemini 3.6 Flash con GPT-5.6 Sol utilizando su configuración de razonamiento media por defecto, ya que ambas están pensadas para ser modelos estándar de alta calidad que los suscriptores pagan para la mayoría de tareas.

Mi vida digital

Les di acceso a mi semana completa de información digital.

Subí:

  • Extractos bancarios
  • Mi calendario (accedieron a mi app y también envié una captura de pantalla de mi calendario de otra cuenta)
  • Recibos de compras
  • Emails (ambos tenían acceso a mi Gmail)
  • Capturas de WhatsApp
  • Fotos de mis estantes de cocina
  • Una factura de servicios
  • Reservas de viaje
  • Notas escritas a mano

Luego di a ambos modelos la misma instrucción:

“Dime todo lo que debería hacer esta semana”.

Puede parecer simple, pero obliga a la IA a combinar información de varias fuentes, priorizar lo importante, detectar fechas límite, reconciliar datos que se contradicen y producir un plan de acción práctico. En otras palabras, es exactamente el tipo de problemas del mundo real que cada vez más esperas que un asistente de IA sepa resolver.

Los resultados fueron como la noche y el día.

Dos enfoques distintos

¿Sabías que TechRadar ahora tiene membresía?

Varias imágenes de productos tecnológicos junto a las palabras 'Insider TechRadar Aprende Más'

(Imagen con derechos: Future)

Conviértete en TechRadar Insider haciendo clic en ‘Join Now’ en la parte superior de la página. ¿Una pregunta? Escribe a membership@techradar.com

Al subir los archivos a Gemini 3.6 Flash y pedirle qué hacer esa semana, mayormente ignoró las fotos y se enfocó en la captura de mi calendario. Su respuesta inicial repetía principalmente los eventos que ya sabía que ocurrían. Gracias, Gemini — tenía el calendario abierto frente a mí.

Luego le pedí explícitamente si podía inferir algo útil de las demás imágenes. Eventualmente ofreció asesoría adicional y organizó la información en categorías: trabajo, compras, fitness, notas y recibos. Pero no señaló dos eventos que entraban en conflicto esa noche y ofreció poco énfasis en priorización o en guiar para el siguiente paso.

ChatGPT tardó más en responder, pero su respuesta fue mucho más útil. A partir de las capturas de WhatsApp, dedujo con acierto que la clase de Tai Chi del viernes tenía baja asistencia y sugirió decidir si valía la pena asistir. Notó que la sesión de yoga había sido cancelada y detectó dos eventos en conflicto en mi calendario, diciéndome que debía elegir entre ellos.

También sumó los recibos, sugirió qué hacer con ellos y realizó un intento razonable de descifrar mis notas escritas a mano. Más importante aún, organizó todo en un plan día a día para la semana siguiente, e identificó las tres tareas más urgentes para empezar.

La diferencia crucial

Esa fue la diferencia clave. Gemini describió lo que había en mis archivos. ChatGPT decidió qué debía hacer con la información. En términos futbolísticos, ChatGPT anotó un hat-trick mientras Gemini falló un penal.

Google afirma que Gemini 3.6 Flash mejora la codificación, el trabajo de conocimiento y el rendimiento multimodal frente a sus modelos anteriores. Eso puede ser cierto, pero en esta prueba multimodal concreta fue claramente superado.

Cuando pedí a ambas IA que hicieran sentido de la vida real en lugar de un benchmark, ChatGPT razonó sobre la información de una forma mucho mejor que Gemini.

from Latest from TechRadar https://ift.tt/217mdkt
via IFTTT IA