Lecturas difíciles y riesgos invisibles: cómo entender las políticas de privacidad de los modelos de lenguaje


En la era de los modelos de lenguaje grande (LLMs), las políticas de privacidad suelen ser una lectura laboriosa. Las investigaciones señalan que incluso para plataformas destacadas, los textos pueden resultar increíblemente extensos y complejos, dificultando que los usuarios comprendan qué datos se recopilan, cómo se utilizan y si se entrenan modelos con esas entradas.

Un estudio de Bridewell, empresa de ciberseguridad, evaluó las políticas de privacidad de 20 LLMs populares y encontró que el tiempo medio para leer una de estas políticas es de 20 minutos. Además, el recuento promedio de palabras ronda las 4.603, pero la verdadera dificultad reside en la comprensión de la información presentada.

La legibilidad de estas políticas también fue objeto de análisis mediante la puntuación de legibilidad de Flesch. Con una puntuación promedio de 40,2, el resultado sugiere una densidad de jerga y estructura que la audiencia general podría encontrar poco accesible. Una lectura clara y transparente es fundamental cuando los usuarios entran datos en un chatbot, con la expectativa de que se interpreten y procesen para ahorrar tiempo, pero sin perder de vista el destino de esa información.

La investigación también revela que 13 de las 20 plataformas evalúan los datos de entrada y salida para entrenar sus modelos. Mientras algunas ofrecen la opción de optar por no entrenar, otras no lo permiten o no lo explican de forma clara. Esto subraya la necesidad de que los usuarios entiendan plenamente cómo se procesan sus datos y de que las empresas cuenten con directrices internas claras sobre qué puede compartirse y qué protecciones deben existir, especialmente en entornos empresariales.

En palabras de expertos, es crucial que tanto usuarios como organizaciones adopten una mirada crítica: entender cómo funciona la recopilación de datos, qué se almacena y si se reutiliza para entrenamiento, así como las opciones de exclusión cuando estén disponibles. En este sentido, cuanto más complejo sea un LLM, como algunos de los ejemplos mencionados, mayor tiende a ser la longitud y la dificultad de la lectura de su política de privacidad.

Facilidad de lectura

La facilidad de lectura de las políticas no solo afecta al usuario individual; también tiene implicaciones para la seguridad y la gestión de la información en las empresas. La claridad de los términos, las opciones de control de datos y las prácticas de entrenamiento contribuyen a un uso más informado y responsable de estas tecnologías.

Entrenamiento a partir de las entradas

El estudio de Bridewell destaca la necesidad de una mayor transparencia sobre si las entradas de los usuarios pueden o no ser utilizadas para entrenar modelos. Las organizaciones deben evaluar cuidadosamente sus políticas de datos y establecer controles accesibles para los empleados, evitando que información sensible o confidencial se utilice sin consentimiento explícito.

En definitiva, para que el uso de chatbots basados en IA sea seguro y productivo, es imprescindible comprender a fondo las políticas de privacidad, las prácticas de entrenamiento y las opciones de protección de datos disponibles. Esto permitirá a las personas y a las empresas aprovechar las ventajas de la IA sin perder de vista la responsabilidad y la seguridad de la información.

from Latest from TechRadar https://ift.tt/KXyNPhu
via IFTTT IA