Datos, derechos y el futuro de la literatura en la era de los modelos de lenguaje


Para alcanzar cualquier nivel de competencia, los grandes modelos de lenguaje (LLMs) requieren una cantidad considerable de datos para su entrenamiento. Las empresas de IA han buscado diversas fuentes para recoger esta información: contenido públicamente disponible en la web, datos sintéticos generados por otros modelos de IA y literatura impresa. Este ensayo examina las implicaciones de estas prácticas y propone una reflexión sobre el equilibrio entre innovación y derechos de autor.

Dificultades de lectura

La noticia de que algunas compañías de IA habrían utilizado libros de sitios de libros electrónicos pirateados para entrenar sus modelos suscitó una condena amplia entre escritores, autores y editores. Este fenómeno pone de relieve una tensión central: la necesidad de datos de alta calidad para entrenar modelos avanzados frente a la protección de la propiedad intelectual y los ingresos de quienes crean contenido.

Cita del día

Este artículo forma parte del proyecto QOTD de TechRadar Pro para ofrecer una visión de las mentes de las figuras más destacadas de la industria tecnológica actual y de años pasados. Lee la serie completa aquí.

La organización profesional Correspondiente a los autores respondió a varios reportes sobre escaneo de libros por parte de empresas de IA, tanto de manera legal como ilegal, con directrices exhaustivas sobre el licenciamiento de IA. Este marco abarca las distintas manifestaciones del uso de obras publicadas por parte de las compañías de IA, incluida su perspectiva legal sobre la legitimidad de tales prácticas y el riesgo de dañar el ecosistema libro si la recolección de datos continúa sin límites.

Compra de libros

El uso de libros por parte de las empresas de IA es una preocupación constante. En meses recientes, la atención ha pivotado hacia quienes compran, escanean y derriban libros a escala industrial. Por ejemplo, documentos judiciales revelaron la existencia de un programa denominado “Proyecto Panamá” dentro de Anthropic. Este plan describe una iniciativa para “escudriñar de forma destructiva todos los libros del mundo” y se utilizó un nombre en código para evitar que se supiera que estaban trabajando en ello.

Para entrenar Claude, Anthropic necesitaba un conjunto de datos grande y de alta calidad, por lo que decidió adquirir libros a escala industrial debido a la calidad relativamente superior de la escritura frente a contenidos encontrados en la web abierta.

from Latest from TechRadar https://ift.tt/wsUvKuG
via IFTTT IA