MORENA: Un modelo de lenguaje africano de 1.5B parámetros que desafía a los grandes rivales


En el dinámico terreno de los modelos de lenguaje, MORENA emerge como una propuesta audaz: un modelo de 1.5 mil millones de parámetros diseñado específicamente para cubrir doce lenguas africanas, además de inglés, francés y código. Con un rendimiento que, en varias métricas clave, supera a alternativas establecidas de gigantes como Google, Meta, Alibaba y HuggingFace, MORENA demuestra que la eficiencia y la especialización pueden ir de la mano con la escala adecuada.

Según sus desarrolladores, MORENA no solo alcanza una puntuación destacada en tareas de modelado y traducción para lenguas africanas, sino que lo hace con un tamaño de modelo significativamente menor. En una evaluación comparable, el modelo obtuvo 1.408 bits por byte (bpb), la mejor cifra entre 26 modelos probados, superando a su competidor más cercano a pesar de contar con más del doble de parámetros.

Una formación sin bases ajenas: lenguaje, vocabulario y dados a la medida

MORENA cubre Nigerian Pidgin, igbo, yoruba, hausa, kiswahili, chiShona, isiZulu, isiXhosa, Kinyarwanda, Setswana, Afrikaans e isiNdebele. A diferencia de numerosos proyectos que ajustan modelos ya existentes, a menudo basados en variantes de Llama y limitados por vocabulario orientado al inglés o al texto de programación, MORENA inició su entrenamiento con un tokenizador fijo, una mezcla de datos y una lista de lenguas establecida de antemano. Este enfoque, tras evaluar distintos tamaños de vocabulario, priorizó la eficiencia y el coste por rendimiento.

El resultado es un vocabulario que codifica textos africanos con 1.39 veces menos tokens que Gemma 3 y 1.53 veces menos que Llama 3.2 en pasajes idénticos. Cabe señalar que, pese a las diferencias de tokenización, el costo por byte en textos africanos se sitúa en 0.249 tokens frente a 0.234 para el inglés, lo que representa aproximadamente un 6% más; el equipo reconoce que aún no puede explicar por completo esta diferencia.

En una comparación cercana, Lugha-Llama-8B (una variante Llama 3.1 adaptada a África) obtiene 1.423 bpb y queda por detrás de MORENA en ocho de las doce lenguas cubiertas. En cuanto a la familia Gemma de 12B, consume alrededor de 11 veces más recursos computacionales que MORENA para obtener resultados algo más débiles en la misma tarea. La versión de chat afinada para instrucciones alcanza 1.441 bpb, quedando por detrás de Lugha-Llama-8B en general, aunque lidera en cinco lenguas compartidas y utiliza aproximadamente el 20% de los parámetros.

Una vez ajustada para traducción y tareas conversacionales, MORENA logra traducir inglés a cinco lenguas africanas con métricas como chrF++ de 45.8, situándose de forma estadísticamente comparable con sistemas de traducción dedicados y manteniendo resultados cercanos a modelos de mayor tamaño en rangos típicos de 9 a 14 en métricas relativas.

Una infraestructura de desarrollo centrada en la eficiencia: 22.000 horas de GPU

El proceso de preentrenamiento de MORENA involucró 251.7 mil millones de tokens, seguido por 63 mil millones en una etapa intermedia. En total, se reportan más de 22.000 horas de GPU A100 dedicadas al proyecto, con un coste estimado de desarrollo de alrededor de 40.000 dólares. El equipo de desarrollo ha contado con el apoyo de organismos como el PNUD, AIHub4SD y CINECA, que suministraron recursos y asistencia técnica durante el proceso.

Además del modelo principal de 1.5B, existen versiones complementarias de 0.5B y 0.2B parámetros. Las variantes de menor tamaño superan, en 11 de las 12 lenguas cubiertas, a sistemas externos evaluados. El modelo de 0.2B está orientado a tareas de reconocimiento de voz, aplicaciones de teclado y normalización de texto, y se ha destacado por su eficiencia: cuesta 58 veces menos por byte procesado que Lugha-Llama-8B y genera 104 tokens por segundo en una GPU A100.

También existe una versión compatible con CPU que puede ejecutarse de forma offline en un portátil, lo que facilita su despliegue en entornos con acceso irregular a GPU. Esta diversidad de tamaños ofrece a desarrolladores y usuarios diferentes opciones, en lugar de depender exclusivamente de la versión más grande.

Más allá de su uso en conversaciones, MORENA facilita traducción y conexiones con otras herramientas de IA a través de su lanzamiento orientado a instrucciones.

Para obtener más contexto y revisiones, consulta recursos como Glitch Front y las series de análisis de TechRadar que han seguido de cerca el desempeño y la evolución de MORENA entre 26 modelos evaluados.

from Latest from TechRadar https://ift.tt/dbY7Ai8
via IFTTT IA