por ComputerWorld EspaƱa

El sistema, creado por el BSC y financiado con fondos del Plan de Tecnologías del Lenguaje del Ministerio de Asuntos Económicos y Agenda Digital y del Future Computing Center (iniciativa del propio BSC e IBM), estÔ disponible en abierto para que cualquier desarrollador, empresa o entidad pueda utilizarlo sin coste.

El equipo del Barcelona Supercomputing Center ha desarrollado un sistema de inteligencia artificial experto en comprender y escribir la lengua espaƱola. Se trata del primer modelo que se realiza de esta lengua con la tecnologĆ­a de inteligencia artificial y basado en datos masivos. El sistema ha sido entrenado con archivos de la Biblioteca Nacional de EspaƱa (se utilizaron 59 terabytes del archivo web de la institución) usando la tecnologĆ­a del superordenador MareNostrum.

El proyecto, financiado con fondos del Plan de TecnologĆ­as del Lenguaje del Ministerio de Asuntos Económicos y Agenda Digital y del Future Computing Center, una iniciativa del BSC e IBM, harĆ” posible que cualquier desarrollador, empresa o entidad pueda utilizar este sistema sin coste. Esta tecnologĆ­a puede emplearse en predictores y correctores lingüísticos, chatbots, aplicaciones de resumen automĆ”tico, bĆŗsquedas inteligentes, aplicaciones para el anĆ”lisis de sentimientos o motores de traducción y subtitulación automĆ”tica, entre otras aplicaciones. 

Como indica Marta Villegas, responsable del proyecto y lĆ­der del grupo de minerĆ­a de textos del BSC-CNS, las nuevas tecnologĆ­as de inteligencia artificial ā€œestĆ”n transformando completamente el campo del procesamiento del lenguaje natural. Con este proyecto contribuimos a que el paĆ­s se incorpore a esta revolución cientĆ­fico-tĆ©cnica y se posicione como actor de pleno derecho en el tratamiento computacional del espaƱolā€. 

¿Cómo funciona MarIA?

El primer modelo de IA masivo de la lengua espaƱola es en realidad un ā€œconjunto de modelos del lenguajeā€ o, como lo explican sus desarrolladores en un comunicado, ā€œredes neuronales profundas que han sido entrenadas para adquirir una comprensión de la lengua, su lĆ©xico y sus mecanismos para expresar el significado y escribir a nivel expertoā€. Son redes que consiguen trabajar con interdependencias cortas y largas y son capaces de entender, no solo conceptos abstractos, sino tambiĆ©n el contexto de los mismos.

El primer paso para crear un modelo de la lengua es elaborar un corpus de palabras y frases que serĆ” la base sobre la que se entrenarĆ” el sistema. Como explican los responsables del proyecto, para crear el corpus de MarIA, se utilizó el equivalente a 59.000 gigabytes del archivo web de la Biblioteca Nacional. Posteriormente, estos archivos se procesaron para eliminar aquello que no fuera texto bien formado, y se guardaron solamente los textos bien formados en la lengua espaƱola. Para este cribado y su posterior compilación fueron necesarias 6.910.000 horas de procesadores del superordenador MareNostrum y los resultados fueron 201.080.084 documentos limpios que ocupan un total de 570 gigabytes de texto limpio y sin duplicidades.

Este corpus, afirman, ā€œsupera en varias órdenes de magnitud el tamaƱo y la calidad de los corpus disponibles en la actualidad. Se trata de un corpus que enriquecerĆ” el patrimonio digital del espaƱol y del propio archivo de la BNE y que podrĆ” servir para mĆŗltiples aplicaciones en el futuro, como tener una imagen temporal que permita analizar la evolución de la lengua, comprender la sociedad digital en su conjunto y, por supuesto, el entreno de nuevos modelosā€.

Una vez creado el corpus, los investigadores del BSC utilizaron una tecnologĆ­a de redes neuronales (basada en la arquitectura Transformer), que ha demostrado buenos resultados en el inglĆ©s y que se entrenó para aprender a utilizar la lengua. Para realizar este entrenamiento se necesitaron 184.000 horas de procesador y mĆ”s de 18.000 horas de GPU. 

Tras lanzar los modelos generales, el equipo minería de textos del BSC estÔ trabajando en la ampliación del corpus, con nuevas fuentes de archivos que aportarÔn textos con particularidades diferentes a los que se encuentran en los entornos web, como por ejemplo publicaciones científicas del CSIC. También estÔ prevista la generación de modelos entrenados con textos de diferentes lenguas: castellano, catalÔn, gallego, euskera, portugués y español de Hispanoamérica.

Fuente: https://www.computerworld.es/tecnologia/nace-maria-el-primer-modelo-masivo-de-inteligencia-artificial-de-la-lengua-espanola

Deja una respuesta