San Millán
Corpus Hispànic
COE San Millán
L'actiu estratègic clau per establir l'espanyol com a llengua materna en la
intel·ligència artificial
¿QUÈ ÉS?
Què és el Corpus Oral
Espanyol de San Millán?
El Corpus Oral d'Espanyol de San Millán (COE San Millán)
ha estat dissenyat per a proporcionar un recurs lingüístic
d'àmbit ampli, d'alta qualitat i tècnicament avançat que
reculli la realitat del llenguatge espontani en tota la seva diversitat.
Aquest corpus es va crear amb l'objectiu d'establir un corpus
unificat de castellà parlat que impulsi la Nova Economia del
Llenguatge i garanteixi la competitivitat de les aplicacions
d'intel·ligència artificial basades en el castellà.
COE San Millán està modelant la llengua espanyola per al futur digital.
COM ESTÀ ORGANITZAT?
Com està organitzat?
Per garantir que les dades serveixin com a «combustible premium» per a l'entrenament de models lingüístics (LLMs), el corpus s'estructura en tres nivells:
Capa 1
Capa de transcripció
Captura exactament el que passa a la conversa: pauses, vacil·lacions, interrupcions o persones parlant al mateix temps. Tot s'enregistra amb precisió d'acord amb l'estàndard EAGLES.
EAGLES
Capa 2
Capa morfosintàctica
Proporciona una anàlisi en profunditat basada en Universal Dependencies per entendre com es construeixen realment les oracions en el llenguatge quotidià.
Universal Dependencies
Capa 3
Capa semàntica:
Utilitzant WordNet / MCR 3.0, el COE San Millán incorpora informació semàntica que ajuda a interpretar el significat i el context del que s'està dient. D'aquesta manera, els models no només 'lleen' paraules, sinó que obtenen una millor comprensió del que transmeten, cosa que els permet captar el significat i el context del discurs.
WordNet / MCR 3.0
COM ESTÀ CONSTRUÏT?
Com està construït el COE de San Millán?
El desenvolupament del corpus segueix una metodologia basada en la sostracció; és a dir, es defineix una cobertura ideal (matrice de cobertura), se n'hi sostrau el material que ja ha estat llicenciat i catalogat (matrice d'adquisició) i només s'hi registren les llacunes identificades.
Per aconseguir-ho, s'utilitzen tres canals d'adquisició:
integració de materials mitjançant acords amb institucions.
enregistraments d'àudio dels mitjans de comunicació, debats o discursos públics.
la participació d'estudiants i professors d'una xarxa global per garantir una àmplia diversitat d'orígens i reduir els prejudicis dialectals.
Normes internacionals
i sostenibilitat
El COE de San Millán s'ha dissenyat d'acord amb els estàndards internacionals
per garantir-ne la durabilitat i la llegibilitat:
EL VALOR ESTRATÈGIC DEL MODEL
El valor estratègic del model
Aquest corpus no és només una base de dades, sinó una infraestructura FAIR (Findable, Accessible, Interoperable i Reusable). El seu alineament amb els perfils DCAT-AP garanteix la seva integració al Mercat Únic Europeu de dades. Així, estableix l'Espai de Dades Valle de la Lengua com a centre global de coneixement acadèmic i lingüístic sobre la llengua espanyola.
Findable
Accessible
Interoperable
Reusable
MOSTRA CORPUS
Descarregueu una mostra del corpus
Un fragment d'enregistrament real amb la seva transcripció corresponent, a punt per avaluar la qualitat i el format de les dades del COE de San Millán.
Enregistrament d'un discurs acadèmic amb una transcripció fonètica i anotacions
Mèxic i Amèrica Central Dona 55 anys o més Llegir en veu alta Educació superior
Durada: 16:13 minuts
Format d'àudio: WAV, 44,1 kHz
Format de transcripció: XML
Capes incloses: Transcripció ortogràfica i morfològica enriquida