San Millán 
Corpus Hispànic

COE San Millán

L'actiu estratègic clau per establir l'espanyol com a llengua materna en la
intel·ligència artificial

¿QUÈ ÉS?

Què és el Corpus Oral
Espanyol de San Millán?

El Corpus Oral d'Espanyol de San Millán (COE San Millán)
ha sigut dissenyat per a proporcionar un recurs lingüístic
d'àmbit ampli, d'alta qualitat i tècnicament avançat que
reculla la realitat del llenguatge espontani en tota la seua diversitat.

Este corpus es va crear amb l'objectiu d'establir un corpus
unificat de castellà parlat que impulse la Nova Economia del
Llenguatge i garantisca la competitivitat de les aplicacions
d'intel·ligència artificial basades en el castellà.

 

COE San Millán està modelant la llengua espanyola per al futur digital.

 

COM ESTÀ ORGANITZAT?

Com està organitzat?

Per a garantir que les dades servisquen com a «combustible premium» per a l'entrenament de models lingüístics (LLMs), el corpus s'estructura en tres nivells:

Capa 1

Capa de transcripció

Captura exactament el que passa a la conversa: pauses, vacil·lacions, interrupcions o persones parlant al mateix temps. Tot es registra amb precisió d'acord amb l'estàndard EAGLES.

EAGLES

Capa 2

Capa morfosintàctica

Proporciona una anàlisi en profunditat basada en Universal Dependencies per a entendre com es construïxen realment les oracions en el llenguatge quotidià.

Universal Dependencies

Capa 3

Capa semàntica:

Utilitzant WordNet / MCR 3.0, el COE San Millán incorpora informació semàntica que ajuda a interpretar el significat i el context del que s'està dient. D'esta manera, els models no només 'lligen' paraules, sinó que obtenen una millor comprensió del que transmeten, cosa que els permet captar el significat i el context del discurs.

WordNet / MCR 3.0

COM ESTÀ CONSTRUÏT?

Com està construït el COE de San Millán?

El desenvolupament del corpus seguix una metodologia basada en la sostracció; és a dir, es definix una cobertura ideal (matriu de cobertura), se n'hi sostrau el material que ja ha estat llicenciat i catalogat (matrice d'adquisició) i només s'hi registren les llacunes identificades.

Per a aconseguir-ho, s'utilitzen tres canals d'adquisició:

Corpus existents

integració de materials mitjançant acords amb institucions.

Fonts públiques:

enregistraments d'àudio dels mitjans de comunicació, debats o discursos públics.

Les nostres pròpies gravacions (model UNIR):

la participació d'estudiants i professors d'una xarxa global per a garantir una àmplia diversitat d'orígens i reduir els prejudicis dialectals.

Normes internacionals
i sostenibilitat

El COE de San Millán s'ha dissenyat d'acord amb els estàndards internacionals 
per garantir-ne la durabilitat i la llegibilitat:

Contenidor TEI P5 (XML)

Considerat l'«estàndard d'or» per a la preservació, combina àudio, text i anotacions sincronitzats en un únic fitxer.

Metadades CMDI (ISO 24622-1)

Permeten cerques detallades (per edat, regió o gènere del parlant) sense necessitat de descarregar tot el corpus.

Coneixement internacional

El corpus s'integra a l'ecosistema CLARIN a
través de l'Observatori Lingüístic Virtual (VLO), 
la qual cosa en garantix la visibilitat als 
investigadors de tota laUnió Europea.

EL VALOR ESTRATÈGIC DEL MODEL

El valor estratègic del model

Este corpus no és només una base de dades, sinó una infraestructura FAIR (Findable, Accessible, Interoperable i Reusable). El seu alineament amb els perfils DCAT-AP garantix la seua integració al Mercat Únic Europeu de dades. Així, establix l'Espai de Dades Valle de la Lengua com a centre global de coneixement acadèmic i lingüístic sobre la llengua espanyola.

Localitzable

Findable

Accessible

Accessible

Interoperable

Interoperable

Reutilitzable

Reusable

MOSTRA CORPUS

Descarregueu una mostra del corpus

Un fragment d'enregistrament real amb la seva transcripció corresponent, a punt per avaluar la qualitat i el format de les dades del COE de San Millán.

Varietat dialectal mexicana de l'Amèrica Central

Enregistrament d'un discurs acadèmic amb una transcripció fonètica i anotacions
Mèxic i Amèrica Central Dona 55 anys o més Llegir en veu alta Educació superior

 

Durada: 16:13 minuts
Format d'àudio: WAV, 44,1 kHz
Format de transcripció: XML
Capes incloses: Transcripció ortogràfica i morfològica enriquida
 

Descarrega l'àudio (.wav) Descarrega la transcripció (.xml)