Corpus Oral del
Español San Millán
COE San Millán
El activo estratégico clave para situar al español como lengua nativa en la
Inteligencia Artificial
¿QUÉ ES?
¿Qué es el Corpus Oral del Español San Millán?
El Corpus Oral del Español San Millán (COE San Millán) ha sido diseñado para proporcionar un recurso lingüístico masivo, de alta calidad y
técnicamente avanzado que capture la realidad del habla espontánea en toda su diversidad.
Este corpus nace con el objetivo de crear un corpus unificado de
español oral que impulse la Nueva Economía de la Lengua y garantice la competitividad de las aplicaciones de Inteligencia Artificial basadas en español.
El COE San Millán construye el español del futuro digital.
¿CÓMO ESTÁ ORGANIZADO?
¿Cómo está organizado?
Para asegurar que los datos sean "combustible premium" para el entrenamiento de Modelos de Lenguaje (LLMs), el corpus se estructura en tres niveles:
Capa 1
Capa de transcripción
Se recoge exactamente lo que ocurre en la conversación: pausas, dudas, interrupciones o personas hablando a la vez. Todo queda documentado con precisión siguiendo el estándar EAGLES.
EAGLES
Capa 2
Capa de morfosintaxis
Proporciona un análisis profundo basado en Universal Dependencies para entender cómo se construyen realmente las frases en el habla cotidiana.
Universal Dependencies
Capa 3
Capa semántica:
Mediante WordNet / MCR 3.0, el COE San Millán incorpora información semántica que ayuda a interpretar el significado y el contexto de lo que se dice. Así, los modelos no solo “leen” palabras, sino que entienden mejor lo que expresan para que los modelos comprendan el significado y contexto del habla.
WordNet / MCR 3.0
¿CÓMO SE CONSTRUYE?
¿Cómo se construye el COE San Millán?
El desarrollo del corpus sigue una lógica de sustracción metodológica, es decir, se define un ideal de cobertura (matriz de cobertura), se resta el material ya licenciado e inventariado (matriz de obtención) y se graban únicamente los déficits identificados.
Para lograrlo, se utilizan tres vías de captación:
integración de materiales mediante acuerdos con instituciones.
audios de medios de comunicación, debates o intervenciones públicas.
participación de alumnos y profesores de una red global para asegurar una gran diversidad de perfiles y reducir sesgos dialectales.
Estándares internacionales
y sostenibilidad
El COE San Millán ha sido diseñado bajo estándares internacionales para garantizar
su perdurabilidad y legibilidad:
EL VALOR ESTRATÉGICO DEL MODELO
El valor estratégico del modelo
Este corpus no es solo una base de datos, sino una infraestructura FAIR (Localizable, Accesible, Interoperable y Reutilizable). Su alineamiento con los perfiles DCAT-AP garantiza su inmersión en el mercado único europeo de datos. De esta forma, posiciona al Espacio de Datos Valle de la Lengua como el nodo de referencia global del conocimiento académico y lingüístico sobre el español.
Findable
Accessible
Interoperable
Reusable
MUESTRA DEL CORPUS
Descarga una muestra del corpus
Un fragmento real de grabación con su transcripción correspondiente, listo para evaluar la calidad y el formato de los datos del COE San Millán.
Grabación de discurso académico con transcripción ortográfica y anotación
Mexicano centroamericano Mujer Mayor de 55 años Lectura en voz alta Estudios superiores
Duración: 16:13 minutos
Formato audio: WAV, 44,1 kHz
Formato transcripción: XML
Capas incluidas: Transcripción ortográfica enriquecida y morfológica