Notícies

Arquitectura i infraestructura d'EDVAL

EDVAL ARQUITECTURA

EDVAL constituïx una infraestructura estratègica per a l'espanyol en intel·ligència artificial, articulada per mitjà de quatre blocs tècnics complementaris que garantixen interoperabilitat, qualitat lingüística i escalabilitat computacional. El primer bloc correspon a l'espai de dades federat, que implementa un catàleg de recursos, connectors interoperables i mecanismes de clearing house alineats amb estàndards europeus. El segon bloc engloba el corpus oral de l'espanyol, reconegut com el corpus més gran disponible actualment, amb cobertura de múltiples varietats dialectals, transcripció validada, anotació lingüística avançada i metadades estructurades per a la traçabilitat. El tercer bloc comprén els models d'intel·ligència artificial especialitzats en veu, desenrotllats per mitjà de tècniques de Deep Learning i entrenats específicament sobre el corpus oral per al reconeixement automàtic de la parla (ASR) i processament del llenguatge natural (NLP). El quart bloc constituïx la infraestructura tecnològica de suport, basada en computació accelerada amb GPU, emmagatzemament unificat d'alta capacitat i arquitectura GitOps per a desplegament continu. Esta estructura modular garantix l'escalabilitat horitzontal del sistema i la seua adaptació a requisits normatius europeus com GDPR i la Data Governance Act.

Un ecosistema viu amb interoperabilitat europea

L'espai de dades EDVAL implementa una plataforma ecosistema que facilita l'intercanvi segur i traçable de recursos lingüístics entre els participants del projecte. El catàleg de recursos actua com a registre centralitzat d'actius disponibles, incloent-hi corpus textuals, corpus orals, models de llenguatge, datasets d'entrenament i servicis de processament lingüístic, tots ells descrits per mitjà de metadades estandarditzades que garantixen la interoperabilitat semàntica. Els connectors constituïxen components tècnics fonamentals que permeten la integració de sistemes externs amb l'espai de dades, implementant protocols d'autenticació, autorització i xifrat que asseguren la traçabilitat i el control d'accés granular a cada recurs. La funció de clearing house proporciona mecanismes de validació, registre i auditoria de transaccions entre proveïdors i consumidors de dades, garantint transparència en l'intercanvi i compliment d'acords de llicència establits. La interoperabilitat tècnica se sustenta en l'adopció d'estàndards europeus promoguts per GAIA-X i el Data Spaces Support Centre (DSSC), assegurant compatibilitat amb altres espais de dades sectorials i facilitant la federació transfronterera de recursos lingüístics. Esta arquitectura garantix la sobirania de la dada, la governança distribuïda i el compliment normatiu d'acord amb la regulació europea vigent.

ComponentFunció TècnicaEstàndard
Catàleg de RecursosRegistre centralitzat d'actius lingüístics amb metadades estandarditzades (corpus textuals, orals, models de llenguatge, datasets, servicis)GAIA-X, DSSC
Connectors InteroperablesComponents d'integració de sistemes externs amb protocols d'autenticació, autorització i xifrat per a control d'accés granularGAIA-X, DSSC
Clearing HouseMecanismes de validació, registre i auditoria de transaccions amb traçabilitat completa i compliment de llicènciesGAIA-X, DSSC

Transcripció, anotació i alineament temporal

El corpus oral de l'espanyol constituïx l'actiu lingüístic central d'EDVAL, reconegut com el corpus oral més gran disponible en l'actualitat per a la llengua espanyola. La transcripció del corpus implementa protocols rigorosos de validació que garantixen precisió fonètica i ortogràfica en múltiples varietats dialectals de l'espanyol peninsular i llatinoamericà, cobrint contextos formals, informals, especialitzats i col·loquials.

Distribución de variedades dialectales del corpus oral español 

L'anotació lingüística incorpora etiquetatge morfosintàctic, anàlisi prosòdica, marcació de fenòmens fonètics dialectals i segmentació en unitats lingüístiques mínimes, facilitant l'anàlisi computacional avançada i l'entrenament de models de llenguatge. L'alineament temporal sincronitza transcripcions textuals amb segments d'àudio corresponents per mitjà de marques temporals precises, permetent l'anàlisi fonètica-acústica, l'entrenament de sistemes de síntesi de veu i el desenrotllament de models de reconeixement automàtic de la parla adaptats a varietats dialectals específiques. Esta riquesa d'anotació i diversitat geogràfica posiciona el corpus com un recurs diferenciador per a entrenar models d'IA en espanyol amb qualitat nativa, evitant biaixos introduïts per transferència des de models entrenats predominantment en anglés.

Uneix-te a nosaltres, comparteix i promou l'espanyol.

EDVAL convida els desenvolupadors de sistemes d'IA, les institucions tecnològiques, les universitats i els investigadors especialitzats en processament del llenguatge natural a unir-se a l'ecosistema tècnic, contribuint amb recursos lingüístics, validant models de veu o desplegant serveis avançats a la infraestructura compartida. L'adopció d'estàndards oberts i una governança transparent posicionen EDVAL com la plataforma líder per al castellà com a llengua nativa en la intel·ligència artificial, facilitant la col·laboració tècnica i generant valor sostenible per a l'ecosistema de parla hispana.