Vllaznia Europa All articles
Arte & Cultura

Parlare in Codice: I Programmatori Europei che Salvano le Lingue che Stavamo per Dimenticare

Vllaznia Europa
Parlare in Codice: I Programmatori Europei che Salvano le Lingue che Stavamo per Dimenticare

C'è qualcosa di profondamente poetico nell'idea che una macchina possa imparare a balbettare in sardo o a sussurrare in bretone. Eppure è esattamente quello che sta succedendo in diversi angoli d'Europa, dove una generazione di sviluppatori — spesso giovani, spesso bilingui, spesso arrabbiati nel senso più costruttivo del termine — ha deciso di usare l'intelligenza artificiale non per uniformare il mondo, ma per renderlo più rumoroso, più vario, più vivo.

L'Europa conta oltre sessanta lingue regionali e minoritarie. Alcune le conosci di nome: il catalano, il gallese, il basco. Altre le hai forse sentite citare di sfuggita: il francoprovenzale, il mirandese, il rusyn. Molte altre ancora esistono in un limbo fatto di anziani che le parlano tra loro, di qualche dizionario impolverato, di una manciata di appassionati che tengono accesa la fiamma. E poi c'è l'abisso digitale: queste lingue semplicemente non esistono nel mondo dei modelli linguistici, degli assistenti vocali, dei motori di ricerca. Quando tutto ciò che conta deve passare per l'inglese — o al massimo per il francese, il tedesco, lo spagnolo — le lingue piccole diventano invisibili. E ciò che è invisibile tende a sparire.

Il Problema dell'Invisibilità Digitale

I modelli linguistici di grandi dimensioni — quelli che stanno ridisegnando il modo in cui interagiamo con la tecnologia — vengono addestrati su enormi quantità di testo. E il testo disponibile in lingue come il friulano o il còrnico è, per usare un eufemismo, scarso. Il risultato è un circolo vizioso: le lingue minoritarie non hanno abbastanza dati digitali per addestrare modelli decenti, e senza modelli decenti non vengono usate nel digitale, quindi non producono nuovi dati. Fine della storia.

O almeno, così sembrava fino a poco fa.

Negli ultimi anni, una serie di progetti sparsi per il continente ha iniziato a rompere questo schema. Non con grandi finanziamenti istituzionali — anche se qualche fondo europeo ha cominciato a muoversi — ma con la logica artigianale e comunitaria dell'open source: tante mani, tanto tempo libero, tanta passione, qualche server condiviso.

Voci dal Margine: Progetti che Fanno la Differenza

Prendiamo il caso del progetto Ġabra, sviluppato a Malta per la lingua maltese — che tecnicamente non è una lingua minoritaria, ma che per dimensioni e risorse digitali si trova in una posizione simile. Il team ha costruito un corpus linguistico aperto e un set di strumenti NLP (Natural Language Processing) che oggi vengono usati come modello da comunità di lingue molto più piccole in tutta Europa.

In Bretagna, il collettivo Brezhoneg Numerel lavora da anni per portare il bretone nel ventunesimo secolo digitale. Hanno sviluppato correttori ortografici, dataset per il riconoscimento vocale e, più recentemente, stanno sperimentando con modelli generativi addestrati su testi letterari bretoni digitalizzati. L'obiettivo non è creare un chatbot che parla bretone per il gusto della novità: è fare in modo che un adolescente di Quimper possa usare il suo smartphone nella lingua dei suoi nonni senza sentirsi fuori dal tempo.

In Italia, la situazione è particolarmente interessante. Il paese ha una delle mappe linguistiche più ricche e frammentate d'Europa — dal friulano al napoletano, dal piemontese al siciliano, passando per le isole alloglotte come le comunità arbereshe o walser. Progetti come Sardware, un'iniziativa nata in Sardegna, stanno costruendo strumenti di NLP specifici per le varianti del sardo, affrontando la sfida aggiuntiva di una lingua che non ha nemmeno una forma scritta standardizzata universalmente accettata. Come insegni a una macchina una lingua che i suoi stessi parlanti scrivono in modi diversi? Con creatività, con umiltà, e con moltissima collaborazione comunitaria.

Open Source come Atto Politico

C'è una dimensione politica in tutto questo che vale la pena sottolineare. Scegliere l'open source per questi progetti non è solo una questione pratica — anche se lo è, perché abbatte i costi e permette la collaborazione distribuita. È anche una scelta ideologica: significa che gli strumenti appartengono alla comunità, non a una corporation che domani potrebbe decidere che il mercato delle lingue minoritarie non è abbastanza redditizio.

Quando Mozilla ha lanciato Common Voice, il progetto per raccogliere voci donate in decine di lingue, ha messo in chiaro che il futuro del riconoscimento vocale non può essere monopolizzato dai giganti tech. Oggi Common Voice ha dati in lingue come il kaszubo, lo chuvash, l'asturiano. Non perché ci sia un business case ovvio, ma perché qualcuno ha deciso che queste voci meritano di essere sentite.

Lo stesso spirito anima Masakhane — un progetto africano che però ha ispirato approcci simili in Europa — e OPUS, il corpus multilingue open source dell'Università di Helsinki che include decine di lingue europee minori. Sono infrastrutture culturali costruite dal basso, mattone dopo mattone, commit dopo commit.

La Sfida della Qualità e dell'Autenticità

Sarebbe però ingenuo dipingere tutto questo come un percorso privo di ostacoli. Una delle tensioni più delicate riguarda l'autenticità: chi decide come deve "parlare" un modello linguistico in ladino o in sorabo? I parlanti anziani, custodi della tradizione orale? I linguisti accademici? I giovani attivisti che vogliono una lingua viva e contemporanea?

Queste domande non hanno risposte semplici, e i team più seri lo sanno. Il progetto Apertium, che sviluppa traduttori automatici per lingue minoritarie europee, dedica una parte significativa del suo lavoro alla consultazione comunitaria proprio per questo motivo. La tecnologia può essere uno strumento potente, ma se costruita senza le comunità che quelle lingue le vivono, rischia di produrre una versione museificata, congelata, di qualcosa che dovrebbe invece respirare e evolversi.

Cosa Possiamo Imparare

Per chi guarda dall'Italia — un paese che ha una legge sulla tutela delle minoranze linguistiche storiche (la 482 del 1999) ma che spesso fatica a tradurla in politiche concrete e finanziate — questi progetti europei offrono qualcosa di più di una semplice ispirazione tecnologica. Mostrano che la preservazione linguistica non è un'attività nostalgica riservata ai folkloristi: è un lavoro vivo, urgente, che richiede le competenze del presente per proteggere le voci del passato e consegnarle al futuro.

E mostrano anche che l'intelligenza artificiale non è necessariamente una forza omologante. Dipende da chi la programma, con quali intenzioni, con quali comunità. Un algoritmo può imparare l'accento di una valle alpina o il ritmo di una parlata isolana. Può farlo male, all'inizio. Può balbettare, sbagliare i toni, confondere le varianti. Ma può anche, con il tempo e con cura, imparare a suonare come qualcosa di vero.

E forse è proprio questo il punto: in un'epoca in cui tutto tende verso il grande, il globale, l'uniforme, c'è qualcosa di radicalmente controcorrente nel costruire una macchina che parla piccolo. Che parla locale. Che parla con accento.

Benvenuti nella resistenza. Ha il sapore del codice e suona come casa.

All Articles

Related Articles

Il Bello dell'Errore: Gli Hacker Europei che Trasformano i Bug in Arte

Il Bello dell'Errore: Gli Hacker Europei che Trasformano i Bug in Arte

Voci Ritrovate: Quando le Reti Neurali Diventano Custodi della Poesia Europea Dimenticata

Voci Ritrovate: Quando le Reti Neurali Diventano Custodi della Poesia Europea Dimenticata

Quando il Codice Diventa Narrativa: I Collettivi Open Source Europei che Reinventano il Racconto

Quando il Codice Diventa Narrativa: I Collettivi Open Source Europei che Reinventano il Racconto