Kan Artificial Intelligence de Koerdische taal beschermen?

Design: Koerdistan Vandaag
Wie een taal wil beschermen, denkt meestal aan scholen, boeken en televisie. Maar de toekomst en onderwijs van een taal wordt steeds vaker ook online bepaald. Zoekmachines, sociale media en digitale assistenten spelen een grote rol in ons dagelijks leven. Kunstmatige intelligentie komt daar nu bovenop.
Dat biedt kansen voor de Koerdische taal. AI kan teksten vertalen, gesproken taal uitschrijven en kinderen helpen bij het leren van hun moedertaal. Oude verhalen en opnames kunnen digitaal worden bewaard. Tegelijk vormt de snelle ontwikkeling van AI ook een bedreiging.
Wanneer digitale systemen het Koerdisch slecht begrijpen, kiezen gebruikers sneller voor het Engels, Arabisch, Turks of Perzisch. De strijd om het behoud van de Koerdische taal wordt daarom ook een digitale strijd.
Een taal moet digitaal bruikbaar zijn
Een taal blijft niet bestaan doordat zij alleen thuis wordt gesproken. Ze moet aanwezig zijn in het onderwijs, de media en het openbare leven. In deze tijd hoort daar ook technologie bij.
Jongeren gebruiken steeds vaker AI om teksten te schrijven, informatie op te zoeken of een taal te leren. Wanneer zij dat niet goed in het Koerdisch kunnen doen, stappen zij over op een andere taal. Dat lijkt misschien een kleine en praktische keuze. Wanneer miljoenen mensen dezelfde keuze maken, kan het gebruik van het Koerdisch langzaam afnemen.
Een taal die digitaal moeilijk te gebruiken is, loopt daardoor het risico minder aantrekkelijk te worden voor nieuwe generaties. Vooral in de diaspora is dat gevaar groot. Veel Koerdische kinderen groeien op met Nederlands, Duits, Engels of Zweeds. Digitale hulpmiddelen kunnen hen helpen om toch Koerdisch te leren. Maar dan moeten die hulpmiddelen wel bestaan.
Het Koerdische begint met een achterstand
AI-systemen leren taal door grote hoeveelheden teksten en geluidsopnames te verwerken. Voor talen als Engels zijn miljarden documenten beschikbaar. Boeken, websites, wetenschappelijke artikelen en gesprekken kunnen worden gebruikt om systemen te trainen.
Voor het Koerdisch is veel minder bruikbaar materiaal beschikbaar. Daarom wordt het Koerdisch binnen de technologiesector vaak gezien als een taal met weinig digitale bronnen.
Daar komt de taaldiversiteit bij. Het Koerdisch bestaat uit verschillende variëteiten, waaronder Sorani en Kurmanji. Ook worden verschillende alfabetten gebruikt. Sorani wordt vooral met een aangepast Arabisch alfabet geschreven. Kurmanji wordt meestal met het Latijnse alfabet geschreven.
Die verscheidenheid is een onderdeel van de rijkdom van de Koerdische taal. Voor ontwikkelaars zorgt zij wel voor extra uitdagingen. Een systeem dat goed werkt in Sorani, werkt niet automatisch even goed in Kurmanji. Ook verschillen spelling, grammatica en woordgebruik per regio.
AI mag daarom niet worden gebouwd alsof er maar één vorm van het Koerdisch bestaat. Wanneer ontwikkelaars zich uitsluitend richten op de grootste taalvariant, kunnen kleinere variëteiten verder naar de achtergrond verdwijnen.
Er wordt al vooruitgang geboekt
De situatie is gelukkig niet uitzichtloos. Koerdische onderzoekers, universiteiten en vrijwilligers werken steeds vaker aan digitale taalprojecten.
Binnen het internationale Common Voice-project zijn inmiddels grote verzamelingen met Koerdische spraakopnames opgebouwd. De nieuwste verzameling voor Centraal-Koerdisch bevat bijna 195 uur aan gesproken materiaal van meer dan tweeduizend deelnemers. Voor Kurmanji is ruim honderd uur aan opnames beschikbaar. Deze bestanden kunnen worden gebruikt om systemen te leren gesproken Koerdisch te herkennen.
Ook op het gebied van vertaling worden stappen gezet. Voor een recent project vertaalden 230 vrijwilligers honderdduizenden Engelstalige zinnen naar het Centraal-Koerdisch. Daarmee werd meer dan duizend uur aan materiaal voor spraakvertaling opgebouwd.
Daarnaast verschijnen nieuwe datasets waarmee computers namen, plaatsen, onderwerpen en meningen in Sorani-teksten kunnen herkennen. Zulke projecten lijken technisch, maar ze vormen de basis voor betere zoekmachines, vertaalprogramma’s en digitale nieuwsplatforms.
Deze ontwikkelingen laten zien dat vooruitgang mogelijk is. Er is geen gebrek aan Koerdisch talent. Het probleem is vooral dat de projecten vaak klein, verspreid en tijdelijk zijn.
AI kan de taal toegankelijker maken
Goed ontwikkelde technologie kan het gebruik van het Koerdisch eenvoudiger maken.
Een betrouwbare spraakfunctie kan gesproken Koerdisch automatisch omzetten naar tekst. Dat is belangrijk voor ouderen die moeite hebben met schrijven. Het kan journalisten helpen bij het uitwerken van interviews. Ook kunnen toespraken, liederen en familieverhalen sneller worden opgeslagen.
Vertaaltechnologie kan Koerdische artikelen toegankelijk maken voor een internationaal publiek. Andersom kunnen boeken en lesmaterialen sneller naar het Koerdisch worden vertaald. Digitale docenten kunnen kinderen helpen met uitspraak, spelling en woordenschat.
Voor de diaspora zijn deze mogelijkheden bijzonder belangrijk. Veel jongeren begrijpen het Koerdisch wel, maar spreken of schrijven het minder goed. Een digitaal taalprogramma dat hun eigen taalvariant herkent, kan de afstand tot hun moedertaal verkleinen.
AI kan bovendien helpen om bedreigde woorden, verhalen en regionale uitspraken te bewaren. Daarvoor moeten taalkundigen samenwerken met ouderen, schrijvers en lokale gemeenschappen. Technologie kan informatie opslaan, maar de kennis moet eerst door mensen worden aangeleverd.
Slechte AI kan juist schade veroorzaken
De aanwezigheid van het Koerdisch in AI-systemen is op zichzelf geen garantie voor bescherming. Slecht ontwikkelde technologie kan fouten verspreiden.
Veel systemen maken nu al grammaticale fouten in het Koerdisch. Ze mengen Sorani en Kurmanji, gebruiken verkeerde spelling of vertalen rechtstreeks vanuit een dominante taal. Wanneer zulke teksten massaal online verschijnen, kunnen verkeerde vormen langzaam normaal worden.
Ook bestaat het gevaar dat één taalvariant als standaard wordt behandeld. Een systeem kan bijvoorbeeld goed Sorani begrijpen, maar moeite hebben met Kurmanji of Hawrami. Gebruikers van kleinere taalvariëteiten krijgen dan indirect te horen dat hun manier van spreken minder bruikbaar is.
Daarom moeten Koerdische taalkundigen betrokken zijn bij de ontwikkeling en controle van deze systemen. Technologiebedrijven kunnen deze verantwoordelijkheid niet alleen dragen. Zij kijken vooral naar het aantal gebruikers en de mogelijke opbrengsten. Het beschermen van een taal vraagt om andere keuzes.
UNESCO waarschuwt daarom dat lokale talen eerlijk vertegenwoordigd moeten worden binnen nieuwe taaltechnologie. Overheden, onderwijsinstellingen, bedrijven en gemeenschappen dragen volgens de organisatie allemaal verantwoordelijkheid voor die digitale aanwezigheid.
Koerdische instellingen moeten zelf investeren
Het zou een fout zijn om te wachten tot grote internationale technologiebedrijven het probleem oplossen. Zij zullen vooral investeren in talen waarmee zij veel geld kunnen verdienen.
De Koerdische Regionale Regering, universiteiten en maatschappelijke organisaties moeten daarom zelf een digitale taalstrategie ontwikkelen. Daarbij moeten datasets worden opgebouwd voor Sorani, Kurmanji en andere Koerdische taalvariëteiten.
Universiteiten kunnen opleidingen opzetten waarin taalkunde en informatietechnologie samenkomen. Media kunnen hun archieven op een veilige en duidelijke manier beschikbaar maken voor onderzoek. Schrijvers en uitgevers kunnen afspraken maken over het gebruik van hun teksten. Ook de diaspora kan bijdragen met kennis, geld en opnames.
Dat betekent niet dat alle Koerdische teksten zomaar aan bedrijven moeten worden gegeven. Er moeten duidelijke regels komen over eigendom, privacy en commercieel gebruik. Koerdische taaldata mag geen gratis grondstof worden waarmee anderen winst maken zonder iets terug te geven aan de gemeenschap.
Open samenwerking blijft wel noodzakelijk. Kleine losse projecten zullen onvoldoende zijn om de achterstand in te halen. Onderzoekers uit Hewlêr, Silêmanî, Dihok, Diyarbakır en de diaspora moeten gegevens en kennis kunnen delen.
AI kan helpen, maar mensen houden een taal levend
Kunstmatige intelligentie kan de Koerdische taal niet zelfstandig redden. Een taal blijft leven doordat ouders haar met hun kinderen spreken. Leraren moeten haar onderwijzen. Journalisten moeten haar gebruiken. Schrijvers moeten nieuwe woorden, verhalen en ideeën blijven ontwikkelen.
AI kan deze mensen ondersteunen. Het kan de taal makkelijker bereikbaar maken en nieuwe mogelijkheden openen. Maar technologie kan menselijk gebruik nooit vervangen.
De echte vraag is daarom niet of AI het Koerdisch kan beschermen. De vraag is of Koerdische instellingen en gemeenschappen bereid zijn om AI bewust voor dat doel in te zetten.
Wanneer het Koerdisch goed kan worden gesproken, geschreven, vertaald en gevonden binnen digitale systemen, wordt de taal sterker. Wanneer er niets gebeurt, zullen andere talen steeds meer digitale ruimte innemen.
De toekomst van het Koerdisch wordt dus niet alleen bepaald in parlementen, scholen en huiskamers. Zij wordt ook bepaald in datasets, software en computermodellen.
Wie zijn taal wil beschermen, moet ervoor zorgen dat ook machines haar leren begrijpen.
