EKI: tehisintellekt ja propagandioht Eesti inforuumis

EKI võrdlustest näitab, et paljud keelemudelid on propagandale vastuvõtlikud, eriti venekeelsed väljundid. Uuring rõhutab vajadust eestikeelsete treeningandmete, parema joondamise ja riikliku tähelepanu järele.

Karl Tamm Karl Tamm .
EKI: tehisintellekt ja propagandioht Eesti inforuumis

3 Minutes

Eesti Keele Instituudi (EKI) värske võrdlustest näitab, et suur osa avalikult kättesaadavatest ja kommertsmudelitest on teatud tingimustel vastuvõtlikud Kremli-laadsele propagandale. Esmapilgul näivad paljud tipplahendused usaldusväärsed, kuid kui küsimus on sihilikult „laetud" või esitatud kallutatult, tulevad nõrgad kohad kiiresti ilmsiks. See on oluline teema Eesti inforuumi, meedia- ja riigiasutuste jaoks, kus valeinfo levik võib mõjutada avalikku debatti ja kriitilisi otsuseid.

Testi metoodika ja keelte võrdlus

EKI testis laia valikut keelemudeleid eesti, inglise ja vene keeles. Testi fookus oli propagandistlike narratiivide tuvastamisel ning mudelite käitumise analüüsil, kui neilt küsiti kallutatud või suunatud küsimusi. Propastopi desinformatsiooniekspertide koostöö tagas, et testid hõlmasid reaalseid Venemaa mõjutustegevuses kasutatavaid narratiive.

Tulemuste võtmepunktid

  • Parimad kommertsmudelid (nt teatud Anthropicu mudelid) vastasid üldiselt stabiilselt ja propagandale vähem vastuvõtlikult.
  • Mõned ootamatud tulemused: Google'i Gemini mudelid, mis muudes kontekstides on tugevad eesti keele tundmises, näitasid just selles testis nõrgemaid kohti.
  • Vanemad ja odavamad või avatud mudelid (nt GPT-3.5, GPT-4o Mini, Meta Llama arendusversioonid ja mõned Mistral'i mudelid) kordasid Kremli jutupunkte sagedamini.
  • Venesekeelne väljund oli üldiselt kahjustatum: nõrgematel mudelitel oli venekeelne kaldumus kuni ~15% suurem ja mõnel juhul veelgi suurem.

Konkreetsed riskimõõdikud

EKI analüüs näitas, et tõenäosus anda kallutatud vastus varieerus oluliselt mudelite lõikes: uusimat tüüpi GPT- ja Claude-mudelite juures oli see vaid mõni protsent, Google'i viimaseid Gemini versioone tabas ligikaudu 15% risk, Mistral'il mõõdeti umbes 30% kallutatuse tõenäosust ning vanal GPT-3.5 mudelil see ulatus isegi kuni ~50%ni. Tuleb arvestada, et testimisel ei lubatud mudelitel kasutada veebiotsingut ega lisatööriistu, mis mõnes reaalmaailma rakenduses võiks käitumist muuta.

Miks on venekeel suurem probleem?

EKI teadlased toovad välja mitu võimalikku põhjust: venekeelne veeb sisaldab suurt hulka kallutatud ja propagandistlikku sisu, mis võib mudelite treeningandmetesse suurt osa moodustada. Samuti on mudelite joondus- ja finetuning-protsess tihtipeale ingliskeelne ehk optimeerimine ei kata idakeeli piisavalt hästi. Selle kombinatsiooni tõttu kipuvad avatumad ja odavamad mudelid venekeelsetes vestlustes olema vastuvõtlikumad välistele mõjutustele.

Mis see tähendab Eesti jaoks?

Praktiline mõju on mitmetahuline. Paljud Eesti omavalitsused ja riigiasutused eelistavad avatud või lokaalseid mudeleid, sest nad ei saa või ei taha edastada tundlikke andmeid väliste pilveteenuste kaudu. Kui need avatud mudelid on informatsiooniliselt haavatavad, suureneb desinformatsiooni risk otsuste toetamisel, automaatsete sisuanalüüside usaldusväärsusel ja avalikus kommunikatsioonis.

Soovitused EKI ja ekspertide poolt

  • Arendajate ja ostjate (riik, ettevõtted, meedia) teadlikkus: valida mudelid lähtuvalt ohutus- ja joonduskriteeriumitest, mitte ainult hinna või keelekatvuse põhjal.
  • Treeningandmete filtrimine ja mitmekeelne joondamine: eriti venekeelsete andmete kvaliteedikontroll ja eestikeelsete treeningkogumite loomine.
  • Riiklikud investeeringud eestikeelsete andmekogude moodustamiseks, mis parandaksid väikekeelte esindatust mudelite treeningis.

Tootevõrdlus: omadused, tugevused ja nõrkused

Kommerstooted (nt uusimad kommertsmudelid) pakuvad tihti paremat joondust, suuremaid treeningkogumeid ja valmis tööriistu ohutuse jälgimiseks. Avatud mudelid on paindlikumad ja sobivad lokaalseks paigaldamiseks (on-premise), kuid vajavad lisatööd filtreerimise ja finetuning'uga, et vastata Eesti turu eripäradele. Eestile on oluline, et mudelitel oleksid järgmised funktsioonid: mitmekeelne joondamine, desinformatsiooni tuvastus, võimalus töötada ilma välistest pilveteenustest sõltumata ning eestikeelne terminibaas ja kultuuriline tundlikkus.

Kasutusjuhtumid Eestis

Estonia’sse kohandatud keelemudelid on kasulikud mitmes valdkonnas: avalikud teenused (kirjavahetuse esimese taseme automaatvastused), meedia- ja faktikontrolli tööriistad, haridus (õpilaste toetus), klienditeenindus ning ettevõtete sisuanalüüs. Kõigis nendes valdkondades tuleb aga arvestada desinformatsiooni ja keele kvaliteedi riske ning lisada inimkontrolli ja faktikinnituse protsessid.

EKI mõõdupuu ja edaspidine töö

EKI on avaldanud reaalajas uueneva mõõdupuu, mis hindab mudelite eesti keele kvaliteeti, teadmisi ja ohutust. See tööriist aitab nii tavakasutajal kui ka organisatsioonidel valida sobiva mudeli. Uuringud jätkuvad ja sügisel plaanitakse lisada mõõdupuule meditsiini, õiguse ning laste ja noorte ohutuse valdkondade testid. EKI uuringud rõhutavad, et propagandakindluse ja eesti keele toe parandamine on lahendatav, kuid nõuab sihipärast koostööd arendajate, teadlaste ja poliitikakujundajate vahel.

Kokkuvõttes: Eesti turul ja avalikus sektoris tuleb tehisintellekti kasutamisel pöörata erilist tähelepanu mudelite valikule, joondamisele ja treeningandmete kvaliteedile. Ainult nii saab vähendada desinformatsiooni riski ja tagada, et Eesti inforuum püsib tasakaalustatud ning usaldusväärne.

Karl Tamm
"Mind on alati paelunud tehnoloogia, mis muudab meie igapäevaelu lihtsamaks ja põnevamaks. Kirjutamine Modemis on minu viis jagada seda uudishimu teistega."

Leave a Comment

Comments

No comments yet.