Tekoälyn päivälehti — mallit, työkalut ja hardware
VDU · Neurotechnology · Tilde IT · Krilas · Mallit
Vytautas Magnuksen yliopiston johtama konsortio julkaisi kansallisen tekstikorpuksen ja kaksi avointa mallia. Toinen on 200 miljoonan parametrin maskattu malli, toinen Llama 3 -arkkitehtuurilla tyhjästä koulutettu miljardin parametrin perusmalli.
Liettualainen alkas.lt kertoi heinäkuun lopulla hankkeesta, joka ei ole näkynyt englanninkielisessä uutisoinnissa lainkaan: Vytautas Magnuksen yliopiston johtama konsortio on saanut valmiiksi liettuan kielen yleisen tekstikorpuksen ja kaksi avointa kielimallia. Mukana ovat VDU, Neurotechnology, Tilde IT ja Krilas, ja tilaajana valtion digiratkaisujen virasto.
Malleja on kaksi, ja ne edustavat kahta eri sukupolvea. Ensimmäinen on maskattu kielimalli, noin 200 miljoonaa parametria, koulutettu 1,87 miljardilla sanalla ja 210 näytönohjaintunnilla. Se on BERT-tyyppinen malli, jolla ei jutella vaan luokitellaan, poimitaan ja upotetaan — juuri se työkalu, jota haku ja dokumenttiputki tarvitsee. Toinen on Llama 3 -arkkitehtuuriin pohjaava perusmalli, noin 1,04 miljardia parametria, koulutettu nollasta 3,9 miljardin sanan korpuksella ja lähes 1 920 tunnin yhtäjaksoisella ajolla.
Kolmas tuotos on se, jota alan ulkopuolella harvoin huomataan: liettualle erikseen sovitettu tokenisaattori. Vähän puhutuille ja rikkaasti taivutetuille kielille yleiskäyttöiset tokenisaattorit ovat tehottomia — sama teksti vie enemmän tokeneita, mikä maksaa sekä koulutuksessa että päättelyssä. Oma tokenisaattori on siksi konkreettinen kustannussäästö eikä akateeminen yksityiskohta. Hanke kesti joulukuusta 2024 huhtikuuhun 2026, ja mukana syntyi uudelleenkäytettävä koulutusmetodiikka.
Aineisto ja mallit ovat avoimia. Korpus on saatavilla CLARIN-LT:n kautta ja avoimena datana valtion data.gov.lt-palvelussa, ja mallikokoelma on Hugging Facessa. Miljardin parametrin perusmalli on nimenomaan perusmalli, ei ohjeistettu keskustelumalli — se on tarkoitettu jatkokoulutettavaksi, ja se on koko hankkeen pointti.
Suomalaiselle lukijalle asetelma on tuttu, ja siksi vertailu kannattaa tehdä. Viro on kulkenut toista reittiä: Tarton yliopiston TartuNLP on julkaissut EstLLM-mallit, jotka on rakennettu Llama 3.1:n kahdeksan miljardin mallin päälle jatkokoulutuksena, ei nollasta. Latviassa Tilden TildeOpen on kolmenkymmenen miljardin monikielinen malli. Kolme naapuria, kolme eri strategiaa: jatkokoulutus, monikielinen jättiläinen ja nollasta koulutettu pieni malli.
Kumpi kannattaa? Miljardin parametrin nollasta koulutettu malli ei kilpaile Qwenin tai Gemman kanssa yleisessä osaamisessa, eikä sen ole tarkoituskaan. Sen arvo on siinä, että koko koulutusdata on tiedossa, tokenisaattori on kielelle oikea ja painot ovat maan omassa hallussa. Se on eri tuote kuin hyvin suomea puhuva monikielinen malli — ja tässä kokoluokassa se pyörii käytännössä millä tahansa mini-PC:llä.