Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Torstai · 20. elokuuta 2026Iltapainos · klo 21Nro 48
← Takaisin etusivulle

Aurora-80K · Apache 2.0 · 20.8.2026 · Mallit

80 000 parametrin kielimalli koulutettiin puhelimella kuudessa tunnissa — ja se on täsmälleen niin hyvä kuin arvaat

Harrastajan tänään julkaisema Aurora-80K opetettiin Xiaomi-puhelimen neljällä suoritinytimellä ilman grammaakaan konesalirautaa. Kieliopin tunnistustestissä malli on niukasti arvausta parempi, tietotesteissä ei — ja juuri siksi se on opettavainen julkaisu: se näyttää, missä kielen oppimisen alaraja kulkee.

Konesali vs. taskun pohjagigawatteja ja H100-hallejavai4 ydintä6 tuntia · 80 milj. tokenia80 000 parametria — miljoonasosa nykymalleista

Samana päivänä, kun uutisvirta kertoo gigawattien konesaleista ja muistipiirien hinnankorotuksista, Hugging Faceen ilmestyi julkaisu vastakkaisesta ääripäästä. AuroraAI-Research-nimimerkin Aurora-80K on kielimalli, jossa on tasan 80 000 parametria — noin miljoonasosa nykyisistä kärkimalleista — ja se koulutettiin Xiaomi 14T Pro -puhelimen neljällä Cortex-X4-ytimellä. Aikaa kului noin 6 tuntia esikäsittelyineen ja tokenisoijan opettamisineen, aineistona noin 40 miljoonaa tokenia fineweb-edu-verkkotekstin koulutusluokiteltua kärkeä kahteen kertaan luettuna.

Tekijä julkaisi mallin Apache 2.0 -lisenssillä ja mittasi sen rehellisesti. Wikitext-2-aineistolla pakkausteho on 3,29 bittiä tavua kohti, kieliopillisuutta mittaavassa BLiMP-testissä malli valitsee oikean lauseen 52,31 prosentissa tapauksista — arvaamalla saisi 50 — ja ARC-Easy-tietotestissä tulos 26,05 on käytännössä arvauksen tasoa. Kiinnostavin tekninen valinta on 4 096 sanaston ositettu upotus, jolla pieni parametribudjetti ei huku sanastotaulukkoon: tavallisessa rakenteessa jo sanasto veisi moninkertaisesti koko mallin koon.

Miksi tällainen julkaisu on uutinen? Koska se piirtää näkyviin rajan, josta harvoin puhutaan: missä kohtaa kieli alkaa. 80 000 parametrin malli oppii tuottamaan sujuvia sanahahmoja ja aavistuksen kielioppia, mutta ei yhtään tietoa — ja juuri tuo aavistus BLiMP-tuloksessa on signaali, että oppimista tapahtuu jo tässä koossa. Harrastajien pienoismallien sarja, johon kuuluvat myös tänään julkaistu 25 miljoonan parametrin Supra2-Medium ja lukuisat fineweb-edu-pohjaiset kokeilut, on käytännössä hajautettu tutkimusohjelma datatehokkuudesta: mitä 800 tokenia parametria kohti saa aikaan, kun tavallinen suhde on kymmeniä.

Paikallisajajan näkökulmasta viesti on vapauttava. Koulutus ei ole pyhä toimitus, joka vaatii konesalin — se on skriptin ajo, jonka voi tehdä laitteella, joka on jo taskussa. Aurora-80K ei auta ketään töissä, mutta se opettaa tekijälleen enemmän kuin sata blogikirjoitusta: tokenisoijan, oppimisnopeudet ja arvioinnin joutuu tekemään itse. Ja jokainen, joka on joskus ihmetellyt, miksi 2 miljardin parametrin malli tuntuu tyhmältä, saa tästä mittakaavan — se on 25 000 kertaa Auroraa suurempi, ja välissä on koko matka satunnaisesta arvauksesta arkijärkeen.

Lisälähteet

Muut jutut tässä numerossa