Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Lauantai · 22. elokuuta 2026Iltapainos · klo 21Nro 50
← Takaisin etusivulle

Prime Intellect · nanoGPT-speedrun · Benchmarkit

18 mallia pantiin tekemään tutkimusta ilman ihmistä — avoin Kimi K3 ylsi 10 askeleen päähän kärjestä

Prime Intellect ajoi 153 täysin autonomista tutkimusajoa, joissa kärkimallit yrittivät nopeuttaa nanoGPT-koulutusta kahdeksan H200-näytönohjaimen hiekkalaatikossa jopa 8 päivää kerrallaan. Suljettu kärki piti pintansa, mutta avoimen painon Kimi K3 ohitti GPT-5.6 Solin — ja ihmisten ennätys kesti kaiken.

Vähemmän askelia on parempiIhmisetOpus 5Kimi K3GPT-5.6 Sol2 6002 9202 9303 042Punainen on ainoa, jonka painot voi ladata itse.

Hajautetun laskennan yhtiö Prime Intellect julkaisi viikolla tähän mennessä laajimman avoimen kokeen siitä, miten kielimallit pärjäävät itsenäisessä tekoälytutkimuksessa. Asetelma: 18 kärkimallia, yhteensä 153 täysin autonomista ajoa, kullakin käytössään 8 H200-näytönohjaimen hiekkalaatikko ilman verkkoyhteyttä, enimmillään 8 vuorokautta aikaa. Tehtävänä oli Andrej Karpathyn nanoGPT-speedrunin optimointirata — eli keksiä, miten pieni GPT-koulutus saadaan maaliin mahdollisimman vähillä askelilla.

Tulokset ovat harvinaisen helppolukuiset, koska mittari on yksi luku ja pienempi on parempi. Kymmenien ihmisten kuukausien työllä hiottu ennätys on 2 600 askelta, eikä yksikään malli yltänyt siihen. Lähimmäs pääsi Anthropicin suljettu Opus 5 tuloksella 2 920. Moonshotin avoimen painon Kimi K3 kiri Prime Intellectin agenttikehikolla tulokseen 2 930 — 10 askeleen päähän kärjestä — ja ohitti OpenAI:n GPT-5.6 Solin, joka jäi lukemaan 3 042. Parhaat ajot kuroivat yhtiön mukaan 82 % ihmisennätyksen ja lähtötason välisestä kuilusta.

Raportin kiinnostavin osa ei ole järjestys vaan työtapa. Lähes kaikki mallit löysivät samat voittavat ideat; erot syntyivät siitä, mitä kokeista jäi jäljelle. Parhaat ajot rakensivat itselleen työkaluja kontrolloituihin vertailuihin, säilyttivät heikot signaalit riittävän pitkään todentaakseen ne — ja uskalsivat myös purkaa vanhaa: Kimi K3 poisti kaksi aiempaan ennätykseen kuulunutta mekanismia havaittuaan, että sen oma uusi normalisointi teki niistä tarpeettomia. Se on tutkijan ele, ei generaattorin.

Kiinalainen QbitAI nosti tuloksesta esiin sen, minkä moni englanninkielinen katsaus ohitti: oletus, että itseään kehittävän tekoälyn kilpailun voittaa väistämättä vahvin suljettu malli, sai kolauksen. Halvempi avoin malli yhdistettynä hyvään koeajoinfraan pääsi käytännössä samaan kuin kallein suljettu — ja infra on sekin avointa. Paikallisajajalle viesti on suora: K3:n painot voi ladata itse, ja kehikko, jolla se ylsi kärjen tuntumaan, on GitHubissa.

Varaukset kuuluvat asiaan: yksi optimointirata on kapea siivu tutkimustyöstä, ja mittari palkitsee juuri sellaista kärsivällistä kokeilua, jota kehikko tukee. Ihmisennätyksen kesto muistuttaa, että kuukausien yhteistyö tuottaa yhä jotain, mihin 8 päivän yksinajo ei pysty. Mutta suunta on merkitty: tämä oli ensimmäinen kerta, kun avoin malli seisoi autonomisen tutkimuksen mittarissa suljetun kärjen rinnalla eikä sen takana.

Lisälähteet

Muut jutut tässä numerossa