Tekoälyn päivälehti — mallit, työkalut ja hardware
Mallit · kvantisointi · muistihierarkia · Mallit
Kun mallin tekijä sanoo, että hakutaulukon voi siirtää pois kiihdyttimeltä, joku kokeilee sitä. Muutamassa tunnissa Hugging Faceen ilmestyi kvanttisarja, jossa 128,8 miljardin parametrin laskentarunko on nelibittisen ja kuusibittisen välissä ja 51,2 miljardin taulukko makaa levyllä täydellä tarkkuudella.
Illan pääjutun malli on rakennettu niin, että sen 51,2 miljardin parametrin hakutaulukon voi siirtää pois kiihdyttimen muistista. Muutamassa tunnissa painojen julkaisusta Hugging Faceen ilmestyi kvanttisarja, joka tekee juuri sen — ja menee askeleen pidemmälle: taulukko ei mene keskusmuistiin vaan SSD-levylle.
Rakenne on selkeä. Laskentarunko, 128,8 miljardia parametria, kvantisoidaan sekamuotoisesti: asiantuntijoiden portti- ja ylöspäinmatriisit viisibittisiksi sisäkerroksissa ja kuusibittisiksi reunakerroksissa, alaspäinmatriisin pääosa kuusibittiseksi ja sen 128 sarakkeen häntä viisibittiseksi. Aina aktiiviset matriisit jäävät kahdeksaan bittiin, normalisoinnit ja tilamuuttujat täyteen tarkkuuteen. Hakutaulukko puolestaan tallennetaan sellaisenaan kuudentoista bitin tarkkuudella 128 osatiedostoon, jotka eivät ole muistissa lainkaan — niistä pidetään vain rajattua sivuvälimuistia.
Tekijä on tehnyt jotain, mitä avoimen painon kvanttien julkaisijat tekevät harvoin: kirjoittanut näkyviin, mikä ei vielä toimi. Repositorion kärjessä lukee, että painot ovat valmiit mutta ajoaika ei: rajattu SSD-välimuisti, päästä päähän -laatutarkistukset ja mittaukset ovat kaikki tekemättä, eikä repositoriota saa vielä kohdella valmiina palveluversiona. Yhteensopivuutta llama.cppin, vLLM:n tai SGLangin kanssa ei luvata; taulukon lukemiseen tarvitaan oma erillinen lataaja.
Mukana on myös rehellinen huomautus siitä, mikä ei mennyt kuten piti. Häntäosan piti olla viisibittinen K-tyypin kvantti, mutta se muoto pakkaa 256 arvon lohkoissa eikä siksi kelpaa tensorille, jonka rivin leveys on 128. Tekijä vaihtoi vanhempaan viisibittiseen muotoon, jonka tallennuskustannus on sama, ja sanoo suoraan, ettei nimeä ole väärennetty.
Kokeilu on keskeneräinen, mutta se osoittaa jotain tärkeää: kun mallin tekijä suunnittelee arkkitehtuurin siirrettäväksi, yhteisö testaa rajan saman vuorokauden aikana. Ja raja on tässä tapauksessa se, kuinka nopeasti SSD-levy pystyy palauttamaan satunnaisia hakuja kesken generoinnin.