Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Maanantai · 31. elokuuta 2026Iltapainos · klo 21Nro 58
← Takaisin etusivulle

Kvantisointi ja karsinta · Mallit

Eteläkorealainen paja poisti GLM-5.3:sta joka kerroksesta eri määrän asiantuntijoita — ja malli mahtui kahdeksan kortin sijaan kahdelle

Tavallinen karsinta pudottaa saman osuuden joka kerroksesta. Nota AI mittasi jokaisen asiantuntijan tärkeyden koko verkon mittakaavassa ja jätti eri kerroksiin eri määrän — jolloin 753 miljardin parametrin mallista jäi 625 miljardia ja tarkkuudesta selvästi enemmän.

Nota AI julkaisi maanantaina Hugging Faceen version Z.ai:n GLM-5.3:sta, jossa on tehty kaksi asiaa yhtä aikaa: painot on kvantisoitu neljän bitin NVFP4-muotoon ja osa asiantuntijoista on poistettu kokonaan. Pohjamalli on 753 miljardin parametrin asiantuntijasekoitus, jossa tokenia kohti on aktiivisena noin 42 miljardia. Karsitussa versiossa parametreja on jäljellä 624,7 miljardia eli 17,75 prosenttia vähemmän.

Kiinnostavaa ei ole karsinnan määrä vaan sen tapa. Tavanomainen asiantuntijakarsinta poistaa jokaisesta lohkosta saman määrän tai saman osuuden asiantuntijoita, koska niin arkkitehtuuri pysyy siistinä. Nota mittasi asiantuntijoiden tärkeyden koko verkon mittakaavassa ja päätti kerroskohtaisesti, montako jää jäljelle. Tuloksena on malli, jonka kerroksissa on eri määrä reititettyjä asiantuntijoita — 75 asiantuntijakerrosta, joissa jokaisessa oma lukunsa. Arkkitehtuuri ei siis ole enää säännöllinen, ja siksi repo sisältää oman paikatun vLLM-mallimäärittelynsä: ilman sitä malli ei lataudu.

Kvantisoinnissa on sama valikoiva ote. NVFP4 ajetaan vain reititetyille asiantuntijoille, ryhmäkoolla 16 ja sekä painot että aktivaatiot neljällä bitillä. MLA-huomiokerros, DSA-indeksoija, reitittimet, jaetut asiantuntijat, alun tiheät MLP-kerrokset, normalisoinnit, upotukset ja seuraavan tokenin ennustuslohko jäävät kuudentoista bitin BF16-muotoon — sama jako kuin viitejulkaisussa. Käytännössä 596,1 miljardia parametria on nelibittisessä pakkauksessa ja 28,5 miljardia täydellä tarkkuudella.

Lopputulos on se, mikä palvelinsalissa lasketaan: malli mahtuu kahdelle B300-kortille, kun BF16-pohjamalli vaatii kahdeksan. Täysi 1 048 576 tokenin konteksti säilyy molemmissa. Tämä ei ole kotikoneen malli millään mittarilla, mutta se on juuri se harppaus, joka aiemmin on ennakoinut seuraavaa: kun sama tekniikka valuu pienempiin malleihin, se tarkoittaa kolmenkymmenen miljardin mallia yhdellä kortilla kahden sijaan.

Yksi ehto kannattaa lukea tarkkaan. NVFP4 nojaa Blackwell-sukupolven neljän bitin tensoriytimiin, joten malli ajaa vain B200-, B300- tai GB200-luokan kortilla. Hopper, Ada ja Ampere eivät sitä suorita — niillä nelibittinen tiedosto olisi vain tiedosto. Lisenssi ei ole MIT vaan Z.ai:n oma GLM-5.3-lisenssi, joka periytyy pohjamallista. Nota julkaisi samana päivänä myös GLM-5.3-Flashin ja Qwen 3.8 Flash Nextin NVFP4-versiot ilman karsintaa.

Lisälähteet

Muut jutut tässä numerossa