Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Sunnuntai · 30. elokuuta 2026Iltapainos · klo 21Nro 57
← Takaisin etusivulle

Päivän Python-kirjasto · kvantisointi · Koodi

AutoRound 0.15.0 antaa ketjuttaa pakkausalgoritmeja peräkkäin — ensimmäinen ominaisuusversio kuuteen viikkoon

Intelin pakkaustyökalu osaa nyt kokeellisesti ajaa useamman algoritmin peräkkäin samalle mallille, esimerkiksi hadamard-muunnoksen, AWQ:n ja oman signround-menetelmänsä. Tulos on tavallinen GGUF- tai painokvantti, jonka ajat omalla koneellasi.

Mitä ratkaisee. AutoRound on Intelin pakkaustyökalu, jolla suuresta kieli- tai näkömallista tehdään kahden, kolmen tai neljän bitin versio ilman että malli hajoaa. Se ei ole ajo-ohjelma vaan tuotantoväline: sillä tehdään se tiedosto, jonka joku muu — tai sinä itse — sitten ajaa llama.cpp:llä, vLLM:llä tai SGLangilla. Ydinidea on etsiä kullekin painoryhmälle paras pyöristys gradienttihaulla sen sijaan, että pyöristettäisiin lähimpään arvoon.

Uutta. Versio 0.15.0 ilmestyi perjantaina, ja se on ensimmäinen ominaisuusversio sitten heinäkuun puolivälin. Kärkiuutuus on kokeellinen algoritmiketjutus: samalle mallille voi ajaa useamman menetelmän peräkkäin komentorivivalitsimella, esimerkiksi awq ja signround tai hadamard, awq ja signround. Ajatus on, että menetelmät korjaavat eri virheitä — hadamard-muunnos tasaa poikkeavia arvoja, AWQ suojelee tärkeimpiä kanavia aktivaatioiden perusteella, ja signround hakee pyöristyksen — eikä niiden yhdistämiselle ole periaatteellista estettä. Tekijät pyytävät julkaisumuistiossa suoraan lisää ehdotuksia ketjuun sopivista algoritmeista.

Toinen uutuus on käyttöönoton puolella: AutoSchemen sekatarkkuuspakkaus toimii taas vLLM:ssä, ja esimerkkinä on julkaistu Qwen3.8-27B:n 2,8 bitin versio. Sekatarkkuus tarkoittaa samaa perusajatusta kuin illan pääjutun tiedostoissa — eri matriiseille eri tarkkuus — mutta eri menetelmällä ja eri ajoympäristöön.

Miten liittyy paikalliseen ajoon. Kirjasto tuottaa GGUF-muotoa, joten sillä tehdyn mallin voi ajaa suoraan llama.cpp:llä, Ollamalla tai LM Studiolla. Se on käytännössä ainoa laajasti käytetty tapa pakata malli itse silloin, kun valmista pakkausta ei ole olemassa — esimerkiksi juuri julkaistusta mallista tai omasta hienosäädöstä. Taustoina toimivat sekä CUDA että Intelin oma XPU-polku ja suoritin, ja kevyimmässä tilassa pakkaus onnistuu ilman kalibrointiaineistoa lainkaan.

Rajoitus. Pakkaaminen itsessään vaatii kunnon koneen ja aikaa: gradienttihaku on raskaampaa kuin yksinkertainen pyöristys, ja käännösoptimointi vie noin kymmenen gigatavua lisää keskusmuistia. Ketjutus on nimenomaan kokeellinen, eikä julkaisu esitä siitä vielä lukuja. Ja kuten illan mittausjuttu muistuttaa: pakkauksen laatua ei kannata päätellä pelkästä menetelmästä, koska sama tiedosto käyttäytyy eri tavalla eri ajoympäristöissä.

Lisälähteet

Muut jutut tässä numerossa