Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Lauantai · 22. elokuuta 2026Iltapainos · klo 21Nro 50
← Takaisin etusivulle

Päivän Python-kirjasto · Koodi

GPTQModel 7.3.4: kirjasto, jolla teet kvantit itse — myös malleille, joita kukaan muu ei pakkaa

Valmiita kvantisointeja odotellaan yhteisön pakkaajilta joskus päiväkausia. GPTQModel on työkalu, jolla painot puristaa itse 4:ään tai 3:een bittiin omalla koneella — ja viikon versio korjasi monen näytönohjaimen kalibroinnin ja pienimmän bittileveyden puskurit.

Sama malli, kutistuva jalanjälkiBF16100 %4-bit~25 %3-bit~19 %kalibrointiaineisto ohjaa, mitkä painot saavat tarkkuuttaCUDA · ROCm · Ascend · Intel XPU · CPU

Kun uusi malli julkaistaan, paikallisajajan ensimmäinen kysymys on: joko kvantit tulivat? Yleensä niitä odotetaan yhteisön pakkaajilta tunneista päiviin — ja harvinaisemmille malleille ne eivät tule koskaan. GPTQModel on ModelCloudin ylläpitämä kirjasto, jolla pakkauksen tekee itse: se kvantisoi Hugging Face -muotoisen mallin GPTQ-menetelmällä 8:aan, 4:ään tai 3:een bittiin kalibrointiaineiston ohjaamana. Projekti on AutoGPTQ:n ylläpidetty seuraaja, ja Transformers-kirjaston GPTQ-tuki nojaa siihen.

Paikalliseen ajoon kytkös on suora kahdesta suunnasta. Pakkaus itsessään onnistuu kotikoneella: kalibrointi tarvitsee muutaman sadan esimerkkirivin ja näytönohjaimen, ja tuore versio kevensi muistinkäyttöä kasaamalla kalibrointitilastot paikalleen laitekohtaisesti. Ja lopputulos ajetaan missä huvittaa — kirjasto lupaa kiihdytetyn ajon NVIDIAn CUDA:lla, AMD:n ROCm:llä, Huawein Ascendilla, Intelin XPU:lla ja pelkällä prosessorillakin, ja pakatut mallit kelpaavat suoraan vLLM:lle ja SGLangille. GGUF-maailman rinnalla GPTQ on se toinen valtaformaatti, jota palvelinmoottorit suosivat.

Tiistaina PyPI:hin noussut 7.3.4 on korjauspainotteinen mutta osuva. Monen näytönohjaimen kalibrointi tasapainottaa nyt tilastonkeruun laitteiden kesken, 3-bittisen GPTQ:n puskurit mitoitetaan vihdoin oikein — pienin bittileveys on ollut formaatin hauras nurkka — ja Marlin-ajoydinten skaalataulukot välimuistitetaan. Mukana on myös ajan hermolla oleva yksityiskohta: Poolsiden Laguna-mallien eräs projektiokerros ohitetaan kvantisoinnissa, koska se ei kestä pakkausta. Sama kirjasto tukee myös tuoreita GLM-, DeepSeek- ja Nemotron-arkkitehtuureja.

Rajoitukset kannattaa tietää ennen ryhtymistä. Kvantisointi ei ole ilmaista: 27 miljardin parametrin mallin kalibrointi vie tunteja ja tarvitsee kunnolla muistia, vaikka kerroksia voi käsitellä levyltä. GPTQ-muoto ei myöskään ole llama.cpp-maailman GGUF — jos työkalusi on Ollama tai LM Studio, tarvitset eri putken. Ja pakkauslaatu riippuu kalibrointiaineistosta: englanninkielinen oletusaineisto voi rokottaa suomen kieltä, mikä on hyvä syy tehdä kvantit itse omalla aineistolla — juuri se on tämän kirjaston vahvin argumentti.

Tila on tarkistettu PyPI:stä ja GitHubista: versio 7.3.4 julkaistiin 19. elokuuta, lisenssi on Apache 2.0 ja asennus onnistuu pip-rivillä. Kokeiluun sopiva ensiaskel on pakata jokin 1–4 miljardin parametrin malli 4 bittiin omalla aineistolla ja vertailla vastauksia alkuperäiseen — ero kertoo enemmän kvantisoinnin luonteesta kuin yksikään taulukko.

Lisälähteet

Muut jutut tässä numerossa