Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Sunnuntai · 30. elokuuta 2026Iltapainos · klo 21Nro 57

Viikonlopun kysymys oli, kuinka paljon pakatusta mallista jää jäljelle. Itävaltalainen tutkimuslaitos julkaisi Qwen 3.8:n 27 miljardin parametrin mallista pakatut versiot, joissa jokaiselle painomatriisille on haettu oma tarkkuutensa erikseen — 8,4 gigatavun tiedosto ratkaisee matematiikkakokeesta kymmenen prosenttiyksikköä enemmän kuin saman kokoinen tiedosto alan vakiintuneelta pakkaajalta. Samaan aikaan yhdysvaltalaisfoorumilla tehty mittaus kertoo, ettei pakkaus edes ole ainoa syy siihen, miksi kotona ajettu malli vastaa eri tavalla kuin virallinen: pelkkä huomiokerroksen laskentatavan vaihto riitti muuttamaan mallin valitsemia sanoja keskellä pitkää keskustelua. Kevyemmässä päässä ilta oli levyn ilta: llama.cpp oppi jättämään mallin suurimman taulukon kovalevylle, ja koboldcpp lataa mallitiedoston käyttöjärjestelmän välimuistin ohi. Lisäksi: AMD hyppäsi kahden versionumeron yli, Intelin 32 gigatavun työasemakortti ajaa 27 miljardin mallia 52 tokenin sekuntivauhtia, Apple nosti pienimmän pöytäkoneensa hintaa puolella — ja illan mini-PC-parissa toinen kone on täysin äänetön ja toinen lukee muistiaan lähes kolme kertaa nopeammin.

53,8 Gt 10,1 Gt 8,4 Gt

Pakkaus · avoimet painot · Qwen 3.8

27 miljardin parametrin malli mahtuu 8,4 gigatavuun ilman että matematiikka katoaa — itävaltalaislabran pakkaus voittaa vakiintuneen kymmenellä pisteellä

IST Austrian tutkimusryhmä julkaisi Qwen3.8-27B:stä GGUF-tiedostot, joissa jokaiselle painomatriisille on haettu oma tarkkuutensa erikseen. Samankokoisessa 8,4 gigatavun tiedostossa ero AIME-matematiikkakokeessa on 96,67 vastaan 86,67, ja 10,1 gigatavun versio pärjää yhtä hyvin kuin pakkaamaton 53,8 gigatavun alkuperäinen.

Lue pääjuttu →

Kokeilemisen arvoista

Jätä mallin suurin taulukko levylle ja katso, paljonko muistia vapautuu

Illan kaksi työkalu-uutista koskevat samaa asiaa kahdelta puolelta: sitä, miten malli liikkuu levyltä muistiin. llama.cpp:n uusi valitsin lukee suurimmat upotustaulukot levyltä sitä mukaa kuin niitä tarvitaan, ja koboldcpp osaa nyt ladata mallitiedoston käyttöjärjestelmän välimuistin ohi. Molemmat vaativat tuoreimman version.

llama-cli -m malli.gguf --mmap 1 --lazy-mode auto -p "Kerro yksi asia Suomen ilmastosta."
llama-server -m malli.gguf --mmap 1 -lzm on --port 8080
./koboldcpp --model malli.gguf --usedirectio --usemlock
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ3_XXS.gguf   # illan pääjutun tiedosto, 10,1 Gt

Lepotilan valitsin toimii vain mmap-latauksen kanssa, ja arvo "auto" koskee vain yli neljän gibitavun taulukoita — pienessä mallissa se ei tee mitään. Vertaa muistinkulutusta ennen ja jälkeen: hyöty on kokonaan kiinni siitä, onko mallissa iso kerroskohtainen upotustaulukko. Jos ajat mallia hitaalta SATA-levyltä, älä odota ihmeitä kummastakaan valitsimesta.