Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Maanantai · 31. elokuuta 2026Iltapainos · klo 21Nro 58

Kuun viimeinen päivä toi vuoden odotetuimman avoimen painon julkaisun: DeepSeek avasi ensimmäisen näkevän mallinsa MIT-lisenssillä, ja tiedostot paljastavat siitä jotain, mitä tiedote ei kerro. Malli tulee ulos valmiiksi pakattuna — sen asiantuntijaosat on tallennettu neljällä bitillä jo tehtaalla, ja siksi yhteisön nelibittinen versio on vain neljä prosenttia pienempi kuin kahdeksanbittinen. Eteläkorealainen Nota AI puolestaan karsi GLM-5.3:sta joka kerroksesta eri määrän asiantuntijoita ja sai 753 miljardin parametrin mallin mahtumaan kahdelle näytönohjaimelle kahdeksan sijaan. llama.cpp:ssä oli sekin harvinainen päivä, jona sama korjaus tehtiin kolmelle eri näytönohjainrajapinnalle: uusi malli vaatii tuhannen vaihtoehdon poimintaa jokaisella sanalla, ja vanha lajittelutapa ei siihen taipunut. Lisäksi: Windowsin kehitysversiosta löytyi asetus, joka murtaa puolikkaan muistin rajan, agenttiohjelmisto OpenClaw ajaa nyt omaa llama.cpp-palvelintaan, NVIDIA ja MediaTek jatkavat pöytäkoneen kokoisen tekoälykoneen kehitystä — ja illan mini-PC-parissa kaksi noin 900 euron toimistokonetta jää molemmat kauas lehden 570 euron valinnasta.

Kokeilemisen arvoista

Katso mallin todellinen koko tiedostoista, älä mallikortista

Illan pääjuttu perustuu siihen, että Hugging Facen rajapinta kertoo jokaisen tiedoston koon tavuina. Se on nopein tapa vastata kysymykseen, jota mallikortit harvoin vastaavat suoraan: mahtuuko tämä minun koneeseeni. Alla olevat komennot toimivat millä tahansa repolla ja vaativat vain curlin ja pythonin.

curl -s 'https://huggingface.co/api/models/unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF?blobs=true' | python3 -c "import json,sys,collections; d=json.load(sys.stdin); a=collections.defaultdict(int); [a.__setitem__(s['rfilename'].split('/')[0], a[s['rfilename'].split('/')[0]]+(s.get('size') or 0)) for s in d['siblings']]; [print('%9.1f GB  %s'%(v/1e9,k)) for k,v in sorted(a.items(), key=lambda x: x[1])]"
curl -s https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp | python3 -m json.tool | grep -A6 safetensors
curl -s https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp/raw/main/config.json | grep -E 'expert_dtype|n_routed_experts|num_experts_per_tok|quant_method'
llama-server -m malli.gguf --top-k 1024 --port 8080   # uusi radix-polku, vaatii tuoreen buildin

Kvanttikansioittain summattu koko on se luku, joka ratkaisee: se sisältää myös upotustaulukot ja huomiokerrokset, jotka jäävät usein mainostetun ”N miljardia parametria neljällä bitillä” -arvion ulkopuolelle. Muista, että ajoon tarvitaan tämän lisäksi tilaa kontekstin välimuistille — pitkällä kontekstilla se voi olla kymmeniä gigatavuja. Viimeinen komento kannattaa ajaa vasta, kun oma llama.cpp on käännetty tänään tai myöhemmin; vanhemmassa buildissa iso top-k vain hidastaa.