Tekoälyn päivälehti — mallit, työkalut ja hardware
Maanantai · 31. elokuuta 2026Iltapainos · klo 21Nro 58
Kuun viimeinen päivä toi vuoden odotetuimman avoimen painon julkaisun: DeepSeek avasi ensimmäisen näkevän mallinsa MIT-lisenssillä, ja tiedostot paljastavat siitä jotain, mitä tiedote ei kerro. Malli tulee ulos valmiiksi pakattuna — sen asiantuntijaosat on tallennettu neljällä bitillä jo tehtaalla, ja siksi yhteisön nelibittinen versio on vain neljä prosenttia pienempi kuin kahdeksanbittinen. Eteläkorealainen Nota AI puolestaan karsi GLM-5.3:sta joka kerroksesta eri määrän asiantuntijoita ja sai 753 miljardin parametrin mallin mahtumaan kahdelle näytönohjaimelle kahdeksan sijaan. llama.cpp:ssä oli sekin harvinainen päivä, jona sama korjaus tehtiin kolmelle eri näytönohjainrajapinnalle: uusi malli vaatii tuhannen vaihtoehdon poimintaa jokaisella sanalla, ja vanha lajittelutapa ei siihen taipunut. Lisäksi: Windowsin kehitysversiosta löytyi asetus, joka murtaa puolikkaan muistin rajan, agenttiohjelmisto OpenClaw ajaa nyt omaa llama.cpp-palvelintaan, NVIDIA ja MediaTek jatkavat pöytäkoneen kokoisen tekoälykoneen kehitystä — ja illan mini-PC-parissa kaksi noin 900 euron toimistokonetta jää molemmat kauas lehden 570 euron valinnasta.
304 miljardin parametrin malli mahtuu 167,8 gigatavuun, koska asiantuntijapainot on tallennettu neljän bitin liukuluvuilla jo tehtaalla. Siksi yhteisön nelibittinen pakkaus on vain neljä prosenttia pienempi kuin kahdeksanbittinen — puristettavaa ei juuri ole jäljellä.
Tavallinen karsinta pudottaa saman osuuden joka kerroksesta. Nota AI mittasi jokaisen asiantuntijan tärkeyden koko verkon mittakaavassa ja jätti eri kerroksiin eri määrän — jolloin 753 miljardin parametrin mallista jäi 625 miljardia ja tarkkuudesta selvästi enemmän.
Vulkan aamulla, ROCm iltapäivällä, Metal illalla. Kaikki kolme saivat radix-pohjaisen top-k-poiminnan, koska Qwen 3.8 Flash Next tarvitsee sitä tuhannen vaihtoehdon kokoluokassa eikä vanha lajittelu enää riitä.
Maanantain julkaisussa paikallinen keskustelumalli ja paikalliset upotukset saivat oman hallitun asennuksensa ja yhden yhteisen nimiavaruuden. Valmis llama-server kelpaa myös sellaisenaan, ja asennusvelho osaa etsiä koneelta jo olevat mallit.
SemiAnalysisin InferenceX-mittauksessa ajettiin GPT-OSS 120B, DeepSeek R1 ja Kimi K2.5 — ja juuri siksi luvut ovat luettavissa. Läpäisy huipputehoa kohti 1,5–1,9-kertainen, keskustelukäytössä 2,1–4,1-kertainen GB200- ja GB300-järjestelmiin nähden.
Sopimus koskee räätälöityjä XPU-piirejä NVLink Fusion -alustalla, mutta paikallisen päättelyn kannalta tärkein rivi on toinen: osapuolet jatkavat RTX Spark- ja DGX Spark -piirien seuraavien sukupolvien yhteiskehitystä.
The Informationin tietojen mukaan Applen elokuinen julkistus aikaistui, koska yritykset ovat ostaneet koneita paikalliseen mallien ajoon nopeammin kuin Apple osasi odottaa. Mac-myynti kasvoi vuosineljänneksellä lähes 29 prosenttia.
Nykyinen Windows antaa näytönohjaimelle enintään noin puolet asennetusta muistista. Kokeellisen kanavan buildista 29648 löytynyt valinta varaa muistin etukäteen grafiikalle ja tekoälykiihdytykselle — mutta vain yhteismuistikoneilla.
Kaksi pientä alustakohtaista korjausta llama.cpp:hen samana päivänä. Strix Halolla neljän rivin vakioasetus voitti automatiikan erävetoisessa ajossa, ja Intelin näytönohjaimilta kysytään nyt vapaa muisti suoraan ajurilta arvion sijaan.
Pieni paikallinen malli ei kysy tarkennusta. Se arvaa, ja arvaus näkyy vasta valmiissa vastauksessa. Yksi rivi kehotteeseen siirtää arvauksen näkyviin ennen kuin työ on tehty.
Levylle tallentava vektorikanta, joka ei tarvitse palvelinprosessia, sai laskettavat sarakkeet ja materialisoidut näkymät. Käytännössä upotusmallin voi kytkeä tauluun kerran, ja uusi rivi saa vektorinsa ilman erillistä ajoa.
ICE-012 Audio on 612 miljoonan parametrin suoratoistava TTS-malli Apache 2.0 -lisenssillä. Mallikortti puhuu 654 kielitunnisteesta, mutta kielijakaumaa ei ole avattu — ja repon esimerkkiäänet eivät ole mallin tuotoksia.
Molemmissa on 16 gigatavua DDR5-muistia kahdella kanavalla, eli täsmälleen sama muistikaista. Toisessa muistin voi kasvattaa 96 gigatavuun ja kylkeen kytkeä oikean näytönohjaimen; toisessa on tekoälykiihdytin ja kaksi Thunderbolt-porttia.
Katso mallin todellinen koko tiedostoista, älä mallikortista
Illan pääjuttu perustuu siihen, että Hugging Facen rajapinta kertoo jokaisen tiedoston koon tavuina. Se on nopein tapa vastata kysymykseen, jota mallikortit harvoin vastaavat suoraan: mahtuuko tämä minun koneeseeni. Alla olevat komennot toimivat millä tahansa repolla ja vaativat vain curlin ja pythonin.
curl -s 'https://huggingface.co/api/models/unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF?blobs=true' | python3 -c "import json,sys,collections; d=json.load(sys.stdin); a=collections.defaultdict(int); [a.__setitem__(s['rfilename'].split('/')[0], a[s['rfilename'].split('/')[0]]+(s.get('size') or 0)) for s in d['siblings']]; [print('%9.1f GB %s'%(v/1e9,k)) for k,v in sorted(a.items(), key=lambda x: x[1])]"
curl -s https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp | python3 -m json.tool | grep -A6 safetensors
curl -s https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp/raw/main/config.json | grep -E 'expert_dtype|n_routed_experts|num_experts_per_tok|quant_method'
llama-server -m malli.gguf --top-k 1024 --port 8080 # uusi radix-polku, vaatii tuoreen buildin
Kvanttikansioittain summattu koko on se luku, joka ratkaisee: se sisältää myös upotustaulukot ja huomiokerrokset, jotka jäävät usein mainostetun ”N miljardia parametria neljällä bitillä” -arvion ulkopuolelle. Muista, että ajoon tarvitaan tämän lisäksi tilaa kontekstin välimuistille — pitkällä kontekstilla se voi olla kymmeniä gigatavuja. Viimeinen komento kannattaa ajaa vasta, kun oma llama.cpp on käännetty tänään tai myöhemmin; vanhemmassa buildissa iso top-k vain hidastaa.