Tekoälyn päivälehti — mallit, työkalut ja hardware
llama.cpp · b10399–b10411 · 13.8.2026 · Työkalut
Kolme spekulatiivisen dekoodauksen yhdistämistä samana päivänä: luonnosmallin tyyppi tunnistetaan nyt automaattisesti GGUF-metatiedoista, MTP-luonnokset tunnistetaan omana lajinaan, ja näytönohjaimella tapahtuva näytteenotto toimii myös DFlash- ja DSpark-luonnoksilla. Ajoitus ei jää epäselväksi kenellekään.
llama.cpp:n päivä näytti lokissa tavalliselta: parikymmentä yhdistettyä muutosta, joiden otsikot eivät huuda mitään. Mutta kolme niistä kuuluu yhteen, ja yhdessä ne muuttavat sen, miltä spekulatiivinen dekoodaus käyttäjälle näyttää. Vedossa #26814 llama.cpp oppii lukemaan luonnosmallin tyypin suoraan GGUF-tiedoston metatiedoista, vedossa #27005 sama automaattitunnistus laajenee MTP-luonnoksiin, ja vedossa #26958 näytönohjaimella tapahtuva näytteenotto — se, joka siirtyi GPU:lle vasta maanantain isossa muutoksessa — kytkeytyy päälle myös DFlash- ja DSpark-tyyppisille luonnoksille.
Tähän asti spekulatiivinen dekoodaus on ollut llama.cpp:ssä käsityötä. Käyttäjä on valinnut luonnosmallin, kertonut komentorivillä mikä se on, ja toivonut että sanasto ja arkkitehtuuri sopivat pääpariin. Kun luonnoslajeja on tullut lisää — perinteinen pienoismalli, EAGLE-tyyliset päät, DFlashin lohkoluonnokset, DSparkin sisäänrakennetut moduulit ja MTP-kerrokset — valintojen määrä on kasvanut nopeammin kuin kenenkään kärsivällisyys. Nyt tiedosto kertoo itse, mikä se on. Se on täsmälleen samanlainen muutos kuin aikanaan mallipohjien siirtyminen GGUF:n sisään: yksi kokonainen virhelähde katoaa.
Ajoitus on se, mikä tekee tästä uutisen. DeepSeek julkaisi tänään lippulaivansa, jonka spekulatiivinen dekoodaus tulee sisäänrakennettuna DSpark-moduulina, ja DeepSeekin kesäkuussa julkaisemat DSpark- ja DFlash-luonnosmallit Qwen3- ja Gemma4-perheille ovat olleet Hugging Facessa jo seitsemän viikkoa. Niiden käyttö llama.cpp:ssä on tähän asti vaatinut käsisäätöä. Tämän päivän kolmen vedon jälkeen polku on suorempi: lataa luonnos, anna se komentoriville, ja moottori päättelee loput.
Näytteenoton siirtyminen näytönohjaimelle luonnoksia myöten on suorituskykyasia, joka näkyy juuri spekuloinnissa. Spekulatiivisessa dekoodauksessa näytteenottoa tehdään moninkertaisesti tavalliseen ajoon nähden — jokainen luonnostoken pitää arpoa ja jokainen varmistus käsitellä — ja jos se työ tehdään suorittimella, kaista kuluu edestakaiseen liikenteeseen. Maanantaina tämä lehti kirjoitti, että näytteenotto siirtyi GPU:lle; tänään siirto ulottuu siihen käyttötapaan, jossa siitä on eniten hyötyä.
Sivujuonteena sama buildiväli toi Metalille TQ2_0-ternäärikvanttien tuen. Se tarkoittaa, että BitNet-tyyppisiä kahden bitin luokan malleja voi nyt ajaa Applen näytönohjaimella asti — pieni yleisö, mutta sitkeä sellainen.
Kokonaiskuva on sama, jonka tämä lehti on piirtänyt koko viikon: spekulatiivisesta dekoodauksesta on tulossa paikallisen ajon oletusarvo, ei erikoisasetus. Ollama kytki sen oletukseksi viikko sitten, vLLM hioo DSpark-varmistustaan julkaisu julkaisulta, ja llama.cpp poistaa nyt viimeisiä käsivaiheita. Kun nopeushyöty on kaksin-kolminkertainen eikä laatu kärsi, syitä olla käyttämättä alkaa olla vähän.