Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Keskiviikko · 19. elokuuta 2026Iltapainos · klo 21Nro 47
← Takaisin etusivulle

DFlash 2 · spekulatiivinen dekoodaus · 15.–19.8.2026 · Työkalut

DFlash 2 luonnostelee kokonaisen lohkon kerralla — ja Qwen3.8-27B sai sen ensimmäisenä

Heinäkuussa esitelty lohkodiffuusioluonnostelu eteni versioon 2: uusi piirtäjä ennustaa kahdeksan tokenin lohkon yhdellä läpikäynnillä ja valitsee ehdokkaista yhtenäisen polun. Gigatavun kokoinen GGUF-luonnosmalli ilmestyi eilen, ja tämän päivän transformers-korjaus paikkasi polun laitevirheen.

Kahdeksan tokenia yhdellä piirrollavalitsin jäljittää yhtenäisen polun ehdokkaiden läpiiso malli vain tarkistaahäviötön: tulos sama kuin ilman luonnostelijaa

Spekulatiivisen dekoodauksen idea on vanha: pieni malli luonnostelee, iso tarkistaa, ja koska tarkistus on rinnakkaista, isoa mallia luetaan muistista harvemmin. DFlash toi kesällä kuvioon lohkodiffuusion — luonnostelijan, joka ei kirjoita tokeneita jonossa vaan ennustaa kokonaisen lohkon yhdellä läpikäynnillä. Nyt menetelmästä julkaistiin versio 2, ja sen ensimmäinen kohde on kesän ladatuin avoin malli: Qwen3.8-27B.

Uutta versiossa on tapa, jolla lohkosta tehdään käyttökelpoinen. DFlash 2 pitää jokaisessa lohkon kohdassa useita ehdokastokeneita, ja kevyt valitsin jäljittää niiden läpi yhden yhtenäisen polun. Rungon kaksihaaraiset dynaamiset konvoluutiot estävät luonnosta hajoamasta lohkon loppupäässä — ongelma, joka rajoitti ykkösversion lohkokokoa. Menetelmä on häviötön: ahne dekoodaus tuottaa täsmälleen saman tekstin kuin ilman luonnostelijaa, ja näytteistys säilyttää kohdemallin jakauman. Nopeushyöty riippuu siis vain siitä, kuinka usein luonnos osuu.

Julkaisu on käytännössä kolmen varaston paketti. Luonnosmalli incoai/Qwen3.8-27B-DFlash2 ja sen peilikopio z-lab-tilillä ilmestyivät viikonloppuna Apache 2.0 -lisenssillä, ja eilen illalla rinnalle tuli GGUF-käännös: nelibittinen luonnostelija vie 1,14 gigatavua ja täystarkka 3,86. Ajo-ohje nojaa SGLangiin, jossa luonnostelija kytketään päälle kahdella lipulla ja lohkoksi suositellaan kahdeksaa tokenia. Kohdemalliksi käy tavallinen Qwen3.8-27B — sama, jonka DGX Spark -mittauksia tämä lehti ruoti eilen.

Ekosysteemi ehti mukaan vuorokaudessa. Hugging Facen transformers julkaisi tänään puolilta päivin korjausversion 5.15.1, jonka keskeisin sisältö on juuri DFlash- ja MTP-luonnosgeneraattorien virheiden paikkaus — muun muassa laitevirhe, jossa luonnostokenit päätyivät eri näytönohjaimelle kuin kohdemalli. Kun edellisen sukupolven DFlash-spekulaattorit lupasivat heinäkuussa noin kaksinkertaista generointia, kakkosversion lupaus on sama mutta pidemmällä lohkolla ja paremmalla osumatarkkuudella; riippumattomia mittauksia Qwen-luonnostelijasta ei vielä ole, joten tarkkoja kertoimia kannattaa odottaa yhteisöltä.

Paikallisajajan kannalta kiinnostavin yksityiskohta on kokosuhde. Kohdemallin nelibittinen käännös vie 17 gigatavua, luonnostelijan 1,14 — eli reilulla gigatavulla lisämuistia voi ostaa ison osan siitä nopeudesta, joka muuten vaatisi leveämmän muistiväylän. Se on täsmälleen sama vaihtokauppa, jonka tämän lehden eilinen pääjuttu totesi raudasta: kun pullonkaula on muistikaista, ohjelmisto joka lukee muistia harvemmin on halvin kiihdytin.

Lisälähteet

Muut jutut tässä numerossa