Tekoälyn päivälehti — mallit, työkalut ja hardware
vLLM v0.28.0rc1–rc2 · DFlash 2 · 20.–21.8.2026 · Työkalut
Tänä aamuna julkaistu toinen julkaisukandidaatti tuo lohkodiffuusioon perustuvan DFlash 2 -spekuloinnin vLLM:ään: paikallinen konvoluutio korjaa lohkon loppupään osumatarkkuutta ja ehdokasvalitsin poimii listoista yhtenäisen jatkon. Kehittäjä-Incon oma mittaus lupaa yli 20 % enemmän hyväksyttyä tekstiä tarkistuskierrosta kohti noin prosentin lisäviiveellä.
DFlash 2 esiteltiin viime viikolla Qwen3.8-27B:n luonnostelijana: pieni diffuusiomalli ehdottaa kokonaisen tokenilohkon kerralla, ja iso malli tarkistaa sen yhdellä läpikäynnillä. Nyt tekniikka etenee moottoreihin. vLLM julkaisi eilen version 0.28.0 ensimmäisen julkaisukandidaatin ja tänä aamuna toisen, jonka nimikkomuutos on juuri DFlash 2 -tuki: spekulatiivisen dekoodauksen polku sai paikallisen konvoluution ja ehdokasvalitsimen.
Kaksi lisäystä ratkovat lohkoluonnostelun kahta tunnettua heikkoutta. Ensimmäinen on osumatarkkuuden hiipuminen lohkon loppua kohti: mitä pidemmälle luonnos ulottuu, sitä epävarmemmiksi ehdotukset käyvät, ja hylätty häntä hukkaa tarkistuskierroksen hyötyä. Kevyt konvoluutiokerros siistii juuri loppupään ennusteita. Toinen on valinta: kun luonnostelija tuottaa ehdokaslistoja, moottorin pitää poimia niistä keskenään yhteensopiva jatko eikä vain todennäköisintä tokenia kerrallaan. Kehittäjä-Incon julkaiseman tekniikkakuvauksen mukaan yhdistelmä tuottaa yli 20 % enemmän hyväksyttyä tekstiä jokaista tarkistuskierrosta kohti noin prosentin lisäviiveellä, ja konvoluution laskentakuorma on noin 3 % siinä missä syvemmät vaihtoehdot maksavat yli 15. Kokonaisnopeutus tavalliseen token kerrallaan -generointiin nähden on tekijöiden mittauksissa 2,7–3,4-kertainen — luvut ovat julkaisijan omia, eikä niitä ole vielä mitattu riippumattomasti.
Julkaisukandidaatti on julkaisukandidaatti: tuotantokäyttöön 0.28.0 kannattaa päästää vasta valmiina, ja rc-versioiden asentaminen vaatii esiversioliput. Suunta on silti selvä ja sama, joka näkyi llama.cpp:ssä koko elokuun: spekulatiivisesta dekoodauksesta on tullut moottorien tärkein kilpakenttä, koska muistikaista ei halpene mutta hyväksytty luonnostoken on kaistaa, jota ei tarvinnut käyttää. DFlash 2:n eteneminen julkistuksesta moottori-integraatioon viikossa kertoo, kuinka lyhyeksi tämä polku on käynyt.
Paikallisajajalle aikajana tarkoittaa, että sama tekniikka valuu alaspäin nopeasti: vLLM on tyypillisesti ensimmäinen pysäkki, ja llama.cpp-maailmassa Qwen3.8:n DFlash 2 -luonnostelija on jo ladattavissa. Kun 0.28.0 valmistuu, lohkoluonnostelu on ensimmäistä kertaa käytettävissä isossa palvelinmoottorissa ilman erillisiä haaroja — ja silloin sen luvut myös mitataan muidenkin kuin tekijöiden toimesta.