Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Perjantai · 14. elokuuta 2026Iltapainos · klo 21Nro 42
← Takaisin etusivulle

llama.cpp · GitHub · 14.8.2026 · Työkalut

Illan mallia ei tarvinnut odottaa, koska sen arkkitehtuuri ehti moottoriin ensin — ja se sanoo itse olevansa Qwen3.5

Qwen3.8-27B:n kerroksista kolme neljäsosaa on Gated DeltaNet -kerroksia. Juuri se operaatio ajettiin llama.cpp:hen omana ggml-operaationaan, ja Metal-taustaosa sai siitä oman toteutuksensa. Mallivaraston arkkitehtuuritunnus paljastaa, miksei tuki ollut kiinni uudesta koodista.

GGML_OP_GATED_DELTA_NETyksi ggml-operaatio · GDA (skalaariportti) ja KDA (rivikohtainen)CPUCUDAMetalMTPpäädimensiot 64 ja 128 · fuusioitu lohkoittainen polkuarkkitehtuuritunnus: qwen3_5uusi malli, vanha tunnus — siksi ketju oli valmiina

Kun uusi mallisukupolvi ilmestyy, paikallisajajan ensimmäinen kysymys ei ole benchmark vaan tämä: milloin se pyörii. Tänään vastaus oli poikkeuksellisen mukava, ja syy näkyy yhdessä kentässä. Hugging Facen mallivarasto merkitsee Qwen3.8-27B:n arkkitehtuuritunnukseksi qwen3_5 — ei qwen3_8. Ajomoottorit eivät katso mallin nimeä vaan tätä tunnusta ja konfiguraatiotiedoston rakennetta. Uusi malli ilmoittaa siis olevansa arkkitehtuuriltaan Qwen3.5-perhettä, ja sitä perhettä varten tehty työ on ollut käynnissä kuukausia.

Keskeinen pala on ggml-operaatio nimeltä GATED_DELTA_NET. Se lisättiin llama.cpp:hen omana operaationaan — ei koottuna kymmenestä pienemmästä laskutoimituksesta, vaan yhtenä fuusioituna, lohkoittain etenevänä ytimenä, jolle on toteutus sekä suorittimelle että CUDAlle. Vetopyynnön kuvaus sanoo suoraan, mihin sitä tarvitaan: qwen3next ja tulevat huomiomallit. Se on juuri se operaatio, jota illan pääuutisen 48 lineaarista huomiopäätä käyttävät.

Applen koneille tuli oma toteutus. Metal-taustaosa sai GGML_OP_GATED_DELTA_NET -tuen, joka kattaa molemmat porttityypit — GDA:n skalaariportin ja KDA:n rivikohtaisen portin — ja päädimensiot 64 ja 128. Qwen3.8-27B:n mallikortti ilmoittaa Gated DeltaNet -päädimensioksi 128. Se osuu tuettuun joukkoon. Käytännössä tämä tarkoittaa, että Applen näytönohjaimella lineaariset kerrokset lasketaan näytönohjaimella eivätkä putoa suorittimelle — ja koska niitä on kolme neljäsosaa mallista, ero ei ole marginaalinen.

Kolmas pala on monen tokenin ennustus. llama.cpp:hen on avattu erillinen vetopyyntö MTP-tuesta spekulatiiviselle dekoodaukselle ja toinen, joka lisää MTP-tuen nimenomaan tiheille Qwen 3.5 -malleille FastMTP-tyylisellä sanaston karsinnalla. Jälkimmäinen on kiinnostava juuri nyt: illan malli on tiheä Qwen-arkkitehtuurin malli, jossa on MTP-pää mukana checkpointissa. Sanaston karsinta tarkoittaa, ettei luonnospää laske koko 248 320 tokenin sanaston yli vaan sen todennäköisimmän osajoukon — mikä on juuri se kohta, jossa MTP:n hyöty muuten valuu hukkaan isolla sanastolla.

Tuoreimmat julkaisubuildit on merkitty tunnuksilla b10427 ja b10428, ja ne on rakennettu tänään 14. elokuuta. Rehellisyyden nimissä: tämä lehti ei tänään löytänyt yksittäistä vetopyyntöä otsikolla "Qwen3.8 support", eikä väitä sellaista olevan. Väite on kapeampi ja varmempi: ne palaset, joita tämän mallin ajaminen vaatii — lineaarisen huomion operaatio kolmella taustaosalla ja monen tokenin ennustuksen tuki tiheille Qwen-malleille — ovat kaikki jo puussa, ja malli itse ilmoittaa arkkitehtuurikseen sen perheen, jota varten ne tehtiin.

Käytännön ohje illaksi: hae tuorein build, älä eilistä. Jos ajat Applen koneella, varmista että käännöksessä on Metal mukana — muuten lineaariset kerrokset menevät hitaampaa polkua. Ja jos aiot venyttää kontekstia, katso konfiguraatiotiedoston rope_parameters-lohkoa: mallikortti neuvoo muuttamaan sitä vain silloin, kun oikeasti ajat yli 262 144 tokenin konteksteja, koska kaikki tunnetut avoimen lähdekoodin toteutukset käyttävät staattista YaRNia — skaalauskerroin pysyy samana syötteen pituudesta riippumatta ja heikentää lyhyiden tekstien laatua.

Lisälähteet

Muut jutut tässä numerossa