Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Torstai · 20. elokuuta 2026Iltapainos · klo 21Nro 48
← Takaisin etusivulle

Liquid AI · LFM2.5-DSpark-GGUF · 19.8.2026 · Mallit

Liquid AI irrotti luonnostelijan sivuvaunuksi — 664 megatavun tiedosto nopeuttaa koko malliperhettä

LFM2.5-mallien sisään koulutettu DSpark-spekulointi on nyt ladattavissa erillisinä GGUF-tiedostoina kolmelle koolle. Sivuvaunussa on vain luonnostelija: viisi huomiokerrosta, Markov-pää ja varmuuspää — token-upotukset se lainaa kohdemallilta latauksen yhteydessä. Tuki on llama.cpp:n päähaarassa.

Iso malli + pieni sivuvaunuLFM2.5-8Bkohdemalli tarkistaaDSpark5 kerrosta664 Mt9 tokenin lohko kerralla — upotukset lainataan isolta

Spekulatiivinen dekoodaus nojaa yleensä kahteen erilliseen malliin: pieni luonnostelee, iso tarkistaa. Liquid AI:n DSpark-arkkitehtuuri upotti luonnostelijan suoraan mallin sisään, ja llama.cpp sai sille tuen päähaaraansa aiemmin tässä kuussa. Eilen Liquid vei ajatuksen seuraavaan vaiheeseen: se julkaisi luonnostelijat erillisinä GGUF-sivuvaunuina kolmelle LFM2.5-koolle — 1,2 ja 2,6 miljardin tiheille malleille sekä 8 miljardin MoE-versiolle, jonka aktiivinen osuus on miljardin luokkaa.

Sivuvaunu on kevyt, koska se kantaa vain olennaisen. Tiedostossa on viisi huomiokerrosta, 256-rankinen Markov-pää, varmuuspää ja 9 tokenin lohkokoko — token-upotukset ja kielimallipää se jakaa kohdemallin kanssa latauksen yhteydessä. Siksi 8B-mallin F16-luonnostelija painaa vain 664 megatavua, eikä sivuvaunua voi ajaa yksinään: se on pariliitettävä saman perheen kohde-GGUF:iin. Käytännössä lataat siis tavallisen LFM2.5-tiedoston ja sen rinnalle pienen kiihdytintiedoston.

Ratkaisu on paikallisajajalle merkittävä kahdesta syystä. Ensinnäkin muisti: sisäänrakennettu luonnostelija kulkee aina painojen mukana, mutta sivuvaunun voi jättää lataamatta, kun muisti on tiukalla — tai ottaa mukaan, kun kaistaa riittää. Toiseksi kvantisointi: kohdemallin voi pakata haluamaansa tarkkuuteen ja pitää luonnostelijan silti täydessä F16-tarkkuudessa, jolloin ehdotusten osumatarkkuus ei kärsi pakkauksesta. Liquid suosittelee juuri tätä yhdistelmää, kun muisti sen sallii.

Ajatus erillisistä, virallisista luonnostelutiedostoista istuu laajempaan kuvaan. Tämän kuun aikana llama.cpp oppi tunnistamaan luonnosmallin tyypin automaattisesti, Qwen3.8-27B sai lohkodiffuusioon perustuvan DFlash 2 -luonnostelijan, ja tämän numeron toisessa jutussa yhteisö niputtaa Ornithin MTP-pään suoraan kvanttitiedostoon. Kaikki kolme ratkovat samaa yhtälöä eri kulmista: muistikaista on paikallisen generoinnin pullonkaula, ja jokainen hyväksytty luonnostoken on kaistaa, jota ei tarvinnut käyttää. Liquidin malli — pieni lisenssitiedosto lfm1.0-ehdoin, lataus Hugging Facesta — on näistä kevyin ottaa käyttöön.

Lisälähteet

Muut jutut tässä numerossa