Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Tiistai · 18. elokuuta 2026Iltapainos · klo 21Nro 46
← Takaisin etusivulle

Ling-3.0-tiny · GGUF · 18.8.2026 · Mallit

Päättelymalli, joka lukee 7,9 miljardista parametristaan kerrallaan 1,4 — nyt viiden gigatavun tiedostona

InclusionAI:n pienin Ling 3.0 sai tänä yönä täyden GGUF-käännössarjan, 24 kvantisointia kaksibittisestä täyteen tarkkuuteen. Q4_K_M vie 4,92 gigatavua, ja mallikortin mukaan huippumuistinkulutus on kahdeksantuhannen tokenin kontekstilla noin 8,3 gigatavua.

128 asiantuntijaa, kahdeksan kerrallaan1,4 mrd luetaan7,9 mrd yhteensäQ4_K_M · 4,92 GBMIT-lisenssi · 131 072 tokenin konteksti

Kiinalaisen inclusionAI:n Ling 3.0 -perheen pienin jäsen sai tänä yönä sen, mitä se on julkaisustaan asti odottanut: täyden GGUF-käännössarjan. Bartowskin hakemistoon ilmestyi Suomen aikaa kello kuuden maissa 24 kvantisointia kaksibittisestä IQ2_M:stä täyteen bf16-tarkkuuteen. Käytännössä se tarkoittaa, että malli ajetaan nyt llama.cpp:llä, LM Studiolla ja Ollamalla eikä pelkästään SGLangilla tai vLLM:llä.

Malli itse ansaitsee huomiota. Ling-3.0-tiny on asiantuntijasekoitus, jossa on 7,9 miljardia parametria yhteensä mutta vain 1,4 miljardia aktiivista tokenia kohti — upotuskerros pois lukien 1,14 miljardia. Reitittimessä on 128 asiantuntijaa, joista jokaiselle tokenille valitaan kahdeksan, ja niiden rinnalla kulkee yksi jaettu asiantuntija. Attentiopuoli on hybridi: neljän kerroksen lohkoissa kolme kerrosta käyttää Kimi Delta -attentiota ja yksi täyttä latenttiattentiota. Rakenne on sama kuin isommassa Ling 3.0 -sarjassa, mutta mitoitettu koneelle, joka ei ole konesali.

Muistijalanjälki on se luku, jonka takia tästä kannattaa kiinnostua. Nelibittinen Q4_K_M-tiedosto on 4,92 gigatavua ja kaksibittinen IQ2_M 2,83. Julkaisijan oma mittaus ilmoittaa huippumuistinkulutukseksi noin 8,34 gibitavua kahdeksantuhannen tokenin kontekstilla kahdeksanbittisenä, eli malli mahtuu kevyemmillä kvantisoinneilla kahdeksan gigatavun näytönohjaimeen ja aivan varmasti kuudentoista gigatavun koneeseen.

Nopeusluvut ovat mallikortista, eivät tämän lehden mittaamia, mutta ne on ilmoitettu poikkeuksellisen tarkasti ja nimenomaan sillä raudalla, jota lukija saattaa harkita. Kahdeksanbittisenä malli tuottaa noin 100–105 tokenia sekunnissa NVIDIAn DGX Sparkilla ja 86–90 tokenia M4 Pro -MacBookilla. Riippumattomassa Artificial Analysis -mittauksessa ulostulonopeus ylittää 160 tokenia sekunnissa, ja 500 tokenin vastaus valmistuu päättelyineen noin 18 sekunnissa.

Älykkyyspuolella on syytä olla realisti. Artificial Analysis antaa mallille älykkyysarviossaan 25 pistettä ja agenttiluokituksessaan 16. Se ei ole kärkimalli eikä yritäkään olla; vertailukohta on muut samalla aktiivisella parametrimäärällä toimivat mallit, ja siinä joukossa luvut ovat hyvät. Päättely on kytkettävissä pyyntökohtaisesti päälle ja pois, eli samaa mallia käytetään sekä nopeisiin vastauksiin että monivaiheiseen pohdintaan ilman että konetta ladataan uudelleen.

Lisenssi on MIT, eli sallivin mahdollinen — ei käyttörajoituksia, ei tulonjakoehtoja, ei mallin nimeä koskevia vaatimuksia. Se erottaa julkaisun useista tämän kesän suurista kiinalaisista malleista, joissa lisenssiehdot ovat kiristyneet. Konteksti-ikkuna on 131 072 tokenia, suositellut näytteenottoparametrit lämpötila 1,0, top-p 0,95 ja top-k 20. Julkaisija sanoo itse kohderaudakseen DGX Sparkin, Apple silicon -MacBookin ja Mac minin, mikä on avoimen mallin julkaisulta harvinaisen suora tunnustus siitä, kenelle malli on tehty.

Yksi varaus kuuluu kertoa. Mallin hybridiarkkitehtuuri on uusi, ja sen tuki llama.cpp:hen on tuoretta — jos palvelin ilmoittaa tuntemattomasta arkkitehtuurista, käännös on liian vanha eikä tiedostossa ole vikaa. Bartowskin hakemistossa on mukana myös imatrix-tiedosto, jota käytetään pienimpien kvantisointien laadun parantamiseen; kaksibittiset versiot kannattaa ottaa nimenomaan IQ-sarjasta eikä K-sarjasta.

Lähde: Hugging Face ↗

Lisälähteet

Muut jutut tässä numerossa