Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Torstai · 20. elokuuta 2026Iltapainos · klo 21Nro 48
← Takaisin etusivulle

APEX-MTP · Ornith-1.5-35B · 19.–20.8.2026 · Mallit

Eilisen mallijulkaisu sai kvantit, jotka luonnostelevat itse itseään — luonnostelupää niputettiin tiedostoon

LocalAI-tiimin APEX-projekti paketoi Ornith-1.5-35B:n neljänä GGUF-kokona, joissa mallin oma MTP-ennustuspää kulkee mukana omana kerroksenaan. Spekulatiivinen dekoodaus käynnistyy yhdellä lipulla ilman erillistä luonnosmallia, ja pakkaus kohtelee kerroksia eriarvoisesti: 256 reititetystä asiantuntijasta puristetaan, luonnostelupäästä ei.

Yksi tiedosto, malli ja luonnostelijablk.40 — MTP-luonnostelupää (Q8_0)reuna: tarkempikeskikerrokset: kovempi pakkaus--spec-type draft-mtp — ei erillistä luonnosmalliakoot 14,37–26,17 Gt · mmproj-nakotiedosto 0,90 Gt

Eilisen numeron mallijulkaisu Ornith-1.5-35B-A3B ehti tuskin latauslistoille, kun sille ilmestyi jo erikoiskäännös. LocalAI-tiimin APEX-projekti julkaisi eilen illalla ja täydensi tänään kvanttisarjan, jonka erikoisuus on niputettu luonnostelu: mallin oma MTP-ennustuspää — täysimittainen MoE-lohko, joka arvaa seuraavia tokeneita eteenpäin — kulkee tiedostossa mukana omana kerroksenaan blk.40. Spekulatiivinen dekoodaus käynnistyy llama.cpp:ssä yhdellä lipulla suoraan tiedostoa itseään vasten, eikä erillistä luonnosmallia ladata tai konfiguroida.

Sarjassa on neljä kokoa 14,37 gigatavusta 26,17:ään sekä 0,90 gigatavun näköprojektori, joten kuvasyötekin säilyy. Pakkausfilosofia on selostettu mallikortilla poikkeuksellisen avoimesti. Ornithin painoista 89,6 prosenttia istuu 256 reititetyssä asiantuntijassa, joista vain 8 aktivoituu tokenia kohti — juuri ne sietävät kovaa pakkausta, joten APEX painaa niitä kerroksittaisella liukumalla: ensimmäiset ja viimeiset kerrokset säilyttävät tarkkuutta, keskikerrokset puristuvat kovimmin, ja jokaisen tokenin läpäisemä jaettu asiantuntija pidetään tarkkana. Huomiokerroksia ei edes yritetä pienentää, koska niissä on vain 3,6 prosenttia painoista.

Tarkin valinta koskee juuri luonnostelupäätä: kolmessa isommassa koossa se on naulattu Q8_0-tarkkuuteen, koska huonosti ennustava luonnostelija tuhlaa juuri sen spekuloinnin, jota varten se on olemassa. Pienin I-Mini-koko tinkii tästäkin pysyäkseen 14 gigatavussa, ja I-alkuiset tiedostot hyödyntävät tärkeysmatriisia, joka on kalibroitu keskustelulla, koodilla, päättelyllä ja työkalukutsuilla.

Juttu rimmaa tämän numeron Liquid-uutisen kanssa: siinä luonnostelija irrotettiin sivuvaunuksi, tässä se niputetaan samaan tiedostoon — kaksi vastakkaista pakkaustapaa samalle ajatukselle, jossa muistikaistaa säästetään antamalla pienen ennustajan tehdä esityö. Tekijä on LocalAI:n pääkehittäjä mudler, joka kertoo ajavansa kvantointinsa DGX Spark -laatikolla, jonka 122 gigatavun yhteismuisti riittää juuri tämän kokoluokan MoE-malleihin. Nopeushyötyä ei mallikortti lupaa numeroina, ja itsespekuloinnin tuoma kiihdytys riippuu tehtävästä — mutta lataajalle valinta on helppo, koska sama tiedostoperhe on saatavilla myös ilman luonnostelupäätä.

Lisälähteet

Muut jutut tässä numerossa