Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Torstai · 27. elokuuta 2026Iltapainos · klo 21Nro 55
← Takaisin etusivulle

Työkalut · ajomoottori · muistin jako · Työkalut

llama.cpp osaa nyt jättää tiheänkin mallin syötekerroksia suorittimelle — eikä koko kerrosta tarvitse enää työntää pois

Valitsin --n-cpu-ffn tekee tiheille malleille sen, minkä --n-cpu-moe teki asiantuntijamalleille: siirtää määrätyn määrän eteenpäinsyöttöosia keskusmuistiin sen sijaan että kokonaisia kerroksia työnnettäisiin pois näytönohjaimelta. Samana päivänä yhdistettiin myös monen kiihdytinpiirin tuki Qualcommin Hexagonille.

Asiantuntijamallien kanssa on jo pitkään voinut tehdä niin, että reititetyt asiantuntijapainot jätetään keskusmuistiin ja loput ajetaan näytönohjaimella. Valitsin on nimeltään --n-cpu-moe, ja se on syy siihen, miksi satojen miljardien parametrien mallit ylipäänsä käynnistyvät kotikoneella. Tiheille malleille vastaavaa ei ole ollut: ainoa keino on ollut --ngl, joka työntää kokonaisia kerroksia pois — ja se hidastaa rajusti.

Torstaina llama.cpp yhdisti pyynnön numero 26622, joka lisää valitsimen --n-cpu-ffn. Se siirtää määrätyn määrän eteenpäinsyöttöosia suorittimelle ja jättää huomiokerrokset näytönohjaimelle. Tekijän oma mittaus kertoo, mitä tämä käytännössä tarkoittaa: Q4_K_M-kvantilla ja yli 90 000 tokenin kontekstilla tekstin tuotto asettui 15–25 tokeniin sekunnissa. Toteutus ottaa kerrokset toistaiseksi järjestyksessä nollasta alkaen, ja keskustelussa on jo huomautettu, että suurimpien osien priorisointi antaisi noin kymmenen prosenttia lisää.

Saman vuorokauden aikana yhdistettiin toinenkin muutos, joka on merkittävä mutta koskee toistaiseksi harvempaa: tuki usealle kiihdytinpiirille Qualcommin Hexagon-taustalla, IQ9- ja IQ10-kvanteilla ja täysin asynkronisilla operaatioilla. Käännettynä: Snapdragon-koneessa on useampi kuin yksi neuroprosessori, ja llama.cpp osaa nyt käyttää niitä yhtä aikaa.

Luonnostelupuolella tuli DFlash2 paikallisella konvoluutiolla ja ehdokasvalitsimella — sama tekniikka, joka ilmestyi vLLM:n eiliseen versioon 0.28.0. Kahden ajomoottorin saama sama spekulatiivinen menetelmä vuorokauden sisällä kertoo, että tekniikka on siirtynyt tutkimusvaiheesta perustyökaluksi.

Loput päivän muutoksista ovat pienempiä mutta kertovat mihin suuntaan projekti menee. Mallinlataajaan tuli TENSOR_READ_LAZY eli laiska tensorien luku. Kvantisointityökalu sai katon työmuistille, jottei se lataa suuria tensoreita kiihdyttimelle turhaan. DeepSeek V4:n LIGHTNING_INDEXER-operaatiot toimivat nyt myös Vulkanilla. Metal-taustalta korjattiin muistivuotoja, jotka johtuivat puuttuvista autorelease-altaista. Ja Windowsin ROCm-julkaisun mukana toimitetaan nyt HIP-ajonaikaiset kirjastot, mikä poistaa yhden klassisen asennusongelman AMD-koneilta.

Kaikki nämä ovat päivän koontiversioissa b10648–b10655. Jos ajossa on tiheä malli, joka mahtuu näytönohjaimelle vain juuri ja juuri, uusi valitsin on illan kokeilemisen arvoisin yksittäinen asia koko tässä numerossa.

Lisälähteet

Muut jutut tässä numerossa