Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Sunnuntai · 23. elokuuta 2026Iltapainos · klo 21Nro 51
← Takaisin etusivulle

llama.cpp · 22.–23.8.2026 · Työkalut

llama.cpp otti GLM-4.5-Airin oman luonnostelupään käyttöön — ja alkoi pienentää kuvat samalla kaavalla kuin alkuperäinen toteutus

Sunnuntain muutoslistalla on kolme asiaa, jotka näkyvät suoraan käyttäjälle: monitokeniennuste yhdelle suositulle mallille, tarkempi kuvien skaalaus kaikille näkömalleille ja välilehdet selainkäyttöliittymään.

yksi askel, neljä tokeniavälilehdet

llama.cpp yhdisti sunnuntaina tuen GLM-4.5-Airin monitokeniennusteelle. Käytännössä se tarkoittaa, että malli luonnostelee itse omat seuraavat tokeninsa mallin mukana tulevalla lisäpäällä eikä erillisellä pienemmällä luonnostelijamallilla. Ero kotikoneella on konkreettinen: erillinen luonnostelija vie oman osuutensa muistista ja pitää huolehtia siitä, että se puhuu samaa kieltä kuin kohde. Kun ennustuspää on jo mallin painoissa, spekulatiivinen dekoodaus on pelkkä valitsin.

Toinen muutos on hiljaisempi mutta koskee useampaa käyttäjää. Näkömallien kuvien esikäsittely siirtyi käyttämään samaa pienennystapaa kuin mallien alkuperäinen Python-toteutus, ja jokaiselle tuetulle mallille korjattiin sen oikea skaalaustapa. Kuulostaa pilkun viilaamiselta, mutta juuri esikäsittely on tavallinen syy siihen, että sama kuva ja sama kehote antavat llama.cpp:llä eri vastauksen kuin mallin julkaisijan omalla koodilla. Kun pienennys tehdään samalla kaavalla, vastaukset alkavat vastata sitä, mitä mallin tekijät mittasivat.

Selainkäyttöliittymään tuli välilehdet: keskustelut avautuvat nyt rinnakkain samaan ikkunaan, ja navigointinäppäimet korjattiin heti perään samana päivänä. Palvelinpuolelle lisättiin ympäristömuuttuja LLAMA_SERVER_SLOTS_N_DIFF, jolla säädetään, kuinka paljon rinnakkaisia paikkoja saa olla epätasapainossa. Lisäksi korjattiin DeepSeek V4:n peruutus monen samanaikaisen istunnon tapauksessa ja tensoririnnakkaisuuden tilan välitys — jälkimmäinen on juuri sitä lajia vikaa, joka näkyy vain monen näytönohjaimen koneilla ja jonka takia niitä on tähän asti kannattanut päivittää varovasti.

Alemmalla tasolla CUDA sai yksiulotteisen pooling-operaation ja Vulkan heijastavan reunatäytön. Kumpikin on rakennuspalikka, jota tarvitaan uusien mallien tukemiseen, eikä kumpikaan tee mitään yksinään. Sunnuntain aikana käännösnumerot juoksivat b10594:stä b10599:ään — tavallinen vauhti projektissa, jossa julkaisu on käytännössä jokainen commit, ja hyvä muistutus siitä, että "päivitä llama.cpp" tarkoittaa eri asiaa maanantaina kuin perjantaina.

Lisälähteet

Muut jutut tässä numerossa