Tekoälyn päivälehti — mallit, työkalut ja hardware
Keskiviikko · 19. elokuuta 2026Iltapainos · klo 21Nro 47
Kolme ja puoli vuotta ja yli 10 500 numeroitua yökäännöstä — ja tänään llama.cpp:llä on versionumero. Paikallisen tekoälyn tärkein yksittäinen ohjelmisto julkaisi kahden päivän sisään versiot v0.1.0, v0.1.1 ja v0.1.2, sai virallisen asennussivun llama.app ja alkoi tänään allekirjoittaa julkaisupakettinsa. Muutos kuulostaa kirjanpidolta, mutta se on infrastruktuuria: vasta versionumeron myötä Debianin ja Homebrew'n kaltaiset jakelijat voivat luvata, että koneellesi asentuva libllama on yhteensopiva kaiken sen kanssa, mikä siihen nojaa.
Mallipuolella ilta kuuluu pienille ja ahkerille: Ornith-koodariperhe päivittyi versioon 1.5 ja sen 35 miljardin MoE-malli lukee kerrallaan vain 3 miljardia, Japani julkaisi 33 miljardin parametrin avoimen kansallismallinsa, ja Qwen3.8-27B sai lohkodiffuusioon perustuvan luonnostelijan, joka lupaa moninkertaistaa paikallisen generoinnin. Rajapintapuolella GLM-5.3 tuli kaikkien käytettäväksi — painot ovat yhä lupaus, jonka määräpäivä lähestyy.
Illan vertailussa kaksi konetta, joissa on täsmälleen sama piiri ja sama 64 gigatavua muistia — ja 1 069 euron hintaero, jonka perustelu ei ole nopeus. Samassa hintaluokassa myyntiin ehtineiden GB10-tekoälylaatikoiden EU-hinnat ovat karanneet jo 5 600 euroon, eikä yhdenkään lepomelusta ole julkaistu ainuttakaan mittausta.
Paikallisajon tärkein moottori julkaisi kahden päivän sisään kolme virallista versiota, avasi asennussivun llama.app ja alkoi tänään allekirjoittaa julkaisupakettinsa. Georgi Gerganov: semanttinen versiointi on käytännössä valmis, ja edessä on rauhallinen, tasainen julkaisutahti.
Heinäkuussa Ollamaan laskeutunut agenttikoodari sai jatko-osan: MIT-lisensoitu Ornith-1.5 tuli kahtena kokona, joista MoE-versio aktivoi 36 miljardistaan noin 3 miljardia per token. Julkaisijan omissa mittauksissa se ohittaa agenttikoodauksessa Gemma 4:n ja Muse Glimmerin — GGUF-käännökset tulivat talon omasta takaa vuorokauden sisään.
Tokion LLM-tutkimuskeskus LLMC julkisti LLM-jp-4:n suurimman koon: tiheä 33,2 miljardin parametrin malli Apache 2.0 -lisenssillä, kahtena versiona ja DPO-koulutusaineistoineen. Thinking-versio päihittää keskuksen kaikki aiemmat mallit neljässä testissä.
Heinäkuussa esitelty lohkodiffuusioluonnostelu eteni versioon 2: uusi piirtäjä ennustaa kahdeksan tokenin lohkon yhdellä läpikäynnillä ja valitsee ehdokkaista yhtenäisen polun. Gigatavun kokoinen GGUF-luonnosmalli ilmestyi eilen, ja tämän päivän transformers-korjaus paikkasi polun laitevirheen.
Eilen llama.cpp:hen sulautettu muutos säätää matriisiytimien säiejaon erikseen DGX Sparkin GB10-piirille, kun tiheää mallia ajetaan yhden käyttäjän voimin. Tekijän sähköposti päättyy nvidia.comiin — valmistaja optimoi nyt itse avointa moottoria laatikolleen, jonka pullonkaulaksi eilinen numero mittasi ohjelmiston.
NVIDIAn DGX Spark maksaa Saksassa tänään 5 599 euroa ja Ranskassa 6 099,95 — eikä LDLC lupaa toimitusta edes 15 päivässä. Halvin reitti samaan GB10-piiriin on ASUSin Ascent GX10 3 999 eurolla. Virallista dollarihintaa nostettiin jo helmikuussa 700 dollarilla, ja muistipula pitää huolen lopusta.
Liettuan viestintävirasto julkaisi tänään ensimmäisten joukossa käytännön tulkinnan EU:n tekoälyasetuksen elokuussa voimaan tulleista läpinäkyvyysvelvoitteista: henkilökohtainen käyttö on vapaata, ammattikäyttö vaatii merkinnän. Paikallisajajalle raja on tärkeämpi kuin pilvikäyttäjälle — omalla koneella ei ole alustaa, joka hoitaisi leiman.
Eilinen build b10488 nosti llama.cpp:n OpenVINO-taustaosan Intelin tuoreimpaan ajokerrokseen ja päivitti CI:n laiteajurit. Samassa muutoksessa yksi testi jouduttiin kytkemään pois: taustaosa ei tue SSM-operaatiota, jota rekursiivisten mallien tilanpalautus vaatii.
Viime viikolla julkistettu Z.ai:n koodimalli ilmestyi OpenRouterin valikkoon: sitä voi nyt ajaa API:n yli, vaikka luvatut avoimet painot ovat edelleen turvatarkastuksessa. Kiinalaisten mittausten mukaan hyppy edeltäjästä on raju — ja turkkilaislehti kuvasi mallin yltävän suljettujen kärkitasolle.
llama.cpp-perheen monitoimityökalu sai viikonloppuna videogeneroinnin: MiniMax H3 tuottaa siinä tekstistä ja kuvasta videota neljän tiedoston paketilla, ja valmis asetuspohja hoitaa lataukset. Yhteisö täydensi kuviota latentti-skaalaimella, joka terävöittää tulokset jälkikäteen.
Pyyntö vastata lyhyesti ei tehoa pieneen malliin, koska lyhyt ei tarkoita sille mitään täsmällistä. Täsmälleen kahden virkkeen budjetti tehoaa: virkkeiden laskeminen on helppoa, ja kiinteä katto pakottaa mallin valitsemaan olennaisen sen sijaan että se täyttäisi tilan.
InternLM-yhteisön ajokirjasto julkaisi aamulla version 0.16.0: tuki GLM-5.2:lle ja Intern-S2:n meta-MoE:lle, TurboMind-moottorin näkömallituki InternVL:lle ja Qwen-VL:lle sekä nopeampi ohjattu dekoodaus. NVIDIA-koneen omistajalle tämä on vLLM:n varteenotettavin haastaja — muille se on väärä työkalu.
Sama Ryzen AI Max+ 395 -piiri, sama 64 gigatavua muistia — ja 1 069 euron ero, joka ei osta nopeutta. Minisforum panee rahansa kahteen 10 gigabitin porttiin ja PCIe-paikkaan, HP nopeampaan muistiin ja huoltoverkkoon. Kalleimman luokan uusien GB10-tulokkaiden lepomelusta ei sen sijaan ole julkaistu vielä ainuttakaan mittausta — hiljaista työpöytää arvostava ostaa ne kuulokuvan osalta arvailun varassa.
Kolme komentoa, joista jokainen liittyy tämän vuorokauden julkaisuun
Ensimmäinen komento lataa illan mallijutun pikkuveljen: eilen ja tänään paketoitu Ornith-1.5-9B on MIT-lisensoitu agenttikoodari, jonka nelibittinen käännös vie 5,63 gigatavua. Toinen asentaa Koodi-palstan kirjaston täsmälleen siihen versioon, joka julkaistiin tänä aamuna. Kolmas päivittää transformersin tämän päivän korjausversioon, joka paikkaa illan luonnostelijajutussa käsitellyn DFlash-polun laitevirheen.
Ensimmäisen komennon malli on multimodaalinen: samasta varastosta löytyy erillinen mmproj-tiedosto (0,92 Gt), jonka llama-server osaa poimia kuvasyötettä varten. Jos palvelin valittaa tuntemattomasta arkkitehtuurista, päivitä llama.cpp — pohjana on tuore Qwen3.5-arkkitehtuuri. Toinen komento vetää mukanaan CUDA-riippuvuudet, joten se kannattaa ajaa virtuaaliympäristössä ja vain NVIDIA-koneella; Applen ja AMD:n käyttäjille lmdeploy on toistaiseksi väärä työkalu. Kolmas nostaa transformersin versioon 5.15.1, joka julkaistiin tänään puolilta päivin.