Tekoälyn päivälehti — mallit, työkalut ja hardware
Tiistai · 18. elokuuta 2026Iltapainos · klo 21Nro 46
Yksi laatikko, kaksi mallia, kahdeksankertainen ero. Japanilainen PC Watch ajoi tänä aamuna Qwen3.8-27B:n NVIDIAn DGX Sparkilla ja sai 12,0 tokenia sekunnissa. Samalla koneella pyörii julkaisijan omissa mittauksissa toinen tämän illan malli, Ling-3.0-tiny, sadan tokenin vauhtia. Kummassakaan ei ole kyse laskentatehosta vaan siitä, montako gigatavua painoja koneen on luettava jokaista sanaa varten.
Ling-3.0-tiny sai tänä yönä ensimmäiset kunnolliset GGUF-käännöksensä, eli 7,9 miljardin parametrin päättelymalli, joka aktivoi kerrallaan 1,4 miljardia, ajetaan nyt llama.cpp:llä viiden gigatavun tiedostosta. LM Studion agenttisovellus sai eilen taitojen asennuskomennot, ja japanilaisessa korjaamossa juotetaan RTX 2080 Ti:hin kaksinkertainen näytönmuisti 282 dollarilla.
Suljetulla puolella yksi kokonainen mallisukupolvi katosi eilen rajapinnasta: Googlen Imagen 4 -päätepisteet suljettiin, ja kutsut ohjataan Geminin omaan kuvamalliin. Illan mini-PC-vertailussa kaksi toistatuhatta euroa maksavaa konetta ostaa muistia sillä rahalla, jolla halvempi kone ostaa kaistaa.
PC Watch ajoi Qwen3.8-27B:n DGX Sparkilla ja mittasi 12,0 tokenia sekunnissa kahdeksanbittisenä ja 10,3 nelibittisenä. Koneen muistikaista asettaa teoreettiseksi katoksi 10,3. Yhteisön oma ajohaara nostaa saman raudan lähes kolminkertaiseksi.
InclusionAI:n pienin Ling 3.0 sai tänä yönä täyden GGUF-käännössarjan, 24 kvantisointia kaksibittisestä täyteen tarkkuuteen. Q4_K_M vie 4,92 gigatavua, ja mallikortin mukaan huippumuistinkulutus on kahdeksantuhannen tokenin kontekstilla noin 8,3 gigatavua.
Bionic 1.0.8 tuo komennot /install-skill ja /create-skill, taitojen päälle- ja poiskytkennän sekä @-viittaukset projektin ulkopuolisiin tiedostoihin. Muutos on pieni koodirivinä ja iso siinä, mihin paikallista mallia voi käyttää.
Yksitoista gigatavun muistipiiriä irti, yksitoista kahden gigatavun tilalle. Kaista pysyy 616 gigatavussa sekunnissa, mutta VRAMia on 22 gigatavua — ja paikallisessa päättelyssä juuri se ratkaisee, mahtuuko malli koneeseen.
MINISFORUM toi myyntiin 895D7-slimin: Ryzen 9 8945HX, RTX 5060 tai Radeon RX 9060 XT, kaksi DDR5-kampapaikkaa. Valmistaja ilmoittaa lepomeluksi 26,4 desibeliä. Hinnat ovat toistaiseksi jeneinä.
Googlen Imagen 4:n kolme päätepistettä suljettiin Gemini-rajapinnasta 17. elokuuta. Vanha generate_images-metodi on poissa, ja kutsut ohjataan Geminin omaan kuvamalliin. Painoja ei ole koskaan ollut, joten siirtymälle ei ole vaihtoehtoa.
EVOKE tuottaa 384 × 640 -videota 24 kuvan sekuntivauhdilla kolmella kohinanpoistoaskeleella ja ilman ohjaustermiä. Maiseman geometria säilytetään mallin ulkopuolisessa pistepilvessä, joten istunto voi jatkua loputtomiin. Painot ovat Hugging Facessa.
Pieni paikallinen malli tottelee muotovaatimusta huonosti mutta jatkaa aloitettua tekstiä erinomaisesti. Kun asetat vastauksen ensimmäiset merkit valmiiksi, mallilla ei ole enää mitään mahdollisuutta aloittaa selittelyllä.
Paketti antaa suoran ctypes-pääsyn llama.cpp:n C-rajapintaan, korkean tason täydennysrajapinnan ja OpenAI-yhteensopivan palvelimen. Sen erikoisuus ja sen ongelma ovat sama asia: PyPI:ssä on vain lähdekoodipaketti, joten asennus kääntää moottorin itse.
Toisessa on neljä muistipaikkaa, virtapiiripaikka näytönohjaimelle ja 25 gigabitin valokuituliitin. Toisessa on 50 teraoperaation kiihdytin ja puolet pienempi virrankulutus. Kummassakin on 32 gigatavua muistia — ja se on illan tärkein luku.
Kolme komentoa, joista kaksi lataa jotain tämän vuorokauden aikana ilmestynyttä
Ensimmäinen komento hakee illan pääjutun vastaparin: pienen päättelymallin, joka aktivoi kerrallaan 1,4 miljardia parametria ja mahtuu viiden gigatavun tiedostoon. Toinen kiinnittää illan Koodi-palstan portin täsmälleen siihen versioon, josta juttu kertoo. Kolmas päivittää dokumenttijäsentimen, josta ilmestyi uusi korjausjulkaisu tänä aamuna.
Ensimmäinen komento vaatii tuoreen llama.cpp:n, koska mallin hybridiarkkitehtuuri on uusi; jos palvelin valittaa tuntemattomasta arkkitehtuurista, käännös on liian vanha. Q4_K_M-tiedosto on 4,92 gigatavua, ja samasta hakemistosta löytyy kaksibittinen IQ2_M 2,83 gigatavun kokoisena, jos muistia on niukalti. Toisen komennon versionumero kannattaa kirjoittaa näkyviin, koska paketista julkaistaan PyPI:hin vain lähdekoodipaketti — asennus kääntää oman llama.cpp-käännöksensä ja kestää ensimmäisellä kerralla minuutteja, joten sitä ei halua tapahtuvan vahingossa uudestaan. Docling päivittyi tänä aamuna versioon 2.120.3, ja päivitys on korjausluokkaa: sarjan edellinen numero ilmestyi viisi päivää sitten.