Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Tiistai · 18. elokuuta 2026Iltapainos · klo 21Nro 46

Yksi laatikko, kaksi mallia, kahdeksankertainen ero. Japanilainen PC Watch ajoi tänä aamuna Qwen3.8-27B:n NVIDIAn DGX Sparkilla ja sai 12,0 tokenia sekunnissa. Samalla koneella pyörii julkaisijan omissa mittauksissa toinen tämän illan malli, Ling-3.0-tiny, sadan tokenin vauhtia. Kummassakaan ei ole kyse laskentatehosta vaan siitä, montako gigatavua painoja koneen on luettava jokaista sanaa varten. Ling-3.0-tiny sai tänä yönä ensimmäiset kunnolliset GGUF-käännöksensä, eli 7,9 miljardin parametrin päättelymalli, joka aktivoi kerrallaan 1,4 miljardia, ajetaan nyt llama.cpp:llä viiden gigatavun tiedostosta. LM Studion agenttisovellus sai eilen taitojen asennuskomennot, ja japanilaisessa korjaamossa juotetaan RTX 2080 Ti:hin kaksinkertainen näytönmuisti 282 dollarilla. Suljetulla puolella yksi kokonainen mallisukupolvi katosi eilen rajapinnasta: Googlen Imagen 4 -päätepisteet suljettiin, ja kutsut ohjataan Geminin omaan kuvamalliin. Illan mini-PC-vertailussa kaksi toistatuhatta euroa maksavaa konetta ostaa muistia sillä rahalla, jolla halvempi kone ostaa kaistaa.

Sama kone, tokenia sekunnissa10,3 nelibittinen27B12,0 kahdeksanbittinen27B30 yhteisön ajohaara27B100 · 1,4 mrd aktiivista7,9Bratkaisee, montako gigatavua luetaan per token

NVIDIA DGX Spark · Qwen3.8-27B · 18.8.2026

Sama laatikko, kaksi mallia — 12 tokenia sekunnissa vai 100, eikä ero ole laskentatehossa

PC Watch ajoi Qwen3.8-27B:n DGX Sparkilla ja mittasi 12,0 tokenia sekunnissa kahdeksanbittisenä ja 10,3 nelibittisenä. Koneen muistikaista asettaa teoreettiseksi katoksi 10,3. Yhteisön oma ajohaara nostaa saman raudan lähes kolminkertaiseksi.

Lue pääjuttu →

128 asiantuntijaa, kahdeksan kerrallaan1,4 mrd luetaan7,9 mrd yhteensäQ4_K_M · 4,92 GBMIT-lisenssi · 131 072 tokenin konteksti

Ling-3.0-tiny · GGUF · 18.8.2026

Päättelymalli, joka lukee 7,9 miljardista parametristaan kerrallaan 1,4 — nyt viiden gigatavun tiedostona

InclusionAI:n pienin Ling 3.0 sai tänä yönä täyden GGUF-käännössarjan, 24 kvantisointia kaksibittisestä täyteen tarkkuuteen. Q4_K_M vie 4,92 gigatavua, ja mallikortin mukaan huippumuistinkulutus on kahdeksantuhannen tokenin kontekstilla noin 8,3 gigatavua.

Lue juttu →

paikallinen malli/install-skill/create-skilltaito päällätaito pois@ ulkoinen tiedostoei rajapinta-avainta

LM Studio Bionic · 1.0.8 · 17.8.2026

Paikallisen mallin agenttisovellus sai oman pakettienhallintansa — taidot asennetaan nyt komennolla

Bionic 1.0.8 tuo komennot /install-skill ja /create-skill, taitojen päälle- ja poiskytkennän sekä @-viittaukset projektin ulkopuolisiin tiedostoihin. Muutos on pieni koodirivinä ja iso siinä, mihin paikallista mallia voi käyttää.

Lue juttu →

Yksitoista piiriä, kaksinkertainen tiheysennen11 GB→jälkeen22 GB352-bittinen väylä · 616 GB/sennallaan45 000 jeniä · noin 244 euroa

Muistimuunnos · Saitama · 18.8.2026

Japanilainen korjaamo juottaa RTX 2080 Ti:hin kaksinkertaisen muistin 282 dollarilla — ja peleissä hyöty on lähes olematon

Yksitoista gigatavun muistipiiriä irti, yksitoista kahden gigatavun tilalle. Kaista pysyy 616 gigatavussa sekunnissa, mutta VRAMia on 22 gigatavua — ja paikallisessa päättelyssä juuri se ratkaisee, mahtuuko malli koneeseen.

Lue juttu →

Kolme päätepistettä, yksi päivämääräimagen-4.0-generate-001imagen-4.0-ultra-generate-001imagen-4.0-fast-generate-001gemini-3.1-flash-image17.8.2026korvaajagenerate_images-metodia ei enää ole

Google · Imagen 4 · 17.8.2026

Kokonainen kuvamallisukupolvi katosi rajapinnasta eilen — ja korvaaja vaatii koodin muuttamista

Googlen Imagen 4:n kolme päätepistettä suljettiin Gemini-rajapinnasta 17. elokuuta. Vanha generate_images-metodi on poissa, ja kutsut ohjataan Geminin omaan kuvamalliin. Painoja ei ole koskaan ollut, joten siirtymälle ei ole vaihtoehtoa.

Lue juttu →

Maailmatila mallin ulkopuolellapistepilvikamera hakee näkyvän osan123kolme askelta, ei ohjaustermiä384 × 640 · 24 kuvaa/s30 sekunnin jaksotkehotetta voi vaihtaa kesken ajon

Alaya Lab · EVOKE 14B · Apache 2.0

Avoin maailmamalli, joka piirtää videota kolmella askeleella ja muistaa maiseman ilman että konteksti kasvaa

EVOKE tuottaa 384 × 640 -videota 24 kuvan sekuntivauhdilla kolmella kohinanpoistoaskeleella ja ilman ohjaustermiä. Maiseman geometria säilytetään mallin ulkopuolisessa pistepilvessä, joten istunto voi jatkua loputtomiin. Painot ovat Hugging Facessa.

Lue juttu →

Kuka kirjoittaa ensimmäisen merkinilman esitäyttöäToki! Tässä pyytämäsi JSON-muotoinen vastaus:{"nimi": "Aino", "ika": 34}esitäytöllä{"nimi": "Aino", "ika": 34}keltainen merkki on sinun, loppu mallinjatkaminen on helpompaa kuin tottelu

Päivän promptivinkki

Älä pyydä mallia noudattamaan muotoa — kirjoita sen vastauksen ensimmäiset merkit itse

Pieni paikallinen malli tottelee muotovaatimusta huonosti mutta jatkaa aloitettua tekstiä erinomaisesti. Kun asetat vastauksen ensimmäiset merkit valmiiksi, mallilla ei ole enää mitään mahdollisuutta aloittaa selittelyllä.

Lue juttu →

Kolme kerrosta, yksi pakettiOpenAI-yhteensopiva palvelinkorkean tason Python-rajapintactypes → llama.cpp:n C-rajapintakäännetään asennuksen yhteydessä0.3.35 · 74,9 MB lähdekoodia

Päivän Python-kirjasto

llama-cpp-python 0.3.35 — llama.cpp:n Python-portti heräsi viiden viikon hiljaisuudesta

Paketti antaa suoran ctypes-pääsyn llama.cpp:n C-rajapintaan, korkean tason täydennysrajapinnan ja OpenAI-yhteensopivan palvelimen. Sen erikoisuus ja sen ongelma ovat sama asia: PyPI:ssä on vain lähdekoodipaketti, joten asennus kääntää moottorin itse.

Lue juttu →

Sama muistimäärä, eri luonneMS-02 Ultraneljä muistipaikkaaPCIe 5.0 ×1624 ydintä · Intel1 899 €102,4 GB/sA9 Maxkaksi muistipaikkaaNPU 50 TOPS12 ydintä · AMD1 399 €89,6 GB/s32 GB kummassakin — kaikki viisi Gemma-kokoa mahtuvat

Mini-PC-vertailu · hintaluokka 1 000–2 000 €

Laajennettava työasema kohtasi umpinaisen tekoälylaatikon — Minisforum MS-02 Ultra ja GEEKOM A9 Max

Toisessa on neljä muistipaikkaa, virtapiiripaikka näytönohjaimelle ja 25 gigabitin valokuituliitin. Toisessa on 50 teraoperaation kiihdytin ja puolet pienempi virrankulutus. Kummassakin on 32 gigatavua muistia — ja se on illan tärkein luku.

Lue juttu →

Kokeilemisen arvoista

Kolme komentoa, joista kaksi lataa jotain tämän vuorokauden aikana ilmestynyttä

Ensimmäinen komento hakee illan pääjutun vastaparin: pienen päättelymallin, joka aktivoi kerrallaan 1,4 miljardia parametria ja mahtuu viiden gigatavun tiedostoon. Toinen kiinnittää illan Koodi-palstan portin täsmälleen siihen versioon, josta juttu kertoo. Kolmas päivittää dokumenttijäsentimen, josta ilmestyi uusi korjausjulkaisu tänä aamuna.

llama-server -hf bartowski/Ling-3.0-tiny-GGUF:Q4_K_M --port 8080
pip install llama-cpp-python==0.3.35
pip install -U docling

Ensimmäinen komento vaatii tuoreen llama.cpp:n, koska mallin hybridiarkkitehtuuri on uusi; jos palvelin valittaa tuntemattomasta arkkitehtuurista, käännös on liian vanha. Q4_K_M-tiedosto on 4,92 gigatavua, ja samasta hakemistosta löytyy kaksibittinen IQ2_M 2,83 gigatavun kokoisena, jos muistia on niukalti. Toisen komennon versionumero kannattaa kirjoittaa näkyviin, koska paketista julkaistaan PyPI:hin vain lähdekoodipaketti — asennus kääntää oman llama.cpp-käännöksensä ja kestää ensimmäisellä kerralla minuutteja, joten sitä ei halua tapahtuvan vahingossa uudestaan. Docling päivittyi tänä aamuna versioon 2.120.3, ja päivitys on korjausluokkaa: sarjan edellinen numero ilmestyi viisi päivää sitten.