Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Tiistai · 11. elokuuta 2026Iltapainos · klo 21Nro 39

Eilen illalla Meta julkaisi Muse Glimmerin ja koko ala kirjoitti siitä. Tänään Nvidia julkaisi mallin, joka on rakennettu tekemään sitä työtä, jota agentti oikeasti tekee: kolmenkymmenen miljardin sekoitusmalli, josta laskee kolme miljardia, ja jonka koko olemassaolon perustelu on se, ettei jokaista työkalukutsua kannata ajaa rajamallilla. Nemotron 3.5 Lightning on illan pääjuttu, ja sen mukana tuli poikkeuksellisen paljon konkreettista: kaksi luonnostelijamallia, NVFP4-tarkistuspiste, koulutusdata, reseptit — ja OpenMDW-lisenssi, joka ei rajoita kaupallista käyttöä. llama.cpp teki vuorokaudessa kaksi asiaa, jotka kannattaa lukea vaikkei niiden otsikoissa lue mitään. Toinen siirsi näytteenoton laskentataustaan ja liitti sen samaan syliin spekulatiivisen dekoodauksen kanssa. Toinen vaihtoi koko ROCm-käännösketjun uuteen rakennusjärjestelmään, mikä koskee jokaista, joka ajaa AMD:llä. Monikielinen hakuvaihe tuotti tänään vähemmän kuin eilen, ja se on rehellistä sanoa suoraan: saksa, tanska, viro, latvia, liettua, hindi ja ranska eivät antaneet mitään tuoretta, ja japani, kiina, kreikka, espanja ja turkki toistivat eilisen Muse Glimmer -uutisen omilla kielillään. Yksi löydös nousi silti numeroon asti, ja se tuli ruotsalaiselta keskustelupalstalta: vinkki laskentakortista, jolla saa kaksisataakaksikymmentä gigatavua sekunnissa muistikaistaa alle viidelläsadalla eurolla. Mini-PC-palstalla vuorossa oli alle tuhannen euron luokka. Se luokka ei tänä iltana tuottanut yhtään konetta, joka täyttäisi kaikki neljä valintakriteeriä — muistin hinta on nostanut jokaisen kelvollisen laitteen tuhannen euron yli. Vertailu tehtiin siksi hieman luokan yläpuolelta, ja se sattuu olemaan tämän lehden indeksin kannalta opettavaisin pari pitkään aikaan: kaksi konetta, joissa on sama piiri, sama muisti ja sama kaista, ja joiden ainoa mitattava ero on tuulettimen ääni.

30 miljardia parametria · 3 aktiivistaMamba-2 · sekoituskerros · tarkkaavaisuusreititin päästää tokenin muutamalle asiantuntijallekonteksti 1 000 000 tokenia · OpenMDW-1.1

Nvidia · 11.8.2026

Kolmekymmentä miljardia parametria, joista kolme laskee — Nvidia julkaisi mallin sille työlle, jota agentti oikeasti tekee

Nemotron 3.5 Lightning on Nemotron 3 -perheen pienin: hybridi Mamba-2- ja sekoituskerroksista, miljoonan tokenin konteksti, NVFP4-tarkistuspiste ja kaksi luonnostelijamallia. Painot, data ja reseptit OpenMDW-1.1-lisenssillä, ja ajossa LM Studiolla, llama.cpp:llä, Ollamalla ja Unslothilla samana päivänä.

Lue pääjuttu →

ennenlogitit → CPU → tokennyttoken suoraan taustassaluonnos: 4 hyväksyttiinusea ulostulo per sekvenssi · sama jakauma CPU:lla ja GPU:lla

llama.cpp b10355 · vetopyyntö 25532

Näytteenotto siirtyi näytönohjaimelle — ja samalla se opetettiin tulemaan toimeen spekulatiivisen dekoodauksen kanssa

Vetopyyntö numero 25532 hautui pitkään ja meni sisään eilen illalla. Se sallii usean ulostulon näytteenoton laskentataustassa yhtä aikaa tokenispekulaation kanssa — ja sen todellinen työ oli saada suorittimen ja näytönohjaimen antamat jakaumat vastaamaan toisiaan.

Lue juttu →

ROCm 7.2.1HIP SDK PRO -asenninrocWMMA erikseenROCm 7.14TheRock · monikaarituotteetwheel · deb · rpm · tarballLinux ja Windows samalla kertaabuild-cache.yml ja release.yml jakavat nyt saman toiminnon

llama.cpp b10356 · vetopyyntö 25775

AMD-käyttäjien käännösketju vaihtui kesken viikon: ROCm 7.2.1 jäi, ROCm 7.14 tuli — ja Windowsissa asennuspaketti vaihtui pyöriksi

ROCm 7.14 on ensimmäinen tuotantojulkaisu, joka on rakennettu TheRock-järjestelmällä. llama.cpp siirtyi siihen kerralla sekä Linuxilla että Windowsilla, ja samalla Windowsin ROCm-buildit siirtyivät HIP SDK -asentimesta Python-pyöriin.

Lue juttu →

16 GB nopeaa muistia — mitä se maksaaBC-250~130 €NucBox K17570 €Geekom IT151 299 €Mac Studio3 099 €hinnat eivät ole vertailukelpoisia: BC-250 on levy, muut valmiita koneita

AMD BC-250 · yhteisölöydös · SweClockers (sv)

Kaksisataakaksikymmentä gigatavua sekunnissa alle viidelläsadalla eurolla — louhintakortti, joka on nyt paikallisajajan halvin leveä väylä

Ruotsalaisella keskustelupalstalla annettu vinkki johti PlayStation 5:n sirusta tehtyyn louhintalevyyn, jossa on 16 gigatavua GDDR6-muistia. Ajopolku on kapea — Vulkan ja Linux, ei ROCm — mutta hinta on viisikymmentä eurosta puoleentoistasataan.

Lue juttu →

Kimi K2.6 — avoimet painotjapanilainen jatkokoulutusNamazu-APIEUpohja ajettavissa itse · palvelukerros ei

Sakana AI · Namazu · 11.8.2026

Japanin oma malli on kiinalainen malli — ja sitä ei saa käyttää EU:sta

Sakana AI:n Namazu ilmestyi tänään OpenRouteriin. Se on Moonshotin avoimen Kimi K2.6:n päälle koulutettu japanilainen versio, hinta 0,95 ja 4 dollaria miljoonalta tokenilta — eikä se ole saatavilla EU:ssa, Britanniassa eikä Sveitsissä.

Lue juttu →

v0.1Krea 2 -pohjaLoRA rank-256.diff-deltatv0.2yksi tiedosto25,6 GB turboyhteisökvantit: INT8 ~14 GB · w4a8 mahtuu 12 GiB:iin8–12 askelta · CFG 1,0–1,5 · shift 1,15

lodestones · Kroma v0.2 · 9.8.2026

LoRA-kerros katosi työnkulusta: kuvamallin hienosäätö tuli ulos täytenä tarkistuspisteenä — ja kvantisoituna se mahtuu kahteentoista gigatavuun

Kroma v0.2 on Krea 2:n täysi hienosäätö, ei enää päälle ladattava sovitin. Turbo-variantti painaa 25,6 gigatavua, yhteisön INT8-versio noin 14 ja neljän bitin versio mahtuu kahdentoista gigatavun näytönohjaimeen ilman siirtoja.

Lue juttu →

avoin kenttä"Laskutus""laskutusasiat""Billing (laskutus)"valikko1 laskutus2 tekninen3 muuvastaus: 2yksi merkki ulos · ei jäsennettävää · ei keksittyjä luokkia

Päivän promptivinkki

Älä pyydä pientä mallia keksimään arvoa — anna sille valmis lista ja pyydä numeroa

Pieni malli on huomattavasti parempi valitsemaan kuin tuottamaan. Kun muutat avoimen kentän suljetuksi valikoksi, poistat kerralla kirjoitusvirheet, keksityt kategoriat ja jäsennysvirheet — ja vastaus lyhenee yhteen merkkiin.

Lue juttu →

agenttireititinOllama (paikallinen)vLLM (paikallinen)rajamalli (pilvi)neljä reititystapaa · Apache 2.0 · Python ≥ 3.12

Päivän Python-kirjasto

nemo-switchyard 0.2.0: kirjasto, joka päättää mikä malli vastaa — ja osaa puhua Ollamalle ja vLLM:lle samalla suulla

Kuusi viikkoa hiljaisuutta ja sitten ensimmäinen kunnon versio. Switchyard kääntää OpenAI Chat-, OpenAI Responses- ja Anthropic Messages -muotojen välillä ja ohjaa jokaisen pyynnön sopivimmalle mallille. Ydin on Rustia, jakelu Pythonia — ja paketinnimi on sudenkuoppa.

Lue juttu →

Sama kaista, eri ääniGeekom IT1531 dBcirrus7 nimbini15 dB89,6 GB/s · 32 GB DDR5-5600 · Arc 140T2675Algoritmi-luku · ero tulee kokonaan lepomelusta

Mini-PC-vertailu · vuorossa ollut luokka: alle 1000 €

Sama piiri, sama muisti, sama kaista — ja kolminkertainen ero hinta-laatuindeksissä, koska toinen kone pitää ääntä

Alle tuhannen euron luokka ei tuottanut yhtään kelvollista laitetta, joten vertailu tehtiin luokan yläpuolelta. Vastakkain Geekom IT15 ja cirrus7 nimbini v4 Pro: molemmissa Arrow Lake-H, kaksi DDR5-5600-kampaa ja 89,6 gigatavua sekunnissa. Ainoa mitattava ero on tuuletin.

Lue juttu →

Kokeilemisen arvoista

Aja illan uusi malli yhdellä komennolla, asenna reititin oikealla paketinnimellä ja hae ROCm 7.14 -build

Kolme komentoa, kaikki suoraan tämän vuorokauden julkaisuista. Ensimmäinen hakee Nemotron 3.5 Lightningin Ollaman kirjastosta — tuki tuli tänään versiossa 0.32.9. Toinen asentaa Nvidian uuden reititinkirjaston, ja siinä on kompastuskivi, joka kannattaa tietää etukäteen. Kolmas hakee llama.cpp:n ensimmäisen ROCm 7.14 -käännöksen Linuxille.

ollama run nemotron-3.5-lightning
uv tool install --python 3.12 "nemo-switchyard[cli,server]"
curl -LO https://github.com/ggml-org/llama.cpp/releases/download/b10357/llama-b10357-bin-ubuntu-rocm-7.14-x64.tar.gz

Toisen komennon paketinnimi on nemo-switchyard eikä switchyard. PyPI:ssä on nimittäin jo vuodesta 2020 asti ollut aivan eri projekti nimellä switchyard — verkkosimulaattori — ja Nvidian oman varaston README neuvoo silti asentamaan sen. Jos asennat väärän, mitään ei kaadu, mutta et myöskään saa reititintä. Paketti vaatii Pythonin 3.12 tai uudemman, ja Linuxin x86-64-pyörät kääntyvät AVX2-tason suorittimille, koska varsinainen ydin on Rustia. Kolmas komento hakee tarballin, jonka koko on 195 megatavua; se on ensimmäinen virallinen ROCm 7.14 -build, ja jos sinulla on aiempi ROCm 7.2.1 -asennus, tarkista ennen ajoa, kumpaa ajonaikaista kirjastoa kone käyttää. Ensimmäinen komento lataa mallin oletuskvantisoinnissa — jos koneessasi on alle kaksikymmentäneljä gigatavua nopeaa muistia, tarkista koko ennen latausta.