Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Torstai · 27. elokuuta 2026Iltapainos · klo 21Nro 55

Torstain uutinen ei ollut malli vaan osoite. The Information kertoi aamulla, että Nvidia on sopinut ostavansa Hugging Facen 12,9 miljardilla dollarilla — eli sen paikan, josta jokainen tässä lehdessä käsitelty avoimen painon malli on ladattu. Allekirjoitusta ei ole, ja kumpikaan osapuoli ei kommentoi. Muualla ilta oli tekninen: neljän Mac Studion klusteri ylsi 4,8 teratavun sekuntikaistaan Thunderboltin yli ajetulla suoralla muistisiirrolla, vLLM siirsi välimuistinsa kolmannelle tasolle kovalevylle asti, ja llama.cpp sai valitsimen, jolla tiheänkin mallin syötekerroksia voi jättää suorittimelle. Lisäksi: Zhipun uusi malli paljastui ajetuksi kokonaan kiinalaisilla kiihdyttimillä, kolmen miljardin parametrin malli voitti puhelinvertailun, Ant Groupin tutkimusyksikkö avasi käyttöliittymäagentin painot — ja OpenAI o3 katosi eilen ChatGPT:stä.

Työkalut · jakelu · avoimet painot

Paikka, josta jokainen avoimen painon malli ladataan, on menossa näytönohjainvalmistajalle — 12,9 miljardia dollaria

The Information kertoi torstaiaamuna, että Nvidia on sopinut ostavansa Hugging Facen. Allekirjoitettua sopimusta ei ole eikä kumpikaan yhtiö kommentoi. Summa on noin 86-kertainen alustan arvioituun vuosiliikevaihtoon nähden — eikä kauppa koske tuloslaskelmaa vaan asemaa: yli miljoonan mallin varasto, jonka jokainen lataus päätyy jollekin ajettavaksi.

Lue pääjuttu →

Mallit · avoimet painot · käyttöliittymäagentti

Malli, joka klikkaa puolestasi — Ant Groupin tutkimusyksikkö avasi yhdeksän miljardin agentin, joka osaa myös työpöydän

UI-Venus-2-9B katsoo ruutua, päättelee tehtävän tilan, tekee toiminnon ja lukee tuloksen. Se on rakennettu Qwen3.5-9B:n päälle ja ajetaan omalla koneella vLLM:llä. Kiinnostavin luku ei ole tarkkuus vaan turvallisuus: haitallisten toimintojen läpimeno putosi pohjamallin 25,3 prosentista 11,3 prosenttiin.

Lue juttu →

Työkalut · ajomoottori · muistin jako

llama.cpp osaa nyt jättää tiheänkin mallin syötekerroksia suorittimelle — eikä koko kerrosta tarvitse enää työntää pois

Valitsin --n-cpu-ffn tekee tiheille malleille sen, minkä --n-cpu-moe teki asiantuntijamalleille: siirtää määrätyn määrän eteenpäinsyöttöosia keskusmuistiin sen sijaan että kokonaisia kerroksia työnnettäisiin pois näytönohjaimelta. Samana päivänä yhdistettiin myös monen kiihdytinpiirin tuki Qualcommin Hexagonille.

Lue juttu →

Kokeilemisen arvoista

Kolme komentoa illan jutuista

Ensimmäinen päivittää päättelypalvelimen, joka sai tänään kolmannen välimuistitason. Toinen hakee illan käyttöliittymäagentin painot. Kolmas asentaa Koodi-palstan kirjaston, joka laittaa katon uudelleenyrityksille.

pip install -U 'vllm==0.28.0' && vllm --version
hf download inclusionAI/UI-Venus-2-9B --local-dir ui-venus-2-9b
pip install -U 'instructor>=1.16.0' && python -c 'import instructor; print(instructor.__version__)'

Ensimmäinen komento asentaa vLLM:n oletuspyörän, joka on käännetty CUDA 13.0:lle; ROCm-, CPU- ja XPU-versiot ovat omina pyörinään ja docker-kuvinaan projektin julkaisusivulla. Huomaa, että tässä versiossa nelibittinen bitsandbytes-tuki ei enää tule mukana ytimessä vaan erillisenä liitännäisenä — jos ajokomennoissasi on load_format bitsandbytes, se hajoaa päivityksessä. Toinen lataa yhdeksän miljardin parametrin käyttöliittymäagentin täydet painot; ne ovat BF16-muodossa eli noin 18 gigatavua, ja pelkkä palvelimen käynnistäminen ei vielä anna toimivaa agenttia — toimintojen jäsentimet ja esimerkit ovat projektin GitHub-repossa. Kolmas päivittää instructorin; se puhuu paikallisille malleille from_provider-kutsulla, esimerkiksi from_provider("ollama/qwen3.5:9b").