Tekoälyn päivälehti — mallit, työkalut ja hardware
Torstai · 13. elokuuta 2026Iltapainos · klo 21Nro 41
DeepSeek julkaisi tänään lippulaivansa avoimin painoin. DeepSeek-V4-Pro-0813 on MIT-lisenssillä jaettava sekoitusmalli, jonka FP8-painot vievät 892,8 gigatavua ja jonka sisään on koulutettu oma spekulatiivisen dekoodauksen moduuli nimeltä DSpark. Kotikoneelle se ei mahdu missään muodossa — mutta tämä ilta jää silti mieleen siitä, kuinka valmiina paikallinen työkaluketju jättiläistä odotti.
Sillä juuri tänään llama.cpp yhdisti kolme spekulatiivisen dekoodauksen muutosta, joiden jälkeen luonnosmallin tyyppiä ei enää kerrota käsin — se luetaan GGUF-tiedoston metatiedoista, ja näytönohjaimella tapahtuva näytteenotto toimii myös DSpark- ja DFlash-luonnoksilla. vLLM ehti jo aiemmin samalle viikolle kahdella DSpark-julkaisulla, ja Unsloth julkisti työpöytäsovelluksensa virallisesti. Harvoin uusi mallijulkaisu on laskeutunut näin katettuun pöytään.
Riippumaton mittaus ehti sekin samaan vuorokauteen: Artificial Analysis antaa uudelle Prolle pistemäärän 53 — täsmälleen yhden pisteen enemmän kuin talon omalle, monin verroin halvemmalle Flash-mallille. Japanilainen PC Watch puolestaan vahvistaa, että rajapinnan hinnat eivät julkaisussa muuttuneet.
Raudan puolella uutiset ovat tylympiä: Nvidia korotti 96 gigatavun RTX Pro 6000:n hinnan 16 000 dollariin, ja korotuksia kertyy julkaisusta jo 88 prosenttia. Mini-PC-palstalla sen sijaan tapahtui jotain, mitä on odotettu kolme viikkoa: kalleimmasta hintaluokasta löytyi vihdoin mitattua melutietoa, ja vertailuun saatiin HP:n 64 gigatavun työasema ja ASUSin näytönohjainkone. Ja Linux-työpöydälle, paikallisen tekoälyn kotikentälle, saapui yllättävä vieras: ChatGPT.
DeepSeek-V4-Pro-0813 on virallinen julkaisu esikatseluversion tilalle: noin 1,57 biljoonaa parametria, joista 48 miljardia laskee, miljoonan tokenin konteksti ja FP8-painot, jotka vievät 892,8 gigatavua. Uutta on DSpark-moduuli, joka kulkee samassa checkpointissa — luonnosmallia ei ladata erikseen.
Kolme spekulatiivisen dekoodauksen yhdistämistä samana päivänä: luonnosmallin tyyppi tunnistetaan nyt automaattisesti GGUF-metatiedoista, MTP-luonnokset tunnistetaan omana lajinaan, ja näytönohjaimella tapahtuva näytteenotto toimii myös DFlash- ja DSpark-luonnoksilla. Ajoitus ei jää epäselväksi kenellekään.
Versio 0.27.1 toi tuen kvantisoiduille DSpark-luonnospäille, ja seuraavan version ensimmäinen kandidaatti rakentaa varmistuksen, joka aikatauluttaa itsensä luonnoksen varmuuden mukaan. Kaksi päivää myöhemmin DeepSeek julkaisi mallin, jossa DSpark on vakiovaruste.
Unsloth kutsuu sovellustaan ensimmäiseksi työpöytäohjelmaksi, joka sekä ajaa että kouluttaa malleja paikallisesti Windowsilla, Macilla ja Linuxilla. Saman päivän 0.1.702-beta toi työkalukutsut ulkoisille palveluntarjoajille, säädettävän muistinkäytön ja paremman AMD-tuen.
Mallit, jotka eivät itse aseta repeat_penalty-arvoa, saavat nyt arvon 1,0 eli rangaistus on pois päältä. Muutos yhdenmukaistaa Ollaman muiden moottoreiden kanssa ja nopeuttaa spekulatiivista dekoodausta — mutta se myös muuttaa hiljaa sitä, mitä koneesi kirjoittaa.
Vahvimman Blackwell-työasemakortin hinta nousi Nvidian omassa kaupassa 13 250 dollarista 16 000:een. Kortin 96 gigatavua GDDR7:ää on suorin tie ulos paikallisajon muistirajoista — ja juuri siksi sen hinta seuraa nyt muistimarkkinaa, ei näytönohjainmarkkinaa.
Artificial Analysis ehti mitata DeepSeek-V4-Pro-0813:n julkaisupäivänä: 53 pistettä kymmenen testin yhdistelmässä, piste enemmän kuin Flash-0731 ja neljä vähemmän kuin GPT-5.6:n keskikokoinen Terra. South China Morning Post tiivisti saman havainnon: yleistesteissä vaisu, kyberturvassa vahva.
llama.cpp:n keskiviikko ja torstai olivat alustapäiviä: SYCL-taustaosaan laskeutui viisi parannusta kiinnitetystä isäntämuistista fuusio-operaatioihin, Metal oppi TQ2_0-ternäärikvantit, ja HIP-käännöksestä poistettiin unsafe-math-lippu. Kolme alustaa, sama viesti: reunoja hiotaan tosissaan.
OpenAI julkaisi ChatGPT:n virallisen työpöytäsovelluksen Linuxille esikatseluna: Ubuntu, Debian ja Fedora, x64 ja ARM64, DEB- ja RPM-paketit. Mukana tulevat Codex, sisäänrakennettu selain ja äänikäyttö. Kuukausi sitten saman teki Anthropic — Linux-pöytäkone ei ole enää pelkkien avointen mallien maata.
Videopalvelu Bilibilin puhesynteesimalli laajeni japaniin, espanjaan ja arabiaan, sai puhenopeuden säädön ja nopeutui. GPT-runko on noin 0,8 miljardia parametria ja päättely vaatii noin 6 gigatavua näyttömuistia. Lisenssi on Bilibilin oma — ei avoin sana varsinaisessa merkityksessä.
Pieni malli ei jankkaa siksi, että se olisi tyhmä, vaan siksi, ettei se tiedä milloin vastaus on valmis. Kun kehote käskee päättämään vastauksen sovittuun merkkijonoon ja ajomoottori katkaisee generoinnin samaan merkkijonoon, jankkaus loppuu kuin seinään.
Pydanticin agenttikehys validoi mallin vastaukset tyypeiksi ja puhuu kaikille OpenAI-yhteensopiville paikallisille palvelimille. Tuoreessa versiossa on MCP-tuen laajennus — ja takana kaksi tietoturvakorjausta, joista vakavampi antoi minkä tahansa verkkosivun komentaa kehityskoneen agenttia.
Kalleimmasta luokasta löytyi vihdoin kaksi konetta, joiden lepomelu on mitattu. HP:n Strix Halo -työasema kantaa 64 gigatavua yhteismuistia, ASUSin pelikone 16 gigatavua GDDR7:ää lähes kolminkertaisella kaistalla. Toinen ajaa isot mallit, toinen ajaa pienet lujaa — ja valinta on harvinaisen selvä.
Kurkista jättimallin GGUF-varastoon, hae illan spekulointibuildit ja asenna paikattu agenttikirjasto
Kolme komentoa tämän vuorokauden julkaisuista. Ensimmäinen ei lataa painoja vaan listaa, mitä Unslothin tuoreessa GGUF-varastossa jo on — varasto täyttyy paraikaa. Toinen hakee llama.cpp:n buildin, jossa on päivän kolme spekulatiivisen dekoodauksen yhdistämistä. Kolmas asentaa päivän Python-kirjaston versiona, jossa on kaksi tuoretta tietoturvakorjausta.
Ensimmäinen komento kysyy Hugging Facen rajapinnalta Unslothin DeepSeek-V4-Pro-0813-GGUF-varaston tilan. Varaston kuvaus sanoo tänään suoraan "In progress will take a while" — kvantisoinnit ilmestyvät tiedosto kerrallaan, ja komennolla näkee mitä on jo tullut ennen kuin lataa mitään. Unslothin oman ohjeen mukaan malli on 1,57 biljoonan parametrin kokoluokkaa, joten pienimmätkin versiot tulevat olemaan satojen gigatavujen luokkaa. Toinen komento hakee buildin b10411, jossa ovat luonnosmallin tyypin automaattitunnistus ja DSpark/DFlash-luonnosten näytönohjainnäytteenotto sekä Metalin uusi ternäärikvanttituki. Kolmas asentaa pydantic-ai:n version 2.29.0; jos olet joskus käynnistänyt kirjaston kehityskäyttöliittymän komennolla clai web tai Agent.to_web(), päivitys kannattaa tehdä heti, koska vanhoissa versioissa mikä tahansa selaimessa auki oleva verkkosivu saattoi komentaa paikallista agenttiasi. Ykkösversion linjalla korjattu versio on 1.107.4.