Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Lauantai · 22. elokuuta 2026Iltapainos · klo 21Nro 50
← Takaisin etusivulle

mistral.rs v0.9.2 · Rust · Työkalut

mistral.rs otti lohkoluonnostelun käyttöön — yhden kehittäjän moottori ehti ennen useimpia isoja

Rust-kielinen ajomoottori sai torstaina version 0.9.2, joka tukee DFlash 2 -lohkoluonnostelua, kvantisoitua luonnostelijaa ja CUDA-graafien eräkokoluokkia. Viikon takainen tutkimusidea pyörii nyt kolmannessa moottorissa — ja pienin ehti lähes ensimmäisenä.

Luonnos lohkoina, vahvistus kerrallaluonnostelija ehdottaa lohkonvahvistusvLLMllama.cpp (DSpark)mistral.rs 0.9.2+ kvantisoitu luonnostelijaSama idea, kolme toteutusta — viikossa

Eric Buehlerin ylläpitämä mistral.rs on ajomoottoreiden joukossa se pieni ja nopealiikkeinen: Rustilla kirjoitettu palvelin, joka puhuu OpenAI-yhteensopivaa rajapintaa, tukee kvantisointeja ja kulkee tarvittaessa Python-paketiksi käärittynä. Torstaina julkaistu versio 0.9.2 on tiivis mutta osuu suoraan viikon kuumimpaan aiheeseen: se tuo tuen DFlash- ja DFlash 2 -lohkoluonnostelumalleille.

DFlash 2 on Incon 18. elokuuta julkistama spekulatiivisen dekoodauksen menetelmä, jossa pieni diffuusiomalli luonnostelee kokonaisen tokenilohkon kerralla ja iso malli vahvistaa sen yhdellä läpikäynnillä. Käsittelimme julkistuksen ja Qwen3.8-27B:n saamat luonnostelijat aiemmin tällä viikolla, ja eilen kerroimme vLLM:n julkaisukandidaatista, joka toi menetelmän ensimmäiseen isoon moottoriin. Nyt sama idea pyörii myös mistral.rs:ssä — ja toteutus menee pykälän pidemmälle: luonnostelija voi olla kvantisoitu, sen syvyys sopeutuu tilanteeseen, ja eräajossa luonnostelijan läpikäynnit niputetaan.

Muu muutosloki jatkaa samaa nopeusteemaa. Monitokeniennustus eli MTP toimii nyt CUDA-graafien kanssa, ja graafit saivat eräkokoluokat, jolloin sama esikäännetty laskentapolku palvelee eri kokoisia eriä. Qwen3.5-hybridimallien laitekartoitus korjattiin, videoiden esikäsittely nopeutui, ja palvelin ymmärtää OpenAI:n uudempaa responses-rajapintaa. Mittaripuolelle tuli aikaa ensimmäiseen tokeniin ja tokenien väliä seuraavat luvut — samat, joilla isot moottorit myyvät itseään.

Paikallisajajalle mistral.rs on kiinnostava juuri siksi, että se ehtii. Projektin ei tarvitse odottaa komiteaa: kun tutkimusidea julkaistaan maanantaina, se voi olla moottorissa perjantaina. Kääntöpuoli on ekosysteemin kapeus — GGUF-maailman työkalut, käyttöliittymät ja valmiit paketit rakentuvat llama.cpp:n ympärille, ja mistral.rs vaatii useammin itse kääntämistä ja ominaisuuslippujen tuntemista. Se on säätäjän moottori, ei ensiasennus.

Suositus menee näin: jos ajat Qwen- tai Kimi-luokan malleja NVIDIA-raudalla ja haluat kokeilla, paljonko lohkoluonnostelu oikeasti tuo, mistral.rs 0.9.2 on tällä hetkellä kevyin tapa testata se omalla koneella. Jos taas haluat vain toimivan paikallisen mallin, llama.cpp ja Ollama pysyvät oletusvalintoina — niihin sama menetelmä valuu omaa tahtiaan, kuten DSpark-tuki juuri osoitti.

Lisälähteet

Muut jutut tässä numerossa