Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Sunnuntai · 23. elokuuta 2026Iltapainos · klo 21Nro 51
← Takaisin etusivulle

SGLang v0.5.18 · 22.8.2026 · Työkalut

SGLang julkaisi 710 muutoksen version — ja palvelin lähtee käyntiin yli kaksi kertaa nopeammin

212 kehittäjää, seitsemän uutta malliarkkitehtuuria ja käynnistysvaiheen limitys, joka pudotti Qwen3-32B:n latausajan 84,8 sekunnista 35,6 sekuntiin.

peräkkäinlimitettynä84,8 s35,6 s

SGLangin versio 0.5.18 julkaistiin lauantain vastaisena yönä, ja sen kokoluokka kertoo, missä vaiheessa paikallisen ja puolipaikallisen tarjoilun kehitys menee: mukana on 710 yhdistettyä muutosta 212 kehittäjältä. Yksittäiselle koneelle näkyvin niistä on käynnistys. Aiemmin palvelin luki mallin painot levyltä ja vasta sen jälkeen nauhoitti CUDA-graafit; nyt painojen sivut siirtyvät taustalla samaan aikaan kun graafit nauhoitetaan. Projektin oma mittaus Qwen3-32B:llä H100-kortilla: 35,6 sekuntia entisen 84,8 sekunnin sijaan eli 2,38-kertainen nopeutus, ja jos ennakkohaku oli jo päällä, 8,6–11,7 prosentin parannus siihen nähden.

Toiminto ei ole vielä oletus, vaan se kytketään päälle valitsimella --startup-weight-load-mode overlap. Sama julkaisu siirtää kaikki käännettyjen ytimien välimuistit — Triton, FlashInfer, Inductor, DeepGEMM ja CUDA-ajuri — yhden ympäristömuuttujan SGLANG_CACHE_DIR alle, mikä tarkoittaa että ensimmäinen käynnistys päivityksen jälkeen kääntää ne uudestaan kertaalleen. Se kannattaa tietää ennen kuin ihmettelee, miksi juuri päivitetty palvelin on hetken hitaampi.

Isojen konekokoonpanojen puolella muutokset ovat mikrosekuntien nyppimistä, mutta suunta on selvä. Rinnakkaisuuden viimeisen kerroksen kokoamisvaihe korvattiin yhdellä kaikki-kaikille-siirrolla, jolloin DeepSeek-V4-Pron dekoodaus B200-kortilla vei siinä 169 mikrosekuntia entisen 320:n sijaan ja tokenikohtainen viive putosi 36,97 millisekunnista 35,67:ään. FlashInferin työtila otettiin käyttöön myös yhdistämättömissä summauksissa, mikä toi DeepSeek-V4-Flashille pienillä eräkoilla enintään 6,9 prosentin lisän.

Uusia malliarkkitehtuureja tuli seitsemän: Muse Glimmer, Intern-S2-Mobius, SANA-Video, LingBot-Video-MoE, LTX-2.5, Cosmos3 Edge ja LongCat-Image. Lisäksi keittokirjaan ilmestyivät ohjeet Qwen3.8-perheelle, Ling-3.0:lle, Nemotron 3.5 Lightningille, dots3-notelle ja DeepSeek-V4-Pro-0813:lle. Spekulatiivisen dekoodauksen osastolla on kymmeniä korjauksia sekä DSpark- että DFlash-luonnostelijoille, mukaan lukien yksi, joka korjasi hiljaisen KV-välimuistin turmeltumisen silloin kun luonnostokeneita oli yli neljä.

Riippuvuudet siirtyivät eteenpäin kerralla: torch 2.13.0 ja triton 3.7.1, flashinfer 0.6.17 ja CuTeDSL 4.6.2, joka korjaa Blackwell-korttien käynnistysvirheen. PyPI:ssä versio on ollut ladattavissa perjantai-illasta lähtien. Kotikoneen kannalta SGLang on yhä raskaampi valinta kuin llama.cpp tai Ollama, mutta jos koneessa on yksi tai kaksi isoa korttia ja sillä tarjoillaan mallia useammalle ohjelmalle, käynnistyksen puolittuminen tuntuu joka kerta kun palvelin käynnistetään uudelleen.

Lisälähteet

Muut jutut tässä numerossa