Tekoälyn päivälehti — mallit, työkalut ja hardware
Päivän Python-kirjasto · lmdeploy 0.16.0 · 19.8.2026 · Koodi
InternLM-yhteisön ajokirjasto julkaisi aamulla version 0.16.0: tuki GLM-5.2:lle ja Intern-S2:n meta-MoE:lle, TurboMind-moottorin näkömallituki InternVL:lle ja Qwen-VL:lle sekä nopeampi ohjattu dekoodaus. NVIDIA-koneen omistajalle tämä on vLLM:n varteenotettavin haastaja — muille se on väärä työkalu.
lmdeploy on Shanghain tekoälylaboratorion InternLM-yhteisön inferenssikirjasto — vLLM:n ja SGLangin vähemmän tunnettu serkku, jonka erikoisuus on kaksi moottoria saman rajapinnan alla. TurboMind on käsin viritetty C++/CUDA-moottori, joka tunnetuilla arkkitehtuureilla kuuluu mittausten kärkeen; PyTorch-moottori taas ottaa uudet arkkitehtuurit vastaan nopeammin. Tänä aamuna PyPI:hin noussut versio 0.16.0 on kesän isoin päivitys, ja sen uutuuslista kertoo mihin kiinalainen avoin ekosysteemi juuri nyt juoksee.
Kärjessä on tuoreiden mallien tuki: GLM-5.2 saa sekä perustuen että omat palveluoptimointinsa — ajankohtaista, koska sen seuraaja aukesi juuri rajapintaan ja painoja odotetaan kuun lopussa — ja InternLM:n oma Intern-S2 Mobius tulee mukaan meta-MoE-rakenteineen ja uusittuine asiantuntijaportteineen. TurboMind-moottori oppi myös näkömallit: InternVL:n ja Qwen-VL-perheen kuvatorni ajetaan nyt nopealla polulla, eli paikallinen kuva-analyysi ei enää pakota hitaammalle moottorille. Listalla on lisäksi Hy3-tuki MTP-rinnakkaisennustuksineen ja FP8-optimointeineen.
Konepellin alla on kolme paikallisajajaa kiinnostavaa parannusta. Ohjattu dekoodaus — se, jolla mallin pakotetaan tuottamaan validia JSONia — nopeutui asynkronisella muistikopiolla ja xgrammar 0.2.1:llä. Dekoodauksen CUDA-graafit saivat valinnaisen torch.compile-polun, ja Hopper-korteille tuli natiiveja BF16- ja FP8-matriisiytimiä. Palvelinpuoli raportoi nyt myös token-erittelyt OpenAI-yhteensopivassa muodossa, joten lmdeployn voi pudottaa minkä tahansa OpenAI-asiakkaan taakse osoitetta vaihtamalla.
Rajoitus on syytä sanoa suoraan: tämä on CUDA-talon kirjasto. Applen Metalille tai AMD:n kuluttajakorteille lmdeploy ei ole oikea valinta, ja asennus vetää täyden CUDA-riippuvuuspuun — virtuaaliympäristö on käytännössä pakollinen. Mutta jos koneessa on NVIDIAn kortti ja tarve ajaa kiinalaisia kärkimalleja tai näkömalleja palvelimena, 0.16.0 on painavin peruste aikoihin kokeilla vLLM:n rinnalla myös tätä. Versio on tarkistettavissa PyPI:stä, jonne se nousi tänään aamukuudelta Suomen aikaa.