Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Perjantai · 14. elokuuta 2026Iltapainos · klo 21Nro 42
← Takaisin etusivulle

Päivän Python-kirjasto · Koodi

lm-eval 0.4.12: kirjasto, jolla tarkistat julkaisijan luvut omalla koneellasi — ja joka lakkasi raahaamasta mukanaan koko PyTorchia

EleutherAI:n lm-evaluation-harness ajaa julkiset kokeet paikallisella mallilla, myös GGUF-muodossa. Joulukuun muutos on pieni mutta olennainen: peruspaketti ei enää asenna transformersia eikä torchia, vaan taustaosa valitaan hakasulkeilla.

lm-eval 0.4.12peruspaketti · kevyt[hf][vllm][sglang]GGUFsamat julkiset kokeet, sinun kvantisoinnillasipip install "lm_eval[hf]"

Illan Benchmarkit-juttu päättyi kysymykseen: mitä tehdä, kun ainoat olemassa olevat luvut ovat julkaisijan omia? Vastaus on tämä kirjasto. EleutherAI:n lm-evaluation-harness, PyPI-nimeltään lm-eval, on se työkalu, jolla suuri osa julkisista kielimallien vertailuluvuista on alun perin tuotettu — myös monissa niistä taulukoista, joita mallien julkaisijat käyttävät. Tuorein versio on 0.4.12, ja PyPI päiväsi sen 11. toukokuuta 2026.

Mitä se ratkaisee? Se ajaa satoja standardoituja koesarjoja yhdellä komennolla ja tuottaa niistä koneluettavan results.json-tiedoston. Olennaista paikallisajajalle on, että se ei ole sidottu yhteen ajotapaan: sama kirjasto ajaa mallin Hugging Face -transformersilla, vLLM:llä, SGLangilla, NVIDIA:n NeMo- ja Megatron-tarkistuspisteinä, ONNX Runtime GenAI:lla tai minkä tahansa OpenAI-yhteensopivan rajapinnan takaa. GGUF-mallit ajetaan Hugging Face -taustaosan kautta, eli sama komento kelpaa myös llama.cpp-muunnoksille.

Tuorein olennainen muutos on joulukuulta 2025, ja se on juuri sellainen muutos, jonka huomaa vasta kun asennus menee pieleen. Peruspaketti ei enää asenna transformersia eikä torchia. Aiemmin pelkkä pip install lm-eval veti mukanaan koko syväoppimispinon; nyt taustaosa valitaan hakasulkeilla — lm_eval[hf], lm_eval[vllm] ja niin edelleen. Se on hyvä muutos rajallisen levytilan koneilla ja huono yllätys skripteille, jotka olettivat vanhan käytöksen. Jos vanha putkesi kaatuu ImportErroriin, syy on lähes varmasti tämä.

Muutama käytännön yksityiskohta. Applen koneella ajo onnistuu MPS-taustaosalla vaihtamalla laitteeksi mps cudan sijaan, mutta kirjaston oma dokumentaatio varoittaa suoraan: PyTorchin MPS-taustaosa on yhä kehityksen alkuvaiheessa, ja jos tulokset näyttävät oudoilta, ensimmäinen tarkistus on ajaa sama eteenpäinsyöttö sekä cpu- että mps-laitteella ja katsoa täsmäävätkö ne. SGLang-taustaosan riippuvuuksia ei ole paketoitu mukaan lainkaan, koska sen käyttämä Flashinfer-huomioydinkirjasto asennetaan omalla tavallaan ja asettaa omat vaatimuksensa torchin versiolle. Ja tensoririnnakkaisuus vaatii PyTorchin 2.4 tai uudemman sekä transformers-version, joka julkaisee mallille rinnakkaisuussuunnitelman.

Rajoitus, joka on hyvä tietää: tämä kirjasto mittaa sitä, mitä koesarjat mittaavat. Se ei kerro, onko malli miellyttävä käyttää, kestääkö se pitkää agenttiajoa tai osuuko se sinun aineistoosi. Ja koska ajoparametrit — lämpötila, kontekstin pituus, promptimuotoilu — vaikuttavat tuloksiin, kaksi eri ihmisen ajamaa lukua samasta mallista eivät ole vertailukelpoisia, ellei asetuksia ole kirjattu. Juuri siksi kirjaston results.json kannattaa tallentaa versionhallintaan, kuten dokumentaatio neuvoo.

Miksi tämä juuri tänään: koska illan pääuutisen mallista on olemassa yksi taulukko, ja se on julkaisijan. Kun lataat Qwen3.8-27B:n neljän bitin kvantisoinnin omalle koneellesi, olennainen kysymys ei ole mitä BF16-painot osasivat Alibaban palvelimella vaan mitä juuri se pakattu tiedosto osaa juuri sinun koneellasi. Tämä kirjasto vastaa siihen kysymykseen, ja vastaus on usein eri kuin taulukossa.

Lisälähteet

Muut jutut tässä numerossa