Tekoälyn päivälehti — mallit, työkalut ja hardware
Benchmarkit · 14.8.2026 · Benchmarkit
Qwen3.8-27B:n taulukko on vaikuttava, mutta se on Qwenin oma: vertailumallit ajettiin uudelleen talon omalla ajurilla, osa tehtävistä korjattiin, ja yhtä mittaria arvioi GPT-4o. Riippumatonta mittausta ei ole vielä olemassa — ja tässä on se, mitä sen odottaminen tarkoittaa.
Kun malli julkaistaan, sen mukana tulee taulukko. Qwen3.8-27B:n taulukko on tavallista laajempi: kaksitoista tekstimittaria ja kolmetoista näkömittaria, vertailukohtina edeltäjä Qwen3.6-27B, saman talon Qwen3.7-Plus, Metan Muse Glimmer-30B ja Anthropicin Opus 4.6 Max. Luvut näyttävät hyviltä. Tämän jutun tarkoitus ei ole kyseenalaistaa niitä vaan kertoa, mitä niissä lukee pienellä.
Ensinnäkin: vertailumallien tuloksia ei ole poimittu niiden omista julkaisuista. Qwen kertoo suoraan, että kaikki mallit Opus 4.6 Maxia lukuun ottamatta ajettiin uudelleen Claude Code -ajurilla asetuksilla temp=1,0, top_p=0,95 ja 256 000 tokenin kontekstilla. Se on metodologisesti puolustettava valinta — sama ajuri kaikille — mutta se tarkoittaa myös, että kilpailijoiden luvut ovat kilpailijan mittaamia. Toiseksi: SWE-bench Pro -kohdalla lukee, että ongelmalliset tehtävät korjattiin ja kaikki vertailumallit arvioitiin uudelleen korjatulla aineistolla. Kolmanneksi: Humanity's Last Exam -tulosta arvioi GPT-4o. Neljänneksi: neljä taulukon kahdestatoista mittarista on Qwenin omia sisäisiä testejä — QwenSWEBench, CoWorkBench, JobBench ja RecreationBench — eli mittareita, joita kukaan muu ei voi ajaa.
Riippumatonta mittausta ei tänä iltana ole. Artificial Analysis, jonka indeksi on tämän lehden vakiovertailukohta, ei ole vielä julkaissut lukua Qwen3.8-27B:lle — mallia ei ollut olemassa vielä eilen. Suuruusluokan hahmottamiseen kelpaavat perheen aiemmat jäsenet: Qwen3.5-27B sai indeksissä 35, Qwen3.6-27B 38, ja keskiviikkona julkaistu jättiläinen Qwen3.8-Max 56.
Se, mitä indeksi mittaa, kannattaa myös tietää. Versio 4.1.1 kokoaa yhdeksän erillistä koetta: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience ja AA-LCR. Yhteinen piirre on, että ne ajetaan samalla ajurilla kaikille malleille ja tulokset julkaistaan kokonaisuutena — juuri se, mitä yksittäisen julkaisijan taulukosta puuttuu.
Jos odottaminen ei sovi, luvut voi mitata itse. Illan Koodi-juttu käsittelee kirjastoa, jolla se tehdään: EleutherAI:n lm-evaluation-harness ajaa samat julkiset kokeet paikallisella GGUF-mallilla, ja tulos kertoo mitä juuri se kvantisointi juuri sinun koneellasi osaa. Se on tärkeämpi luku kuin julkaisijan BF16-tulos, koska sinä et aja BF16-painoja.
Yksi lukema taulukosta kannattaa silti nostaa esiin, koska se on rakenteellisesti kiinnostava. Muse Glimmer-30B, Metan neljä päivää aiemmin julkaistu avoin agenttimalli, jää Qwenin ajossa jälkeen jokaisessa kohdassa jossa molemmat esiintyvät — Terminal Bench 2.1 51,7 vastaan 73,0, SWE-bench Pro 51,2 vastaan 61,7, OSWorld-Verified 65,9 vastaan 84,3, OmniDocBench 75,8 vastaan 91,1. Ero on niin systemaattinen, että se ansaitsee riippumattoman tarkistuksen suuntaan tai toiseen. Tämä lehti palaa asiaan, kun sellainen ilmestyy.