Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Perjantai · 14. elokuuta 2026Iltapainos · klo 21Nro 42
← Takaisin etusivulle

Benchmarkit · 14.8.2026 · Benchmarkit

Illan mallista on kaksitoista lukua, ja jokainen niistä on julkaisijan itsensä mittaama

Qwen3.8-27B:n taulukko on vaikuttava, mutta se on Qwenin oma: vertailumallit ajettiin uudelleen talon omalla ajurilla, osa tehtävistä korjattiin, ja yhtä mittaria arvioi GPT-4o. Riippumatonta mittausta ei ole vielä olemassa — ja tässä on se, mitä sen odottaminen tarkoittaa.

Artificial Analysis -indeksi, aiemmat sukupolvetQwen3.5-27BQwen3.6-27BQwen3.8-MaxQwen3.8-27B353856ei vielä mitattuindeksi v4.1.1 — yhdeksän erillistä koettaasteikko 0–100, korkeampi parempi

Kun malli julkaistaan, sen mukana tulee taulukko. Qwen3.8-27B:n taulukko on tavallista laajempi: kaksitoista tekstimittaria ja kolmetoista näkömittaria, vertailukohtina edeltäjä Qwen3.6-27B, saman talon Qwen3.7-Plus, Metan Muse Glimmer-30B ja Anthropicin Opus 4.6 Max. Luvut näyttävät hyviltä. Tämän jutun tarkoitus ei ole kyseenalaistaa niitä vaan kertoa, mitä niissä lukee pienellä.

Ensinnäkin: vertailumallien tuloksia ei ole poimittu niiden omista julkaisuista. Qwen kertoo suoraan, että kaikki mallit Opus 4.6 Maxia lukuun ottamatta ajettiin uudelleen Claude Code -ajurilla asetuksilla temp=1,0, top_p=0,95 ja 256 000 tokenin kontekstilla. Se on metodologisesti puolustettava valinta — sama ajuri kaikille — mutta se tarkoittaa myös, että kilpailijoiden luvut ovat kilpailijan mittaamia. Toiseksi: SWE-bench Pro -kohdalla lukee, että ongelmalliset tehtävät korjattiin ja kaikki vertailumallit arvioitiin uudelleen korjatulla aineistolla. Kolmanneksi: Humanity's Last Exam -tulosta arvioi GPT-4o. Neljänneksi: neljä taulukon kahdestatoista mittarista on Qwenin omia sisäisiä testejä — QwenSWEBench, CoWorkBench, JobBench ja RecreationBench — eli mittareita, joita kukaan muu ei voi ajaa.

Riippumatonta mittausta ei tänä iltana ole. Artificial Analysis, jonka indeksi on tämän lehden vakiovertailukohta, ei ole vielä julkaissut lukua Qwen3.8-27B:lle — mallia ei ollut olemassa vielä eilen. Suuruusluokan hahmottamiseen kelpaavat perheen aiemmat jäsenet: Qwen3.5-27B sai indeksissä 35, Qwen3.6-27B 38, ja keskiviikkona julkaistu jättiläinen Qwen3.8-Max 56.

Se, mitä indeksi mittaa, kannattaa myös tietää. Versio 4.1.1 kokoaa yhdeksän erillistä koetta: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience ja AA-LCR. Yhteinen piirre on, että ne ajetaan samalla ajurilla kaikille malleille ja tulokset julkaistaan kokonaisuutena — juuri se, mitä yksittäisen julkaisijan taulukosta puuttuu.

Jos odottaminen ei sovi, luvut voi mitata itse. Illan Koodi-juttu käsittelee kirjastoa, jolla se tehdään: EleutherAI:n lm-evaluation-harness ajaa samat julkiset kokeet paikallisella GGUF-mallilla, ja tulos kertoo mitä juuri se kvantisointi juuri sinun koneellasi osaa. Se on tärkeämpi luku kuin julkaisijan BF16-tulos, koska sinä et aja BF16-painoja.

Yksi lukema taulukosta kannattaa silti nostaa esiin, koska se on rakenteellisesti kiinnostava. Muse Glimmer-30B, Metan neljä päivää aiemmin julkaistu avoin agenttimalli, jää Qwenin ajossa jälkeen jokaisessa kohdassa jossa molemmat esiintyvät — Terminal Bench 2.1 51,7 vastaan 73,0, SWE-bench Pro 51,2 vastaan 61,7, OSWorld-Verified 65,9 vastaan 84,3, OmniDocBench 75,8 vastaan 91,1. Ero on niin systemaattinen, että se ansaitsee riippumattoman tarkistuksen suuntaan tai toiseen. Tämä lehti palaa asiaan, kun sellainen ilmestyy.

Lisälähteet

Muut jutut tässä numerossa