Tekoälyn päivälehti — mallit, työkalut ja hardware
Päättelypiirien mittaus · Benchmarkit
SemiAnalysisin InferenceX-mittauksessa ajettiin GPT-OSS 120B, DeepSeek R1 ja Kimi K2.5 — ja juuri siksi luvut ovat luettavissa. Läpäisy huipputehoa kohti 1,5–1,9-kertainen, keskustelukäytössä 2,1–4,1-kertainen GB200- ja GB300-järjestelmiin nähden.
OpenAI julkisti kesäkuussa Broadcomin kanssa tehdyn oman päättelypiirinsä, koodinimeltään Jalapeño. Ensimmäiset riippumattomaan mittaukseen perustuvat luvut tulivat julki 25. elokuuta, ja japanilainen ITmedia kokosi ne viikkokoosteeseensa 30. elokuuta. Mittaus tehtiin SemiAnalysisin InferenceX-testipatterilla, ja siinä on paikallisajajalle olennainen piirre: ajetut mallit ovat avoimia painoja, joten kuka tahansa voi periaatteessa toistaa saman kuorman omalla raudallaan.
Testimallit olivat GPT-OSS 120B, DeepSeek R1 670B ja Kimi K2.5, joka on biljoonan parametrin kokoluokkaa. Vertailukohtana olivat NVIDIAn GB200- ja GB300-järjestelmät. Läpäisy huipputehoa kohti oli Jalapeñolla 1,5–1,9-kertainen, päästä päähän -viive 1/1,7–1/3,6 eli selvästi lyhyempi, ja keskustelunomaisessa käytössä ero kasvoi 2,1–4,1-kertaiseksi. Luvut ovat mittaajan omia eivätkä valmistajan, mutta on syytä muistaa, että mittaaja on alan analyysitalo eikä akateeminen taho.
Toinen luku kertoo kehitystahdista. Suunnittelusta piirin valmistusvedokseen meni yhdeksän kuukautta, ja työssä käytettiin tekoälyä. Kolme avoimen painon mallia siirrettiin massatuotantoarviointiin kahdessa kuukaudessa Codexilla ja GPT-Astralilla. Osassa GPT-OSS:n huomiokerroksen ja asiantuntijasekoituksen lohkoja tekoälyn tuottamat laskentaytimet olivat 1,5–1,8 kertaa nopeampia kuin ihmisen käsin virittämät — yhtiö korostaa itse, että kyse on valikoiduista lohkoista eikä koko mallista.
Miksi tämä on paikallisajajan asia. Ensinnäkin siksi, että avoimen painon mallien käyttö mittatikkuna tarkoittaa, että lukuja voi verrata omiin — GPT-OSS 120B pyörii myös yhteismuistikoneella, ja sen tokeninopeus tunnetaan monelta laitteelta. Toiseksi siksi, että päättelyn siirtyminen pois NVIDIAn kortilta on sama liike, joka näkyi elokuussa Z.ai:n ajaessa koko GLM-5.3-Flashin liikenteen kotimaisilla kiihdyttimillä. Koulutus pysyy toistaiseksi siellä missä on ollut; päättely ei.
Varaus on paikallaan. Nämä ovat mittaajan tiivistelmälukuja eivätkä täysi tulostaulukko, eikä testiajojen kokoonpanoja ole julkaistu samalla tarkkuudella kuin esimerkiksi yhteisömittauksissa on tapana vaatia. Suhdeluvut kertovat suunnan, eivät sitä, mitä tietty malli tietyllä kontekstipituudella tekee.