Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Torstai · 13. elokuuta 2026Iltapainos · klo 21Nro 41
← Takaisin etusivulle

Benchmarkit · Artificial Analysis · 13.8.2026 · Benchmarkit

Riippumaton mittaus antoi uudelle Prolle 53 pistettä — tasan yhden enemmän kuin talon omalle halpamallille

Artificial Analysis ehti mitata DeepSeek-V4-Pro-0813:n julkaisupäivänä: 53 pistettä kymmenen testin yhdistelmässä, piste enemmän kuin Flash-0731 ja neljä vähemmän kuin GPT-5.6:n keskikokoinen Terra. South China Morning Post tiivisti saman havainnon: yleistesteissä vaisu, kyberturvassa vahva.

Kymmenen testin yhdistelmäV4 Flash 0731GLM-5.2V4 Pro 0813GPT-5.6 Terra52535357Artificial Analysis Intelligence Index v4.1.1 · max-päättelytaso

Artificial Analysis ajoi DeepSeek-V4-Pro-0813:n testipatteristonsa läpi julkaisuvuorokauden aikana, ja tulos on 53 — yhdistelmä kymmenestä testistä, joiden joukossa ovat muun muassa Humanity's Last Exam, GPQA Diamond, Terminal-Bench ja SciCode. Mittaus tehtiin korkeimmalla max-päättelytasolla. Konteksti tekee luvusta kiinnostavan: talon oma, monin verroin halvempi V4-Flash-0731 sai samalta mittarilta 52.

Yksi piste eroa herättää saman kysymyksen, jonka tämä lehti esitti Flashin julkaisussa kaksi viikkoa sitten: mihin Prota tarvitaan, jos Flash on melkein yhtä hyvä kahdeksasosahinnalla? Vastaus löytyy testien painotuksesta. Yleismittari painottaa tietoa ja päättelyä, joissa mallien ero on kaventunut. DeepSeekin omissa agenttitesteissä ero on toista luokkaa: DeepSWE-tuloksessa Pro 0813 saa 62,7 ja Flash 54,4, ja työkalumaratonissa ero on samansuuntainen. Pro on agenttimalli, ja yleismittari mittaa jotain muuta.

South China Morning Post luki samat luvut ja otsikoi havainnon tylysti: uusi malli kompuroi benchmarkeissa mutta loistaa kyberturvassa. Cybergym-testin 83,3 on DeepSeekin oman taulukon mukaan enemmän kuin Opus 4.8:n 78,3, ja se on tulos, joka herättää kahdenlaisia ajatuksia — kyvykkyys hyökkäystehtävissä on myös se alue, jonka takia suljettujen mallien julkaisijat pitävät turvakaiteistaan kiinni. Avoimen painon mallissa vastaavaa kaidetta ei julkaisun jälkeen ole.

Vertailu ylöspäin asettaa mittakaavan: GPT-5.6-sarjan keskikokoinen Terra saa samalta mittarilta 57, eli neljä pistettä enemmän. Zhipun GLM-5.2, kesäkuun kiinalaisjulkaisu, on tasoissa 53:ssa. Kiinalaisten avoimen painon mallien kärki on siis tiivistynyt muutaman pisteen haarukkaan — ja se haarukka on kaventunut suljettuun kärkeen nähden koko vuoden.

Riippumattomat mittaukset ansaitsevat tässä kohtaa puolustuspuheen, jonka tämä lehti pitää aina tilaisuuden tullen. DeepSeekin oma taulukko on rehellisen oloinen, mutta se mittaa vain agenttitehtäviä, joissa uusi malli on parhaimmillaan. Artificial Analysisin patteristo ajetaan samoilla säännöillä kaikille, ja juuri siksi sen yksi piste kertoo enemmän kuin valmistajan viisitoista. Molempia kannattaa lukea — kumpaakaan ei kannata lukea yksin.

Lisälähteet

Muut jutut tässä numerossa