Tekoälyn päivälehti — mallit, työkalut ja hardware
Benchmarkit · Artificial Analysis · 13.8.2026 · Benchmarkit
Artificial Analysis ehti mitata DeepSeek-V4-Pro-0813:n julkaisupäivänä: 53 pistettä kymmenen testin yhdistelmässä, piste enemmän kuin Flash-0731 ja neljä vähemmän kuin GPT-5.6:n keskikokoinen Terra. South China Morning Post tiivisti saman havainnon: yleistesteissä vaisu, kyberturvassa vahva.
Artificial Analysis ajoi DeepSeek-V4-Pro-0813:n testipatteristonsa läpi julkaisuvuorokauden aikana, ja tulos on 53 — yhdistelmä kymmenestä testistä, joiden joukossa ovat muun muassa Humanity's Last Exam, GPQA Diamond, Terminal-Bench ja SciCode. Mittaus tehtiin korkeimmalla max-päättelytasolla. Konteksti tekee luvusta kiinnostavan: talon oma, monin verroin halvempi V4-Flash-0731 sai samalta mittarilta 52.
Yksi piste eroa herättää saman kysymyksen, jonka tämä lehti esitti Flashin julkaisussa kaksi viikkoa sitten: mihin Prota tarvitaan, jos Flash on melkein yhtä hyvä kahdeksasosahinnalla? Vastaus löytyy testien painotuksesta. Yleismittari painottaa tietoa ja päättelyä, joissa mallien ero on kaventunut. DeepSeekin omissa agenttitesteissä ero on toista luokkaa: DeepSWE-tuloksessa Pro 0813 saa 62,7 ja Flash 54,4, ja työkalumaratonissa ero on samansuuntainen. Pro on agenttimalli, ja yleismittari mittaa jotain muuta.
South China Morning Post luki samat luvut ja otsikoi havainnon tylysti: uusi malli kompuroi benchmarkeissa mutta loistaa kyberturvassa. Cybergym-testin 83,3 on DeepSeekin oman taulukon mukaan enemmän kuin Opus 4.8:n 78,3, ja se on tulos, joka herättää kahdenlaisia ajatuksia — kyvykkyys hyökkäystehtävissä on myös se alue, jonka takia suljettujen mallien julkaisijat pitävät turvakaiteistaan kiinni. Avoimen painon mallissa vastaavaa kaidetta ei julkaisun jälkeen ole.
Vertailu ylöspäin asettaa mittakaavan: GPT-5.6-sarjan keskikokoinen Terra saa samalta mittarilta 57, eli neljä pistettä enemmän. Zhipun GLM-5.2, kesäkuun kiinalaisjulkaisu, on tasoissa 53:ssa. Kiinalaisten avoimen painon mallien kärki on siis tiivistynyt muutaman pisteen haarukkaan — ja se haarukka on kaventunut suljettuun kärkeen nähden koko vuoden.
Riippumattomat mittaukset ansaitsevat tässä kohtaa puolustuspuheen, jonka tämä lehti pitää aina tilaisuuden tullen. DeepSeekin oma taulukko on rehellisen oloinen, mutta se mittaa vain agenttitehtäviä, joissa uusi malli on parhaimmillaan. Artificial Analysisin patteristo ajetaan samoilla säännöillä kaikille, ja juuri siksi sen yksi piste kertoo enemmän kuin valmistajan viisitoista. Molempia kannattaa lukea — kumpaakaan ei kannata lukea yksin.