Tekoälyn päivälehti — mallit, työkalut ja hardware
Avoimen painon julkaisu · monimodaalinen · Mallit
304 miljardin parametrin malli mahtuu 167,8 gigatavuun, koska asiantuntijapainot on tallennettu neljän bitin liukuluvuilla jo tehtaalla. Siksi yhteisön nelibittinen pakkaus on vain neljä prosenttia pienempi kuin kahdeksanbittinen — puristettavaa ei juuri ole jäljellä.
DeepSeek julkaisi maanantaiaamuna Hugging Faceen mallin DeepSeek-V4-Flash-Vision-Exp — V4-perheen ensimmäisen version, joka näkee kuvia. Lisenssi on MIT, eli kaupallinen käyttö, muokkaus ja uudelleenjakelu ovat sallittuja ilman ehtoja. Repossa on 84 tiedostoa, joista 48 on mallipainoja, ja yhteispaino on 167,83 gigatavua. Mukana ei tule pelkkiä painoja: samassa paketissa on tokenisoija, kehotteen koodauksen viitetoteutus ja pelkistetty PyTorch-päättelytoteutus, joka kattaa näköenkooderin, Aligner-osan, DFlash-huomiokerroksen, asiantuntijasekoituksen, Hyper-Connections-yhteydet ja DSpark-lohkot.
Tiedostoissa on yksi luku, joka kannattaa laskea itse. Mallin parametrimäärä on tarkalleen 304 646 824 126 eli 304,6 miljardia. Jos painot olisivat kahdeksanbittisiä, tiedostojen pitäisi viedä noin 300 gigatavua; jos kuudentoistabittisiä, kaksi kertaa sen. Ne vievät 167,8 gigatavua, mikä tekee noin 4,4 bittiä parametria kohti. Selitys löytyy mallin asetustiedostosta yhdeltä riviltä: ”expert_dtype: "fp4"”. Asiantuntijapainot — eli valtaosa mallista — on tallennettu neljän bitin liukuluvuilla, ja loppu FP8-muodossa lohkoittaisella skaalauksella. Malli tulee siis ulos jo kertaalleen pakattuna.
Tämä näkyy heti siinä, mitä yhteisö sai siitä irti. Unsloth latasi samana päivänä GGUF-muunnokset, ja niiden koot ovat poikkeukselliset: nelibittinen UD-Q4_K_XL vie 155,1 gigatavua ja kahdeksanbittinen UD-Q8_K_XL 161,9 gigatavua. Ero on 6,8 gigatavua eli neljä prosenttia. Tavallisessa julkaisussa kahdeksanbittinen versio on kaksinkertainen nelibittiseen nähden. Tässä ei ole, koska alkuperäisessä tiedostossa ei ole enää sitä tarkkuutta, jonka pakkaaja voisi heittää pois — nimi "Q8" kertoo vain, ettei pakkaaja pakota painoja alemmas kuin ne jo ovat.
Käytännössä se tarkoittaa, ettei mallia saa kutistettua kotikoneeseen odotetulla tavalla. Kevyinkin saatavilla oleva versio vaatii 155 gigatavua pelkkiin painoihin, ja päälle tulee kontekstin välimuisti — mallin ikkuna on 1 048 576 tokenia. Tämä on siis edelleen monen näytönohjaimen tai ison yhteismuistikoneen malli, ei mini-PC:n. Se, mikä muuttui, on lisenssi ja se, että painot ovat nyt kenen tahansa haettavissa.
Rakenteesta muutama luku, koska ne selittävät, miksi malli on nopea kokoonsa nähden. Kerroksia on 43. Reititettyjä asiantuntijoita on 256 ja jaettuja yksi, ja jokaista tokenia kohti aktivoidaan kuusi asiantuntijaa. Huomiokerroksessa on 64 päätä mutta vain yksi avain-arvo-pää, ja indeksoija poimii 512 kohtaa kerrallaan. Lisäksi mukana on kolme seuraavan tokenin ennustuskerrosta eli oma luonnostelupää spekulatiivista dekoodausta varten. Näköpuoli on 32 kerrosta, piirrekoko 1024, kuvapalan koko 14 pikseliä ja yksi kuva enintään 384 tokenia.
DeepSeekin oma mittaustaulukko vertaa mallia sekä edeltäjäänsä että Opus-4.8:aan. Terminal Bench 2.1 -testissä uusi malli saa 83,9 pistettä, edeltäjä 82,7 ja Opus 85,0. DeepSWE-koodaustestissä uusi malli menee ohi: 59,3 vastaan 58,0. ZeroBench-näkötestissä sama toistuu, 35,0 vastaan 34,0. Mutta NL2Repo-testissä ero on iso toiseen suuntaan, 57,7 vastaan 69,7, ja monimodaalisessa ApexBenchissä 36,5 vastaan 39,4. Kuvamuodoista tuetaan JPEG, PNG, GIF ja WebP. Malli on merkitty kokeelliseksi, ja rajapinnassa se on ollut jo 21. elokuuta — uutta on se, että painot ovat nyt ulkona.