Tekoälyn päivälehti — mallit, työkalut ja hardware
Puheentunnistus · 22.8.2026 · Media
Moonshinen englanninkielinen suoratoistomalli hienosäädettiin ReazonSpeechin koko aineistolla, ja tulos ajetaan ONNX-muodossa ilman näytönohjainta.
Iltakoosteen mediapalstalle päätyy tänään pieni malli, jonka merkitys on isompi kuin sen koko. ayousanz julkaisi lauantaina mallin kodama-ja-streaming-small: japaninkielisen suoratoistavan puheentunnistimen, joka on hienosäädetty Moonshine AI:n englanninkielisestä moonshine-streaming-small-mallista ReazonSpeech v2:n koko 35 000 tunnin aineistolla. Lisenssi on Apache 2.0.
Julkaisun ydin on siinä, mitä pakkauksessa on mukana: valmiit ONNX- ja ORT-ajokuvaajat, yhteensä 324 megatavua, tarkoitettu prosessorilla ajettavaksi ja matalaan viiveeseen. Näytönohjainta ei tarvita. Suoratoistava tunnistin tarkoittaa, että teksti valmistuu puheen edetessä eikä vasta äänitteen loputtua — juuri se ero ratkaisee, käykö malli sanelutyökaluksi vai pelkäksi jälkikäsittelijäksi.
Mallikortti on epätavallisen tarkka rajanvedosta. Tekijä toteaa erikseen, ettei kyseessä ole Moonshine AI:n tuote eikä hyväksymä malli, ja että Moonshinen virallisia japaninkielisiä versioita tai niiden tokenisoijaa ja dekooderipainoja ei ole käytetty alkupainoina lainkaan — ne esiintyvät vain vertailukohtana. Kun avoimen painon ekosysteemissä hienosäädöt periytyvät toistensa päälle kerroksittain, tällainen alkuperäselvitys on se, mikä tekee mallista käyttökelpoisen myös työpaikalla.
Suomalaiselle lukijalle kiinnostavinta on kaava, ei kieli. Se menee näin: ota pieni englanninkielinen suoratoistomalli, hienosäädä se kokonaan yhdellä isolla avoimella puheaineistolla, mittaa merkki- ja sanavirhe vertaisryhmää vasten ja julkaise ONNX-paketti prosessoriajoa varten. Japanissa iso avoin puheaineisto on ReazonSpeech; muilla kielillä vastaava aineisto on se pullonkaula, joka ratkaisee, syntyykö samaa. Tämän illan malli löytyi japanilaisesta lähteestä ennen kuin se näkyi englanninkielisessä uutisoinnissa.