Tekoälyn päivälehti — mallit, työkalut ja hardware
Media · Audio8 TTS 0.1B · ONNX INT8 · Media
Audio8 julkaisi tiistaina puhesyntetisaattoristaan ONNX-version, jossa mallit ovat kahdeksanbittisiä ja äänikoodekki kuudentoista bitin liukuluvuilla. Ajoon ei tarvita PyTorchia eikä näytönohjainta. Kieliä on yksitoista, lisenssi Apache 2.0.
Audio8 julkaisi tiistaipäivällä puhesyntetisaattoristaan version, joka on tarkoitettu ajettavaksi kokonaan suorittimella. Pohjamalli on sata miljoonaa parametria — pieni jopa puhemallien mittapuulla — ja tämä paketti sisältää sen ONNX-muodossa: itse mallit kahdeksanbittisinä kokonaislukuina, neuroäänikoodekki kuudentoista bitin liukuluvuilla, tokenisoijan, valmiin vertailuäänen ja valinnaisen kooderin uusien äänten rekisteröintiin.
Ratkaiseva ero aiempaan on ajoympäristö. ONNX Runtime ei tarvitse PyTorchia, CUDAa eikä näytönohjainta, ja kahdeksanbittinen pakkaus pudottaa muistijalanjäljen niin pieneksi, että malli mahtuu käytännössä mihin tahansa. Tämä on se koko, jossa puhesynteesi lakkaa olemasta erillinen palvelin ja muuttuu kirjastoksi jonka voi upottaa ohjelmaan.
Mallin osaamislista: nollaotoksinen äänikloonaus, eli äänen matkiminen lyhyestä näytteestä ilman erillistä koulutusta, ja yksitoista kieltä — kantoninkiina, mandariini, hollanti, englanti, ranska, saksa, italia, japani, korea, puola ja espanja. Suomi ei ole listalla. Lisenssi on Apache 2.0.
Vientitapa on teknisesti kiinnostava: mallit on viety tokenikohtaisina graafeina pinotulla rekursiivisella rajapinnalla ja kelvollisen etuliitteen huomiomekanismilla. Julkaisija kertoo suoraan, että suunnittelu ja kahdeksanbittinen pakkausstrategia on **omaksuttu yhteisön tekemästä muunnoksesta** ja nimeää tekijän — mutta myös sen, että graafit on tuotettu itsenäisesti virallisesta tarkistuspisteestä eikä yhteisöversion tiedostoja ole käytetty. Tuollainen merkintä on harvinaisen siisti tapa hoitaa asia.
Yksi rajoitus: repo sisältää vain mallitiedostot. Päättelykoodi, suoratoistopalvelin ja äänen rekisteröinti ovat projektin GitHub-repossa, eikä pelkkien painojen lataaminen riitä. Ja kuten aina äänikloonauksessa: teknisesti helppo on tässä tapauksessa myös helppo väärinkäyttää, ja se kannattaa pitää mielessä ennen kuin syöttää malliin toisen ihmisen äänen.