Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Lauantai · 22. elokuuta 2026Iltapainos · klo 21Nro 50
← Takaisin etusivulle

FireRedAudio · Apache 2.0 · 22.8.2026 · Media

Yksi malli kuuntelee, puhuu ja editoi puhetta — RedNote avasi FireRedAudion painot tänään

FireRedAudio on Apache-lisensoitu 9 miljardin parametrin äänimalli, joka yhdistää puheentunnistuksen, äänen ymmärtämisen, nollanäytteisen puhesynteesin ja puheen editoinnin samaan verkkoon. Painot ovat Hugging Facessa: 21 gigatavua mallia ja 8,4 gigatavun dekooderi.

Kuuntele — ymmärrä — puhu — editoiFireRedAudio9 mrd · Apache 2.0puhe sisäänpuhe ulos — myös editoitunaYmmärrys ja generointi eriytetty omiin polkuihinsa

RedNoten FireRed-tiimi avasi tänään FireRedAudio-mallin painot Hugging Faceen Apache 2.0 -lisenssillä. Kyse on yleiskäyttöisestä äänikielimallista: sama 9 miljardin parametrin verkko tekee puheentunnistuksen, äänen ymmärtämisen ja päättelyn, nollanäytteisen puhesynteesin, ohjeistetun puhesynteesin sekä puheen semanttisen ja akustisen editoinnin. Tiimin iskulause tiivistää tavoitteen: yksi malli, joka kuuntelee, ymmärtää, päättelee, puhuu ja editoi.

Arkkitehtuurin ydinajatus on eriytetyt jatkuvat esitykset: äänen ymmärtäminen kulkee oman enkooderin kautta ja generointi erillisen RedAE-polun kautta, jolloin kumpikaan ei joudu tinkimään toisen ehdoilla. Ratkaisu eroaa tavallisesta diskreettien äänitokenien reitistä, jota useimmat avoimet puhemallit käyttävät. Se, lunastaako rakenne lupauksensa, selviää vasta riippumattomista mittauksista — teknistä raporttia lupaillaan, mutta sitä ei julkaisuhetkellä vielä ole, joten kykyväitteet ovat toistaiseksi julkaisijan omia.

Rautavaatimukset kannattaa katsoa ennen innostumista: safetensors-painot vievät noin 21 gigatavua ja generointipuolen RedAE-dekooderi 8,4 gigatavua lisää, eikä kvantisoituja versioita vielä ole. Käytännössä mukava ajo vaatii 24 gigatavun näytönohjaimen tai ison yhteismuistin koneen, ja koodi on PyTorchia. Tässä kokoluokassa malli kilpailee eri sarjassa kuin eilen käsitelty 170 miljoonan parametrin Audio8 — se oli pienin ajokelpoinen äänikloonaaja, tämä on järein avoin ääniyleismalli.

Julkaisu on RedNotelle jo toinen muutaman päivän sisään: eilen kerroimme, että llama.cpp sai tuen saman talon dots3-note-mallille. Sosiaalisen median jätti, joka tunnetaan lännessä lähinnä TikTok-pakolaisten turvapaikkana, on hiljalleen noussut Kiinan johdonmukaisimpien avoimen painon julkaisijoiden joukkoon — ja nimenomaan äänessä sen FireRed-sarja on ollut poikkeuksellisen avokätinen jo aiemmin.

Sama varoitus kuin aina äänimallien kohdalla: nollanäytteinen synteesi tarkoittaa, että malli jäljittelee ääntä lyhyen näytteen perusteella, ja editointiominaisuudet tekevät puheeseen kajoamisesta entistä helpompaa. Työkalu on nyt isompi ja vapaammin lisensoitu kuin ennen. Kannattaa muistaa EU:n tekoälyasetuksen linjaus, jota käsittelimme aiemmin: merkintävelvoite koskee sisällön julkaisijaa — se, että malli pyörii omalla koneella, ei poista vastuuta siitä, mitä sillä tehdyllä äänellä tekee.

Lisälähteet

Muut jutut tässä numerossa