Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Maanantai · 17. elokuuta 2026Iltapainos · klo 21Nro 45
← Takaisin etusivulle

Shunya Labs · puheentunnistus · Media

Avoin puheentunnistin kuudelle intialaiselle kielelle — ja mallikortti, joka ei kerro kokoa

Shunya Labsin Vak Conformer on Hugging Facessa avoimin painoin. Arkkitehtuuri on Conformer, kielivalikoima kuusi intialaista kieltä — mutta parametrimäärää, koulutusaineistoa eikä vertailulukuja ole julkaistu, ja lisenssi on räätälöity.

Puhe → teksti, kuusi kieltäConformerkonvoluutio+ attentiolitteroitu tekstiparametrimäärä: ei ilmoitettu

Shunya Labs on julkaissut Hugging Facessa Vak Conformer -nimisen automaattisen puheentunnistusmallin, joka on koulutettu kuudelle intialaiselle kielelle. Painot ovat ladattavissa, eli mallia voi ajaa omalla koneella ilman että ääni lähtee minnekään — ja äänitteiden kohdalla se ero on suurempi kuin tekstissä, koska ääninäyte tunnistaa puhujansa.

Arkkitehtuuri on Conformer, joka on ollut puheentunnistuksen vakiovalinta jo useamman vuoden. Se yhdistää konvoluutiokerrokset ja itsehuomion: konvoluutio poimii äänteiden paikalliset yksityiskohdat, huomio pitää huolta siitä, että lause pysyy kasassa pidemmällä matkalla. Yhdistelmä on osoittautunut kestäväksi erityisesti silloin, kun koulutusaineistoa on rajallisesti — mikä on tilanne useimmilla eteläaasialaisilla kielillä, vaikka puhujia on satoja miljoonia.

Tässä kohtaa on kerrottava, mitä julkaisusta ei tiedetä. Parametrimäärää ei ole ilmoitettu, koulutusaineistoa ei ole kuvattu eikä mallista ole julkaistu vertailulukuja. Lisenssikin on räätälöity eikä mikään vakiolisenssi, joten sen ehdot on luettava itse ennen kuin mallia käyttää mihinkään muuhun kuin kokeiluun. Kokoluokan puuttuminen tarkoittaa käytännössä, ettei rautavaatimusta voi arvioida etukäteen — Conformer-mallit ovat tyypillisesti kymmenistä miljoonista muutamaan sataan miljoonaan parametriin, eli tavallisen kannettavan prosessorillakin ajettavia, mutta tätä lukua ei ole tälle mallille julkaistu.

Julkaisu asettuu laajempaan kuvaan. Intialaisten kielten puheentunnistus on ollut pitkään aliedustettu suhteessa puhujamääriin, ja avoimin painoin julkaistut kielikohtaiset mallit ovat siihen suora vastaus: ne madaltavat kynnystä rakentaa puhekäyttöliittymiä, litterointia ja saavutettavuustyökaluja alueellisille markkinoille, ilman pilvipalvelun kuukausimaksua ja ilman että äänitteet siirtyvät maan rajojen yli.

Suositus on varovainen mutta myönteinen: jos työ koskee intialaisia kieliä, malli kannattaa ladata ja testata omalla aineistolla, koska julkaistujen lukujen puuttuessa oma mittaus on ainoa käytettävissä oleva vertailu. Muussa tapauksessa tämä on merkintä siitä, että avoin puhepino laajenee kielialueille, joilla sitä ei aiemmin ollut — ja se on hyvä uutinen riippumatta siitä, minkä kielisiä äänitteitä itse litteroi.

Lisälähteet

Muut jutut tässä numerossa