Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Perjantai · 21. elokuuta 2026Iltapainos · klo 21Nro 49
← Takaisin etusivulle

Päivän Python-kirjasto · RealtimeSTT 1.0.4 · Koodi

RealtimeSTT 1.0.4: paikallinen sanelu palasi kesätauolta — ja oppi suoratoistamaan pelkällä prosessorilla

Reaaliaikaisen puheentunnistuksen Python-vakiokirjasto julkaisi eilen illalla ensimmäisen versionsa kolmeen kuukauteen. Uutta: nopea CPU-suoratoisto NVIDIAn Nemotron 3.5 ASR:llä ja Parakeet-viimeistelyllä sherpa-onnx-taustan kautta, tuotantovalmis FastAPI-palvelin TLS:llä ja tunnistautumisella sekä sanakohtaiset aikaleimat. Taustaksi käy neljä eri tunnistinta whisper.cpp:stä faster-whisperiin.

Mikrofonista tekstiksi — koneelta poistumattaVAD + tunnistinNemotron 3.5 ASRCPU riittääosatulos elää puhuessa — lopullinen rivi viimeistellään kerrantaustat: faster-whisper · whisper.cpp · openai-whisper · sherpa-onnx

Jos olet rakentanut Pythonilla paikallisen sanelun, puhekomennot tai kokousmuistiinpanot, olet todennäköisesti törmännyt RealtimeSTT:hen: se on kirjasto, joka hoitaa mikrofonin kuuntelun, puheen havaitsemisen ja tunnistuksen yhdellä rajapinnalla, kaikki omalla koneella. Eilen illalla julkaistu versio 1.0.4 on projektin ensimmäinen julkaisu sitten toukokuun, ja tauon jälkeinen lista on pitkä. Kärkiuutuus on nopea CPU-suoratoisto: reaaliaikainen osatulos tuotetaan NVIDIAn Nemotron 3.5 ASR -mallilla ja lopullinen rivi viimeistellään Parakeet TDT:llä, molemmat sherpa-onnx-taustan kautta — eli ilman näytönohjainta ja ilman PyTorch-riippuvuutta itse tunnistuspolulla.

Käytännössä tämä tarkoittaa, että elävä sanelu — teksti joka täydentyy sitä mukaa kun puhut — onnistuu nyt mini-PC:llä tai vanhalla läppärillä, jolla Whisper-mallien reaaliaikainen ajo on ollut liian raskasta. Uusi stt-install-sherpa-models-komento hakee tarvittavat mallit valmiiksi tarkistettuina. Kirjaston vanhat taustat säilyvät rinnalla: faster-whisper, whisper.cpp pywhispercpp-siltauksen kautta ja alkuperäinen openai-whisper, joten saman koodin voi ajaa raskaammalla mallilla, kun rautaa riittää.

Toinen iso lisäys on tuotantopää. Mukana tulee valmis FastAPI-pohjainen HTTP- ja WebSocket-palvelin TLS-salauksella, tunnistautumisella ja vastapaineen hallinnalla — juuri niillä ominaisuuksilla, joiden puutteesta tämän viikon Ray- ja LocalAI-uutiset muistuttivat. WebSocket-virran semantiikka siivottiin: jokainen puheenvuoro tuottaa nyt täsmälleen yhden lopullisen tuloksen ja yhden valmistumisilmoituksen, mikä poistaa kokonaisen luokan kaksoiskappaleita asiakassovelluksista. Lisäksi tulivat sanakohtaiset aikaleimat, feed_audio_file-syöttö valmiille tiedostoille ja rajapinta omien tunnistinmoottorien liittämiseen.

Rajoitukset kannattaa tietää. Kirjasto naulaa riippuvuutensa tiukasti versiolleen — muun muassa PyAudion, websocketsin ja scipyn — mikä helpottaa asennusta puhtaaseen ympäristöön mutta voi riidellä olemassa olevan projektin kanssa; virtuaaliympäristö on tässä ystävä. Mikrofonipolku vaatii PortAudion, jonka asennus on Linuxilla oma askeleensa. Ja vaikka CPU-suoratoisto on uutuus, suomen kaltaisilla kielillä paras laatu tulee yhä Whisper-suvun malleista — Nemotron-polun kieligalleria on kapeampi. Versio 1.0.4 on tarkistettavissa PyPI:stä, jonne se nousi eilen klo 23.39.

Lisälähteet

Muut jutut tässä numerossa