Tekoälyn päivälehti — mallit, työkalut ja hardware
Mallit · avoimet painot · käyttöliittymäagentti · Mallit
UI-Venus-2-9B katsoo ruutua, päättelee tehtävän tilan, tekee toiminnon ja lukee tuloksen. Se on rakennettu Qwen3.5-9B:n päälle ja ajetaan omalla koneella vLLM:llä. Kiinnostavin luku ei ole tarkkuus vaan turvallisuus: haitallisten toimintojen läpimeno putosi pohjamallin 25,3 prosentista 11,3 prosenttiin.
Käyttöliittymäagentit ovat tähän asti olleet pilvipalveluiden aluetta, koska ruudun jatkuva katsominen ja toimintojen päättely vaatii monimuotoisen mallin ja pitkän kontekstin. Ant Groupin tutkimusyksikkö inclusionAI julkaisi keskiviikkona UI-Venus-2-9B:n täydet painot: agentin, joka toimii mobiilisovelluksissa, verkkosivuilla ja työpöytäkäyttöjärjestelmässä yhdellä ja samalla suljetulla silmukalla — havaitse käyttöliittymä, päättele tehtävän tila, tee toiminto, lue palaute ja jatka.
Pohjana on Qwen3.5-9B, ja repositorio julkaisee koko parametrijoukon eikä sovitinta. Palvelu käynnistetään vLLM:llä 262 144 tokenin kontekti-ikkunalla ja qwen3-päättelyjäsentimellä, ja se tarjoaa OpenAI-yhteensopivan rajapinnan paikallisesti. Malli on ohjeistettu käytettäväksi eri asetuksilla eri tehtävissä: yleisissä agenttitehtävissä lämpötila 1,0 ja päättely päällä koko historian kanssa, käyttöliittymän kohdistuksessa päättely pois ja lämpötila 0, ja CAPTCHA-tehtävissä oma kehote ja jäsennin, joka sietää useaa toimintoa samassa vuorossa.
Koulutus on tehty kolmessa vaiheessa. Ensin monimuotoinen välikoulutus simuloiduissa mobiili-, selain- ja käyttöjärjestelmäympäristöissä, sitten askeltason vahvistusoppiminen viidessä erillisessä tehtäväperheessä — kohdistus, CAPTCHA, mobiili, verkko ja tietokone — ja lopuksi usean opettajan tislaus, jossa erikoistuneet mallit sulautetaan yhdeksi politiikaksi. Ympäristöpooli on epätavallisen laaja: yli 170 monikielistä mobiilisovellusta, joista yli sata kiinankielisiä ja 70 englanninkielisiä, sekä yli 4 000 verkkotunnusta 19 kategoriassa.
Kiinnostavin yksityiskohta on verifiointi. Tehtävän onnistumista ei arvioida katsomalla lopputilaa kokonaisuutena, vaan tehtävän kannalta olennaisten visuaalisten avainkohtien perusteella, ja arviot kootaan usean mallin äänestyksellä. Perustelu on suora: yksi tuomarimalli on helppo huijata, ja palkkiosignaalin huijaaminen on juuri se tapa, jolla vahvistusoppiminen menee pieleen.
Turvallisuusluvut julkaistaan poikkeuksellisen avoimesti. OSHarm-aineistossa, joka mittaa kuinka usein agentti suostuu tekemään peruuttamattoman haitallisen toiminnon, UI-Venus-2-9B päästää läpi 11,3 prosenttia hyökkäyksistä, kun pohjamalli Qwen3.5-9B päästää 25,3 prosenttia. OSBlind-aineistossa vastaavat luvut ovat 48,8 ja 79,4 prosenttia. Toinen luku on syytä lukea kunnolla: lähes joka toinen sokea hyökkäys menee yhä läpi. Agentti, joka saa klikata omaa työpöytääsi, kannattaa toistaiseksi pitää hiekkalaatikossa.
Repositorion mallikortti on tässä rehellinen myös itsestään: se toteaa, ettei annettua vLLM-palvelinkokoonpanoa ole validoitu tuoreeltaan, ja kehottaa naulaamaan Qwen3.5:lle sopivan version ennen käyttöönottoa. Pelkkä palvelin ei myöskään anna toimivaa agenttia — kehotteet, toimintojen jäsentimet ja ajettavat esimerkit ovat erikseen projektin koodirepossa.