Tekoäly
Apple väittää, että sen ReALM ylittää GPT‑4:n kyvyissä

Claude 3 Opus on äskettäin syrjäyttänyt GPT 4 edistyneimpänä LLM:nä. Samaan aikaan Applen tutkijat esittelivät ReALM:n, pian sen jälkeen kun uutinen siitä, että Googlen Gemini ohjaa iPhonea, herätti huomiota. Tutkimuspaperi, jonka otsikko on “ReALM: Reference Resolution As Language Modeling”, esittelee sen huipputason AI‑järjestelmänä, jonka lupaus on määritellä uudelleen, miten ääniohjaimet ymmärtävät ja vastaavat käyttäjän kyselyihin.
(AAPL )ReALM:n ja muiden järjestelmien välinen ero on sen saumaton referenssiratkaisun yhdistäminen kielenymmärryksen kokonaisuuteen. Tämä on innovatiivinen lähestymistapa ottaen huomioon nykyiset suurten kielimallien pohjaiset järjestelmät, ja se auttaa parantamaan mallin kontekstin ymmärtämistä sekä asettamaan uuden vertailukohdan tekoälyn ja graafisten käyttöliittymien väliselle vuorovaikutukselle.
Tutkimustulosten perusteella sen on tarkoitus auttaa LLM‑insinöörejä ja AI‑työkalujen tuotejohtajia saavuttamaan intuitiivisempia ja kontekstitietoisempia käyttäjävuorovaikutuksia. ReALM myös helpottaa tekstisyötteen ja visuaalisen kontekstin yhdistämistä, mikä laajentaa mahdollisuuksia parantaa digitaalisten avustajien taitoja monissa sovelluksissa.
ReALM:n innovatiivinen lähestymistapa NLP‑referenssiratkaisuun
Kaikki NLP‑järjestelmät perustuvat “referenssiratkaisuun”, prosessiin, jossa tunnistetaan ja linkitetään epäselvät mutta kontekstuaaliset viittaukset, kuten pronominit tai epäsuorat kuvaukset (esim. “they” tai “that”), oikeisiin entiteetteihin keskustelussa tai visuaalisessa kontekstissa, jotta käyttäjävuorovaikutus pysyy johdonmukaisena.
Perinteiset AI‑järjestelmät perustuvat sääntöpohjaisiin menetelmiin tai heuristiikkoihin referenssiratkaisussa, mikä ei tuota toivottuja tuloksia luonnollisen kielen täyden monimutkaisuuden hallinnassa. Tämän seurauksena visuaalisen kontekstin, kuten näytöllä olevien entiteettien, integrointi ratkaisuun on ollut vaikeaa näillä menetelmillä. Ääniavustajat kuten Sirikin kärsivät samoista rajoituksista, joita ReALM ratkaisee käsittelemällä ongelman kielimallinnusongelmana.
ReALM hyödyntää LLM:eja ymmärtääkseen ja ratkaistakseen epäselvät viittaukset laajemmassa keskustelukontekstissa sen sijaan, että käyttäisi sääntöjä tai heuristiikkoja. Kun visuaalinen konteksti on mukana, se rekonstruoi laitteen näytön tekstimuotoisilla esityksillä ja tallentaa spatiaalit yhteydet näytöllä olevien komponenttien välillä.
Joel Ruben Antony Monizin johdolla tutkimusryhmä toteaa:
“Parhaan tietämyksemme mukaan tämä on ensimmäinen työ, jossa käytetään suurta kielimallia, jonka tavoitteena on koodata konteksti näytöltä.”
Tuloksena? ReALM‑voimaiset ääniavustajat voivat ymmärtää kyselyitä kuten “Napauta oikeassa yläkulmassa olevaa painiketta” ja “Avaa listan toinen artikkeli”, joihin perinteiset AI‑järjestelmät kamppailevat.
Tämä tekee ReALM:n referenssiratkaisumenetelmästä tehokkaamman ja ihanteellisemman laitteella tapahtuvaan prosessointiin, koska se pystyy ratkaisemaan viittaukset paikallisesti laitteella, toisin kuin pilvipohjaiset AI‑järjestelmät, jotka vaativat jatkuvaa tiedonsiirtoa. Tämä tekee siitä paremman vaihtoehdon Siri‑käyttöön parantuneen yksityisyyden, viiveen ja offline‑toiminnan ansiosta.
Klikkaa tästä saadaksesi listan viidestä parhaasta ChatGPT-laajennuksesta.
Aineiston keruu ja arviointi
Applen tutkimusryhmä koostoi monipuolisen aineiston, joka kattaa keskustelu-, näytöllä‑ ja synteettisen datan, arvioidakseen perusteellisesti ReALM:n kykyä navigoida todellisten käyttäjävuorovaikutusten monimutkaisuudessa verrattuna sen vaihtoehtoihin. Tätä varten tiimi keräsi monipuolisen aineiston, joka sisältää keskustelu‑, näytöllä‑ ja synteettistä dataa.
Keskusteludata luotiin näyttämällä joukko työntekijöille kuvia, joissa oli synteettisiä listoja, ja pyytämällä heitä lähettämään selkeitä kyselyitä, jotka liittyvät tiettyihin listan elementteihin. Näytöllä oleva aineisto käytiin läpi kaksivaiheisen merkintäprosessin, jonka avulla varmistettiin, että malli pystyy käsittelemään todellisten verkkosivujen monimutkaisuutta. Tämä prosessi sisälsi näkyvien objektien luokittelun, kyselyjen tuottamisen ja yhteyksien luomisen kyselyjen ja niihin viittaavien entiteettien välillä.
Vaikuttavat suorituskykytulokset
Arviointitulokset osoittavat ReALM:n poikkeuksellisen suorituskyvyn kaikissa aineistoissa. Verrattuna MARRS:iin, aiempaan huipputason referenssiratkaisujärjestelmään, ReALM saavuttaa merkittäviä tarkkuusparannuksia. Erityisesti pieninkin ReALM‑malli saa yli 5 %:n absoluuttisen parannuksen haastavassa näytöllä‑aineistossa, mikä osoittaa sen kyvyn tehokkaasti ymmärtää ja ratkaista viittauksia monimutkaisissa visuaalisissa konteksteissa.
Jatkaakseen ReALM:n kykyjen arviointia tutkijat vertasivat sitä OpenAI:n GPT‑3.5‑ ja GPT‑4‑malleihin. Vaikuttavasti pienin ReALM‑malli suoriutuu tasaisesti GPT‑4:n kanssa, vaikka sillä on kymmeniä kertoja vähemmän parametreja. Mallin koon kasvaessa ReALM:n suorituskyky paranee edelleen, ja suuremmat mallit ylittävät merkittävästi GPT‑4:n arvioiduissa aineistoissa.
Alla oleva taulukko esittää yhteenvedon suorituskykytuloksista, korostaen ReALM:n ylivertaisuutta olemassa oleviin lähestymistapoihin ja sen kilpailukykyä huipputason kielimalleihin nähden.

Menestyksen avain: Optimoitu näytön koodaus
Kuten on selvää, ReALM:n optimoitu näytön koodausmenetelmä on keskeinen tekijä, joka edistää sen vaikuttavaa suorituskykyä. Tämä lisää myös sitä tosiasiaa, että tutkijat tutkivat useita strategioita ennen lopullisen algoritmin saavuttamista, joka osoittautui tehokkaimmaksi.
Yksi alkuperäisistä yrityksistä sisälsi näytön elementtien ryhmittelyn ja kaikkien muiden elementtien sisällyttämisen kunkin entiteetin kontekstiin. Tämä kuitenkin johti kehotteiden pituuden nopeaan kasvuun näytöllä olevien entiteettien määrän kasvaessa, mikä teki siitä melko epäkäytännöllisen todellisissa sovelluksissa.
Toinen lähestymistapa sisälsi entiteettien merkitsemisen tekstuaalisessa näytön jäsentämisessä, mutta niiden tarjoamisen erikseen pääkontekstista. Vaikka tämä menetelmä vaikuttaa lupaavalta, tutkijat havaitsivat, että merkkien suora injektointi itse jäsentämiseen tuotti parhaat tulokset.
Lopullinen “injected on-screen encoding” -lähestymistapa, kuten paperissa on kuvattu, toimii järjestämällä näytön elementtien keskukset ylhäältä alas ja vasemmalta oikealle. Määritellyn pystysuoran marginaalin sisällä olevat elementit ryhmitellään samaan “linjaan” tekstuaalisessa esityksessä, ja samassa linjassa olevat elementit erotetaan sarkaimilla. Tämä älykäs koodausmenetelmä mahdollistaa ReALM:n lähentää 2‑D‑näyttöasettelua 1‑D‑tekstimuodossa, jolloin malli pystyy tehokkaasti ymmärtämään entiteettien spatiaalit suhteet.
Tutkijoiden suorittamat ablaatiokokeet vahvistivat tämän optimoidun koodausmenetelmän ylivertaisuuden, kuten alla olevassa kuvassa:

Monimutkaisten käyttötapausten käsittely
Paperi tarjoaa useita kvalitatiivisia esimerkkejä, jotka osoittavat ReALM:n kyvyn käsitellä monimutkaisia käyttötapauksia, jotka vaativat erilaisia päättelymuotoja, kuten semanttista ymmärrystä, tiivistämistä, maailmantietoa ja tervettä järkeä.
Eräässä mielenkiintoisessa tiimin jakamassa esimerkissä ReALM ratkaisee oikein kyselyn “Soita iltapuhelinnumeroon” puhelinnumeroon, joka on listattu “5 PM – 9 PM” -kohdassa, kun näytöllä on sekä aamun että illan yhteystiedot. Vaikka se kuulostaa loogiselta tulokselta, tämä on vaikuttava kykyjen esitys, sillä ReALM ymmärsi onnistuneesti sanan “ilta” merkityksen ja yhdisti sen oikeaan aikaväliin, mikä on vielä toteutumatta muissa AI‑järjestelmissä.
Toinen syöteesimerkki sisälsi näytön, jossa esitettiin veron määräajat, ja malli tunnisti onnistuneesti huhtikuun ilmoituspäivän relevantiksi määräajaksi, kun pyydettiin asettamaan muistutus asiakirjojen tulostamisesta ennen veron eräpäivää.
Nämä kvalitatiiviset esimerkit vahvistavat havainnot ReALM:n monipuolisuudesta ja potentiaalista käsitellä laajaa valikoimaa todellisia tilanteita, jotka vaativat syvällistä kielenymmärrystä ja päättelykykyjä.
Edut end-to-end -lähestymistapoihin verrattuna
Vaikka end-to-end -lähestymistavat, jotka perustuvat pelkästään massiivisiin LLM:eihin, ovat osoittaneet lupaavia tuloksia erilaisissa kielenymmärrystehtävissä, tutkijat korostavat useita ReALM:n arkkitehtuurin etuja:
Kokonaisen end-to-end -mallin ajaminen laitteella viiveen ja yksityisyyden vuoksi olisi nykyisillä malleilla toteuttamattomia laskenta- ja muistirajoitteiden vuoksi. Käyttämällä pienempää, tarkkaan hienosäädettyä mallia, joka on erityisesti suunniteltu referenssiratkaisuun, ReALM välttää nämä ongelmat ja mahdollistaa tehokkaan laitteella tapahtuvan prosessoinnin.
Lisäksi ReALM:n modulaarinen arkkitehtuuri mahdollistaa saumattoman integroinnin olemassa oleviin entiteettien tunnistus- ja tehtävien suorituskomponentteihin keskustelevaan AI‑putkeen. Sen sijaan end-to-end -malli vaatisi merkittäviä muutoksia koko putkeen, mikä tekee sen käyttöönotosta todellisissa järjestelmissä haastavampaa.
Skaalautuvuus uusiin entiteettityyppeihin
Yksi ReALM:n keskeisistä vahvuuksista on sen skaalautuvuus uusiin entiteettityyppeihin. Toisin kuin aiemmat putkitetut lähestymistavat, kuten MARRS, jotka perustuivat manuaalisesti määriteltyyn tyyppikohtaiseen logiikkaan, ReALM:n LLM-pohjainen lähestymistapa voi helposti yleistää näkemättömiin toimialoihin.
Tutkijat osoittavat tämän edun arvioimalla ReALM:n näkemättömään “alarm”‑entiteettityyppiin. Vaikuttavasti ReALM vastaa GPT‑4:n zero-shot -suorituskykyä tarkasti ratkaistessaan kyselyitä kuten “Sammuta se, joka muistuttaa minua hakemaan didi” oikeaan hälytysentiteettiin. Tämä havainnollistaa mallin kykyä hyödyntää kielenymmärryskykyjään käsitellä uusia entiteettityyppejä ilman erillistä koulutusdataa.
Alla oleva taulukko esittää suorituskykyvertailun ReALM:n ja GPT‑4:n välillä näkemättömällä “alarm”‑aineistolla, korostaen ReALM:n vahvaa zero-shot -yleistämiskykyä:

Tulevaisuuden mahdollisuudet ja rajoitukset
Vaikka ReALM tuo merkittävää edistystä tärkeisiin osa-alueisiin, kuten referenssiratkaisuun keskustelevalle AI:lle, tutkimusryhmä huomautti muutamista rajoituksista, jotka on syytä ymmärtää.
Järjestelmän yksi merkittävä haittapuoli on kuitenkin se, että 2‑D‑näyttöasettelun muuntaminen 1‑D‑tekstuaaliseen esitykseen aiheuttaa monimutkaisten spatiaalisten yksityiskohtien menetyksen. Tiimi ehdotti kehittyneempien koodausstrategioiden käyttöä, kuten näytön komponenttien esittämistä ruudukkomaisella tavalla, jotta suhteelliset sijainnit pysyvät tarkempina.
Toinen mahdollinen parannus tulevaisuudessa on vahvistaa ReALM:n kykyä käsitellä monimutkaisempia ja monipuolisempia viittauksia, mukaan lukien ne, jotka sisältävät aikaisia tai hierarkkisia yhteyksiä entiteettien välillä.
Näistä rajoituksista huolimatta ReALM:n vaikuttava suorituskyky ja skaalautuva suunnittelu tekevät siitä erittäin lupaavan perustan jatkotutkimukselle ja kehitykselle keskustelun AI‑alueella.
Päätelmät
ReALM:n kyky yhdistää tekstisyöte ja visuaalinen konteksti raivaa tietä intuitiivisemmille ja kontekstitietoisemmille käyttöliittymille. LLM‑insinöörit ja kehittäjät pystyvät luomaan AI‑järjestelmiä, jotka todella ymmärtävät ja vastaavat käyttäjien aikomuksiin, vaikka ne käsittelevätkin monimutkaisia näytöllä olevia elementtejä.
Puhdist teknisestä näkökulmasta ReALM:n modulaarinen arkkitehtuuri ja laitteella tapahtuvat prosessointimahdollisuudet ovat erityisen arvokkaita, koska ne eivät ainoastaan ratkaise käyttäjän yksityisyys- ja viiveongelmia, vaan myös asettavat ennakkotapauksen skaalautuvammille, tehokkaammille ja integroidummille AI‑järjestelmille.
Yksinkertaisesti sanottuna ReALM:n menestys monimutkaisten käyttötapausten käsittelyssä ja sen kyky yleistää uusiin entiteettityyppeihin osoittaa, että käsityksemme siitä, mitä keskusteleva AI tällä hetkellä pystyy, on täysin muuttunut. Tämä voi nopeuttaa melko pysähtynyttä AI:n käyttöönottoa eri toimialoilla, kuten asiakaspalvelussa, verkkokaupassa, terveydenhuollossa ja koulutuksessa.












