Artipisyal na Intelihensiya
Inihahabol ng Apple na Higit ang ReALM nito kaysa GPT-4 sa Kakayahan

Kamakailan lamang ang Claude 3 Opus na nagpatalsik sa GPT 4 bilang pinaka-advanced na LLM. Samantala, inilunsad ng mga mananaliksik sa Apple (AAPL ) ang ReALM, ilang sandali matapos ang balita na ang Gemini ng Google ay nagpapatakbo ng iPhone na naging tampok sa mga balita. Ang papel pananaliksik, na pinamagatang “ReALM: Reference Resolution As Language Modeling,” ay naglalarawan dito bilang isang makabagong AI system na nangangakong muling tukuyin kung paano nauunawaan at tumutugon ang mga voice assistant sa mga query ng gumagamit.
Ang pagkakaiba ng ReALM sa iba pang mga sistema ay nasa walang putol nitong pagsasama ng reference resolution sa balangkas ng pag-unawa sa wika. Ito ay isang makabagong pamamaraan batay sa kasalukuyang disenyo ng mga sistemang nakabatay sa malalaking language model, at tumutulong ito na mapahusay ang pag-unawa ng modelo sa konteksto habang nagtatakda ng bagong pamantayan para sa pakikipag-ugnayan sa pagitan ng AI at mga graphical user interface.
Based on the pananaliksik na kinalabasan, ito ay nakatakdang tulungan ang mga LLM engineer at mga product manager ng AI tool na makamit ang mas intuitive at context-aware na pakikipag-ugnayan sa mga gumagamit. Pinapadali rin ng ReALM ang pagsasama ng tekstuwal na input sa visual na konteksto, kaya pinapalawak ang potensyal para mapabuti ang mga kakayahan ng digital assistant sa maraming aplikasyon.
Inobatibong Lapit ng ReALM sa NLP Reference Resolution
Lahat ng NLP system ay umaasa sa “reference resolution,” isang proseso upang tukuyin at iugnay ang mga malabo ngunit kontekstwal na sanggunian tulad ng mga panghalip o di-tuwirang paglalarawan, hal., “sila” o “iyon,” sa tamang mga entidad sa loob ng isang pag-uusap o visual na konteksto upang mapanatili ang magkakaugnay na pakikipag-ugnayan ng gumagamit.
Ang tradisyonal na AI system ay umaasa sa mga rule-based na pamamaraan o heuristics para sa reference resolution, na hindi nagbibigay ng ninanais na resulta pagdating sa pagkuha ng buong komplikasyon ng natural na wika. Bilang resulta, ang visual na konteksto, tulad ng mga entidad sa screen, ay naging mahirap isama sa resolution gamit ang mga pamamaraang ito. Voice assistant tulad ng Siri ay kapwa nahuhulog sa parehong mga limitasyon na tinutugunan ng ReALM sa pamamagitan ng pagtrato nito bilang isang problema sa language modeling.
Ginagamit ng ReALM ang mga LLM upang maunawaan at maresolba ang mga malabong sanggunian sa mas malawak na konteksto ng pag-uusap kumpara sa paggamit ng mga patakaran o heuristics. Kapag kasali ang visual na konteksto, binubuo muli nito ang screen ng device gamit ang tekstuwal na representasyon at itinatala ang mga espasyal na koneksyon sa pagitan ng mga komponenteng nasa screen.
Pinamumunuan ni Joel Ruben Antony Moniz, sinabi ng koponan ng mga mananaliksik:
“Sa aming kaalaman, ito ang unang gawa na gumagamit ng Large Language Model na naglalayong i-encode ang konteksto mula sa isang screen.”
Resulta? Ang mga voice assistant na pinapagana ng ReALM ay maaaring maunawaan ang mga query tulad ng “Pindutin ang button sa kanang itaas na sulok” at “Buksan ang ikalawang artikulo sa listahan,” na kung saan nahihirapan ang mga karaniwang AI system.
Ginagawa nitong mas epektibo at angkop para sa on-device processing ang method ng reference resolution ng ReALM dahil kaya nitong lutasin ang mga sanggunian nang lokal sa device, hindi tulad ng mga cloud-based na AI system na nangangailangan ng patuloy na transmisyon ng data. Dahil dito, mas angkop ito para sa Siri dahil sa pinahusay na privacy, latency, at offline na pag-andar.
I-click dito para sa listahan ng limang pinakamahusay na ChatGPT extension.
Pagkolekta ng Dataset at Pagsusuri
Ang pangkat ng pananaliksik ng Apple ay nagtipon ng isang magkakaibang dataset na sumasaklaw sa conversational, on-screen, at synthetic na data upang lubusang tasahin ang kakayahan ng ReALM na harapin ang mga komplikasyon ng totoong pakikipag-ugnayan ng gumagamit kumpara sa mga alternatibo nito. Upang magawa ito, nagtipon ang pangkat ng isang magkakaibang dataset na sumasaklaw sa conversational, on-screen, at synthetic na data.
Ang conversational data ay nilikha sa pamamagitan ng pagpapakita sa mga crowd worker ng mga larawan na naglalaman ng synthetic na listahan at paghingi sa kanila na magsumite ng malinaw na mga query na may kaugnayan sa tiyak na mga elemento sa loob ng mga listahang iyon. Ang on-screen dataset ay sumailalim sa isang dalawang-yugong proseso ng anotasyon na nagtiyak na kayang harapin ng modelo ang komplikasyon ng totoong web page. Kasama sa prosesong ito ang pag-uuri ng mga nakikitang object, pagbuo ng mga query, at pagtatatag ng mga koneksyon sa pagitan ng mga query at ng mga entidad na tinutukoy nila.
Kahanga-hangang Resulta ng Pagganap
Ipinapakita ng mga resulta ng pagsusuri ang kahanga-hangang pagganap ng ReALM sa lahat ng dataset. Kung ihahambing sa MARRS, isang naunang state-of-the-art na reference resolution system, nakakamit ng ReALM ang makabuluhang pagbuti sa katumpakan. Kapansin-pansin, kahit ang pinakamaliit na modelo ng ReALM ay nakakakuha ng ganap na pagtaas na higit sa 5% sa hamong on-screen dataset, na nagpapakita ng kakayahan nitong epektibong maunawaan at maresolba ang mga sanggunian sa komplikadong visual na konteksto.
Upang higit pang tasahin ang kakayahan ng ReALM, sinuri ito ng mga mananaliksik laban sa mga modelo ng OpenAI na GPT-3.5 at GPT-4. Kamangha-mangha, ang pinakamaliit na modelo ng ReALM ay tumatakbo nang kapantay ng GPT-4 kahit na may napakakaunting bilang ng mga parameter. Habang lumalaki ang sukat ng modelo, patuloy na bumubuti ang pagganap ng ReALM, kung saan ang mas malalaking modelo ay lubos na nalalampasan ang GPT-4 sa mga sinuring dataset.
Ang talahanayan sa ibaba ay naglalarawan ng buod ng mga resulta ng pagganap, na binibigyang-diin ang kahusayan ng ReALM kumpara sa umiiral na mga pamamaraan at ang kompetitibidad nito sa mga state-of-the-art na language model.

Ang Susi sa Tagumpay: Optimal na Pag-encode ng Screen
Tulad ng nakikita, ang pinahusay na paraan ng pag-encode ng screen ng ReALM ay isang kritikal na salik na nag-aambag sa kahanga-hangang pagganap nito. Idinadagdag pa rito ang katotohanang sinuri ng mga mananaliksik ang ilang estratehiya bago narating ang panghuling algoritmo, na napatunayang pinakaepektibo.
Isa sa mga unang pagsubok ay ang pag-cluster ng mga elemento ng screen at pagsasama ng lahat ng iba pang elemento sa konteksto ng bawat entidad. Gayunpaman, nagdulot ito ng mabilis na pagtaas ng haba ng prompt habang dumarami ang mga entidad sa screen, na nagiging hindi praktikal para sa mga totoong aplikasyon.
Ang isa pang pamamaraan ay ang pag-tag ng mga entidad sa tekstuwal na pag-parse ng screen ngunit ibinibigay ito nang hiwalay mula sa pangunahing konteksto. Bagaman mukhang maganda ang pamamaraang ito, natuklasan ng mga mananaliksik na ang direktang pag-inject ng mga tag sa mismong parse ay nagbigay ng pinakamahusay na resulta.
Ang huling “injected on-screen encoding” na pamamaraan, ayon sa paglalarawan sa papel, ay gumagana sa pamamagitan ng pagsasaayos ng mga sentro ng mga elemento ng screen mula itaas pababa at pagkatapos mula kaliwa pakanan. Ang mga elemento na nasa loob ng tinukoy na vertical na margin ay pinagsasama sa parehong “linya” sa tekstuwal na representasyon, at ang mga elemento sa parehong linya ay pinaghiwalay ng mga tab. Ang matalinong encoding scheme na ito ay nagpapahintulot sa ReALM na tantiyahin ang 2D layout ng screen sa isang 1D na tekstuwal na format, na nagbibigay-daan sa modelo na epektibong maunawaan ang mga espasyal na ugnayan sa pagitan ng mga entidad.
Kumpirmado ng mga ablation experiment na isinagawa ng mga mananaliksik ang kahusayan ng pinahusay na pamamaraan ng pag-encode, tulad ng ipinapakita sa larawan sa ibaba:

Pagharap sa mga Kumplikadong Kaso ng Paggamit
Nagbibigay ang papel ng ilang kwalitatibong halimbawa na nagpapakita ng kakayahan ng ReALM na harapin ang mga kumplikadong kaso ng paggamit na nangangailangan ng iba’t ibang anyo ng pangangatwiran, kabilang ang semantikong pag-unawa, pagsasama-sama, kaalaman sa mundo, at pangkaraniwang pangangatwiran.
Sa isang kawili-wiling halimbawa na ibinahagi ng koponan, tama na naresolba ng ReALM ang query na “Tumawag sa numero ng gabi” sa numero ng telepono na nakalista sa ilalim ng “5 PM – 9 PM” kapag pinakita ang screen na may parehong impormasyon ng umaga at gabi. Bagaman tila lohikal ang kinalabasan, ito ay isang kahanga-hangang pagpapakita ng kakayahan dahil matagumpay na naunawaan ng ReALM ang kahulugan ng “gabi” at inugnay ito sa tamang saklaw ng oras, na hindi pa nagaganap sa ibang AI system.
Isang iba pang halimbawa ng input ay nagpakita ng screen na may mga deadline ng buwis, at matagumpay na natukoy ng mode ang petsa ng pag-file sa Abril bilang kaukulang deadline nang hilingin itong magtakda ng paalala para i-print ang mga dokumento bago ang takdang petsa ng buwis.
Pinagtitibay ng mga kwalitatibong halimbawang ito ang mga obserbasyon tungkol sa pagiging versatile ng ReALM at potensyal nitong harapin ang malawak na hanay ng mga totoong senaryo na nangangailangan ng malalim na pag-unawa sa wika at kakayahan sa pangangatwiran.
Mga Kalamangan Kumpara sa End-to-End na Pamamaraan
Bagaman ang mga end-to-end na pamamaraan na umaasa lamang sa napakalalaking LLM ay nagpakita ng magagandang resulta sa iba’t ibang gawain ng pag-unawa sa wika, binigyang-diin ng mga mananaliksik ang ilang mga kalamangan ng arkitektura ng ReALM:
Ang pagpapatakbo ng buong end-to-end na modelo sa device para sa mga kadahilanang latency at privacy ay magiging hindi posible sa kasalukuyang mga modelo dahil sa mga limitasyon sa computation at memorya. Sa pamamagitan ng paggamit ng mas maliit, pinong-tuned na modelo na partikular na dinisenyo para sa reference resolution, iniiwasan ng ReALM ang mga isyung ito at nagbibigay-daan sa epektibong pagproseso sa device.
Higit pa rito, ang modular na arkitektura ng ReALM ay nagpapahintulot ng walang putol na integrasyon sa umiiral na mga komponent ng entity detection at task completion sa mga conversational AI pipeline. Sa kabaligtaran, ang isang end-to-end na modelo ay mangangailangan ng malalaking pagbabago sa buong pipeline, na nagpapahirap na gamitin ito sa mga totoong sistema.
Scalability sa Mga Bagong Uri ng Entidad
Isa sa mga pangunahing lakas ng ReALM ay ang scalability nito sa mga bagong uri ng entidad. Hindi tulad ng mga nakaraang pipelined na pamamaraan tulad ng MARRS, na umasa sa manu-manong tinukoy na type-specific na lohika, ang LLM-based na pamamaraan ng ReALM ay madaling mag-generalize sa mga hindi pa nakikitang domain.
Ipinakita ng mga mananaliksik ang kalamangan na ito sa pamamagitan ng pagsusuri sa ReALM sa isang hindi pa nakikitang uri ng entidad na “alarm”. Kamangha-mangha, ang ReALM ay tumutugma sa zero-shot na pagganap ng GPT-4 sa tumpak na pagresolba ng mga query tulad ng “Patayin ang nagpaalala sa akin na kunin si didi” sa kaukulang alarm na entidad. Ipinapakita nito ang kakayahan ng modelo na gamitin ang pag-unawa nito sa wika upang harapin ang mga bagong uri ng entidad nang hindi nangangailangan ng tahasang data para sa pagsasanay.
Ipinapakita ng talahanayan sa ibaba ang paghahambing ng pagganap sa pagitan ng ReALM at GPT-4 sa hindi pa nakikitang dataset na “alarm”, na binibigyang-diin ang malakas na kakayahan ng ReALM sa zero-shot generalization:

Mga Posibleng Hinaharap at Limitasyon
Bagaman nagdadala ang ReALM ng makabuluhang pag-unlad sa mahahalagang aspeto tulad ng reference resolution para sa conversational AI, binanggit ng pangkat ng pananaliksik ang ilang limitasyon na dapat maunawaan.
Isang pangunahing kahinaan ng sistema, gayunpaman, ay ang pag-convert ng 2D na layout ng screen sa 1D na tekstuwal na representasyon na nagreresulta sa pagkawala ng masalimuot na detalye ng espasyo. Iminungkahi ng pangkat ang paggamit ng mas advanced na mga estratehiya sa pag-encode, tulad ng pagpapakita ng mga komponent ng screen sa anyong grid, upang mapanatili ang mas tumpak na relatibong lokasyon.
Isa pang posibleng pagpapabuti para sa hinaharap ay ang pagpapalakas ng kakayahan ng ReALM na harapin ang mas masalimuot at magkakaibang sanggunian, kabilang ang mga sanggunian na may temporal o hierarchical na ugnayan sa pagitan ng mga entidad.
Sa kabila ng mga limitasyong ito, ang kahanga-hangang pagganap at scalable na disenyo ng ReALM ay ginagawa itong napakapanatag na pundasyon para sa karagdagang pag-aaral at pag-unlad sa larangan ng conversational AI.
Pangwakas na Kaisipan
Ang kakayahan ng ReALM na pag-ugnayin ang agwat sa pagitan ng tekstuwal na input at visual na konteksto ay magbubukas ng daan para sa mas intuitive at context-aware na mga user interface. Ang mga LLM engineer at developer ay makakalikha ng mga AI system na tunay na nauunawaan at tumutugon sa intensyon ng mga gumagamit, kahit na humaharap sa mga komplikadong elemento sa screen.
Mula sa purong teknikal na pananaw, ang modular na arkitektura ng ReALM at mga kakayahan sa pagproseso sa device ay partikular na mahalaga dahil hindi lamang nito tinutugunan ang mga isyu sa privacy at latency ng gumagamit kundi nagtatakda rin ng pamantayan para sa mas scalable, epektibo, at integrated na mga AI system.
Sa simpleng salita, ang tagumpay ng ReALM sa paghawak ng mga kumplikadong kaso ng paggamit at ang kakayahan nitong mag-generalize sa mga bagong uri ng entidad ay nagmumungkahi na ang ating pag-unawa sa kung ano ang posible ngayon sa conversational AI ay ganap na nabago. Maaaring mapabilis nito ang medyo matagal nang mabagal na pag-adopt ng AI sa mga industriya mula sa customer service at e-commerce hanggang sa healthcare at edukasyon.
I-click dito upang matutunan ang lahat tungkol sa pamumuhunan sa artificial intelligence.












