Kunstmatige intelligentie

Apple beweert dat ReALM GPT-4 overtreft in mogelijkheden

mm
Voeg Securities.io toe aan je voorkeursbronnen op Google
Toelichting: Securities.io kan een vergoeding ontvangen wanneer u links naar beoordeelde producten gebruikt. Dit beïnvloedt onze redactionele beoordelingen niet. Wij zijn geen geregistreerd beleggingsadviseur; dit is geen beleggingsadvies. Lees onze affiliateverklaring.
Apple ReALM

Claude 3 Opus recently verwijderde GPT 4 als het meest geavanceerde LLM. Ondertussen onthulden onderzoekers van Apple (AAPL ) ReALM, kort nadat het nieuws dat Google’s Gemini de iPhone aandrijft, de krantenkoppen haalde. Het onderzoeksrapport, getiteld “ReALM: Reference Resolution As Language Modeling,” prijst het als een geavanceerd AI‑systeem dat belooft de manier waarop spraakassistenten gebruikersvragen begrijpen en beantwoorden te herdefiniëren. 

Het verschil tussen ReALM en andere systemen ligt in de naadloze integratie van referentie‑resolutie in de structuur van taalbegrip. Dit is een innovatieve benadering gezien het huidige ontwerp van op grote taalmodellen gebaseerde systemen, en het helpt het begrip van context door het model te verbeteren terwijl het tevens een nieuwe norm stelt voor interactie tussen AI en grafische gebruikersinterfaces. 

Op basis van de onderzoek resultaten is het bedoeld om LLM‑engineers en productmanagers van AI‑tools te helpen meer intuïtieve en contextbewuste gebruikersinteracties te realiseren. ReALM vergemakkelijkt bovendien de integratie van tekstuele invoer met visuele context, waardoor het potentieel voor het verbeteren van digitale assistentvaardigheden in tal van toepassingen wordt vergroot.

ReALM’s innovatieve benadering van NLP-referentie‑resolutie

Alle NLP‑systemen vertrouwen op “referentie‑resolutie”, een proces om ambiguë maar contextuele verwijzingen zoals voornaamwoorden of indirecte beschrijvingen, bijvoorbeeld “they” of “that”, te identificeren en te koppelen aan de juiste entiteiten binnen een gesprek of visuele context om coherente gebruikersinteracties te behouden.

Traditionele AI‑systemen vertrouwen op regelgebaseerde methoden of heuristieken voor referentie‑resolutie, wat niet de gewenste resultaten oplevert bij het vastleggen van de volledige complexiteit van natuurlijke taal. Daardoor is visuele context, zoals entiteiten op het scherm, moeilijk te integreren in de resolutie met deze methoden. Spraakassistenten zoals Siri vallen ook ten prooi aan dezelfde beperkingen die ReALM aanpakt door het te behandelen als een taalmodelleerprobleem. 

ReALM maakt gebruik van LLM’s om ambiguë verwijzingen binnen de bredere context van het gesprek te begrijpen en op te lossen, in plaats van regels of heuristieken te gebruiken. Wanneer visuele context betrokken is, reconstrueert het het scherm van het apparaat met tekstuele representaties en registreert het ruimtelijke verbindingen tussen componenten op het scherm. 

Onder leiding van Joel Ruben Antony Moniz verklaart het onderzoeksteam:

“Voor zover wij weten, is dit het eerste werk dat een Large Language Model gebruikt dat erop gericht is context van een scherm te coderen.”

Resultaat? Door ReALM aangedreven spraakassistenten kunnen vragen begrijpen zoals “Tik op de knop in de rechterbovenhoek” en “Open het tweede artikel in de lijst”, waar standaard AI‑systemen moeite mee hebben.

Dit maakt de referentie‑resolutiemethode van ReALM efficiënter en ideaal voor verwerking op het apparaat, omdat het referenties lokaal op het apparaat kan oplossen, in tegenstelling tot cloud‑gebaseerde AI‑systemen die voortdurende datatransmissie vereisen. Hierdoor is het beter geschikt voor Siri dankzij verbeterde privacy, lagere latentie en offline werking.

Klik hier voor een lijst van de vijf beste ChatGPT‑extensies.

Datasetverzameling en evaluatie

Het onderzoeksteam van Apple stelde een diverse dataset samen die conversationele, on‑screen en synthetische data omvat, om grondig de capaciteit van ReALM te beoordelen om de complexiteit van gebruikersinteracties in de echte wereld te doorgronden in vergelijking met alternatieven. Om dit te doen, stelde het team een diverse dataset samen die conversationele, on‑screen en synthetische data omvat.

De conversationele data werd gegenereerd door crowd‑workers afbeeldingen met synthetische lijsten te tonen en hen te vragen duidelijke vragen in te dienen die betrekking hebben op specifieke elementen in die lijsten. De on‑screen dataset onderging een tweefasig annotatieproces dat verzekerde dat het model de complexiteit van echte webpagina’s aankan. Dit proces omvatte het classificeren van de zichtbare objecten, het genereren van vragen, en het leggen van verbanden tussen de vragen en de entiteiten waarnaar ze verwijzen.

Indrukwekkende prestatie‑resultaten

De evaluatieresultaten tonen de opmerkelijke prestaties van ReALM over alle datasets. Vergeleken met MARRS, een eerder state‑of‑the‑art referentie‑resolutiesysteem, behaalt ReALM aanzienlijke verbeteringen in nauwkeurigheid. Opmerkelijk is dat zelfs het kleinste ReALM‑model absolute winsten van meer dan 5 % behaalt op de uitdagende on‑screen dataset, wat zijn vermogen aantoont om referenties in complexe visuele contexten effectief te begrijpen en op te lossen.

Om de mogelijkheden van ReALM verder te beoordelen, benchmarkten de onderzoekers het tegen de GPT‑3.5‑ en GPT‑4‑modellen van OpenAI. Indrukwekkend presteert het kleinste ReALM‑model op gelijke hoogte met GPT‑4, ondanks dat het orders van grootte minder parameters heeft. Naarmate de modelgrootte toeneemt, blijft de prestatie van ReALM verbeteren, waarbij de grotere modellen GPT‑4 aanzienlijk overtreffen op de geëvalueerde datasets.

De onderstaande tabel geeft een samenvatting van de prestatie‑resultaten weer, waarbij de superioriteit van ReALM ten opzichte van bestaande benaderingen en zijn concurrentievermogen met state‑of‑the‑art taalmodellen wordt benadrukt.

Model Accuracy for Different Datasets

De sleutel tot succes: optimale schermcodering

Zoals duidelijk is, is de geoptimaliseerde schermcodering van ReALM een cruciale factor die bijdraagt aan de indrukwekkende prestaties. Dit wordt verder versterkt door het feit dat onderzoekers verschillende strategieën hebben onderzocht voordat ze bij het uiteindelijke algoritme kwamen, dat zich als het meest effectief heeft bewezen.

Een van de eerste pogingen omvatte het clusteren van scherm‑elementen en het opnemen van alle andere elementen in de context van elke entiteit. Dit leidde echter tot een snelle toename van de promptlengte naarmate het aantal on‑screen entiteiten toenam, waardoor het onpraktisch werd voor toepassingen in de echte wereld.

Een andere benadering betrof het taggen van entiteiten in de tekstuele scherm‑parse, maar deze apart van de hoofdcontext te leveren. Hoewel deze methode veelbelovend leek, ontdekten de onderzoekers dat het direct injecteren van de tags in de parse zelf de beste resultaten opleverde.

De uiteindelijke “injected on-screen encoding”‑benadering, zoals beschreven in het artikel, werkt door de centra van scherm‑elementen van boven naar beneden en vervolgens van links naar rechts te sorteren. Elementen binnen een gespecificeerde verticale marge worden gegroepeerd op dezelfde “lijn” in de tekstuele representatie, en elementen op dezelfde lijn worden gescheiden door tabs. Dit slimme coderingsschema stelt ReALM in staat om de 2D‑schermlay-out te benaderen in een 1D‑tekstformaat, waardoor het model de ruimtelijke relaties tussen entiteiten effectief kan begrijpen.

Ablatie‑experimenten uitgevoerd door de onderzoekers bevestigden de superioriteit van deze geoptimaliseerde coderingsbenadering, zoals weergegeven in de onderstaande figuur:

Performance improvements with each encoding experiment

Complexe use‑cases afhandelen

Het artikel biedt verschillende kwalitatieve voorbeelden die de capaciteit van ReALM tonen om complexe use‑cases af te handelen die diverse vormen van redeneren vereisen, waaronder semantisch begrip, samenvatting, wereldkennis en gezond verstand.

In een interessant voorbeeld gedeeld door het team, lost ReALM de vraag “Bel het avondnummer” correct op naar het telefoonnummer dat onder “17:00 – 21:00” staat, wanneer het een scherm krijgt dat zowel ochtend‑ als avondcontactinformatie toont. Hoewel dit logisch klinkt, is dit een indrukwekkende demonstratie van capaciteiten omdat ReALM de betekenis van “avond” succesvol begreep en deze aan de juiste tijdsperiode koppelde, iets wat bij andere AI‑systemen nog niet is gerealiseerd.

Een andere invoer­voorbeeld bevatte een scherm met belastingdeadlines, en de modus identificeerde succesvol de indieningsdatum in april als de relevante deadline toen gevraagd werd om een herinnering in te stellen voor het afdrukken van documenten vóór de belastingvervaldatum.

Deze kwalitatieve voorbeelden bevestigen de observaties over de veelzijdigheid van ReALM en het potentieel om een breed scala aan scenario’s uit de echte wereld aan te kunnen die een diep taalbegrip en redeneercapaciteiten vereisen.

Voordelen ten opzichte van end‑to‑end benaderingen

Hoewel end‑to‑end benaderingen die uitsluitend op enorme LLM’s vertrouwen veelbelovende resultaten hebben laten zien in diverse taalbegripstaken, benadrukken de onderzoekers verschillende voordelen van de architectuur van ReALM:

Het uitvoeren van een volledig end‑to‑end model op het apparaat omwille van latentie‑ en privacyredenen zou onhaalbaar zijn met huidige modellen vanwege reken‑ en geheugenbeperkingen. Door een kleiner, fijn afgestemd model te gebruiken dat specifiek is ontworpen voor referentie‑resolutie, vermijdt ReALM deze problemen en maakt het efficiënte verwerking op het apparaat mogelijk.

Bovendien maakt de modulaire architectuur van ReALM naadloze integratie mogelijk met bestaande entiteitsdetectie‑ en taakvoltooiingscomponenten in conversationele AI‑pijplijnen. Daarentegen zou een end‑to‑end model aanzienlijke wijzigingen in de volledige pijplijn vereisen, waardoor adoptie in real‑world systemen moeilijker wordt.

Schaalbaarheid naar nieuwe entiteitstypen

Een van de belangrijkste sterktes van ReALM is de schaalbaarheid naar nieuwe entiteitstypen. In tegenstelling tot eerdere gepijplijnde benaderingen zoals MARRS, die vertrouwden op handmatig gedefinieerde type‑specifieke logica, kan de LLM‑gebaseerde aanpak van ReALM gemakkelijk generaliseren naar ongeziene domeinen.

De onderzoekers tonen dit voordeel aan door ReALM te evalueren op een ongeziene “alarm”‑entiteitstype. Indrukwekkend evenaart ReALM de zero‑shot prestatie van GPT‑4 bij het nauwkeurig oplossen van vragen zoals “Schakel de alarm uit die me herinnert om didi op te halen” naar de relevante alarm‑entiteit. Dit toont het vermogen van het model om zijn taalbegripcapaciteiten te benutten om nieuwe entiteitstypen af te handelen zonder expliciete trainingsdata.

De onderstaande tabel toont de prestatie‑vergelijking tussen ReALM en GPT‑4 op de ongeziene “alarm”‑dataset, waarbij de sterke zero‑shot generalisatie‑vaardigheden van ReALM worden benadrukt:

Performance on Unseen Alarm Dataset

Toekomstige mogelijkheden en beperkingen

Hoewel ReALM aanzienlijke vooruitgang boekt in belangrijke aspecten zoals referentie‑resolutie voor conversationele AI, merkte het onderzoeksteam een aantal beperkingen op die het waard zijn om te begrijpen.

Een belangrijk nadeel van het systeem is echter dat het omzetten van een 2D‑schermlay-out naar een 1D‑tekstuele representatie leidt tot verlies van ingewikkelde ruimtelijke details. Het team stelde het gebruik van meer geavanceerde coderingsstrategieën voor, zoals het weergeven van de schermcomponenten in een raster‑achtige opzet, om meer nauwkeurige relatieve posities te behouden.

Een andere mogelijke verbetering voor de toekomst is het versterken van ReALM’s vermogen om meer ingewikkelde en diverse verwijzingen af te handelen, inclusief die met temporele of hiërarchische associaties tussen entiteiten.

Ondanks deze beperkingen maken ReALM’s indrukwekkende prestaties en schaalbare ontwerp het tot een zeer veelbelovende basis voor verder onderzoek en ontwikkeling op het gebied van conversationele AI.

Conclusieve gedachten

ReALM’s vermogen om de kloof tussen tekstuele invoer en visuele context te overbruggen, zal de weg vrijmaken voor meer intuïtieve en context‑bewuste gebruikersinterfaces. LLM‑engineers en ontwikkelaars zullen AI‑systemen kunnen creëren die echt de intenties van gebruikers begrijpen en erop reageren, zelfs bij complexe on‑screen elementen.

Vanuit een puur technisch perspectief zijn ReALM’s modulaire architectuur en on‑device verwerkingsmogelijkheden bijzonder waardevol, omdat ze niet alleen privacy‑ en latentieproblemen van gebruikers aanpakken, maar ook een precedent scheppen voor meer schaalbare, efficiënte, geïntegreerde AI‑systemen.

In eenvoudige bewoordingen signaleert ReALM’s succes bij het afhandelen van complexe use‑cases en het vermogen om te generaliseren naar nieuwe entiteitstypen dat ons begrip van wat momenteel mogelijk is met conversationele AI volledig is veranderd. Het zou de enigszins stagnerende adoptiesnelheid van AI in sectoren variërend van klantenservice en e‑commerce tot gezondheidszorg en onderwijs kunnen versnellen.

Klik hier om alles te leren over investeren in kunstmatige intelligentie.

Gaurav is in 2017 begonnen met het verhandelen van cryptocurrencies en is sindsdien verliefd geworden op de crypto-ruimte. Zijn interesse in alles wat met crypto te maken heeft, heeft hem ertoe gebracht een schrijver te worden die zich specialiseert in cryptocurrencies en blockchain. Al snel vond hij zichzelf werken met crypto-bedrijven en media-uitzendingskanalen. Hij is ook een grote fan van Batman.