Yapay Zekâ
Apple, ReALM’inin Yeteneklerde GPT-4’ten Üstün Olduğunu İddia Ediyor

Claude 3 Opus yakın zamanda GPT 4’ü tahtından indirdi en gelişmiş LLM olarak. Bu arada, Apple’ (AAPL ) daki araştırmacılar ReALM’i duyurdu, kısa bir süre sonra haber Google’ın Gemini’sinin iPhone’u güçlendirdiği haber başlık yaptı. Araştırma makalesi, başlığı \”ReALM: Reference Resolution As Language Modeling\” olan, bunu ses asistanlarının kullanıcı sorgularını anlama ve yanıtlamasını yeniden tanımlamayı vaat eden son teknoloji bir AI sistemi olarak tanıtıyor.
ReALM ve diğer sistemler arasındaki fark, referans çözümlemesini dil anlayışının dokusuna sorunsuz bir şekilde işleyişinde yatar. Bu, büyük dil modeli tabanlı sistemlerin mevcut tasarımı göz önüne alındığında yenilikçi bir yaklaşımdır ve modelin bağlam anlayışını artırmaya yardımcı olurken aynı zamanda AI ve grafik kullanıcı arayüzleri arasındaki etkileşim için yeni bir ölçüt belirler.
Araştırma sonuçlarına dayanarak, LLM mühendislerine ve AI araç ürün yöneticilerine daha sezgisel ve bağlam farkındalıklı kullanıcı etkileşimleri sağlamada yardımcı olması hedefleniyor. ReALM ayrıca metin girdisinin görsel bağlamla entegrasyonunu kolaylaştırarak birçok uygulamada dijital asistan yeteneklerini geliştirme potansiyelini genişletiyor.
ReALM’ın NLP Referans Çözümlemesine Yenilikçi Yaklaşımı
Tüm NLP sistemleri “referans çözümlemesi”ne dayanır; bu süreç, zamirler veya dolaylı tanımlamalar gibi belirsiz ama bağlamsal referansları (örneğin “they” veya “that”) bir konuşma ya da görsel bağlam içinde doğru varlıklarla ilişkilendirerek tutarlı kullanıcı etkileşimlerini sürdürmeyi sağlar.
Geleneksel AI sistemleri referans çözümlemesi için kural tabanlı yöntemler veya sezgisel yaklaşımlara dayanır; bu, doğal dilin tam karmaşıklığını yakalamada istenen sonuçları vermez. Sonuç olarak, ekrandaki varlıklar gibi görsel bağlamı bu yöntemlerle çözümlemeye entegre etmek zor olmuştur. Ses asistanları gibi Siri de ReALM’in bir dil modelleme problemi olarak ele almasıyla çözdüğü aynı sınırlamalara maruz kalır.
ReALM, kurallar veya sezgisel yaklaşımlar yerine, LLM’leri kullanarak konuşmanın daha geniş bağlamı içinde belirsiz referansları anlamak ve çözmek için kullanır. Görsel bağlam söz konusu olduğunda, cihazın ekranını metinsel temsillerle yeniden oluşturur ve ekrandaki bileşenler arasındaki uzamsal bağlantıları kaydeder.
Joel Ruben Antony Moniz liderliğindeki araştırmacı ekibi şöyle belirtiyor:
“Bilgi ve araştırmalarımıza göre, bu, bir Ekrandan bağlam kodlamayı amaçlayan Büyük Dil Modeli kullanan ilk çalışma.”
Sonuç? ReALM destekli ses asistanları, standart AI sistemlerinin zorlandığı “Üst sağ köşedeki düğmeye dokun” ve “Listede ikinci makaleyi aç” gibi sorguları anlayabilir.
Bu, ReALM’in referans çözümleme yöntemini daha verimli ve cihaz içinde işleme için ideal kılar; çünkü bulut tabanlı AI sistemlerinin sürekli veri iletimine ihtiyaç duymadığı gibi referansları cihazda yerel olarak çözebilir. Bu, gizlilik, gecikme ve çevrim dışı çalışma açısından Siri için daha uygun olmasını sağlar.
En iyi beş ChatGPT uzantısının listesi için buraya tıklayın.
Veri Kümesi Toplama ve Değerlendirme
Apple araştırma ekibi, ReALM’in gerçek dünya kullanıcı etkileşimlerinin karmaşıklıklarını alternatifleriyle karşılaştırarak değerlendirmek için konuşma, ekrandaki ve sentetik verileri içeren çeşitli bir veri kümesi oluşturdu. Bunu yapmak için ekip, konuşma, ekrandaki ve sentetik verileri içeren çeşitli bir veri kümesi oluşturdu.
Konuşma verileri, kalabalık çalışanlara sentetik listeler içeren resimler gösterilerek ve bu listelerdeki belirli öğelerle ilgili net sorgular göndermeleri istenerek oluşturuldu. Ekran veri kümesi, modelin gerçek dünya web sayfalarının karmaşıklığını yönetebileceğini sağlamak için iki aşamalı bir etiketleme sürecine tabi tutuldu. Bu süreç, görünen nesnelerin sınıflandırılmasını, sorguların üretilmesini ve sorgular ile onlara atıfta bulunan varlıklar arasındaki bağlantıların kurulmasını içeriyordu.
Etkileyici Performans Sonuçları
Değerlendirme sonuçları, ReALM’in tüm veri kümeleri üzerindeki olağanüstü performansını gösteriyor. Önceki en iyi referans çözümleme sistemi MARRS ile karşılaştırıldığında, ReALM doğrulukta önemli iyileşmeler sağlıyor. Özellikle, en küçük ReALM modeli bile zorlu ekran veri kümesinde %5’in üzerinde mutlak kazanç elde ederek karmaşık görsel bağlamlarda referansları etkili bir şekilde anlama ve çözme yeteneğini gösteriyor.
ReALM’in yeteneklerini daha da değerlendirmek için araştırmacılar, onu OpenAI’nin GPT-3.5 ve GPT-4 modelleriyle karşılaştırdı. Etkileyici bir şekilde, ReALM’in en küçük modeli, parametre sayısı çok daha az olmasına rağmen GPT-4 ile aynı seviyede performans gösteriyor. Model boyutu arttıkça, ReALM’in performansı artmaya devam ediyor ve büyük modeller, değerlendirilen veri kümelerinde GPT-4’ü önemli ölçüde geride bırakıyor.
Aşağıdaki tablo, performans sonuçlarının bir özetini sunarak ReALM’in mevcut yaklaşımlara göre üstünlüğünü ve en son dil modelleriyle rekabet gücünü vurguluyor.

Başarının Anahtarı: Optimum Ekran Kodlaması
Açıkça görüldüğü gibi, ReALM’in optimize edilmiş ekran kodlaması yaklaşımı, etkileyici performansına katkıda bulunan kritik bir faktördür. Ayrıca, araştırmacıların en etkili olduğu kanıtlanan nihai algoritmaya ulaşmadan önce çeşitli stratejileri araştırdığı gerçeğini de ekler.
İlk denemelerden biri, ekran öğelerini kümelendirmeyi ve her varlığın bağlamına diğer tüm öğeleri eklemeyi içeriyordu. Ancak, bu, ekrandaki varlık sayısı arttıkça istem uzunluklarının hızla uzamasına yol açtı ve gerçek dünya uygulamaları için oldukça pratik olmayan bir durum yarattı.
Başka bir yaklaşım, metinsel ekran ayrıştırmasında varlıkları etiketlemeyi ve bunları ana bağlamdan ayrı olarak sunmayı içeriyordu. Bu yöntem umut verici görünse de, araştırmacılar etiketleri doğrudan ayrıştırmaya enjekte etmenin en iyi sonuçları verdiğini buldu.
Makaledeki açıklamaya göre, son “enjekte edilmiş ekran kodlaması” yaklaşımı, ekran öğelerinin merkezlerini üstten alta ve ardından soldan sağa sıralayarak çalışır. Belirli bir dikey marj içinde bulunan öğeler, metinsel temsilde aynı “satır”da gruplanır ve aynı satırdaki öğeler sekmelerle ayrılır. Bu akıllı kodlama şeması, ReALM’in 2D ekran düzenini 1D metinsel formatta yaklaşık olarak temsil etmesini sağlar ve modelin varlıklar arasındaki uzamsal ilişkileri etkili bir şekilde anlamasını mümkün kılar.
Araştırmacılar tarafından yürütülen ablasyon deneyleri, aşağıdaki şekilde gösterildiği gibi, bu optimize edilmiş kodlama yaklaşımının üstünlüğünü doğruladı:

Karmaşık Kullanım Durumlarını Ele Alma
Makale, ReALM’in anlamsal anlama, özetleme, dünya bilgisi ve sağduyu akıl yürütmesi gibi çeşitli akıl yürütme biçimlerini gerektiren karmaşık kullanım durumlarını ele alma yeteneğini gösteren birkaç niteliksel örnek sunuyor.
Ekip tarafından paylaşılan ilginç bir örnekte, ReALM, sabah ve akşam iletişim bilgilerini gösteren bir ekran verildiğinde “Akşam numarasını ara” sorgusunu “17:00 – 21:00” altında listelenen telefon numarasına doğru bir şekilde çözümlüyor. Mantıksal bir sonuç gibi görünse de, bu, ReALM’in “akşam” anlamını başarıyla anlayıp uygun zaman aralığına eşleştirmesiyle diğer AI sistemlerinde henüz gerçekleşmemiş etkileyici bir yetenek gösterimidir.
Başka bir giriş örneğinde, vergi son tarihlerini gösteren bir ekran bulunuyordu ve model, vergi son tarihinden önce belge yazdırmak için bir hatırlatıcı ayarlamamız istendiğinde ilgili son tarih olarak Nisan dosyalama tarihini başarıyla belirledi.
Bu niteliksel örnekler, ReALM’in çok yönlülüğü ve derin dil anlayışı ve akıl yürütme yetenekleri gerektiren geniş bir gerçek dünya senaryosu yelpazesini ele alma potansiyeli üzerine yapılan gözlemleri pekiştiriyor.
Uçtan Uca Yaklaşımlara Göre Avantajlar
Yalnızca büyük LLM’lere dayanan uçtan uca yaklaşımlar çeşitli dil anlama görevlerinde umut verici sonuçlar gösterse de, araştırmacılar ReALM mimarisinin birkaç avantajını vurguluyorlar:
Gecikme ve gizlilik nedenleriyle tam bir uçtan uca modeli cihazda çalıştırmak, mevcut modellerin hesaplama ve bellek kısıtlamaları nedeniyle mümkün değildir. Referans çözümlemesi için özel olarak tasarlanmış daha küçük, ince ayarlı bir model kullanarak ReALM bu sorunlardan kaçınır ve verimli cihaz içi işleme olanak tanır.
Ayrıca, ReALM’in modüler mimarisi, konuşma AI akışlarındaki mevcut varlık tespiti ve görev tamamlama bileşenleriyle sorunsuz entegrasyona izin verir. Buna karşılık, uçtan uca bir model tüm akışta büyük değişiklikler gerektirir ve gerçek dünya sistemlerinde benimsenmesini zorlaştırır.
Yeni Varlık Türlerine Ölçeklenebilirlik
ReALM’in temel güçlü yönlerinden biri, yeni varlık türlerine ölçeklenebilirliğidir. Manuel olarak tanımlanmış tür‑spesifik mantığa dayanan önceki MARRS gibi ardışık yaklaşımların aksine, ReALM’in LLM‑tabanlı yaklaşımı görülmemiş alanlara kolayca genelleme yapabilir.
Araştırmacılar, bu avantajı görülmemiş bir “alarm” varlık türü üzerinde ReALM’i değerlendirerek gösteriyorlar. Etkileyici bir şekilde, ReALM, “Beni didi almaya hatırlatan alarmı kapat” gibi sorguları ilgili alarm varlığına doğru bir şekilde çözerken GPT-4’ün sıfır‑atış performansına eşdeğer sonuçlar elde ediyor. Bu, modelin yeni varlık türlerini açık eğitim verisi gerektirmeden dil anlama yeteneklerini kullanarak ele alabilme kapasitesini gösteriyor.
Aşağıdaki tablo, görülmemiş “alarm” veri kümesinde ReALM ile GPT-4 arasındaki performans karşılaştırmasını sunarak ReALM’in güçlü sıfır‑atış genelleme yeteneklerini vurguluyor:

Gelecek Olanakları ve Sınırlamalar
ReALM, konuşma AI için referans çözümlemesi gibi önemli alanlarda önemli ilerlemeler sağlasa da, araştırma ekibi anlaşılması gereken birkaç sınırlamaya değindi.
Ancak sistemin büyük bir dezavantajı, 2D ekran düzenini 1D metinsel temsile dönüştürmenin karmaşık uzamsal detayların kaybolmasına yol açmasıdır. Ekip, daha doğru göreceli konumları korumak için ekran bileşenlerini ızgara benzeri bir şekilde tasvir eden daha gelişmiş kodlama stratejileri kullanılmasını önerdi.
Gelecek için bir diğer potansiyel iyileştirme, zamansal veya hiyerarşik ilişkileri içeren referanslar gibi daha karmaşık ve çeşitli referansları ele alma yeteneğini artırmaktır.
Bu sınırlamalara rağmen, ReALM’in etkileyici performansı ve ölçeklenebilir tasarımı, konuşma AI alanında daha ileri araştırma ve geliştirme için çok umut verici bir temel oluşturuyor.
Sonuç Düşünceleri
ReALM’in metin girdisi ile görsel bağlam arasındaki boşluğu kapatma yeteneği, daha sezgisel ve bağlam farkındalıklı kullanıcı arayüzlerinin yolunu açacak. LLM mühendisleri ve geliştiriciler, karmaşık ekran öğeleriyle bile kullanıcı niyetlerini gerçekten anlayıp yanıtlayan AI sistemleri oluşturabilecek.
Tamamen teknik bir bakış açısından, ReALM’in modüler mimarisi ve cihaz içinde işleme yetenekleri özellikle değerlidir; çünkü yalnızca kullanıcı gizliliği ve gecikme sorunlarını çözmekle kalmaz, aynı zamanda daha ölçeklenebilir, verimli ve bütünleşik AI sistemleri için bir öncül oluşturur.
Basit bir dille, ReALM’in karmaşık kullanım durumlarını ele alma başarısı ve yeni varlık türlerine genelleme yeteneği, konuşma AI ile şu anda nelerin mümkün olduğuna dair anlayışımızın tamamen değiştiğini gösteriyor. Bu, müşteri hizmetleri ve e-ticaretten sağlık hizmetleri ve eğitime kadar çeşitli sektörlerde bir süredir durağan olan AI benimseme oranını hızlandırabilir.
Yapay zekaya yatırım hakkında her şeyi öğrenmek için buraya tıklayın.












