인공지능

Apple, ReALM이 GPT-4보다 뛰어난 성능을 제공한다고 주장

mm
Securities.io를 Google의 선호 소스에 추가
공개: Securities.io는 검토한 제품 링크 이용 시 보상을 받을 수 있습니다. 이는 편집 평가에 영향을 주지 않습니다. 당사는 등록된 투자 자문사가 아니며, 이는 투자 조언이 아닙니다. 제휴 공개를 확인하세요.
Apple ReALM

Claude 3 Opus가 최근 GPT 4를 제치고 가장 진보된 LLM으로 평가되었습니다. 한편, Apple의 연구원들은 Google의 Gemini이 iPhone을 구동한다는 뉴스가 헤드라인을 장식한 직후 ReALM을 공개했습니다. “ReALM: Reference Resolution As Language Modeling”이라는 제목의 연구 논문은 이 시스템을 최첨단 AI로 내세우며, 음성 비서가 사용자 질의를 이해하고 응답하는 방식을 재정의할 것이라고 주장합니다. 

ReALM과 다른 시스템의 차이는 참조 해결을 언어 이해의 구조에 매끄럽게 결합한다는 점입니다. 이는 현재 대형 언어 모델 기반 시스템의 설계에서 혁신적인 접근이며, 모델의 컨텍스트 이해를 향상시키고 AI와 그래픽 사용자 인터페이스 간 상호작용에 새로운 기준을 제시합니다. 

연구 결과를 바탕으로, LLM 엔지니어와 AI 도구 제품 관리자들이 보다 직관적이고 컨텍스트 인식이 가능한 사용자 상호작용을 달성하도록 돕습니다. ReALM은 텍스트 입력과 시각적 컨텍스트의 통합을 촉진하여 다양한 응용 분야에서 디지털 어시스턴트 기술을 향상시킬 잠재력을 확대합니다.

ReALM의 혁신적인 NLP 참조 해결 접근법

모든 NLP 시스템은 “참조 해결”에 의존합니다. 이는 대명사나 간접적인 설명과 같이 모호하지만 문맥상 중요한 참조(예: “they” 또는 “that”)를 대화나 시각적 컨텍스트 내의 올바른 엔터티와 연결하여 일관된 사용자 상호작용을 유지하는 과정입니다.

전통적인 AI 시스템은 규칙 기반 방법이나 휴리스틱에 의존하여 참조 해결을 수행하지만, 이는 자연어의 전체 복잡성을 포착하는 데 원하는 결과를 제공하지 못합니다. 그 결과, 화면에 표시되는 엔터티와 같은 시각적 컨텍스트를 이러한 방법으로 통합하기가 어려웠습니다. 음성 비서인 Siri도 ReALM이 이를 언어 모델링 문제로 다루어 해결하는 동일한 제한에 직면합니다. 

ReALM은 LLM을 활용해 대화의 광범위한 컨텍스트 내에서 모호한 참조를 이해하고 해결합니다. 시각적 컨텍스트가 포함될 경우, 텍스트 표현을 사용해 디바이스 화면을 재구성하고 화면 구성 요소 간의 공간적 연결을 기록합니다. 

Joel Ruben Antony Moniz가 이끄는 연구팀은 다음과 같이 말합니다:

“우리가 알기로는, 화면으로부터 컨텍스트를 인코딩하려는 대형 언어 모델을 사용한 최초의 연구입니다.”

결과는? ReALM 기반 음성 비서는 “오른쪽 상단 모서리의 버튼을 탭하세요”와 “목록에서 두 번째 기사를 열어 주세요”와 같은 질의를 이해할 수 있으며, 표준 AI 시스템은 이를 처리하기 어렵습니다.

이로 인해 ReALM의 참조 해결 방식은 보다 효율적이며, 장치 내에서 로컬로 참조를 해결할 수 있어 클라우드 기반 AI 시스템이 지속적인 데이터 전송을 필요로 하는 것과 달리, Siri에 더 적합합니다. 이는 프라이버시, 지연 시간 및 오프라인 작동 측면에서 개선됩니다.

ChatGPT 최고의 확장 5개 목록 보려면 여기를 클릭하세요.

데이터셋 수집 및 평가

Apple (AAPL ) 연구팀은 대화, 화면, 합성 데이터를 포괄하는 다양한 데이터셋을 구축하여 ReALM이 실제 사용자 상호작용의 복잡성을 탐색하는 능력을 다른 모델과 비교 평가했습니다. 이를 위해 팀은 대화, 화면, 합성 데이터를 포함하는 다양한 데이터셋을 수집했습니다. 

대화 데이터는 군중 작업자들에게 합성 리스트가 포함된 사진을 보여주고, 해당 리스트 내 특정 요소와 관련된 명확한 질의를 제출하도록 요청하여 생성되었습니다. 화면 데이터셋은 두 단계의 주석 과정을 거쳐 모델이 실제 웹 페이지의 복잡성을 처리할 수 있도록 보장했습니다. 이 과정에는 가시 객체 분류, 질의 생성, 질의와 해당 엔터티 간 연결 설정이 포함되었습니다.

인상적인 성능 결과

평가 결과는 모든 데이터셋에서 ReALM이 보여준 놀라운 성능을 강조합니다. 이전 최첨단 참조 해결 시스템인 MARRS와 비교했을 때, ReALM은 정확도에서 상당한 향상을 달성했습니다. 특히, 가장 작은 ReALM 모델조차도 어려운 화면 데이터셋에서 5% 이상의 절대적인 향상을 보이며, 복잡한 시각적 컨텍스트에서 참조를 효과적으로 이해하고 해결할 수 있음을 입증합니다.

ReALM의 능력을 더 평가하기 위해, 연구진은 OpenAI의 GPT-3.5 및 GPT-4 모델과 벤치마크를 진행했습니다. 놀랍게도, 가장 작은 ReALM 모델은 파라미터 수가 훨씬 적음에도 불구하고 GPT-4와 동등한 성능을 보였습니다. 모델 크기가 증가함에 따라 ReALM의 성능은 계속 향상되며, 큰 모델들은 평가된 데이터셋에서 GPT-4를 크게 능가합니다.

아래 표는 성능 결과 요약을 나타내며, 기존 접근 방식에 대한 ReALM의 우수성과 최첨단 언어 모델과의 경쟁력을 강조합니다.

Model Accuracy for Different Datasets

성공의 핵심: 최적화된 화면 인코딩

분명히, ReALM의 최적화된 화면 인코딩 접근법은 인상적인 성능에 기여하는 핵심 요소입니다. 연구자들은 최종 알고리즘에 도달하기 전에 여러 전략을 탐색했으며, 이는 가장 효과적인 것으로 입증되었습니다.

초기 시도 중 하나는 화면 요소를 클러스터링하고 각 엔터티의 컨텍스트에 모든 다른 요소를 포함하는 것이었습니다. 그러나 화면 엔터티 수가 증가함에 따라 프롬프트 길이가 급격히 늘어나 실제 적용이 어려워졌습니다.

또 다른 접근법은 텍스트 화면 파싱에 엔터티를 태그로 표시하되, 메인 컨텍스트와는 별도로 제공하는 것이었습니다. 이 방법은 유망해 보였지만, 연구자들은 태그를 파싱 자체에 직접 삽입하는 것이 최상의 결과를 낳는다는 것을 발견했습니다.

최종 “인젝션된 화면 인코딩” 접근법은 논문에서 자세히 설명되며, 화면 요소의 중심을 위에서 아래, 왼쪽에서 오른쪽 순으로 정렬합니다. 지정된 수직 여백 내에 있는 요소들은 텍스트 표현에서 동일한 “라인”에 그룹화되며, 같은 라인에 있는 요소들은 탭으로 구분됩니다. 이 스마트한 인코딩 방식은 2D 화면 레이아웃을 1D 텍스트 형식으로 근사화하여 모델이 엔터티 간의 공간 관계를 효과적으로 이해할 수 있게 합니다.

연구진이 수행한 소거 실험은 아래 그림과 같이 최적화된 인코딩 접근법의 우수성을 확인시켰습니다.

Performance improvements with each encoding experiment

복잡한 사용 사례 처리

논문은 ReALM이 의미 이해, 요약, 세계 지식, 상식 추론 등 다양한 형태의 추론을 필요로 하는 복잡한 사용 사례를 처리할 수 있음을 보여주는 여러 정성적 예시를 제공합니다.

팀이 공유한 흥미로운 예시에서, ReALM은 화면에 아침 및 저녁 연락처 정보가 모두 표시된 상황에서 “저녁 번호를 전화해 주세요”라는 질의를 정확히 “5 PM – 9 PM” 아래에 나열된 전화번호로 매핑했습니다. 논리적인 결과처럼 들리지만, ReALM이 “저녁”이라는 의미를 이해하고 적절한 시간 범위에 연결한 것은 다른 AI 시스템에서는 아직 구현되지 않은 인상적인 능력입니다.

또 다른 입력 예시에서는 세금 마감일이 표시된 화면이 주어졌고, 시스템은 “세금 마감일 전에 서류를 인쇄하도록 알림을 설정해 주세요”라는 요청에 대해 4월 신고일을 관련 마감일로 정확히 식별했습니다.

이러한 정성적 예시들은 ReALM의 다재다능함과 깊은 언어 이해 및 추론 능력이 필요한 다양한 실제 시나리오를 처리할 수 있는 잠재력을 뒷받침합니다.

엔드-투-엔드 접근 방식 대비 장점

대규모 LLM만을 활용하는 엔드-투-엔드 접근 방식이 다양한 언어 이해 작업에서 유망한 결과를 보여주었지만, 연구진은 ReALM 아키텍처의 몇 가지 장점을 강조합니다.

지연 시간 및 프라이버시 이유로 전체 엔드-투-엔드 모델을 장치 내에서 실행하는 것은 현재 모델의 계산 및 메모리 제한으로 인해 실현 불가능합니다. 참조 해결 전용으로 설계된 작고 미세 조정된 모델을 사용함으로써 ReALM은 이러한 문제를 회피하고 효율적인 장치 내 처리를 가능하게 합니다.

또한, ReALM의 모듈식 아키텍처는 기존 엔터티 감지 및 작업 완료 구성 요소와 원활하게 통합될 수 있습니다. 반면, 엔드-투-엔드 모델은 전체 파이프라인에 큰 변화를 요구하여 실제 시스템에 도입하기 어렵게 만듭니다.

새로운 엔터티 유형에 대한 확장성

ReALM의 핵심 강점 중 하나는 새로운 엔터티 유형에 대한 확장성입니다. 이전 파이프라인 방식인 MARRS는 수동으로 정의된 유형별 로직에 의존했지만, ReALM의 LLM 기반 접근법은 보지 못한 도메인에도 쉽게 일반화될 수 있습니다.

연구진은 보지 못한 “알람” 엔터티 유형에 대해 ReALM을 평가함으로써 이 장점을 입증했습니다. 인상적으로, ReALM은 GPT-4와 동일한 제로샷 성능을 보여, “didi를 데려오라고 알리는 알람을 끄세요”와 같은 질의를 해당 알람 엔터티와 정확히 연결했습니다. 이는 명시적인 학습 데이터 없이도 새로운 엔터티 유형을 처리할 수 있는 모델의 언어 이해 능력을 보여줍니다.

아래 표는 보지 못한 “알람” 데이터셋에서 ReALM과 GPT-4의 성능 비교를 보여주며, ReALM의 강력한 제로샷 일반화 능력을 강조합니다.

Performance on Unseen Alarm Dataset

미래 가능성 및 제한 사항

ReALM은 대화형 AI의 참조 해결과 같은 중요한 측면에서 상당한 진전을 이루었지만, 연구팀은 몇 가지 제한 사항을 지적했습니다.

시스템의 주요 단점 중 하나는 2D 화면 레이아웃을 1D 텍스트 표현으로 변환하면서 복잡한 공간 세부 정보가 손실된다는 점입니다. 팀은 화면 구성 요소를 그리드 형태로 표현하는 등 보다 정교한 인코딩 전략을 사용해 상대적 위치를 보다 정확히 유지하는 방안을 제안했습니다.

또 다른 향후 개선점은 시간적 또는 계층적 연관성을 포함하는 보다 복잡하고 다양한 참조를 처리할 수 있도록 ReALM의 능력을 강화하는 것입니다.

이러한 제한에도 불구하고, ReALM의 인상적인 성능과 확장 가능한 설계는 대화형 AI 분야에서 추가 연구 및 개발을 위한 매우 유망한 기반을 제공합니다.

결론적 고찰

ReALM이 텍스트 입력과 시각적 컨텍스트 사이의 격차를 메우는 능력은 보다 직관적이고 컨텍스트 인식이 가능한 사용자 인터페이스의 길을 열어줄 것입니다. LLM 엔지니어와 개발자는 복잡한 화면 요소를 다룰 때도 사용자의 의도를 진정으로 이해하고 응답하는 AI 시스템을 만들 수 있게 됩니다.

순수 기술적 관점에서, ReALM의 모듈식 아키텍처와 장치 내 처리 능력은 사용자 프라이버시와 지연 시간을 해결할 뿐만 아니라, 보다 확장 가능하고 효율적이며 통합된 AI 시스템의 전례를 설정합니다.

일반적인 말로 표현하면, 복잡한 사용 사례를 처리하고 새로운 엔터티 유형에 일반화할 수 있는 ReALM의 성공은 현재 대화형 AI가 무엇이 가능한지에 대한 우리의 이해를 완전히 바꾸었습니다. 이는 고객 서비스, 전자상거래, 의료, 교육 등 다양한 산업 전반에 걸친 AI 도입 속도를 가속화할 수 있습니다.

인공지능 투자에 대해 모두 알아보려면 여기를 클릭하세요.

가우라브는 2017년에 암호화폐 거래를 시작하여 그 이후로 암호화폐 분야에 사랑에 빠졌습니다. 암호화폐에 대한 그의 관심은 암호화폐와 블록체인 전문 작가로 그를 만들었습니다. 곧 그는 암호화폐 회사와 미디어 아웃렛에서 일하게 되었습니다. 그는 또한 큰 배트맨 팬입니다.