人工知能

Apple、ReALMがGPT-4の機能を上回ると主張

mm
Securities.io を Google の優先ソースに追加
開示: Securities.ioは、レビュー製品へのリンク利用により報酬を受け取る場合があります。これは当社の編集評価に影響しません。 当社は登録投資顧問ではなく、これは投資助言ではありません。 アフィリエイト開示をご覧ください
Apple ReALM

Claude 3 Opusは最近 GPT 4の王座を奪いました、最先端のLLMとして。 一方、Apple (AAPL ) の研究者はReALMを発表し、GoogleのGeminiがiPhoneを駆動しているという ニュースがヘッドラインになった直後でした。 タイトルが「ReALM: Reference Resolution As Language Modeling」の研究論文は、音声アシスタントがユーザーの問い合わせを理解し応答する方法を再定義すると約束する最先端のAIシステムであると宣伝しています。 

ReALMと他のシステムとの違いは、参照解決を言語理解の構造にシームレスに組み込んでいる点にあります。これは現在の大規模言語モデルベースのシステムの設計を考えると革新的なアプローチであり、モデルの文脈理解を向上させると同時に、AIとグラフィカルユーザーインターフェース間の相互作用の新たなベンチマークを確立します。 

研究成果に基づき、研究の結果、LLMエンジニアやAIツール製品マネージャーがより直感的で文脈に配慮したユーザーインタラクションを実現できるようになります。ReALMはテキスト入力と視覚的コンテキストの統合も促進し、多くのアプリケーションでデジタルアシスタントのスキル向上の可能性を拡大します。

ReALMの革新的なNLP参照解決アプローチ

すべてのNLPシステムは「参照解決」に依存しており、これは代名詞や間接的な記述(例:”they”や”that”)のような曖昧だが文脈上の参照を特定し、会話や視覚的コンテキスト内の正しいエンティティにリンクさせ、整合性のあるユーザーインタラクションを維持するプロセスです。

従来のAIシステムはルールベースやヒューリスティックに依存した参照解決を行っており、自然言語の複雑さを完全に捉えることができず、期待した結果が得られません。その結果、画面上のエンティティなどの視覚的コンテキストをこれらの手法で統合することは困難でした。音声アシスタントのSiriなども、ReALMが言語モデリング問題として扱うことで解決しようとしている同じ制限に直面しています。

ReALMはLLMを活用し、ルールやヒューリスティックではなく、会話全体の文脈内で曖昧な参照を理解し解決します。視覚的コンテキストが関与する場合、テキスト表現を用いてデバイスの画面を再構築し、画面上のコンポーネント間の空間的接続を記録します。

Joel Ruben Antony Moniz率いる研究チームは次のように述べています:

「我々の知る限り、これは画面からコンテキストをエンコードすることを目的とした大規模言語モデルを使用した初めての研究です。」

結果は?ReALM搭載の音声アシスタントは「右上隅のボタンをタップして」や「リストの2番目の記事を開いて」などのクエリを理解でき、標準的なAIシステムは苦労します。

これにより、ReALMの参照解決手法はより効率的でデバイス上での処理に最適となります。クラウドベースのAIシステムが継続的なデータ送信を必要とするのに対し、デバイス上でローカルに参照を解決できるからです。このため、プライバシー、レイテンシ、オフライン機能が向上し、Siriにより適しています。

ChatGPTのベスト5拡張機能のリストはこちら。

データセットの収集と評価

Appleの研究チームは、会話、画面上、合成データを含む多様なデータセットを作成し、ReALMが実世界のユーザーインタラクションの複雑さを他の手法と比較してどれだけうまく処理できるかを徹底的に評価しました。

会話データは、クラウドワーカーに合成リストを含む画像を見せ、リスト内の特定要素に関する明確なクエリを提出させることで生成されました。画面上データセットは、実際のウェブページの複雑さに対応できるよう、二段階のアノテーションプロセスを経ました。このプロセスは、可視オブジェクトの分類、クエリの生成、クエリと参照先エンティティ間の接続確立を含みます。

印象的なパフォーマンス結果

評価結果は、すべてのデータセットにおけるReALMの卓越したパフォーマンスを示しています。従来の最先端参照解決システムであるMARRSと比較して、ReALMは精度で大幅な改善を達成しました。特に、最小のReALMモデルでも難易度の高い画面上データセットで5%以上の絶対的な向上を示し、複雑な視覚コンテキストにおける参照の理解と解決能力を実証しています。

さらにReALMの能力を評価するため、研究者はOpenAIのGPT-3.5およびGPT-4とベンチマークしました。驚くべきことに、最小のReALMモデルはパラメータ数がはるかに少ないにもかかわらず、GPT-4と同等の性能を示しました。モデルサイズが大きくなるにつれて、ReALMの性能は向上し、評価されたデータセットでは大規模モデルがGPT-4を大幅に上回ります。

以下の表はパフォーマンス結果の概要を示し、既存アプローチに対するReALMの優位性と最先端言語モデルとの競争力を強調しています。

さまざまなデータセットにおけるモデル精度

成功の鍵:最適な画面エンコーディング

明らかなように、ReALMの最適化された画面エンコーディング手法は、その卓越したパフォーマンスに寄与する重要な要素です。また、研究者は最終アルゴリズムに至るまで複数の戦略を検討し、最も効果的であることが証明されました。

最初の試みの一つは画面要素をクラスタリングし、各エンティティのコンテキストにすべての他要素を含めることでした。しかし、画面上のエンティティ数が増えるとプロンプト長が急速に拡大し、実用的ではなくなりました。

別のアプローチは、テキスト画面パース内でエンティティにタグ付けし、メインコンテキストとは別に提供する方法でした。この方法は有望に見えましたが、研究者はタグをパース自体に直接注入する方が最良の結果をもたらすことを発見しました。

最終的な「画面上エンコーディングの注入」アプローチは、論文で詳細に説明されているように、画面要素の中心を上から下、左から右の順にソートします。指定された垂直マージン内の要素は同じ「行」にグループ化され、同一行の要素はタブで区切られます。この巧妙なエンコーディング方式により、ReALMは2次元の画面レイアウトを1次元のテキスト形式で近似でき、エンティティ間の空間関係を効果的に理解できます。

研究者が実施したアブレーション実験は、以下の図に示すように、この最適化されたエンコーディング手法の優位性を確認しました:

各エンコーディング実験によるパフォーマンス向上

複雑なユースケースへの対応

論文は、意味理解、要約、世界知識、常識的推論など、さまざまな形態の推論を必要とする複雑なユースケースに対応できるReALMの能力を示す定性的な例をいくつか提供しています。

チームが共有した興味深い例では、画面に午前と午後の連絡先情報が表示されている状態で、ReALMは「夕方の番号を呼び出す」というクエリを正しく解決し、「5 PM – 9 PM」の下に記載された電話番号を返しました。論理的な結果のように聞こえるものの、ReALMは「夕方」の意味を正しく理解し、適切な時間帯にマッピングできた点で、他のAIシステムがまだ実現できていない印象的な能力を示しています。

別の入力例では、税金の締め切りを示す画面が表示され、ReALMは「税金の期限前に書類を印刷するリマインダーを設定して」と尋ねられた際に、4月の提出日を関連する締め切りとして正しく特定しました。

これらの定性的な例は、ReALMの汎用性と、深い言語理解と推論能力を必要とする幅広い実世界シナリオに対応できる可能性に関する観察を裏付けています。

エンドツーエンドアプローチに対する優位性

大規模LLMのみを使用したエンドツーエンドアプローチはさまざまな言語理解タスクで有望な結果を示していますが、研究者はReALMのアーキテクチャのいくつかの利点を強調しています:

現在のモデルでは計算量とメモリの制約により、レイテンシとプライバシーの観点からデバイス上でフルエンドツーエンドモデルを実行することは実現不可能です。参照解決専用に設計された小型でファインチューニングされたモデルを使用することで、ReALMはこれらの問題を回避し、効率的なオンデバイス処理を可能にします。

さらに、ReALMのモジュラーアーキテクチャは、会話型AIパイプライン内の既存のエンティティ検出やタスク完了コンポーネントとシームレスに統合できます。対照的に、エンドツーエンドモデルはパイプライン全体に大幅な変更を必要とし、実運用システムへの導入がより困難になります。

新しいエンティティタイプへのスケーラビリティ

ReALMの主要な強みの一つは、新しいエンティティタイプへのスケーラビリティです。従来のパイプライン方式であるMARRSは手動で定義されたタイプ固有のロジックに依存していましたが、ReALMのLLMベースのアプローチは未見のドメインにも容易に汎化できます。

研究者は、未見の「アラーム」エンティティタイプでReALMを評価し、驚くべきことに、ReALMはGPT-4と同等のゼロショット性能で、例えば「didiをピックアップすることをリマインドしてくれるものをオフにする」というクエリを適切なアラームエンティティに正確に解決しました。これは、明示的なトレーニングデータを必要とせずに新しいエンティティタイプを処理できるモデルの言語理解能力を活用できることを示しています。

以下の表は、未見の「アラーム」データセットにおけるReALMとGPT-4のパフォーマンス比較を示し、ReALMの強力なゼロショット汎化能力を強調しています:

未見のアラームデータセットにおけるパフォーマンス

将来の可能性と制限

ReALMは会話型AIにおける参照解決など重要な側面で大きな進歩をもたらしていますが、研究チームは理解すべきいくつかの制限も指摘しています。

しかし、システムの大きな欠点の一つは、2次元の画面レイアウトを1次元のテキスト表現に変換することで、細かな空間的詳細が失われることです。チームは、画面コンポーネントをグリッド状に表現するなど、より高度なエンコーディング戦略の使用を提案し、相対位置をより正確に保持しようとしています。

将来的な改善点として、時間的または階層的なエンティティ間の関連性を含む、より複雑で多様な参照を処理する能力を強化することが挙げられます。

これらの制限にもかかわらず、ReALMの印象的なパフォーマンスとスケーラブルな設計は、会話型AIのさらなる研究と開発の非常に有望な基盤となります。

結論

ReALMはテキスト入力と視覚的コンテキストのギャップを埋める能力により、より直感的で文脈に配慮したユーザーインターフェースへの道を切り開きます。LLMエンジニアや開発者は、複雑な画面要素を扱う際にもユーザーの意図を真に理解し応答できるAIシステムを構築できるようになります。

純粋に技術的な観点から見ると、ReALMのモジュラーアーキテクチャとオンデバイス処理能力は、プライバシーとレイテンシの課題に対処するだけでなく、よりスケーラブルで効率的、統合されたAIシステムの先例を示しています。

一般的な言葉で言えば、ReALMが複雑なユースケースに対応し、新しいエンティティタイプに汎化できる成功は、会話型AIで現在可能なことに対する我々の理解が根本的に変わったことを示しています。これにより、カスタマーサービスやeコマースからヘルスケア、教育に至るまで、業界全体のAI導入率が停滞していた状況を加速させる可能性があります。

人工知能への投資に関するすべてを学ぶにはこちらをクリックしてください。

ガウラブは2017年に暗号通貨取引を開始し、以来暗号通貨スペースに恋に落ちました。彼のすべての暗号通貨への興味は、暗号通貨とブロックチェーンを専門とするライターに変貌しました。すぐに彼は暗号通貨会社やメディア・アウトレットと一緒に仕事をすることになりました。また、彼は大きなバットマンのファンです。