人工知能
UNITE AIモデルは顔に依存せずにあらゆるディープフェイクを検出可能

科学者たちは現在、AI自体を使ってAI問題に取り組んでいます。 UCリバーサイド大学の研究者は、ディープフェイクという深刻な問題に対処するためにUNITEモデルを作成しました。
「人々は自分が見ているものが本物かどうか知る権利があります」と、UCRのMarlan and Rosemary Bourns College of Engineeringの博士課程候補生で、本稿のリーダーであるRohit Kundu氏は述べました。汎用合成ビデオ検出器へ:顔や背景の操作から完全にAI生成されたコンテンツまで.1 「AIが現実を偽造する能力が向上すれば、真実を明らかにする能力も向上しなければなりません。」
研究者たちは、Alphabet の Google (GOOG ) の科学者と協力し、動画改ざんを検出し、偽コンテンツを露呈させる新しいAIモデルを開発しました。この手法は、偽情報の拡散や危害を引き起こすために利用されています。研究は次のように指摘しています:
「選挙などの重要な時期における誤情報の急速な拡散は、顔、背景、そして人間主体の有無に関わらず、さまざまな操作を特定できる汎用的な検出モデルの必要性を浮き彫りにしています。」
このモデルは、部分的に操作された動画と完全に合成された動画の両方を検出できます。従来の検出器が顔に焦点を当てるのとは異なり、このモデルは人間主体の有無に関わらずフレーム全体を解析します。
このため、事実確認者、教育者、編集者、ソーシャルメディアプラットフォームなどが、改ざんされた動画が拡散するのを防ぐための強力なツールとなります。
AIの台頭とそれに伴う合成コンテンツの過剰供給

人工知能(AI)は、私たちの生活と仕事のさまざまな側面を変革する膨大な可能性を持っています。
この技術の自動化、データ分析、意思決定への能力はすでに産業を変革し始めており、今十年の終わりまでに世界経済に数兆ドルを加えると予測されています。
IDCという市場予測大手による推計では、AIの台頭により2030年までに累計で19.9兆ドルの経済効果がもたらされるとされています。
一方、McKinseyの調査では、生成AIがもたらす付加価値は、同社が分析した63のユースケースで合計4.4兆ドルに上ると見込まれています。AIが提供できる価値の約75%は、次の4つの分野に集中するとされています:
- 研究開発(R&D)
- ソフトウェアエンジニアリング
- マーケティングとセールス
- 顧客オペレーション
技術の影響はすべてのセクターで顕著と予測されますが、テックと金融は生成AIからの収益比率が最も高くなる可能性があります。Goldman Sachs (GS ) も同様の見解を示し、AIによって世界GDPが7%増加すると予測しています。銀行のエコノミストである Joseph Briggs と Devesh Kodnani は、当時次のように指摘しました:
「生成AIの潜在的な不確実性は大きいものの、人間が作成したものと区別できないコンテンツを生成し、人間と機械のコミュニケーションの壁を取り払う能力は、マクロ経済的に大きな影響をもたらす重要な進歩です。」
しかし、学習、問題解決、意思決定といった人間の知能を要するタスクをコンピュータが実行できるようになることで、世界は混乱に陥る危険性も高まっています。
技術が高度化すればするほど、現実と偽造の境界はますます曖昧になります。
従来のディープフェイク検出器が機能しなくなった理由
| Company | Tool | Detection Focus | Limitations |
|---|---|---|---|
| UC Riverside + Google | UNITE | Full-frame (face, background, T2V/I2V) | Still under development |
| Microsoft | Video Authenticator | Face-based manipulations | Outdated vs. modern generative AI |
| Intel | FakeCatcher | Authenticity via physiological signals | Requires high-quality facial footage |
| OpenAI | Text Watermarking | Text-based AI output | Limited for visual content |
| SynthID | AI-generated watermark detection | Only works with Google AI models |
過去数年でAIの進歩により、合成メディアが前例のない速度で急増しています。 調査によればLinkedIn の長文投稿の半数以上が現在AIによって執筆されていると指摘されています。さらに「AIスロップ」と呼ばれる、低品質で大量に生成されたAIコンテンツも存在します。
しかし最も懸念すべきは、AIを用いて生成または改変された画像、動画、音声といったディープフェイクです。これはAIが偽のリアルな表現を作り出すことで、誤情報を拡散させます。
今日、この種のコンテンツはインターネットの至る所に溢れ、全てのコーナーに浸透しています。これらのハイパーリアルなデジタルメディアは混乱を招き、誤情報を拡散させ、プライバシーとセキュリティに脅威を与えています。
サイバー犯罪者はAIを利用してフィッシングや身元盗用を高度に行っています。Kundu氏によれば:
「これらのツールが手に入りやすくなったことは恐ろしいです。中程度のスキルさえあれば、安全フィルタを回避し、公共の人物が決して言っていないことを言っているように見えるリアルな動画を生成できます。」
ある事例では、サイバー犯罪者がZoom会議で企業の最高財務責任者(CFO)になりすまし、2500万ドルの損失を引き起こしました。
これは始まりに過ぎません。Deloitteは予測し、2027年までに米国での詐欺損失が400億ドルに達するとしています。米国財務省の報告でも、既存のリスク管理フレームワークが新興AI技術に対応しきれない可能性が指摘されています。
ディープフェイクやAIコンテンツを検出し、リスクから身を守るツールがないわけではありません。市場には実際に多くのツールが存在します。
新しいAIツールでコンテンツ生成を容易にする企業が、同時に合成データを見分ける手段も提供しています。
2020年にテック大手 Microsoft (MSFT ) は、静止画や動画を分析し、信頼度スコアを提供するVideo Authenticatorを発表しました。このツールは、ディープフェイクの境界線や微細なフェードを検出し、人間の目では捉えにくい改ざんを見つけます。
当時、同社は偽コンテンツを識別し、メディアの真正性を確認する技術も導入しました。クリエイターがデジタルハッシュや証明書をコンテンツに埋め込み、メタデータとして保存できるようにし、閲覧者はそれらをチェックして真正性を検証できるようにしました。
しかし、AIが継続的に学習し生成するディープフェイクは、従来の検出手法をすぐに追い越す可能性があると同社は警告しています。
同時期に、Meta(Meta (META ))も、研究者が以前はアクセスできなかったデータを用いたディープフェイク検出コンペティションを開始しました。
数年前、Intel(Intel (INTC ))はFakeCatcherというリアルタイムディープフェイク検出器を発表し、96%の精度を主張しました。
このツールはOpenVINOを使用して顔とランドマーク検出アルゴリズムを実行し、コンピュータビジョンブロックはIntegrated Performance Primitives と OpenCV で最適化されました。ハードウェア面では、3世代目 Xeon® Scalable プロセッサ上で同時に70以上の検出ストリームを実行可能です。
FakeCatcherは問題点を探すのではなく、人間らしさを評価する手法で、アルゴリズムがこれらのシグナルを時空間マップに変換し、深層学習で動画が本物か偽かを即座に判定します。
昨年、OpenAIはコンテンツの真正性支援ツールの研究を発表しました。
これにはテキストのウォーターマーキングが含まれ、局所的な改ざんには有効ですが、全体的な改ざんには効果が薄いとされています。また、非英語話者への不公平な影響も指摘されました。
このアップデートは、Wall Street Journal が報じた、OpenAI が既にChatGPT生成テキストに対し高精度でウォーターマークと検出を行うツールを開発しているが、リリースの決定は未だ保留中であるという報道に続きました。
さらに、OpenAIはC2PA(コンテンツの出所と真正性に関する連合)の運営委員会に参加し、同基準に基づきすべての生成・編集画像にメタデータを付与しています。
今年、Googleは自社のAIサービス(Gemini、Imagen、Veo、Lyria)で生成されたコンテンツにのみ有効な「SynthID Detector」というテキスト・画像・音声・動画検出ツールを発表しました。
このツールは、Google の製品が出力に埋め込む「ウォーターマーク」の有無を検出することで機能します。
ウォーターマークは、機械が読み取れるユニークな要素で、コンテンツに埋め込まれ、人間には認識できませんが、専用アルゴリズムで検出・抽出可能です。
UNITE の画期的技術の内部構造

AI技術が急速に進化するにつれ、生成されたコンテンツを検出するツールも同様に進化していますが、すべてのAI生成コンテンツに対応できる汎用ツールはまだ存在しません。
既存のディープフェイク検出技術は主にリップシンクや顔入れ替えといった顔の操作に焦点を当てており、技術の進歩によりそれらは不十分になっています。
テキストから動画(T2V)や画像から動画(I2V)といった生成モデルが大幅に進化したことで、誰でも高精度の完全AI生成合成コンテンツや背景のシームレスな変更を簡単に作成できるようになり、個人から組織、国家に至るまで深刻なリスクが生じています。
この背景から、従来のディープフェイク検出器が顔に依存していたことは、今日の高度な技術環境では時代遅れです。
「フレームに顔がない場合、多くの検出器は機能しません。しかし、偽情報はさまざまな形で現れ、シーンの背景を変更するだけでも真実を歪めることができます。」
– Kundu
したがって、従来の検出器は新しい操作には対応できず、全シーンや背景を含む合成コンテンツは顔中心の検出手法にとって課題となります。
この課題に対処するため、UCリバーサイドの研究者はUNITEを提案しました。
Universal Network for Identifying Tampered and Synthetic Videos(UNITE)モデルはフルフレームの操作を捕捉します。
「ディープフェイクは進化しました」とKundu氏は述べ、同氏は画像セグメンテーションや偽メディア検出のための基礎モデル活用に注力しています。「もはや顔入れ替えだけではありません。人々は顔から背景まで、強力な生成モデルを使って完全に偽の動画を作成しています。我々のシステムはそれらすべてを捕捉できるように構築されています。」
このモデルは、顔が存在しない、あるいは人間主体がいないシナリオでも検出能力を拡張し、さらに微細な空間的・時間的不整合や、従来システムが見逃した複雑な背景変更も識別できます。
つまり、顔だけでなく背景や動きのパターンも解析し、フルビデオフレームをカバーすることで、UNITEは顔コンテンツだけに依存しない初のツールの一つとなります。
このために、モデルはトランスフォーマー型深層学習モデルを採用し、マルチヘッド・アテンション機構でシーケンシャルデータを処理します。テキストはトークンと呼ばれる数値表現に変換され、これはGPTなど多くの現代言語モデルの基盤となっています。
情報を並列処理することで、トランスフォーマーは学習速度と性能を向上させます。
UNITEの場合、トランスフォーマーはSigLIP-So400M基礎モデルから抽出されたドメイン非依存の特徴を処理します。SigLIPは特定の対象や人物に縛られない特徴を抽出します。
顔/背景やテキスト→動画/画像→動画の変化を網羅するデータセットが限られているため、チームは革新的な学習戦略を採用しました。具体的には、タスクに無関係なデータと標準的なディープフェイクデータを組み合わせて訓練しました。
FaceForensics++ データセットに加えて、チームはSAIL-VOS-3D データセットも使用しました。これはGTA‑Vゲーム内の3Dビデオオブジェクトセグメンテーション用に設計されたもので、合成環境をシミュレートし、多様な合成シーンを提供します。元はAI生成ではありませんが、完全に合成されたデータであり、AI生成メディアのシミュレーションに役立ちます。このデータは、合成操作の検出能力を向上させました。
Googleは必要なデータセットと計算リソースへのアクセスを提供しました。
モデルが顔に過度に注目しすぎる傾向を抑えるため、チームは注意多様性(AD)ロスを導入し、フレーム全体で多様な空間的注意を促しました。
ADロスはクロスエントロピー(対数損失)と組み合わせられ、様々な状況での分類性能を測定するために機械学習で一般的に使用されます。
単にクロスエントロピー(CE)ロスだけで訓練すると、人間主体がいるが背景が操作された動画や、T2V・I2Vモデルで生成されたコンテンツの取り扱いが困難になります。
そこでチームはADロスを導入し、各フレームの複数の視覚領域を監視させ、前景と背景の重要なサインを捕捉できるようにしました。
ADロスはチームのアプローチにおける鍵となるイノベーションであり、UNITEがAI生成や背景改変動画の検出に優れるだけでなく、従来の顔操作コンテンツの検出精度も顕著に向上させました。
他モデルと比較した結果、UNITEは顔・背景操作や完全合成T2V/I2V動画を含むデータセットで最先端検出器を上回り、適応性と汎用的検出能力を示しました。
デジタル化・自動化が進む世界で、UNITEは単なる顔入れ替えから完全合成動画まで幅広い偽造をフラグできる汎用検出器として期待されています。Kundu氏は次のように述べました:
「すべてのシナリオに対応できる唯一のモデルです。これがユニバーサルである理由です。」
現在開発中のUNITEは、合成動画検出の新たな風景で重要なツールとなり、将来的には動画偽情報防止の鍵となるでしょう。
AIベース検出への投資
Palantir Technologies (PLTR ) は、AI駆動型データ統合、パターン認識、異常検出で知られています。
同社は4つの主要ソフトウェアプラットフォーム:Gotham、Foundry、Apollo、AIP を提供しています。Apollo は単一の制御層で構成・セキュリティ更新・新機能配信を調整し、重要システムの継続稼働を保証します。Gotham はデータセット深部のパターンを特定し、Foundry は資産・リスク管理のオペレーティングシステムとして機能します。AIP は企業が LLM や他のモデルをフルコントロールで実行できるようにします。
Palantir Technologies (PLTR )
Palantir は米国政府、軍、情報機関との深い関係を誇ります。 今年、同社は3,000万ドルの契約を取得し、移民記録へのAI分析を導入しました。
時価総額 3,720億ドル、PLTR 株は現在 157.72 ドルで取引され、年初来で 109.35% の上昇を記録しています。EPS(TTM)は 0.23、P/E(TTM)は 687.90 です。
PLTR 価格チャート
財務面では、Palantir は 2025年第1四半期の売上高が前年同期比 39% 増の 8.84億ドルと報告しました。米国売上は 55% 増の 6.28億ドルで、うち 2.55億ドルが米国商業部門、3.73億ドルが米国政府部門です。
この期間、米国商業部門の総契約額は最高を記録し、残りの取引価値は 23.2億ドルでした。
Palantir の顧客数は 2025年第1四半期に前年同期比 39% 増加しました。GAAP の1株当たり利益は 0.08 ドル、調整後 EPS は 0.13 ドルです。四半期末の現金・現金等価物・短期米国財務証券は 54億ドルでした。
「AI時代におけるモダンエンタープライズ向けオペレーティングシステムを提供しています。米国でのソフトウェア採用が大きく転換期にあります。」
– CEO Alexander C. Karp
Latest Palantir Technologies (PLTR) Stock News and Developments
Conclusion
人工知能の登場により、個人も組織もテクノロジーを活用して生産性を向上させ、意思決定を強化しています。
世界経済に数兆ドルの貢献が見込まれる一方で、AIには危険も伴います。ディープフェイクやそれを利用した誤情報・詐欺は、AI普及の最大のリスクの一つです。
現実と合成の区別が難しくなる中、UNITE のようなツールはますます重要かつ緊急の存在です。この汎用AIモデルが偽コンテンツに対する防御策となり、AIの負の影響を抑えつつ、仕事や生活へのプラス効果を享受できるようになるでしょう。
人工知能への投資に関するすべてを学ぶにはこちらをクリックしてください。
References:
1. Kundu, R.; Xiong, H.; Mohanty, V.; Balachandran, A.; Roy‑Chowdhury, A. K.; et al. Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI‑Generated Content. arXiv preprint arXiv:2412.12278 (2024). https://doi.org/10.48550/arXiv.2412.12278












