인공지능
UNITE AI 모델은 얼굴에 의존하지 않고 모든 딥페이크를 감지할 수 있다

과학자들은 이제 AI 자체로 AI 문제에 도전하고 있습니다. UC Riverside의 연구원들은 딥페이크라는 중대한 문제를 해결하기 위해 UNITE 모델을 만들었습니다.
“사람들은 자신이 보는 것이 실제인지 알 권리가 있습니다,” 라고 UCR의 Marlan and Rosemary Bourns College of Engineering 박사과정 후보인 Rohit Kundu가 말했습니다. 그는 논문 ‘Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI-Generated Content.1 “그리고 AI가 현실을 위조하는 능력이 향상될수록, 우리는 진실을 밝히는 능력을 향상시켜야 합니다.”
연구원들은 구글의 과학자들과 협력했으며, 알파벳 Alphabet (GOOG ) 회사와 함께 비디오 변조를 감지하고 가짜 콘텐츠를 드러내는 새로운 AI 모델을 개발했습니다. 이 모델은 허위 정보를 퍼뜨리고 해를 끼치는 데 사용되고 있습니다. 연구에서는 다음과 같이 언급했습니다:
“특히 선거와 같은 중요한 시기에 허위 정보가 급속히 확산되는 것은 얼굴, 배경, 인간 피사체 유무에 관계없이 완전 AI 생성 T2V/I2V 콘텐츠를 포함한 다양한 변조를 식별할 수 있는 일반화 가능한 탐지 모델의 필요성을 강조합니다.”
이 모델은 부분적으로 변조된 비디오와 완전 합성 비디오 모두를 감지할 수 있습니다. 대부분의 기존 탐지기가 얼굴에만 초점을 맞추는 것과 달리, 이 모델은 인간 피사체가 존재하든 없든 전체 프레임을 분석합니다.
이는 사실 확인자, 교육자, 편집자, 소셜 미디어 플랫폼 및 기타 기관이 조작된 비디오가 바이럴되는 것을 방지할 수 있는 강력한 도구가 됩니다.
AI의 부상과 그에 따른 합성 과부하

인공지능(AI)은 우리 삶과 업무의 다양한 측면을 혁신할 엄청난 잠재력을 가지고 있습니다.
이 기술의 자동화, 데이터 분석 및 의사결정 능력은 이미 산업을 변화시키기 시작했으며, 이번 십년 말까지 전 세계 경제에 수조 달러를 추가할 것으로 예상됩니다.
시장 전망 대기업 IDC의 연구에 따르면 AI의 부상이 2030년까지 전 세계 경제에 누적 19.9조 달러를 부스트할 것으로 추정됩니다.
한편 맥킨지는 전 세계 경영 컨설팅 회사가 분석한 63개 사용 사례 전반에 걸쳐 생성 AI가 창출할 가치가 최대 4.4조 달러에 이를 것으로 예상합니다. AI가 제공할 가치의 약 75%는 다음 네 분야에 집중될 것입니다:
- 연구개발
- 소프트웨어 엔지니어링
- 마케팅 및 영업
- 고객 운영
기술의 영향이 모든 부문에서 크게 예상되지만, 기술 및 금융 분야는 매출 대비 생성 AI로부터 가장 큰 영향을 받을 수 있습니다. 골드만삭스도 같은 견해를 가지고 있으며, AI로 인해 전 세계 GDP가 7% 증가할 것으로 기대합니다. 은행의 경제학자 조셉 브릭스와 데베시 코드나니는 당시 다음과 같이 언급했습니다:
“생성 AI의 잠재력에 대한 상당한 불확실성에도 불구하고, 인간이 만든 출력과 구별할 수 없는 콘텐츠를 생성하고 인간과 기계 사이의 커뮤니케이션 장벽을 허무는 능력은 큰 거시경제적 효과를 가져올 수 있는 중요한 진보를 나타냅니다.”
하지만 학습, 문제 해결, 의사결정 등 일반적으로 인간 지능을 필요로 하는 작업을 수행하는 컴퓨터 시스템의 동일한 능력은 세계를 뒤흔들 준비가 되어 있는 동시에 혼란을 초래하고 있습니다.
기술이 점점 정교해질수록 현실과 가상의 경계가 더욱 흐려지고 있습니다.
구식 딥페이크 탐지기가 더 이상 작동하지 않는 이유
| 회사 | 도구 | 탐지 초점 | 제한 사항 |
|---|---|---|---|
| UC Riverside + Google | UNITE | 전체 프레임(얼굴, 배경, T2V/I2V) | 아직 개발 중 |
| Microsoft | Video Authenticator | 얼굴 기반 변조 | 현대 생성 AI에 비해 구식 |
| Intel | FakeCatcher | 생리 신호를 통한 진위 확인 | 고품질 얼굴 영상 필요 |
| OpenAI | 텍스트 워터마킹 | 텍스트 기반 AI 출력 | 시각 콘텐츠에 제한적 |
| SynthID | AI 생성 워터마크 탐지 | Google AI 모델에만 작동 |
지난 몇 년간 AI의 발전은 전례 없는 합성 미디어 급증을 초래했습니다. 추정에 따르면 현재 긴 LinkedIn 게시물의 절반 이상이 AI에 의해 작성되고 있습니다. 그리고 ‘AI 슬롭’이라는 용어가 있는데, 이는 저품질의 대량 생산된 AI 생성 콘텐츠를 의미합니다.
하지만 가장 우려되는 것은 딥페이크입니다. 이는 AI를 사용해 생성하거나 변조된 이미지, 비디오, 혹은 오디오 녹음으로, AI를 이용해 거짓이지만 현실처럼 보이는 콘텐츠를 만든 것입니다.
오늘날 이러한 종류의 콘텐츠는 인터넷 구석구석에 퍼져 있습니다. 이 초현실적인 디지털 미디어는 혼란을 야기하고 허위 정보를 퍼뜨리고 있습니다. 또한 사람들의 프라이버시와 보안에 위협이 되고 있습니다.
사이버 범죄자들은 AI를 활용해 피싱 사기와 신원 도용을 놀라운 정밀도로 수행하고 있습니다. Kundu에 따르면:
“이 도구들이 이렇게 접근하기 쉬워진 것이 무섭습니다. 중간 수준의 기술을 가진 누구든 안전 필터를 우회하고 공인 인물이 결코 말하지 않은 말을 하는 현실적인 비디오를 생성할 수 있습니다.”
한 사례에서는 사이버 범죄자들이 Zoom 회의 중 회사의 최고재무책임자(CFO)로 가장해 2,500만 달러의 손실을 초래했습니다.
하지만 이것은 시작에 불과합니다. Deloitte는 이러한 사건으로 인한 사기 손실이 2027년 미국에서 400억 달러에 이를 것으로 예측하고 있으며, 이는 2023년 123억 달러에서 증가한 수치입니다. 미국 재무부 보고서는 또한 기업이 채택한 “기존 위험 관리 프레임워크”가 “신흥 AI 기술을 포괄하기에 충분하지 않을 수 있다”고 밝혔습니다.
AI 콘텐츠를 감지하고 기술 위험으로부터 자신을 보호하는 도구가 없다는 뜻은 아닙니다. 실제로 시장에는 많은 도구가 존재합니다.
새로운 콘텐츠 생성을 쉽게 하는 AI 도구를 출시하는 동일한 기업들이 합성 데이터를 식별하는 방법도 도입하고 있습니다.
2020년, 기술 대기업 Microsoft (MSFT ) 는 정지 사진이나 비디오를 분석해 신뢰 점수를 제공하고 미디어가 인위적으로 조작되었는지 판단하는 Video Authenticator를 발표했습니다. 이 도구는 딥페이크의 블렌딩 경계와 인간 눈으로는 감지하기 어려운 미세한 페이딩을 탐지함으로써 작동합니다.
당시에는 위조된 콘텐츠를 식별하고 사용자가 상호작용하는 미디어의 진위를 확인하는 기술도 도입했습니다. 이는 제작자가 디지털 해시와 인증서를 콘텐츠에 추가할 수 있게 하는 도구를 포함했으며, 이는 메타데이터로 콘텐츠에 내재됩니다. 독자는 인증서를 확인하고 해시를 매칭해 콘텐츠 진위를 검증할 수 있게 되었습니다.
(GS )이 기술 대기업은 AI 기반 시대에서 이 기술의 단기적 효용성을 경고했습니다. 딥페이크는 지속적으로 학습하는 AI에 의해 생성되므로 전통적인 탐지 방법을 능가하는 것은 시간 문제입니다.
동시에 Meta 소속 Facebook도 연구자들이 이전에 접근할 수 없었던 데이터를 활용해 딥페이크 탐지기를 개발하는 대회를 시작했습니다.
몇 년 전, Intel (INTC ) 은 실시간 딥페이크 탐지기인 FakeCatcher를 출시했으며, 이는 96%의 정확도를 가지고 있다고 주장합니다.
이 도구는 OpenVino를 사용해 얼굴 및 랜드마크 감지 알고리즘을 위한 AI 모델을 실행했으며, 컴퓨터 비전 블록은 Integrated Performance Primitives와 OpenCV로 최적화되었습니다. 하드웨어 측면에서 이 플랫폼은 3세대 Xeon® Scalable 프로세서에서 동시에 70개 이상의 다양한 탐지 스트림을 실행할 수 있습니다.
FakeCatcher는 무엇이 잘못됐는지를 찾으려는 대신, 인간성을 구성하는 요소를 평가해 진정한 단서를 찾고, 알고리즘이 이러한 신호를 시공간 지도으로 변환한 뒤, 딥러닝을 사용해 비디오가 실제인지 가짜인지를 즉시 감지합니다.
지난해 OpenAI는 콘텐츠 진위 확인을 돕는 도구를 연구하고 있다고 발표했습니다.
여기에는 텍스트 워터마킹이 포함되며, 이는 국부적인 변조에는 효과적이지만 전역적인 변조에는 그다지 효과적이지 않다고 언급했습니다. 또한 비원어민 영어 사용자와 같은 그룹에 “불균형적인 영향을 미칠 수 있다”고 밝혔습니다.
이 업데이트는 월스트리트 저널이 해당 회사가 이미 일정 기간 동안 ChatGPT 생성 텍스트에 워터마크를 삽입하고 “높은 정확도”로 감지하는 도구를 개발했지만, 아직 출시 결정을 내리지 않았다고 보도한 이후에 나왔습니다.
또한 OpenAI는 디지털 콘텐츠 인증을 위한 널리 사용되는 표준인 C2PA(콘텐츠 출처 및 진위 연합)의 운영 위원회에 참여했습니다. 이 회사는 이미지 탐지 도구의 일환으로 모든 서비스에서 생성 및 편집된 이미지에 C2PA 메타데이터를 추가합니다.
올해 Google은 자체 AI 생성 텍스트, 이미지, 오디오 및 비디오 탐지 도구인 SynthID Detector를 출시했습니다.
하지만 Google의 이 도구는 Gemini, Imagen, Veo, Lyria와 같은 Google 자체 AI 서비스로 생성된 콘텐츠에만 작동합니다. 이는 이 도구가 기본적으로 Google 제품이 출력에 삽입한 “워터마크”의 존재를 식별하기 때문입니다.
워터마크는 콘텐츠에 삽입된 고유한 기계 판독 가능한 요소입니다. 인간에게는 인식되지 않지만, 이를 위해 구축된 알고리즘에 의해 감지 및 추출될 수 있습니다.
UNITE의 혁신을 가능하게 하는 기술 내부

따라서 AI 기술이 빠르게 발전함에 따라 이를 활용해 생성된 콘텐츠를 탐지하는 도구도 함께 발전하고 있습니다. 그러나 모든 종류의 AI 콘텐츠에 대해 모두가 사용할 수 있는 보편적인 도구는 아직 없습니다.
게다가 기존 딥페이크 탐지 기술은 특히 입맞춤 동기화나 얼굴 교체와 같은 얼굴 변조에 초점을 맞추고 있으며, 기술의 진보로 인해 이러한 방법들은 충분하지 않게 되었습니다.
텍스트-비디오(T2V) 및 이미지-비디오(I2V) 생성 모델에서 기술 혁신이 크게 진전됨에 따라 누구나 매우 설득력 있는 완전 AI 생성 합성 콘텐츠와 매끄러운 배경 변조를 손쉽게 만들 수 있게 되었습니다. 이는 개인부터 기관, 심지어 국가까지 모두에게 심각한 위험을 초래합니다.
이러한 배경에서, 이전 딥페이크 탐지기가 얼굴에 완전히 의존했던 점은 오늘날 보다 기술적으로 진보된 세계에서 구식이 되었습니다.
“프레임에 얼굴이 없으면 많은 탐지기가 작동하지 않습니다. 그러나 허위 정보는 다양한 형태로 나타날 수 있습니다. 장면의 배경을 변경하는 것만으로도 진실을 쉽게 왜곡할 수 있습니다.”
– Kundu
따라서 기존 탐지기는 새로운 변조에 대해 작동하지 않으며, 전체 장면과 배경을 포함한 새로운 합성 콘텐츠는 얼굴 중심 탐지 방법에 도전이 됩니다.
이는 보다 다재다능한 접근이 필요함을 의미합니다. 이 문제에 대한 해결책으로 UC Riverside 연구원들은 UNITE를 소개했습니다.
전체 프레임 변조를 포착하는 Universal Network for Identifying Tampered and Synthetic Videos(UNITE) 모델이 도입되었습니다.
(META )“딥페이크가 진화했습니다,” 라고 UC Riverside에서 기반 모델을 활용해 이미지 분할 및 가짜 미디어 탐지와 같은 고급 비전 작업에 집중하고 있는 Kundu가 말했습니다. “이제는 단순히 얼굴 교체만이 아니라, 강력한 생성 모델을 사용해 얼굴부터 배경까지 완전한 가짜 비디오를 만들고 있습니다. 우리 시스템은 이러한 모든 것을 포착하도록 구축되었습니다.”
이 모델은 얼굴이나 인간 피사체가 없는 상황에서도 탐지 능력을 확장하며, 그 위에 미세한 공간·시간 차이를 식별하고 이전 시스템이 놓친 복잡한 배경 변조까지 포괄할 수 있습니다.
따라서 얼굴뿐만 아니라 배경 및 움직임 패턴을 검토해 전체 비디오 프레임을 포괄함으로써, UNITE는 얼굴 콘텐츠에만 의존하지 않는 합성 비디오를 식별하는 최초의 도구 중 하나를 제공합니다.
이를 위해 모델은 트랜스포머 기반 딥러닝 모델을 활용합니다. 이는 다중 헤드 어텐션 메커니즘을 사용해 순차 데이터를 처리하는 신경망 유형입니다. 여기서 텍스트는 토큰이라 불리는 수치 표현으로 변환됩니다. 이 아키텍처는 실제로 GPT와 같은 현대 언어 모델들의 기반이 됩니다.
정보를 병렬 처리함으로써 트랜스포머는 더 빠른 학습과 향상된 성능을 가능하게 합니다.
UNITE의 경우, 트랜스포머 기반 아키텍처는 SigLIP-So400M 기반 모델을 통해 비디오에서 추출된 도메인에 구애받지 않는 특징들을 처리합니다. 기본 AI 프레임워크인 SigLIP는 특정 객체나 사람에 제한되지 않은 특징을 추출합니다.
얼굴/배경 및 텍스트-비디오/이미지-비디오 콘텐츠 변화를 모두 포괄하는 제한된 데이터셋 때문에, 팀은 모델을 위해 혁신적인 학습 전략을 사용했습니다. 이는 표준 딥페이크 데이터와 함께 작업과 무관한 데이터를 활용해 학습한다는 의미입니다.
따라서 인기 있는 FaceForensics++ 데이터셋 외에도, 팀은 복잡한 환경을 시뮬레이션하고 다양한 합성 장면을 제공하는 SAIL-VOS-3D 데이터셋을 사용했습니다. 이 데이터셋은 원래 게임 GTA-V의 3D 비디오 객체 분할을 위해 설계되었으며, AI 생성은 아니지만 완전 합성 데이터로 AI 생성 미디어를 시뮬레이션하는 데 도움이 됩니다. 팀은 이것이 모델의 다양한 합성 변조 탐지 능력을 향상시킨다고 발견했습니다.
Google은 모델 학습에 필요한 데이터셋과 컴퓨팅 자원을 제공했습니다.
모델이 얼굴에 과도하게 집중하는 경향을 줄이기 위해, 팀은 비디오 프레임 전반에 걸쳐 다양한 공간 어텐션을 장려하는 attention-diversity(AD) 손실도 사용했습니다.
AD 손실은 교차 엔트로피(로그 손실 함수)와 결합되어, 다양한 상황에서 모델 성능을 향상시키기 위해 기계 학습(ML)에서 일반적으로 사용되는 분류 모델 성능 측정에 활용됩니다.
단순히 교차 엔트로피(CE) 손실만으로 모델을 학습하면, 실제 인간 피사체와 변조된 배경이 있는 비디오나 T2V·I2V 모델이 생성한 콘텐츠를 다루기 어려워집니다.
따라서 팀은 AD 손실을 도입했으며, 이는 시스템이 각 프레임에서 여러 시각 영역을 모니터링하도록 유도해 전경과 배경 모두에서 중요한 신호를 포착하는 모델 능력을 강화합니다.
AD 손실은 팀 접근 방식의 핵심 혁신으로, UNITE가 AI 생성 및 배경 변조 비디오를 탐지하는 데 뛰어날 뿐만 아니라 일반적인 얼굴 변조 콘텐츠를 식별하는 데도 눈에 띄는 향상을 가능하게 합니다.
UNITE와 다른 모델들의 성능을 비교한 결과, 팀은 UNITE가 얼굴/배경 변조와 완전 합성 T2V/I2V 비디오를 포함한 데이터셋(교차 데이터 설정)에서 최첨단 탐지기를 능가하며, 적응력과 일반화 가능한 탐지 능력을 보여준다고 밝혔습니다.
디지털화와 자동화가 점점 진행되는 세상에서, 이 새로운 시스템은 간단한 얼굴 교체부터 실제 영상 없이 만든 복잡한 완전 합성 비디오까지 다양한 가짜를 탐지할 수 있는 보편적인 탐지기를 제공합니다. Kundu에 따르면:
“이 모델 하나로 모든 시나리오를 처리합니다. 이것이 보편성을 부여합니다.”
현재 진행 중인 UNITE는 제작자들에 따르면 합성 비디오 탐지 분야에서 가치 있는 도구이며, 곧 비디오 허위 정보 방어에 핵심적인 역할을 할 것으로 기대됩니다.
AI 기반 탐지에 투자하기
AI 분야에서 Palantir Technologies (PLTR )는 AI 기반 데이터 통합, 패턴 인식 및 이상 탐지로 알려져 있습니다.
이 회사는 네 가지 주요 소프트웨어 플랫폼인 Gotham, Foundry, Apollo, AIP를 운영합니다. Apollo는 구성, 보안 업데이트 및 새로운 기능 제공을 조정하는 단일 제어 레이어로, 핵심 시스템의 지속적인 운영을 보장합니다. Gotham은 사용자가 데이터셋 깊숙이 숨겨진 패턴을 식별하도록 하며, Foundry는 효과적인 자산 및 위험 관리용 운영 체제로 기능합니다. AIP는 기업이 LLM 및 기타 모델을 완전한 제어 하에 실행할 수 있게 합니다.
Palantir Technologies (PLTR )
Palantir는 미국 정부, 군대 및 정보 기관과 깊은 연계를 가지고 있습니다. 올해, 이 회사는 이민 기록에 AI 분석을 도입하기 위해 3,000만 달러 계약을 체결했습니다.
시가총액 3720억 달러인 PLTR 주식은 현재 157.72달러에 거래되고 있으며, AI 수요, 대규모 소매 투자 및 확대되는 정부 계약 덕분에 연초 대비 무려 109.35% 상승했습니다. EPS(TTM)는 0.23이며, P/E(TTM)는 687.90입니다.
PLTR 가격 차트
재무적으로 Palantir는 2025년 1분기에 매출이 전년 대비 39% 증가한 8억 8,400만 달러를 기록했습니다. 미국 매출은 전년 대비 55% 증가한 6억 2,800만 달러이며, 여기에는 2억 5,500만 달러의 미국 상업 매출과 3억 7,300만 달러의 미국 정부 매출이 포함됩니다.
이 기간 동안 회사는 미국 상업 총 계약 가치에서 최고 분기를 기록했으며, 나머지 계약 가치는 23억 2,000만 달러에 달했습니다.
Palantir의 2025년 1분기 고객 수는 전년 대비 39% 증가했습니다. GAAP 주당 순이익은 0.08달러였으며, 조정 EPS는 0.13달러였습니다. 현금 및 현금성 자산, 단기 미국 국채는 분기 말에 54억 달러였습니다.
“우리는 AI 시대에 현대 기업을 위한 운영 체제를 제공하고 있습니다. 특히 미국에서 우리 소프트웨어 채택이 급격히 변화하는 중간 단계에 있습니다.”
– CEO Alexander C. Karp
최신 Palantir Technologies (PLTR) 주식 뉴스 및 개발
결론
인공지능의 등장은 세계를 완전히 바꾸었으며, 개인과 조직 모두 생산성을 향상하고 의사결정을 강화하기 위해 기술을 점점 더 받아들이고 있습니다.
AI가 세계 경제에 수조 달러를 기여할 것으로 예상되지만, 위험이 없는 것은 아닙니다. 딥페이크와 이를 이용한 허위 정보 및 사기는 AI가 널리 채택됨에 따라 가장 중요한 위험 중 하나입니다.
현실과 합성을 구분하기 어려워짐에 따라 UNITE와 같은 도구는 더욱 중요하고 시급해집니다. 이 일반화 가능한 AI 모델이 위조 콘텐츠에 대한 방어 수단이 된다면, AI의 부정적 영향을 완화하면서 업무와 삶에 긍정적인 효과를 증대하고 누릴 수 있을 것입니다.
인공지능 투자에 대해 모두 알아보려면 여기를 클릭하십시오.
참고문헌:
1. Kundu, R.; Xiong, H.; Mohanty, V.; Balachandran, A.; Roy‑Chowdhury, A. K.; et al. Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI‑Generated Content. arXiv preprint arXiv:2412.12278 (2024). https://doi.org/10.48550/arXiv.2412.12278












