Kecerdasan buatan

Model AI UNITE Dapat Mendeteksi Semua Deepfake Tanpa Mengandalkan Wajah

mm
Tambahkan Securities.io ke sumber pilihan Anda di Google
Analyzing a video frame for deepfakes

Para ilmuwan kini menangani masalah AI dengan AI itu sendiri. Peneliti dari UC Riverside telah menciptakan model UNITE untuk mengatasi masalah serius deepfake. 

“Orang berhak mengetahui apakah apa yang mereka lihat itu nyata,” kata Rohit Kundu, kandidat PhD dari Marlan and Rosemary Bourns College of Engineering UCR, yang memimpin makalah ‘Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI-Generated Content.1 “Dan seiring AI menjadi lebih baik dalam memalsukan realitas, kita harus menjadi lebih baik dalam mengungkap kebenaran.”

Para peneliti telah bekerja sama dengan ilmuwan dari Google, sebuah perusahaan Alphabet (GOOG ), untuk mengembangkan model AI baru yang mendeteksi manipulasi video dan mengungkap konten palsu, yang digunakan untuk menyebarkan disinformasi dan memicu kerusakan. Studi tersebut mencatat:

“Penyebaran cepat misinformasi, terutama selama periode kritis seperti pemilihan, menyoroti kebutuhan akan model deteksi yang dapat digeneralisasi untuk mengidentifikasi manipulasi beragam, termasuk wajah, latar belakang, dan konten T2V/I2V yang sepenuhnya dihasilkan AI dengan/atau tanpa subjek manusia.”

Model ini mampu mendeteksi video yang sebagian dimanipulasi maupun sepenuhnya sintetis. Alih-alih hanya fokus pada wajah, seperti kebanyakan detektor konvensional, model ini menganalisis seluruh frame, terlepas dari apakah ada subjek manusia dalam video.

Hal ini menjadikannya alat yang kuat yang dapat digunakan oleh pemeriksa fakta, pendidik, editor, platform media sosial, dan lainnya untuk mencegah video yang dimanipulasi menjadi viral.

Kenaikan AI dan Beban Sintetis yang Dihasilkan

A crowded digital space filled with hyperreal faces/images floating like data shards.

Kecerdasan Buatan (AI) memiliki potensi luar biasa untuk merevolusi berbagai aspek kehidupan dan pekerjaan kita. 

Kemampuan teknologi ini dalam otomatisasi, analisis data, dan pengambilan keputusan telah mulai mengubah industri, diproyeksikan menambah triliunan dolar ke ekonomi global menjelang akhir dekade ini.

Sebuah studi oleh raksasa peramalan pasar IDC memperkirakan bahwa kenaikan AI akan meningkatkan ekonomi global sebesar $19,9 triliun kumulatif pada 2030.

Penelitian McKinsey, sementara itu, memperkirakan nilai tambah AI generatif mencapai $4,4 triliun di antara 63 kasus penggunaan yang dianalisis oleh firma konsultan manajemen global. Sekitar 75% nilai yang dapat diberikan AI akan berada hanya di empat bidang:

  • Penelitian & Pengembangan
  • Rekayasa Perangkat Lunak
  • Pemasaran dan Penjualan
  • Operasi Pelanggan

Meskipun dampak teknologi diproyeksikan signifikan di semua sektor, teknologi dan perbankan dapat melihat dampak terbesar sebagai persentase pendapatan mereka dari AI generatif. Goldman Sachs (GS ) memiliki pandangan serupa, memperkirakan peningkatan 7% pada PDB global akibat AI. Para ekonom bank, Joseph Briggs dan Devesh Kodnani, pada saat itu menyatakan:

“Meskipun terdapat ketidakpastian signifikan mengenai potensi AI generatif, kemampuannya menghasilkan konten yang tidak dapat dibedakan dari output buatan manusia dan memecahkan hambatan komunikasi antara manusia dan mesin mencerminkan kemajuan besar dengan efek makroekonomi yang potensial.”

Namun, kemampuan sistem komputer untuk melakukan tugas seperti belajar, memecahkan masalah, dan mengambil keputusan yang biasanya memerlukan kecerdasan manusia, yang siap mengguncang dunia, juga menimbulkan kekacauan. 

Semakin canggih teknologi, semakin kabur batas antara apa yang nyata dan apa yang tidak.

Mengapa Detektor Deepfake Lama Tidak Lagi Berfungsi

Perusahaan Alat Fokus Deteksi Keterbatasan
UC Riverside + Google UNITE Seluruh frame (wajah, latar belakang, T2V/I2V) Masih dalam pengembangan
Microsoft Video Authenticator Manipulasi berbasis wajah Kedaluwarsa dibanding AI generatif modern
Intel FakeCatcher Keaslian melalui sinyal fisiologis Membutuhkan rekaman wajah berkualitas tinggi
OpenAI Text Watermarking Output AI berbasis teks Terbatas untuk konten visual
Google SynthID Deteksi watermark yang dihasilkan AI Hanya berfungsi dengan model AI Google

Selama beberapa tahun terakhir, kemajuan AI telah menyebabkan lonjakan media sintetis yang belum pernah terjadi sebelumnya. Perkiraan menunjukkan bahwa lebih dari setengah posting LinkedIn yang lebih panjang saat ini ditulis oleh AI. Kemudian ada ‘AI slop’, yang merujuk pada konten AI‑generasi massal ber kualitas rendah.

Namun yang paling mengkhawatirkan adalah deepfake, yaitu gambar, video, atau rekaman audio yang dihasilkan atau diubah menggunakan AI. Ini adalah konten buatan yang menggunakan AI untuk menampilkan representasi palsu seolah‑olah realistis.

Saat ini, jenis konten ini ada di mana‑mana, meresap ke semua sudut Internet. Media digital hiper‑realistik ini menyebabkan kebingungan dan menyebarkan misinformasi. Ia juga mengancam privasi dan keamanan orang.

Penjahat siber memanfaatkan AI untuk meningkatkan kemampuan mereka, melakukan penipuan phishing dan pencurian identitas dengan presisi mengkhawatirkan. Menurut Kundu:

“Menakutkan betapa mudahnya alat‑alat ini diakses. Siapa pun dengan keterampilan menengah dapat melewati filter keamanan dan menghasilkan video realistis tokoh publik yang mengatakan hal yang tidak pernah mereka katakan.”

Dalam satu insiden, penjahat siber menyamar sebagai chief financial officer (CFO) perusahaan dalam pertemuan Zoom, mengakibatkan kerugian $25 juta. 

Ini baru permulaan, meskipun Deloitte memperkirakan bahwa kerugian penipuan akibat insiden semacam ini akan mencapai $40 miliar di AS pada 2027, naik dari $12,3 miliar pada 2023. Laporan Departemen Keuangan AS juga menemukan bahwa “kerangka kerja manajemen risiko “yang diadopsi oleh perusahaan “mungkin tidak memadai untuk menutupi teknologi AI yang muncul.”

Bukan berarti tidak ada alat untuk mendeteksi konten AI dan melindungi diri dari risiko teknologi tersebut. Sebenarnya ada banyak alat yang tersedia di pasar.

Perusahaan yang sama yang meluncurkan alat AI baru untuk memudahkan pembuatan konten baru juga memperkenalkan cara untuk membantu mendeteksi data sintetis.

Kembali pada 2020, raksasa teknologi Microsoft (MSFT ) mengumumkan Video Authenticator untuk menganalisis foto atau video guna memberikan skor kepercayaan dalam menentukan apakah media telah dimanipulasi secara artifisial. Alat ini bekerja dengan mendeteksi batas pencampuran deepfake dan pergeseran halus yang tidak dapat dilihat mata manusia.

Pada saat itu, mereka juga memperkenalkan teknologi untuk mengidentifikasi konten palsu dan mengonfirmasi keaslian media yang diakses orang. Alat tersebut memungkinkan pencipta menambahkan hash digital dan sertifikat ke konten mereka, yang tersimpan di dalamnya sebagai metadata. Pembaca, di sisi lain, dapat memeriksa sertifikat dan mencocokkan hash untuk keaslian konten.

Raksasa teknologi tersebut memperingatkan kegunaan jangka pendek teknologi ini di era yang didorong AI. Karena deepfake dihasilkan oleh AI yang terus belajar, hanya masalah waktu sebelum mereka melampaui metode deteksi tradisional.

Pada waktu yang sama, Facebook, sebuah perusahaan Meta (META ) juga memulai sebuah kompetisi untuk mengembangkan detektor deepfake menggunakan data yang sebelumnya tidak dimiliki peneliti.

Beberapa tahun lalu, Intel (INTC ) menghadirkan FakeCatcher, sebuah detektor deepfake waktu nyata yang mereka klaim memiliki akurasi 96%.

Alat ini memanfaatkan OpenVino untuk menjalankan model AI untuk algoritma deteksi wajah dan landmark, sementara blok visi komputer dioptimalkan dengan Integrated Performance Primitives dan OpenCV. Untuk perangkat kerasnya, platform dapat menjalankan lebih dari tujuh puluh aliran deteksi berbeda secara bersamaan pada prosesor Xeon® Scalable generasi ke‑3.

Alih‑alih mencari apa yang salah, FakeCatcher mencari petunjuk otentik dengan menilai apa yang membuat kita manusia dan kemudian memungkinkan algoritma menerjemahkan sinyal tersebut menjadi peta spatio‑temporal, dan akhirnya, menggunakan deep learning untuk secara instan mendeteksi apakah video itu nyata atau palsu.

Tahun lalu, OpenAI juga mengumumkan bahwa mereka meneliti alat untuk membantu keaslian konten.

Ini termasuk watermark teks, yang mereka catat efektif melawan tampering terlokalisasi namun tidak begitu melawan tampering global. Mereka juga menyatakan bahwa hal itu dapat “memberi dampak tidak proporsional“ pada kelompok seperti penutur non‑native bahasa Inggris.

Pembaruan ini datang setelah Wall Street Journal melaporkan bahwa perusahaan telah mengembangkan alat yang menandai watermark dan mendeteksi teks yang dihasilkan ChatGPT dengan “akurasi tinggi” untuk beberapa waktu, namun belum mengambil keputusan untuk merilisnya.

Selain itu, OpenAI telah bergabung dengan Steering Committee C2PA (Coalition for Content Provenance and Authenticity), standar yang banyak dipakai untuk sertifikasi konten digital. Perusahaan menambahkan metadata C2PA ke semua gambar yang dibuat dan diedit oleh semua layanan mereka, sebagai bagian dari alat deteksi gambar.

Kini, tahun ini, Google juga menghadirkan alat deteksi teks, gambar, audio, dan video yang dihasilkan AI bernama SynthID Detector. 

Alat Google, bagaimanapun, hanya berfungsi untuk konten yang dihasilkan menggunakan layanan AI milik raksasa teknologi tersebut seperti Gemini, Imagen, Veo, dan Lyria. Ini karena alat tersebut pada dasarnya mengidentifikasi keberadaan “watermark“ yang disematkan produk Google dalam output mereka.

Watermark adalah elemen unik yang dapat dibaca mesin yang disematkan dalam konten. Tidak dapat dikenali oleh manusia, ia dapat dideteksi dan diekstrak oleh algoritma yang dibangun untuk tujuan tersebut.

Di Dalam Teknologi yang Mendorong Terobosan UNITE

A computer vision system analyzing a full video frame

Jadi, seiring teknologi AI berkembang pesat, alat untuk mendeteksi konten yang dihasilkan dengan bantuannya juga berkembang. Namun belum ada alat universal yang dapat digunakan semua orang untuk semua jenis konten AI.

Selain itu, fokus teknik deteksi deepfake yang ada, khususnya, tetap pada manipulasi wajah seperti sinkronisasi bibir atau pertukaran wajah, dan kemajuan teknologi menjadikannya tidak memadai.

Dengan inovasi teknologi yang membuat kemajuan signifikan dalam model generatif teks‑ke‑video (T2V) dan gambar‑ke‑video (I2V), kini siapa pun dapat dengan mudah menciptakan konten sintetis yang sangat meyakinkan, sepenuhnya dihasilkan AI, serta perubahan latar belakang yang mulus. Hal ini, tentu saja, menempatkan individu, institusi, bahkan negara pada risiko serius.

Dengan latar belakang ini, ketergantungan penuh detektor deepfake sebelumnya pada wajah membuatnya usang di dunia yang semakin maju secara teknologi. 

“Jika tidak ada wajah dalam frame, banyak detektor tidak berfungsi. Namun disinformasi dapat muncul dalam banyak bentuk. Mengubah latar belakang sebuah adegan dapat mendistorsi kebenaran sama mudahnya.”

– Kundu

Jadi, detektor konvensional tidak berfungsi pada manipulasi baru, karena konten sintetis baru kini menampilkan adegan penuh dan latar belakang yang menantang metode deteksi berfokus pada wajah.

Ini menuntut pendekatan yang lebih serbaguna. Sebagai solusi, peneliti dari UC Riverside memperkenalkan UNITE.

Model Universal Network for Identifying Tampered and Synthetic Videos (UNITE) menangkap manipulasi seluruh frame.

“Deepfake telah berevolusi,“ kata Kundu, yang fokusnya di UC Riverside adalah memanfaatkan model fondasi untuk tugas visi lanjutan, termasuk segmentasi gambar dan deteksi media palsu. “Tidak lagi hanya tentang pertukaran wajah. Orang kini membuat video sepenuhnya palsu – dari wajah hingga latar belakang – menggunakan model generatif yang kuat. Sistem kami dibangun untuk menangkap semua itu.”

Model ini memperluas kemampuan deteksi ke skenario tanpa wajah atau tanpa subjek manusia, dan di atas itu, dapat mengidentifikasi ketidaksesuaian spasial dan temporal halus serta menutupi modifikasi latar belakang kompleks yang terlewat sistem sebelumnya.

Jadi, dengan memeriksa wajah serta latar belakang dan pola gerakan, sehingga mencakup seluruh frame video, UNITE menawarkan salah satu alat pertama yang dapat mengidentifikasi video sintetis tanpa bergantung semata pada konten wajah.

Untuk ini, model memanfaatkan model pembelajaran mendalam berbasis transformer,  jenis jaringan saraf yang menggunakan mekanisme perhatian multi‑head untuk memproses data berurutan. Di sini, teks diubah menjadi representasi numerik yang disebut token. Arsitektur ini sebenarnya menjadi dasar bagi banyak model bahasa modern seperti GPT. 

Dengan memproses informasi secara paralel, transformer dapat mempercepat pelatihan dan meningkatkan kinerja.

Dalam kasus UNITE, arsitektur berbasis transformer memproses fitur agnostik domain yang diektrak dari video melalui model fondasi SigLIP‑So400M. Kerangka AI dasar SigLIP mengekstrak fitur yang tidak terikat pada objek atau orang tertentu.

Karena dataset terbatas yang mencakup perubahan pada wajah/latar belakang serta konten teks‑ke‑video/gambar‑ke‑video, tim menggunakan strategi pelatihan inovatif untuk model mereka. Ini berarti melatih menggunakan data yang tidak relevan dengan tugas bersama data deepfake standar. 

Jadi, selain dataset populer FaceForensics++, tim juga menggunakan dataset SAIL‑VOS‑3D, yang mensimulasikan lingkungan kompleks, menawarkan beragam adegan sintetis yang membantu melatih model deteksi AI.  Perlu dicatat, dataset ini awalnya dirancang untuk segmentasi objek video 3D dalam game GTA‑V. Meskipun bukan AI‑generasi, dataset ini sepenuhnya sintetis dan, karenanya, membantu mensimulasikan media yang dihasilkan AI. Tim menemukan bahwa ini meningkatkan kemampuan model mereka dalam mendeteksi berbagai bentuk manipulasi sintetis.

Google menyediakan akses ke dataset yang diperlukan serta sumber daya komputasi untuk melatih model. 

Untuk mengurangi kecenderungan model untuk terlalu fokus pada wajah, tim juga menggunakan loss diversitas‑perhatian (AD), yang mendorong perhatian spasial beragam di seluruh frame video.

Loss AD telah digabungkan dengan cross‑entropy, juga dikenal sebagai fungsi log loss, yang umum dipakai dalam pembelajaran mesin (ML) untuk mengukur kinerja model klasifikasi, guna meningkatkan performa model pada situasi beragam.

Hanya melatih model dengan loss cross‑entropy (CE) cenderung membuatnya sulit menangani video yang memiliki subjek manusia nyata dengan latar belakang yang dimanipulasi atau konten yang dihasilkan oleh model T2V dan I2V.

Oleh karena itu, tim memperkenalkan loss AD, yang memaksa sistem memantau beberapa wilayah visual di setiap frame, sehingga meningkatkan kemampuan model menangkap tanda penting dari latar depan dan latar belakang.

Loss AD menandai inovasi utama dalam pendekatan tim, memungkinkan UNITE tidak hanya unggul dalam mendeteksi video AI‑generasi dan latar belakang yang diubah tetapi juga memiliki peningkatan signifikan dalam mengidentifikasi konten yang biasanya dimanipulasi wajah.

Saat membandingkan kinerja UNITE dengan model lain, tim menemukan bahwa UNITE “mengungguli detektor state‑of‑the‑art pada dataset (dalam pengaturan cross‑data) yang menampilkan manipulasi wajah/latar belakang serta video T2V/I2V sepenuhnya sintetis, menunjukkan adaptabilitas dan kemampuan deteksi yang dapat digeneralisasi.”

Di dunia yang semakin digital dan otomatis, sistem baru ini menawarkan detektor universal yang dapat menandai berbagai jenis palsu, mulai dari pertukaran wajah sederhana hingga video sepenuhnya sintetis yang dibuat tanpa rekaman nyata. Menurut Kundu:

“Ini satu model yang menangani semua skenario ini. Itulah yang membuatnya universal.”

Saat ini dalam proses pengembangan, UNITE, menurut penciptanya, merupakan alat berharga dalam lanskap deteksi video sintetis yang berkembang. Segera, model ini dapat diharapkan memainkan peran kunci dalam melindungi dari disinformasi video.

Berinvestasi dalam Deteksi Berbasis AI

Di ranah AI, Palantir Technologies (PLTR ) dikenal karena integrasi data berbasis AI, pengenalan pola, dan deteksi anomali. 

Perusahaan ini beroperasi melalui empat platform perangkat lunak utama: Gotham, Foundry, Apollo, dan AIP. Apollo adalah lapisan kontrol tunggal yang mengoordinasikan konfigurasi, pembaruan keamanan, dan pengiriman fitur baru untuk memastikan operasi berkelanjutan sistem kritis. Gotham memungkinkan pengguna mengidentifikasi pola tersembunyi dalam dataset, sementara Foundry berfungsi sebagai sistem operasi untuk manajemen aset dan risiko yang efektif. AIP memungkinkan perusahaan menjalankan LLM dan model lainnya dengan kontrol penuh.

Palantir Technologies (PLTR )

Palantir memiliki hubungan mendalam dengan pemerintah AS, militer, dan badan intelijen. Tahun ini, mereka mendapatkan kontrak $30 juta untuk menerapkan analisis AI pada catatan imigrasi.

Dengan kapitalisasi pasar $372 miliar, saham PLTR saat ini diperdagangkan pada $157,72, naik 109,35% YTD, berkat permintaan AI, minat ritel yang besar, dan kontrak pemerintah yang berkembang. EPS (TTM)‑nya 0,23, dan P/E (TTM)‑nya 687,90.

PLTR Grafik Harga

Secara finansial, Palantir melaporkan peningkatan pendapatan 39% YoY menjadi $884 juta pada Q1 2025. Pendapatan AS‑nya, sementara itu, tumbuh 55% YoY menjadi $628 juta, termasuk $255 juta pendapatan komersial AS dan $373 juta pendapatan pemerintah AS.

Selama periode ini, perusahaan mencatat nilai kontrak total komersial AS tertinggi, dengan nilai kesepakatan tersisa sebesar $2,32 miliar. 

Jumlah pelanggan Palantir pada 1Q25 meningkat 39% YoY. EPS GAAP‑nya $0,08, dan EPS yang disesuaikan $0,13. Kas, setara kas, dan sekuritas Treasury AS jangka pendek berjumlah $5,4 miliar pada akhir kuartal.

“Kami menyediakan sistem operasi untuk perusahaan modern di era AI. Kami berada di tengah pergeseran tektonik dalam adopsi perangkat lunak kami, khususnya di AS.”

– CEO Alexander C. Karp

Berita dan Perkembangan Saham Palantir Technologies (PLTR) Terbaru

Kesimpulan

Kedatangan kecerdasan buatan telah mengubah secara total dunia, dengan individu dan organisasi semakin mengadopsi teknologi untuk meningkatkan produktivitas dan meningkatkan pengambilan keputusan.

Diproyeksikan menyumbang triliunan dolar ke ekonomi dunia, AI tidak lepas dari bahaya. Deepfake dan penggunaannya untuk menyesatkan serta menipu orang merupakan salah satu risiko paling kritis dari adopsi AI yang meluas. 

Seiring semakin sulit membedakan antara yang nyata dan yang sintetis, alat seperti UNITE menjadi semakin penting dan mendesak. Dengan model AI yang dapat digeneralisasi ini sebagai perlindungan terhadap konten palsu, kita dapat mengurangi dampak negatif AI sambil memanfaatkan dan menikmati efek positifnya pada pekerjaan dan kehidupan kita.

Klik di sini untuk mempelajari semua tentang berinvestasi dalam kecerdasan buatan.

Referensi:

1. Kundu, R.; Xiong, H.; Mohanty, V.; Balachandran, A.; Roy‑Chowdhury, A. K.; et al. Menuju Detektor Video Sintetis Universal: Dari Manipulasi Wajah atau Latar Belakang hingga Konten yang Sepenuhnya Dihasilkan AI. arXiv preprint arXiv:2412.12278 (2024). https://doi.org/10.48550/arXiv.2412.12278

Gaurav memulai perdagangan cryptocurrency pada 2017 dan telah jatuh cinta dengan ruang crypto sejak saat itu. Minatnya pada semua hal crypto menjadikannya seorang penulis yang berspesialisasi dalam cryptocurrency dan blockchain. Tak lama kemudian, dia menemukan dirinya bekerja dengan perusahaan crypto dan outlet media. Dia juga seorang penggemar besar Batman.