Artificiell intelligens

UNITE AI-modell kan upptäcka alla deepfakes utan att förlita sig på ansikten

mm
Lägg till Securities.io bland dina föredragna källor på Google
Analyzing a video frame for deepfakes

Forskare tar nu itu med AI-problemet med AI själva. Forskare från UC Riverside har skapat en UNITE-modell för att hantera det allvarliga problemet med deepfakes. 

“Människor förtjänar att veta om det de ser är äkta,” sade Rohit Kundu, doktorand vid UCR:s Marlan and Rosemary Bourns College of Engineering, som ledde artikeln ‘Mot en universell syntetisk videodetektor: Från ansikts- eller bakgrundsmanipulationer till helt AI-genererat innehåll‘.1 “Och när AI blir bättre på att förfalska verkligheten måste vi bli bättre på att avslöja sanningen.”

Forskarna har samarbetat med forskare från Google, ett Alphabet (GOOG )-företag, för att utveckla en ny AI-modell som upptäcker videomanipulation och avslöjar falskt innehåll, som används för att sprida desinformation och uppmuntra skada. Studien noterade:

“Den snabba spridningen av desinformation, särskilt under kritiska perioder som val, understryker behovet av generaliserbara detektionsmodeller som kan identifiera olika manipulationer, inklusive ansikts-, bakgrunds- och helt AI-genererat T2V/I2V-innehåll med/utan mänskliga subjekt.” 

Modellen kan upptäcka både delvis manipulerade och helt syntetiska videor. Istället för att bara fokusera på ansiktet, som de flesta konventionella detektorer gör, analyserar denna modell hela bildrutor, oavsett om en mänsklig subjekt finns i videorna. 
Detta gör den till ett kraftfullt verktyg som kan användas av faktagranskare, utbildare, redaktörer, sociala medieplattformar och andra för att förhindra att manipulerade videor blir virala.

AI:s uppsving och den resulterande syntetiska överbelastningen

Ett trångt digitalt utrymme fyllt med hyperreala ansikten/bilder som svävar som datasplitter.

Artificiell intelligens (AI) har enorm potential att revolutionera olika aspekter av både våra liv och vårt arbete.

Denna tekniks förmåga inom automatisering, dataanalys och beslutsfattande har redan börjat omvandla industrier och förväntas tillföra flera biljoner dollar till den globala ekonomin innan detta årtionde är slut.

En studie av marknadsprognosjätten IDC uppskattar att AI:s uppsving kommer att öka den globala ekonomin med sammanlagt 19,9 biljoner dollar till 2030.

McKinseys forskning förväntar sig samtidigt att värdet som generativ AI tillför kan uppgå till 4,4 biljoner dollar över de 63 användningsfallen som analyserats av det globala managementkonsultföretaget. Ungefär 75 % av det värde som AI kan leverera skulle komma från bara fyra områden:

  • F&U
  • Mjukvaruutveckling
  • Marknadsföring och försäljning
  • Kundoperationer

Även om teknikens påverkan förväntas vara betydande över alla sektorer, kan teknik och bankverksamhet se den största påverkan som andel av sina intäkter från generativ AI. Goldman Sachs (GS ) delar samma syn och förväntar sig en 7 % ökning av den globala BNP:n från AI. Bankens ekonomer, Joseph Briggs och Devesh Kodnani, noterade då:

“Trots betydande osäkerhet kring potentialen för generativ AI, dess förmåga att generera innehåll som är omöjligt att skilja från mänskligt skapat och att bryta ner kommunikationsbarriärer mellan människor och maskiner representerar ett stort framsteg med potentiellt stora makroekonomiska effekter.”

Dock är samma förmåga hos datorsystemet att utföra uppgifter som lärande, problemlösning och beslutsfattande – som vanligtvis kräver mänsklig intelligens och som är på väg att omvälva världen – också en källa till kaos.
Ju mer sofistikerad tekniken blir, desto suddigare blir gränsen mellan vad som är verkligt och vad som inte är det.

Varför gamla deepfake-detektorer inte längre fungerar

Företag Verktyg Detekteringsfokus Begränsningar
UC Riverside + Google UNITE Fullram (ansikte, bakgrund, T2V/I2V) Fortfarande under utveckling
Microsoft Video Authenticator Ansiktsbaserade manipulationer Föråldrad jämfört med modern generativ AI
Intel FakeCatcher Autenticitet via fysiologiska signaler Kräver högkvalitativt ansiktsmaterial
OpenAI Text Watermarking Textbaserad AI-utdata Begränsad för visuellt innehåll
Google SynthID Detektering av AI-genererade vattenmärken Fungerar endast med Googles AI-modeller

Under de senaste åren har framsteg inom AI lett till en oöverträffad ökning av syntetiskt media. Uppskattningar tyder på att mer än hälften av längre LinkedIn-inlägg för närvarande skrivs av AI. Sedan finns det ‘AI-slop’, som avser lågkvalitativt, massproducerat AI-genererat innehåll.

Men det mest oroande är deepfakes, som är bilder, videor eller ljudinspelningar som har genererats eller manipulerats med AI. Det är fabricerat innehåll som använder AI för att presentera en falsk representation som realistisk.

Idag finns detta slags innehåll överallt, genomsyrar alla hörn av internet. Dessa hyperrealistiska digitala medier orsakar förvirring och sprider desinformation. De utgör också ett hot mot människors integritet och säkerhet. 

Cyberkriminella använder AI för att förbättra sina metoder, genomför phishing-bedrägerier och identitetsstölder med alarmerande precision. Enligt Kundu:

“Det är skrämmande hur tillgängliga dessa verktyg har blivit. Alla med måttliga färdigheter kan kringgå säkerhetsfilter och skapa realistiska videor av offentliga personer som säger saker de aldrig har sagt.”

I ett sådant fall utgav sig cyberkriminella för en företags ekonomichef (CFO) under ett Zoom-möte, vilket resulterade i en förlust på 25 miljoner dollar.

Detta är bara början, dock, eftersom Deloitte förutspår att förluster på grund av bedrägerier från sådana incidenter kommer att nå 40 miljarder dollar i USA år 2027, upp från 12,3 miljarder dollar 2023. En rapport från USAs finansdepartement har också funnit att “befintliga riskhanteringsramverk” som antagits av företag “möjligen inte är tillräckliga för att täcka framväxande AI-teknologier”.

Det betyder inte att det inte finns verktyg för att hjälpa till att upptäcka AI-innehåll och skydda sig mot teknikens risker. Det finns faktiskt många verktyg tillgängliga på marknaden.

Samma företag som lanserar nya AI-verktyg för att underlätta skapandet av nytt innehåll introducerar också sätt att hjälpa till att upptäcka syntetisk data.

År 2020 meddelade teknikjätten Microsoft (MSFT ) ett Video Authenticator för att analysera ett stillbild eller video för att ge ett förtroendescore för att avgöra om mediet är artificiellt manipulerat. Verktyget fungerar genom att upptäcka deepfake:ens blandningsgräns och subtila blekningar som det mänskliga ögat kanske inte kan upptäcka.

Vid den tiden introducerade den också teknik för att identifiera förfalskat innehåll och bekräfta äktheten i det media som människor interagerar med. Det inkluderade ett verktyg som låter en skapare lägga till digitala hashvärden och certifikat till sitt innehåll, som lever inom det som metadata. En läsare fick samtidigt möjlighet att kontrollera certifikaten och matcha hashvärdena för att verifiera innehållets äkthet.

Teknikjätten varnade för verktygets kortsiktiga nytta i den AI-drivna eran. Eftersom deepfakes genereras av AI som ständigt lär sig är det bara en tidsfråga innan de överträffar traditionella detektionsmetoder.

Runt samma tid startade Facebook, ett Meta (META )-företag, också en tävling för att utveckla en deepfake-detektor med hjälp av data som forskare tidigare inte hade tillgång till.

För några år sedan utvecklade Intel (INTC ) FakeCatcher, en realtidsdetektor för deepfakes som de påstår har en noggrannhet på 96 %.

Verktyget använde OpenVino för att köra AI-modeller för ansikts- och landmärkesdetekteringsalgoritmer, medan datorvisionsblock optimerades med dess Integrated Performance Primitives och OpenCV. När det gäller hårdvaran kan plattformen köra mer än sjuttio olika detektionsströmmar samtidigt på sina tredje generations Xeon® Scalable-processorer.

Istället för att försöka hitta vad som är fel, letar FakeCatcher efter autentiska ledtrådar genom att bedöma vad som gör oss mänskliga och sedan låta algoritmer översätta dessa signaler till rumsliga och tidsmässiga kartor, och slutligen, med djupinlärning, omedelbart avgöra om en video är äkta eller falsk.

Förra året meddelade OpenAI också att de forskade på verktyg för att hjälpa till med innehållsäkthet.

Detta inkluderar textvattenmärkning, som de påpekade är effektiv mot lokala manipulationer men mindre så mot globaliserade manipulationer. De påstod också att det kan “påverka oproportionerligt” grupper som icke-modersmålstalande engelska.

Denna uppdatering kom efter att Wall Street Journal rapporterade att företaget redan har utvecklat ett verktyg som vattenmärker och upptäcker ChatGPT-genererad text med “hög noggrannhet” under en tid, men ännu inte har beslutat att släppa det.

Dessutom har OpenAI gått med i styrkommittén för C2PA (Coalition for Content Provenance and Authenticity), en allmänt använd standard för certifiering av digitalt innehåll. Företaget lägger till C2PA-metadata till alla bilder som skapas och redigeras av alla dess tjänster, som en del av bilddetektionsverktyg.

I år har Google också utvecklat sitt eget verktyg för att upptäcka AI-genererad text, bild, ljud och video, kallat SynthID Detector.

Verktyget från Google fungerar dock endast för innehåll som har genererats med företagets egna AI-tjänster som Gemini, Imagen, Veo och Lyria. Detta beror på att verktyget i princip identifierar närvaron av ett “vattenmärke” som Googles produkter har inbäddat i sitt resultat.

Ett vattenmärke är ett unikt, maskinläsbart element som är inbäddat i innehållet. Oigenkännbart för oss människor kan det upptäckas och extraheras av algoritmer som är byggda för detta ändamål.

Inuti tekniken som driver UNITE:s genombrott

Ett datorvisionssystem som analyserar en hel videoram

Alltså, i takt med att AI-tekniken utvecklas snabbt, gör även verktygen för att upptäcka innehåll som genereras med dess hjälp det. Men det finns inget sådant universellt verktyg som kan användas av alla för alla typer av AI-innehåll.

Dessutom fokuserar befintliga deepfake-detekteringstekniker, i synnerhet, på ansiktsmanipulationer som läpsynkning eller ansiktsbyte, och tekniska framsteg gör dem otillräckliga.

Med teknisk innovation som gör betydande framsteg inom text‑till‑video (T2V) och bild‑till‑video (I2V) generativa modeller, är det nu möjligt för vem som helst att enkelt skapa högst övertygande, helt AI‑genererat syntetiskt innehåll och sömlösa bakgrundsändringar. Detta, naturligtvis, utsätter alla från individer till institutioner och till och med nationer för allvarlig risk.

Mot denna bakgrund gör den fullständiga beroendet av tidigare deepfake-detektorer på ansiktet dem föråldrade i dagens mer teknologiskt avancerade värld. 

“Om det inte finns något ansikte i bilden fungerar många detektorer helt enkelt inte. Men desinformation kan komma i många former. Att ändra en scenbakgrund kan förvränga sanningen lika lätt.”

– Kundu

Alltså fungerar konventionella detektorer inte på nyare manipulationer, eftersom det nya syntetiska innehållet nu med hela scener och bakgrunder utgör en utmaning för ansiktscentrerade detektionsmetoder.

Detta kräver ett mer mångsidigt tillvägagångssätt. Som en lösning på detta problem har forskare från UC Riverside introducerat UNITE.

Den universella nätverket för att identifiera manipulerade och syntetiska videor (UNITE) fångar manipulationer i hela bildrutor.

“Deepfakes har utvecklats,” sade Kundu, vars fokus vid UC Riverside är att utnyttja grundmodeller för avancerade synuppgifter, inklusive bildsegmentering och upptäckt av falskt media. “Det handlar inte längre bara om ansiktsbyten. Människor skapar nu helt falska videor – från ansikten till bakgrunder – med kraftfulla generativa modeller. Vårt system är byggt för att fånga allt detta.”

Modellen utökar detektionskapaciteten till scenarier där det inte finns ansikten eller mänskliga subjekt, och dessutom kan den identifiera subtila rumsliga och tidsmässiga avvikelser samt även täcka komplexa bakgrundsmodifieringar som tidigare system har missat.

Genom att undersöka ansikten såväl som bakgrund och rörelsemönster, och därmed täcka hela videoram, erbjuder UNITE ett av de första verktygen som identifierar syntetiska videor utan att enbart förlita sig på ansiktsinnehåll.

För detta använder modellen en transformer‑baserad djupinlärningsmodell, en typ av neuralt nätverk som använder en multi‑head‑attention‑mekanism för att bearbeta sekventiell data. Här omvandlas text till numeriska representationer som kallas token. Denna arkitektur är faktiskt grunden för många moderna språkmodeller som GPT.

Genom att bearbeta information parallellt kan transformatorer möjliggöra snabbare träning och förbättrad prestanda.

I fallet UNITE bearbetar den transformer‑baserade arkitekturen domän‑agnostiska funktioner som extraheras från videor via SigLIP‑So400M‑grundmodellen. Det grundläggande AI‑ramverket SigLIP extraherar funktioner som inte är bundna till ett specifikt objekt eller en person.

På grund av begränsade dataset som täcker förändringar både i ansikts-/bakgrunds- och text‑till‑video/ bild‑till‑video‑innehåll, använde teamet innovativa träningsstrategier för sin modell. Detta innebär träning med data som är uppgifts‑irrelevant tillsammans med standard‑deepfake‑data.

Så, förutom det populära FaceForensics++‑datasetet använde teamet även SAIL‑VOS‑3D‑datasetet, som simulerar komplexa miljöer och erbjuder mångsidiga syntetiska scener som är hjälpsamma för att träna AI‑detektionsmodeller. Noterbart är att det ursprungligen designades för 3D‑videobjektsegmentering i spelet GTA‑V. Även om det inte är AI‑genererat är datasetet helt syntetiskt och hjälper därmed till att simulera AI‑genererat media. Detta, fann teamet, förbättrar modellens förmåga att upptäcka olika former av syntetisk manipulation.

Google tillhandahöll åtkomst till de nödvändiga dataset samt beräkningsresurser för att träna modellen.

För att minska modellens benägenhet att överfokusera på ansikten använde teamet även en attention‑diversity (AD)‑loss, som uppmuntrar varierad rumslig uppmärksamhet genom hela videoramarna.

AD‑loss har kombinerats med cross‑entropy, även känd som log‑loss‑funktionen, som vanligtvis används inom maskininlärning (ML) för att mäta prestandan hos en klassificeringsmodell, för att förbättra modellens prestanda i olika situationer.

Att bara träna modellen på cross‑entropy (CE)‑loss gör det svårt för den att hantera videor där det finns ett verkligt mänskligt subjekt med en manipulerad bakgrund eller innehåll genererat av T2V‑ och I2V‑modeller.

Därför introducerade teamet AD‑loss, som får systemet att övervaka flera visuella regioner i varje ram, vilket ökar modellens förmåga att fånga viktiga tecken både från förgrunden och bakgrunden.

AD‑loss markerar nyckelinnovation i teamets tillvägagångssätt, vilket gör att UNITE inte bara excellerar i att upptäcka AI‑genererade och bakgrundsmodifierade videor utan också visar en märkbar förbättring i att identifiera vanligt ansiktsmanipulerat innehåll.

När de jämförde UNITE:s prestanda med andra modeller fann teamet att den “överträffar toppmoderna detektorer på dataset (i cross‑data‑inställningar) som innehåller ansikts‑/bakgrundsmanipulationer och helt syntetiska T2V/I2V‑videor, vilket visar dess anpassningsförmåga och generaliserbara detektionskapacitet.”

I en värld som blir alltmer digitaliserad och automatiserad erbjuder det nya systemet en universell detektor som kan flagga ett brett spektrum av förfalskningar, från enkla ansiktsbyten till komplexa, helt syntetiska videor skapade utan något verkligt filmmaterial. Enligt Kundu:

“Det är en modell som hanterar alla dessa scenarier. Det är vad som gör den universell.”

För närvarande under utveckling är UNITE, enligt dess skapare, ett värdefullt verktyg i det växande landskapet för syntetisk videodetektion. Snart kan det förväntas spela en nyckelroll i att försvara mot videodesinformation.

Investera i AI‑baserad detektion

Inom AI‑området är Palantir Technologies känt för sin AI‑drivna dataintegration, mönsterigenkänning och avvikelsedetektion. 
Företaget verkar genom fyra huvudprogramvaruplattformar: Gotham, Foundry, Apollo och AIP. Apollo är ett enskilt kontrollskikt som koordinerar konfiguration, säkerhetsuppdateringar och leverans av nya funktioner för att säkerställa kontinuerlig drift av kritiska system. Gotham låter användare identifiera mönster dolda djupt i dataset, medan Foundry fungerar som operativsystem för effektiv tillgångs‑ och riskhantering. AIP möjliggör för företag att köra LLM‑modeller och andra modeller med full kontroll.

Palantir Technologies (PLTR )

Palantir har djupa kopplingar till den amerikanska regeringen, militären och underrättelsetjänsterna. I år fick de ett kontrakt på 30 miljoner dollar för att införa AI‑analys i immigrationsregister.

Med ett börsvärde på 372 miljarder dollar handlas PLTR‑aktier för närvarande till 157,72 $, en ökning på hela 109,35 % år‑till‑datum, tack vare AI‑efterfrågan, enormt detaljhandelsintresse och växande statliga kontrakt. Dess EPS (TTM) är 0,23 och P/E (TTM) är 687,90.

PLTR Prisdiagram

Finansiellt rapporterade Palantir en 39 % år‑till‑år ökning i intäkter till 884 miljoner dollar under Q1 2025. Dess amerikanska intäkter växte samtidigt 55 % år‑till‑år till 628 miljoner dollar, inklusive 255 miljoner dollar i amerikanska kommersiella intäkter och 373 miljoner dollar i amerikanska statliga intäkter.

Under denna period bokade företaget sin högsta kvartal för total kontraktsvärde i USA:s kommersiella sektor, med återstående affärsvärde på 2,32 miljarder dollar.

Palantirs kundantal under 1Q25 ökade med 39 % år‑till‑år. Dess GAAP vinst per aktie var 0,08 $, och justerad EPS var 0,13 $. Kassa, likvida medel och kortfristiga amerikanska statsobligationer uppgick till 5,4 miljarder dollar i slutet av kvartalet.

“Vi levererar operativsystemet för det moderna företaget i AI‑eran. Vi befinner oss mitt i en tektonisk förändring i antagandet av vår programvara, särskilt i USA.”

– CEO Alexander C. Karp

Senaste nyheter och utveckling kring Palantir Technologies (PLTR) aktier

Slutsats

Framträdandet av artificiell intelligens har fullständigt förändrat världen, där både individer och organisationer i allt högre grad omfamnar tekniken för att förbättra produktiviteten och stärka beslutsfattandet.

Trots att AI förväntas bidra med biljoner till världsekonomin är den inte utan risker. Deepfakes och deras användning för att vilseleda och lura människor är ett av de mest kritiska farorna med AI:s breda spridning.

När det blir svårare att skilja på vad som är äkta och vad som är syntetiskt blir verktyg som UNITE allt viktigare och mer akuta. Med denna generaliserbara AI‑modell som skydd mot förfalskat innehåll kan vi möjligen mildra AI:s negativa påverkan samtidigt som vi förstärker och njuter av dess positiva effekter på vårt arbete och våra liv.

Klicka här för att lära dig allt om att investera i artificiell intelligens.

Referenser:

1. Kundu, R.; Xiong, H.; Mohanty, V.; Balachandran, A.; Roy‑Chowdhury, A. K.; et al. Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI‑Generated Content. arXiv preprint arXiv:2412.12278 (2024). https://doi.org/10.48550/arXiv.2412.12278

Gaurav började handla med kryptovalutor 2017 och har sedan dess blivit förälskad i kryptorummet. Hans intresse för allt som rör kryptovalutor förvandlade honom till en skribent som specialiserar sig på kryptovalutor och blockchain. Snart fann han sig själv arbeta med kryptoföretag och mediekanaler. Han är också en stor Batman-entusiast.