Kunstig intelligens
UNITE AI-model kan opdage enhver deepfake uden at være afhængig af ansigter

Forskere tackler nu AI-problemet med AI selv. Forskerne fra UC Riverside har skabt en UNITE-model for at tackle det alvorlige problem med deepfakes.
“Folk fortjener at vide, om det de ser er ægte,” sagde Rohit Kundu, PhD‑kandidat fra UCR’s Marlan and Rosemary Bourns College of Engineering, som ledede papiret ‘Mod en universel syntetisk videodetektor: Fra ansigts- eller baggrundsmanipulationer til fuldt AI‑genereret indhold. 1 “Og efterhånden som AI bliver bedre til at forfalske virkeligheden, må vi blive bedre til at afsløre sandheden.”
Forskerne har samarbejdet med videnskabsfolk fra Google, et Alphabet (GOOG )-firma, for at udvikle en ny AI-model, der opdager videomanipulation og afslører falskt indhold, som bruges til at sprede misinformation og fremkalde skade. Undersøgelsen bemærkede:
“Den hurtige spredning af misinformation, især i kritiske perioder som valg, understreger behovet for generaliserbare detektionsmodeller, der kan identificere forskellige manipulationer, herunder ansigt, baggrund og fuldt AI‑genereret T2V/I2V-indhold med eller uden menneskelige subjekter.”
Modellen er i stand til at opdage både delvist manipulerede og fuldstændigt syntetiske videoer. I stedet for kun at fokusere på ansigtet, som de fleste konventionelle detektorer gør, analyserer denne model hele rammer, uanset om et menneskeligt subjekt er til stede i videoerne.
Dette gør den til et kraftfuldt værktøj, der kan bruges af faktatjekkere, undervisere, redaktører, sociale medieplatforme og andre til at forhindre manipulerede videoer i at gå viralt.
Stigningen i AI og den resulterende syntetiske overbelastning

Kunstig intelligens (AI) har enormt potentiale til at revolutionere forskellige aspekter af både vores liv og arbejde.
Teknologiens evne inden for automatisering, dataanalyse og beslutningstagning har allerede begyndt at transformere industrier og forventes at tilføre flere billioner dollars til den globale økonomi inden udgangen af dette årti.
En undersøgelse af markedsprognosegiganten IDC estimerer at AI’s vækst vil øge den globale økonomi med i alt 19,9 trillioner dollars inden 2030.
McKinseys forskning forventer derimod, at den værditilvækst, som generativ AI kan tilføre, vil være så meget som 4,4 trillioner dollars på tværs af de 63 brugsscenarier, som det globale konsulentfirma har analyseret. Omkring 75 % af den værdi, AI kan levere, vil komme fra blot fire områder:
- F&U
- Softwareudvikling
- Marketing og salg
- Kundeoperationer
Selvom teknologisektoren og bankerne forventes at opleve den største påvirkning som en procentdel af deres indtægter fra generativ AI, er Goldman Sachs (GS ) af samme mening og forventer en 7 % stigning i den globale BNP fra AI. Bankens økonomer, Joseph Briggs og Devesh Kodnani, bemærkede på det tidspunkt:
“På trods af betydelig usikkerhed omkring potentialet for generativ AI, afspejler dens evne til at generere indhold, der er umuligt at skelne fra menneskeskabt output, og at nedbryde kommunikationsbarrierer mellem mennesker og maskiner, et stort fremskridt med potentielt store makroøkonomiske effekter.”
Dog sender denne samme evne for computersystemet til at udføre opgaver som læring, problemløsning og beslutningstagning, som typisk kræver menneskelig intelligens, og som er klar til at ryste verden, også verden i kaos.
Jo mere sofistikeret teknologien bliver, desto slørrere bliver grænsen mellem, hvad der er ægte, og hvad der er falskt.
Hvorfor gamle deepfake-detektorer ikke længere fungerer
| Firma | Værktøj | Detektionsfokus | Begrænsninger |
|---|---|---|---|
| UC Riverside + Google | UNITE | Full-frame (ansigt, baggrund, T2V/I2V) | Stadig under udvikling |
| Microsoft | Video Authenticator | Ansigtsbaserede manipulationer | Forældet i forhold til moderne generativ AI |
| Intel | FakeCatcher | Autenticitet via fysiologiske signaler | Kræver højkvalitets ansigtsoptagelser |
| OpenAI | Tekstvandmærkning | Tekstbaseret AI-output | Begrænset for visuelt indhold |
| SynthID | AI‑genereret vandmærkedetektion | Fungerer kun med Googles AI‑modeller |
I de seneste år har fremskridt inden for AI ført til en hidtil uset stigning i syntetisk medie. Estimatet siger at mere end halvdelen af længere LinkedIn‑indlæg i øjeblikket er skrevet af AI. Så er der også ‘AI slop’, som refererer til lavkvalitets, masseproduceret AI‑genereret indhold.
Men det mest bekymrende er deepfakes, som er billeder, videoer eller lydoptagelser, der er blevet genereret eller ændret ved hjælp af AI. Det er fabrikeret indhold, der bruger AI til at præsentere en falsk repræsentation som realistisk.
I dag er denne type indhold overalt, gennemtrængende alle hjørner af internettet. Disse hyperrealistiske digitale medier forårsager forvirring og spreder misinformation. De udgør også en trussel mod folks privatliv og sikkerhed.
Cyberkriminelle udnytter AI til at hæve deres spil, udfører phishing‑svindel og identitetstyveri med alarmerende præcision. Ifølge Kundu:
“Det er skræmmende, hvor tilgængelige disse værktøjer er blevet. Enhver med moderate færdigheder kan omgå sikkerhedsfiltre og generere realistiske videoer af offentlige personer, der siger ting, de aldrig har sagt.”
I en sådan hændelse udgav cyberkriminelle sig for at være en virksomheds økonomichef (CFO) under et Zoom‑møde, hvilket resulterede i et tab på 25 millioner dollars.
Dette er kun begyndelsen, da Deloitte forudsiger, at tab på grund af svindel fra sådanne hændelser vil nå 40 milliarder dollars i USA inden 2027, op fra 12,3 milliarder i 2023. En rapport fra det amerikanske finansministerium har også fundet, at “eksisterende risikostyringsrammer” vedtaget af virksomheder “måske ikke er tilstrækkelige til at dække nye AI‑teknologier”.
Det betyder ikke, at der ikke findes værktøjer til at hjælpe med at opdage AI‑indhold og beskytte sig mod teknologiens risici. Der findes faktisk mange værktøjer på markedet.
De samme virksomheder, der lancerer nye AI‑værktøjer for at gøre det nemt at skabe nyt indhold, introducerer også metoder til at hjælpe med at opdage syntetiske data.
I 2020 annoncerede teknologigiganten Microsoft (MSFT ) en Video Authenticator til at analysere et stillbillede eller en video for at give en tillidsgrad for at afgøre, om mediet er kunstigt manipuleret. Værktøjet fungerer ved at opdage deepfake’ens blandingsgrænse og subtile udtoning, som det menneskelige øje måske ikke kan opdage.
På tidspunktet introducerede den også teknologi til at identificere forfalsket indhold og bekræfte ægtheden af de medier, folk interagerer med. Det omfattede et værktøj, der gør det muligt for en skaber at tilføje digitale hash‑værdier og certifikater til deres indhold, som lever inden i det som metadata. En læser blev derimod introduceret til at tjekke certifikaterne og matche hash‑værdierne for indholdets ægthed.
Teknologigiganten advarede om teknologiens kortsigtede nytte i den AI‑drevne æra. Da deepfakes genereres af AI, der løbende lærer, er det kun et spørgsmål om tid, før de overgår traditionelle detektionsmetoder.
Omtrent på samme tid startede Facebook, et Meta (META )‑firma, også en konkurrence for at udvikle en deepfake‑detektor ved hjælp af data, som forskere tidligere ikke havde adgang til.
For et par år siden kom Intel (INTC ) med en FakeCatcher, en realtids‑deepfake‑detektor, som de hævder har en nøjagtighed på 96 %.
Værktøjet brugte OpenVino til at køre AI‑modeller for ansigts‑ og landmark‑detektionsalgoritmer, mens computer‑visionsblokke blev optimeret med dets Integrated Performance Primitives og OpenCV. Med hensyn til hardware kan platformen køre mere end halvfjerds forskellige detektionsstrømme samtidigt på sine 3. generation Xeon® Scalable‑processorer.
I stedet for at forsøge at finde, hvad der er galt, søger FakeCatcher autentiske spor ved at vurdere, hvad der gør os menneskelige, og derefter lade algoritmer oversætte disse signaler til spatiotemporale kort, og til sidst bruge dyb læring til øjeblikkeligt at opdage, om en video er ægte eller falsk.
Sidste år annoncerede OpenAI også, at de forsker i værktøjer til at hjælpe med indholdsautenticitet.
Dette inkluderer tekstvandmærkning, som de bemærkede er effektiv mod lokalt manipuleret indhold, men mindre så mod globalt manipuleret indhold. De udtalte også, at det kunne “u forholdsmæssigt påvirke” grupper som ikke‑engelsktalende.
Denne opdatering kom efter at Wall Street Journal rapporterede, at virksomheden allerede har udviklet et værktøj, der vandmærker og opdager ChatGPT‑genereret tekst med “høj nøjagtighed” i et stykke tid, men endnu ikke har besluttet at frigive det.
Derudover er OpenAI blevet medlem af styringskomitéen for C2PA (Coalition for Content Provenance and Authenticity), en bredt anvendt standard for certificering af digitalt indhold. Virksomheden tilføjer C2PA‑metadata til alle billeder, der er oprettet og redigeret af alle dens tjenester, som en del af billeddetektionsværktøjer.
I år har Google også udviklet sit eget AI‑genererede tekst-, billede-, lyd- og video‑detektionsværktøj kaldet SynthID Detector.
Google’s værktøj fungerer dog kun for indhold, der er genereret ved hjælp af teknologigigantens egne AI‑tjenester som Gemini, Imagen, Veo og Lyria. Dette skyldes, at værktøjet grundlæggende identificerer tilstedeværelsen af et “vandmærke”, som Googles produkter har indlejret i deres output.
Et vandmærke er et unikt, maskinlæsbart element, der er indlejret i indhold. Uigenkendeligt for os mennesker kan det opdages og udtrækkes af algoritmer, der er bygget til dette formål.
Bag teknologien, der driver UNITE’s gennembrud

Så mens AI‑teknologien udvikler sig hurtigt, gør også værktøjerne til at opdage indhold, der er genereret med dens hjælp. Men der findes ikke et sådant universelt værktøj, som alle kan bruge på alle former for AI‑indhold.
Desuden fokuserer de eksisterende deepfake‑detektionsteknikker primært på ansigtsmanipulationer som læbesynkronisering eller ansigtsudskiftning, og teknologiske fremskridt gør dem utilstrækkelige.
Med teknologisk innovation, der gør betydelige fremskridt inden for tekst‑til‑video (T2V) og billede‑til‑video (I2V) generative modeller, er det nu muligt for enhver at nemt skabe yderst overbevisende, fuldt AI‑genereret syntetisk indhold og sømløse baggrundsændringer. Dette udgør naturligvis en alvorlig risiko for alle fra enkeltpersoner til institutioner og endda nationer.
I denne sammenhæng gør den fulde afhængighed af tidligere deepfake‑detektorer af ansigtet dem forældede i dagens mere teknologisk avancerede verden.
“Hvis der ikke er et ansigt i rammen, fungerer mange detektorer simpelthen ikke. Men misinformation kan komme i mange former. At ændre en scenes baggrund kan forvride sandheden lige så let.”
– Kundu
Så konventionelle detektorer fungerer ikke på nyere manipulationer, da det nye syntetiske indhold, der nu indeholder fulde scener og baggrunde, udgør en udfordring for ansigtscentrerede detektionsmetoder.
Dette kræver en mere alsidig tilgang. Som en løsning på dette problem har forskerne fra UC Riverside introduceret UNITE.
Den universelle netværk for identifikation af manipulerede og syntetiske videoer (UNITE) model fanger manipulationer på hele rammen.
“Deepfakes har udviklet sig,” sagde Kundu, hvis fokus på UC Riverside er at udnytte grundlæggende modeller til avancerede synsopgaver, herunder billedsegmentering og falsk mediedetektion. “De handler ikke længere kun om ansigtsudskiftninger. Folk skaber nu helt falske videoer – fra ansigter til baggrunde – ved hjælp af kraftfulde generative modeller. Vores system er bygget til at fange alt dette.”
Modellen udvider detektionskapaciteterne til scenarier, hvor der ingen ansigter eller ingen menneskelige subjekter er, og derudover kan den identificere subtile rumlige og tidsmæssige uoverensstemmelser og endda dække komplekse baggrundsmodifikationer, som tidligere systemer har overset.
Så ved at undersøge ansigter såvel som baggrund og bevægelsesmønstre, og derved dække hele video‑rammer, tilbyder UNITE et af de første værktøjer, der kan identificere syntetiske videoer, som ikke kun er afhængige af ansigtsindhold.
Til dette bruger modellen en transformer‑baseret dyb læringsmodel, en type neuralt netværk, der anvender en multi‑head attention‑mekanisme til at behandle sekventielle data. Her konverteres tekst til numeriske repræsentationer kaldet tokens. Denne arkitektur er faktisk grundlaget for mange moderne sprogmodeller som GPT.
Ved at behandle information parallelt kan transformere muliggøre hurtigere træning og forbedret ydeevne.
I tilfældet UNITE behandler den transformer‑baserede arkitektur domæne‑agnostiske funktioner, der udtrækkes fra videoer gennem SigLIP‑So400M grundmodel. Det grundlæggende AI‑framework SigLIP udtrækker funktioner, der ikke er bundet til et specifikt objekt eller en person.
På grund af begrænsede datasæt, der dækker ændringer i både ansigts-/baggrunds‑ og tekst‑til‑video/billede‑til‑video‑indhold, brugte teamet innovative træningsstrategier for deres model. Dette betyder træning med data, der er opgave‑irrelevante, sammen med standard deepfake‑data.
Så ud over det populære FaceForensics++‑datasæt brugte teamet også SAIL‑VOS‑3D‑datasættet, som simulerer komplekse miljøer og tilbyder forskellige syntetiske scener, der er nyttige til træning af AI‑detektionsmodeller. Bemærkelsesværdigt blev det oprindeligt designet til 3D‑video‑objektsegmentering i spillet GTA‑V. Selvom det ikke er AI‑genereret, er datasættet fuldstændigt syntetisk og hjælper derfor med at simulere AI‑genereret medie. Dette fandt teamet at forbedrer modellens evne til at opdage forskellige former for syntetisk manipulation.
Google leverede adgang til de nødvendige datasæt samt computerressourcer til at træne modellen.
For at reducere modellens tendens til at over‑fokusere på ansigter, brugte teamet også et attention‑diversity (AD) tab, som opmuntrer til varieret rumlig opmærksomhed gennem video‑rammer.
AD‑tab er blevet kombineret med cross‑entropy, også kendt som log‑tab‑funktionen, som almindeligt bruges i maskinlæring (ML) til at måle ydeevnen af en klassifikationsmodel, for at forbedre modellens præstation på tværs af forskellige situationer.
Kun at træne modellen på cross‑entropy (CE) tab gør det svært for den at håndtere videoer, hvor der er et ægte menneskeligt subjekt med en manipuleret baggrund eller indhold genereret af T2V‑ og I2V‑modeller.
Derfor introducerede teamet AD‑tab, som får systemet til at overvåge flere visuelle regioner i hver ramme, og dermed øger modellens evne til at opfange vigtige tegn fra både forgrunden og baggrunden.
AD‑tab markerer den centrale innovation i teamets tilgang, som gør det muligt for UNITE ikke kun at udmærke sig i at opdage AI‑genererede og baggrundsændrede videoer, men også at opnå en mærkbar forbedring i identifikation af den sædvanlige ansigtsmanipulerede indhold.
Ved at sammenligne UNITE’s ydeevne med andre modeller fandt teamet, at den “overgår state‑of‑the‑art‑detektorer på datasæt (i cross‑data indstillinger) med ansigts-/baggrundsmanipulationer og fuldstændigt syntetiske T2V/I2V‑videoer, hvilket demonstrerer dens tilpasningsevne og generaliserbare detektionskapaciteter.”
I en verden, der bliver stadig mere digitaliseret og automatiseret, tilbyder det nye system en universel detektor, der kan markere en række falskheder, fra simple ansigtsudskiftninger til komplekse, fuldstændigt syntetiske videoer skabt uden noget rigtigt optagelsesmateriale. Ifølge Kundu:
“Det er én model, der håndterer alle disse scenarier. Det er, hvad der gør den universel.”
UNITE er i øjeblikket under udvikling, og ifølge skaberne er den et værdifuldt værktøj i det voksende landskab for syntetisk videodetektion. Snart kan den forventes at spille en central rolle i forsvaret mod video‑misinformation.
Investering i AI‑baseret detektion
I AI‑verdenen er Palantir Technologies (PLTR ) kendt for sin AI‑drevne dataintegration, mønstergenkendelse og anomali‑detektion.
Virksomheden opererer gennem fire hovedsoftwareplatforme: Gotham, Foundry, Apollo og AIP. Apollo er et enkelt kontrol‑lag, der koordinerer konfiguration, sikkerhedsopdateringer og levering af nye funktioner for at sikre kontinuerlig drift af kritiske systemer. Gotham giver brugere mulighed for at identificere mønstre gemt dybt i datasæt, mens Foundry fungerer som operativsystemet for effektiv aktiv‑ og risikostyring. AIP gør det muligt for virksomheder at køre LLM‑modeller og andre modeller med fuld kontrol.
Palantir Technologies (PLTR )
Palantir har dybe forbindelser til den amerikanske regering, militæret og efterretningsagenturerne. I år har den opnået en kontrakt på 30 millioner dollars for at bringe AI‑analyse til immigrationsregistre.
Med en markedsværdi på 372 milliarder dollars handles PLTR‑aktierne i øjeblikket til 157,72 dollars, oppe på imponerende 109,35 % år‑til‑dato, takket være AI‑efterspørgslen, massiv detailinteresse og udvidende regeringskontrakter. Dens EPS (TTM) er 0,23, og P/E (TTM) er 687,90.
PLTR Prisdiagram
Finansielt rapporterede Palantir en 39 % årlig stigning i omsætning til 884 millioner dollars i Q1 2025. Dens amerikanske omsætning voksede derimod 55 % år‑til‑år til 628 millioner dollars, herunder 255 millioner dollars i kommerciel amerikansk omsætning og 373 millioner dollars i amerikansk regeringsomsætning.
I denne periode registrerede virksomheden sit højeste kvartal for samlet amerikansk kommerciel kontraktværdi, med den resterende aftaleværdi på 2,32 milliarder dollars.
Palantirs kundetælling i 1Q25 steg med 39 % år‑til‑år. Dens GAAP‑indtjening pr. aktie var 0,08 dollars, og justeret EPS var 0,13 dollars. Kontanter, kontantekvivalenter og kortfristede amerikanske statsobligationer udgjorde 5,4 milliarder dollars ved kvartalets slutning.
“Vi leverer operativsystemet for den moderne virksomhed i AI‑æraen. Vi er midt i et tektonisk skift i adoptionen af vores software, især i USA.”
– CEO Alexander C. Karp
Seneste Palantir Technologies (PLTR) aktienyheder og udviklinger
Konklusion
Fremkomsten af kunstig intelligens har fuldstændigt ændret verden, hvor både enkeltpersoner og organisationer i stigende grad omfavner teknologien for at forbedre produktiviteten og styrke beslutningstagningen.
Selvom AI forventes at bidrage med trillioner til verdensøkonomien, er den ikke uden fare. Deepfakes og deres brug til at sprede misinformation og bedrage folk er en af de mest kritiske risici ved AI’s udbredte adoption.
Efterhånden som det bliver sværere at skelne mellem, hvad der er ægte, og hvad der er syntetisk, bliver værktøjer som UNITE stadig vigtigere og mere presserende. Med denne generaliserbare AI‑model som beskyttelse mod forfalsket indhold kan vi muligvis afbøde AI’s negative påvirkning, mens vi forstærker og nyder dens positive effekter på vores arbejde og liv.
Klik her for at lære alt om investering i kunstig intelligens.
Referencer:
1. Kundu, R.; Xiong, H.; Mohanty, V.; Balachandran, A.; Roy‑Chowdhury, A. K.; et al. Mod en universel syntetisk videodetektor: Fra ansigts- eller baggrundsmanipulationer til fuldt AI‑genereret indhold. arXiv preprint arXiv:2412.12278 (2024). https://doi.org/10.48550/arXiv.2412.12278












