Kunstig intelligens
UNITE AI-modellen kan oppdage enhver deepfake uten å stole på ansikter

Forskere takler nå AI-problemet med AI selv. Forskerne fra UC Riverside har laget en UNITE-modell for å takle det alvorlige problemet med deepfakes.
«Folk fortjener å vite om det de ser er ekte», sa Rohit Kundu, PhD‑kandidat ved UCRs Marlan and Rosemary Bourns College of Engineering, som ledet artikkelen «Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI‑Generated Content».1 «Og etter hvert som AI blir bedre til å forfalske virkeligheten, må vi bli bedre til å avsløre sannheten.»
Forskerne har samarbeidet med vitenskapsfolk fra Google, et Alphabet (GOOG )-selskap, for å utvikle en ny AI-modell som oppdager videomanipulering og avslører falskt innhold, som brukes til å spre desinformasjon og oppfordre til skade. Studien bemerket:
«Den raske spredningen av feilinformasjon, spesielt i kritiske perioder som valg, understreker behovet for generaliserbare deteksjonsmodeller som kan identifisere ulike manipulasjoner, inkludert ansikts-, bakgrunns- og fullstendig AI‑generert T2V/I2V‑innhold med/uten menneskelige subjekter.»
Modellen er i stand til å oppdage både delvis manipulerte og fullstendig syntetiske videoer. I stedet for kun å fokusere på ansiktet, som de fleste konvensjonelle detektorer gjør, analyserer denne modellen hele rammer, uavhengig av om et menneskelig subjekt er tilstede i videoene.
Dette gjør den til et kraftig verktøy som kan brukes av faktasjekkere, lærere, redaktører, sosiale medieplattformer og andre for å hindre at manipulerte videoer blir virale.
Oppgangen av AI og den påfølgende syntetiske overbelastningen

Kunstig intelligens (AI) har enormt potensial for å revolusjonere ulike aspekter av både våre liv og arbeid.
Teknologiens evne til automatisering, dataanalyse og beslutningstaking har allerede begynt å transformere industrier, og den forventes å tilføre flere billioner dollar til verdensøkonomien innen slutten av dette tiåret.
En studie av markedsprognosegiganten IDC estimerer at oppgangen av AI vil øke den globale økonomien med kumulative 19,9 billioner dollar innen 2030.
McKinseys forskning forventer derimot at verdien som generativ AI tilfører kan nå $4,4 billioner på tvers av de 63 brukstilfellene som er analysert av det globale konsulentselskapet. Omtrent 75 % av verdien AI kan levere vil være kun fordelt på fire felt:
- F&U
- Programvareutvikling
- Markedsføring og salg
- Kundeoperasjoner
Selv om virkningen av teknologien er prognostisert å være betydelig på tvers av alle sektorer, kan teknologi‑ og banksektoren se den største påvirkningen som en prosentandel av deres inntekter fra generativ AI. Goldman Sachs (GS ) har samme syn, og forventer en 7 % økning i global BNP på grunn av AI. Bankens økonomer, Joseph Briggs og Devesh Kodnani, bemerket på den tiden at:
«Til tross for betydelig usikkerhet rundt potensialet for generativ AI, representerer dens evne til å generere innhold som er uatskillelig fra menneskeskapt output og å bryte ned kommunikasjonsbarrierer mellom mennesker og maskiner et stort fremskritt med potensielt store makroøkonomiske effekter.»
Imidlertid sender den samme evnen til datasystemet til å utføre oppgaver som læring, problemløsning og beslutningstaking – oppgaver som tradisjonelt krever menneskelig intelligens – også verden inn i kaos.
Jo mer sofistikert teknologien blir, jo mer uklart blir skillet mellom hva som er ekte og hva som er falskt.
Hvorfor gamle deepfake‑detektorer ikke lenger fungerer
| Selskap | Verktøy | Deteksjonsfokus | Begrensninger |
|---|---|---|---|
| UC Riverside + Google | UNITE | Full‑ramme (ansikt, bakgrunn, T2V/I2V) | Fortsatt under utvikling |
| Microsoft | Video Authenticator | Ansiktsbaserte manipuleringer | Utdatert i forhold til moderne generativ AI |
| Intel | FakeCatcher | Autentisitet via fysiologiske signaler | Krever høy‑kvalitets ansiktsopptak |
| OpenAI | Text Watermarking | Tekstbasert AI‑output | Begrenset for visuelt innhold |
| SynthID | Deteksjon av AI‑generert vannmerke | Fungerer kun med Googles AI‑modeller |
I løpet av de siste årene har fremskritt innen AI ført til en enestående bølge av syntetisk media. Estimater tyder på at mer enn halvparten av lengre LinkedIn‑innlegg for tiden skrives av AI. Deretter er det «AI slop», som refererer til lav‑kvalitets, masseprodusert AI‑generert innhold.
Men det mest bekymringsfulle er deepfakes, som er bilder, videoer eller lydopptak som har blitt generert eller endret ved hjelp av AI. Det er fabrikkert innhold som bruker AI til å presentere en falsk representasjon som realistisk.
I dag er denne typen av innhold overalt, gjennomtrenger alle hjørner av Internett. Disse hyper‑realistiske digitale mediene forårsaker forvirring og sprer feilinformasjon. De utgjør også en trussel mot folks personvern og sikkerhet.
Cyberkriminelle utnytter AI for å heve sitt spill, gjennomfører phishing‑svindel og identitetstyveri med alarmerende presisjon. Ifølge Kundu:
«Det er skremmende hvor tilgjengelige disse verktøyene har blitt. Alle med moderate ferdigheter kan omgå sikkerhetsfiltre og generere realistiske videoer av offentlige personer som sier ting de aldri har sagt.»
I en slik hendelse utga cyberkriminelle seg for å være en bedrifts finansdirektør (CFO) under et Zoom‑møte, noe som resulterte i et tap på 25 millioner dollar.
Dette er bare begynnelsen, selv om Deloitte forutsier at svindeltap fra slike hendelser vil nå 40 milliarder dollar i USA innen 2027, opp fra 12,3 milliarder i 2023. En rapport fra US Treasury har også funnet at «eksisterende risikostyringsrammer“ som firmaer har vedtatt «kan være utilstrekkelige for å dekke nye AI‑teknologier.»
Det betyr ikke at det ikke finnes verktøy som kan oppdage AI‑innhold og beskytte seg mot teknologienes risikoer. Det finnes faktisk mange verktøy på markedet.
De samme selskapene som lanserer nye AI‑verktøy for å gjøre det enkelt å lage nytt innhold, introduserer også måter å hjelpe med å oppdage syntetisk data.
Tilbake i 2020 kunngjorde teknologigiganten Microsoft (MSFT ) en Video Authenticator for å analysere et stillbilde eller video for å gi en tillitsgrad for å avgjøre om mediet er kunstig manipulert. Verktøyet fungerer ved å oppdage deepfake‑ens blandingsgrense og subtile fading‑effekter som det menneskelige øyet kanskje ikke oppfatter.
På den tiden introduserte de også teknologi for å identifisere forfalsket innhold og bekrefte autentisiteten til mediene folk interagerer med. Det inkluderte et verktøy som gjør det mulig for en skaper å legge digitale hash‑verdier og sertifikater til innholdet, som lever i det som metadata. En leser kunne derimot sjekke sertifikatene og matche hash‑verdiene for innholdsautentisitet.
Teknologigiganten advarte også om verktøyets kortsiktige nytte i den AI‑drevne æraen. Siden deepfakes genereres av AI som kontinuerlig lærer, er det bare et spørsmål om tid før de overgår tradisjonelle deteksjonsmetoder.
Rundt samme tid startet Facebook, et Meta (META )-selskap, også en konkurranse for å utvikle en deepfake‑detektor ved hjelp av dataene som forskere ikke tidligere hadde tilgang til.
For noen år siden kom Intel (INTC ) med en FakeCatcher, en sanntids‑deepfake‑detektor som de hevder har en nøyaktighet på 96 %.
Verktøyet brukte OpenVino for å kjøre AI‑modeller for ansikts‑ og landemerke‑deteksjonsalgoritmer, mens datamaskinsyn‑blokker ble optimalisert med dets Integrated Performance Primitives og OpenCV. Når det gjelder maskinvaren, kan plattformen kjøre mer enn sytti ulike deteksjons‑strømmer samtidig på sine 3.‑generasjons Xeon® Scalable‑prosessorer.
I stedet for å lete etter hva som er galt, ser FakeCatcher etter autentiske ledetråder ved å vurdere hva som gjør oss menneskelige og deretter lar algoritmer oversette disse signalene til rom‑tid‑kart, og til slutt, ved hjelp av dyp‑læring umiddelbart oppdage om en video er ekte eller falsk.
I fjor kunngjorde også OpenAI at de forsket på verktøy for å hjelpe med innholdsautentisitet.
Dette inkluderer tekst‑vannmerking, som de bemerket er effektivt mot lokalisert manipulering, men ikke så mye mot global manipulering. De uttalte også at det kunne «disproportionelt påvirke» grupper som ikke‑innfødte engelsktalende.
Denne oppdateringen kom etter at Wall Street Journal rapporterte at selskapet allerede har utviklet et verktøy som vannmerker og oppdager ChatGPT‑generert tekst med «høy nøyaktighet» i en periode, men har ennå ikke tatt en beslutning om å slippe den.
I tillegg har OpenAI blitt med i styringskomiteen for C2PA (Coalition for Content Provenance and Authenticity), en mye brukt standard for digital innholdscertifisering. Selskapet legger til C2PA‑metadata i alle bilder som opprettes og redigeres av alle sine tjenester, som en del av bildedeteksjonsverktøyene.
Nå i år har også Google lansert sitt eget AI‑genererte tekst‑, bilde‑, lyd‑ og videodeteksjonsverktøy kalt SynthID Detector.
Verktøyet fra Google fungerer imidlertid kun for innhold som er generert ved hjelp av teknologigigantens egne AI‑tjenester som Gemini, Imagen, Veo og Lyria. Dette er fordi verktøyet i hovedsak identifiserer tilstedeværelsen av et «vannmerke» som Googles produkter har innebygd i deres output.
Et vannmerke er et unikt, maskinlesbart element som er innebygd i innhold. Uleselig for oss mennesker, kan det oppdages og ekstraheres av algoritmer utviklet for dette formålet.
Innsiden av teknologien som driver UNITE‑gjennombruddet

Så, etter hvert som AI‑teknologien utvikler seg raskt, gjør også verktøyene for å oppdage innhold generert med dens hjelp. Men det finnes ingen universell løsning som kan brukes av alle på alle typer AI‑innhold.
Dessuten fokuserer eksisterende deepfake‑deteksjonsteknikker, spesielt, på ansiktsmanipuleringer som leppesynkronisering eller ansiktsbytte, og fremskritt innen teknologien gjør dem utilstrekkelige.
Med teknologisk innovasjon som gjør betydelige fremskritt innen tekst‑til‑video (T2V) og bilde‑til‑video (I2V) generative modeller, er det nå mulig for hvem som helst å enkelt lage svært overbevisende, fullstendig AI‑generert syntetisk innhold og sømløse bakgrunnsendringer. Dette, selvfølgelig, setter både enkeltpersoner, institusjoner og til og med nasjoner i alvorlig fare.
Mot denne bakgrunnen gjør den totale avhengigheten av tidligere deepfake‑detektorer av ansiktet dem utdaterte i dagens mer teknologisk avanserte verden.
«Hvis det ikke er noe ansikt i rammen, fungerer mange detektorer rett og slett ikke. Men desinformasjon kan komme i mange former. Å endre bakgrunnen i en scene kan forvrenge sannheten like lett.»
– Kundu
Så, konvensjonelle detektorer fungerer ikke på nyere manipuleringer, da det nye syntetiske innholdet nå viser fullstendige scener og bakgrunner som utfordrer ansikts‑sentrerte deteksjonsmetoder.
Dette krever en mer allsidig tilnærming. Som en løsning på dette problemet har forskere fra UC Riverside introdusert UNITE.
Den universelle nettverket for identifisering av manipulert og syntetisk video (UNITE)‑modellen fanger opp manipuleringer i hele rammen.
«Deepfakes har utviklet seg,» sa Kundu, som ved UC Riverside fokuserer på å utnytte grunnleggende modeller for avanserte synsoppgaver, inkludert bildesegmentering og oppdagelse av falskt media. «De handler ikke lenger bare om ansiktsbytter. Folk lager nå helt falske videoer – fra ansikter til bakgrunner – ved hjelp av kraftige generative modeller. Systemet vårt er bygget for å fange opp alt dette.»
Modellen utvider deteksjonskapasiteten til scenarier uten ansikter eller uten menneskelige subjekter, og i tillegg kan den identifisere subtile rom‑ og tidsavvik og til og med dekke komplekse bakgrunnsendringer som tidligere systemer har gått glipp av.
Så, ved å undersøke ansikter så vel som bakgrunn og bevegelsesmønstre, dermed dekke hele videorammer, tilbyr UNITE et av de første slike verktøyene for å identifisere syntetiske videoer som ikke kun er avhengige av ansiktsinnhold.
For dette bruker modellen en transformer‑basert dyp‑læringsmodell, en type nevralt nettverk som benytter en multi‑head‑attention‑mekanisme for å behandle sekvensielle data. Her blir tekst konvertert til numeriske representasjoner kalt tokens. Denne arkitekturen er faktisk grunnlaget for mange moderne språkmodeller som GPT.
Ved å behandle informasjon parallelt, kan transformere muliggjøre raskere trening og forbedret ytelse.
I tilfelle av UNITE behandler den transformer‑baserte arkitekturen domene‑agnostiske funksjoner som ekstraheres fra videoer gjennom SigLIP‑So400M‑grunnmodellen. Den grunnleggende AI‑rammeverket SigLIP trekker ut funksjoner som ikke er bundet til et spesifikt objekt eller en person.
På grunn av begrensede datasett som dekker endringer både i ansikt/bakgrunn og tekst‑til‑video/ bilde‑til‑video‑innhold, brukte teamet innovative treningsstrategier for modellen sin. Dette betyr trening med data som er oppgave‑irrelevante sammen med standard deepfake‑data.
Så, i tillegg til det populære FaceForensics++‑datasettet, brukte teamet også SAIL‑VOS‑3D‑datasettet, som simulerer komplekse miljøer og tilbyr ulike syntetiske scener som er nyttige for trening av AI‑deteksjonsmodeller. Merk at dette opprinnelig ble designet for 3D‑videobjekt‑segmentering i spillet GTA‑V. Selv om det ikke er AI‑generert, er datasettet fullstendig syntetisk og hjelper dermed med å simulere AI‑generert media. Dette, fant teamet, forbedrer modellens evne til å oppdage ulike former for syntetisk manipulering.
Google ga tilgang til de nødvendige datasett samt beregningsressurser for å trene modellen.
For å redusere modellens tendens til over‑fokus på ansikter, brukte teamet også en attention‑diversity (AD)‑loss, som oppmuntrer til variert romlig oppmerksomhet gjennom videorammer.
AD‑loss har blitt kombinert med cross‑entropy, også kjent som log‑loss‑funksjonen, og er vanlig i maskinlæring (ML) for å måle ytelsen til en klassifiseringsmodell, for å forbedre modellens ytelse på tvers av ulike situasjoner.
Just training the model on cross‑entropy (CE) loss tends to make it hard for it to handle videos where there’s a real human subject with a manipulated background or content generated by T2V and I2V models.
Derfor introduserte teamet AD‑loss, som får systemet til å overvåke flere visuelle regioner i hver ramme, og dermed øker modellens evne til å fange opp viktige tegn fra både forgrunnen og bakgrunnen.
AD‑loss markerer den viktigste innovasjonen i teamets tilnærming, som gjør at UNITE ikke bare utmerker seg i å oppdage AI‑genererte og bakgrunn‑endrede videoer, men også har en merkbar forbedring i å identifisere vanlig ansikts‑manipulert innhold.
Ved å sammenligne ytelsen til UNITE med andre modeller, fant teamet at den «overgår state‑of‑the‑art‑detektorer på datasett (i cross‑data‑innstillinger) som inneholder ansikt‑/bakgrunns‑manipuleringer og fullstendig syntetiske T2V/I2V‑videoer, og viser sin tilpasningsevne og generaliserbare deteksjonskapasitet.»
I en verden som blir stadig mer digitalisert og automatisert, tilbyr det nye systemet en universell detektor som kan flagge et spekter av falskheter, fra enkle ansiktsbytter til komplekse, fullstendig syntetiske videoer laget uten ekte opptak. Ifølge Kundu:
«Det er én modell som håndterer alle disse scenarioene. Det er det som gjør den universell.»
For tiden under utvikling, UNITE, ifølge skaperne, er et verdifullt verktøy i det voksende landskapet for syntetisk videodeteksjon. Snart kan den forventes å spille en nøkkelrolle i forsvaret mot video‑desinformasjon.
Investering i AI‑basert deteksjon
I AI‑verdenen er Palantir Technologies (PLTR ) kjent for sin AI‑drevne dataintegrasjon, mønstergjenkjenning og avviksdeteksjon.
Selskapet opererer gjennom fire hovedprogramvareplattformer: Gotham, Foundry, Apollo og AIP. Apollo er et enkelt kontroll‑lag som koordinerer konfigurasjon, sikkerhetsoppdateringer og levering av nye funksjoner for å sikre kontinuerlig drift av kritiske systemer. Gotham gjør det mulig for brukere å identifisere mønstre skjult dypt i datasett, mens Foundry fungerer som operativsystemet for effektiv eiendoms‑ og risikostyring. AIP gjør det mulig for firmaer å kjøre LLM‑er og andre modeller med full kontroll.
Palantir Technologies (PLTR )
Palantir har dype bånd til den amerikanske regjeringen, militæret og etterretningsbyråene. I år har de sikret en kontrakt på 30 millioner dollar for å bringe AI‑analyse til immigrasjonsregistre.
Med en markedsverdi på 372 milliarder dollar, handles PLTR‑aksjene for tiden til 157,72 $, opp 109,35 % år‑til‑dato, takket være AI‑etterspørsel, massiv detaljistinteresse og ekspanderende offentlige kontrakter. EPS (TTM) er 0,23, og P/E (TTM) er 687,90.
PLTR Prisdiagram
Finansielt rapporterte Palantir en 39 % år‑til‑år økning i inntekter til 884 millioner dollar i Q1 2025. US‑inntektene økte 55 % år‑til‑år til 628 millioner dollar, inkludert 255 millioner dollar i kommersiell US‑inntekt og 373 millioner dollar i amerikansk regjeringsinntekt.
I denne perioden registrerte selskapet sin høyeste kvartal for total kontraktsverdi i US‑kommersielle avtaler, med den resterende avtaleverdien på 2,32 milliarder dollar.
Palantirs kundebase i 1Q25 økte med 39 % år‑til‑år. GAAP‑resultat per aksje var 0,08 $, og justert EPS var 0,13 $. Kontanter, kontantekvivalenter og kortsiktige amerikanske statsobligasjoner var 5,4 milliarder dollar ved kvartalsslutt.
«Vi leverer operativsystemet for den moderne virksomheten i AI‑æraen. Vi er midt i et tektonisk skifte i adopsjonen av vår programvare, spesielt i USA.»
– CEO Alexander C. Karp
Latest Palantir Technologies (PLTR) Stock News and Developments
Conclusion
Fremveksten av kunstig intelligens har fullstendig endret verden, med både enkeltpersoner og organisasjoner som i økende grad omfavner teknologien for å forbedre produktiviteten og forsterke beslutningstakingen.
Forventet å bidra med trillioner til verdensøkonomien, er AI ikke uten sine farer. Deepfakes og deres bruk for å feilinformere og svindle folk er en av de mest kritiske risikoene ved AI‑s breddeadopsjon.
Ettersom det blir vanskeligere å skille mellom hva som er ekte og hva som er syntetisk, blir verktøy som UNITE stadig viktigere og mer presserende. Med denne generaliserbare AI‑modellen som beskyttelse mot forfalsket innhold, kan vi kanskje dempe de negative virkningene av AI samtidig som vi utnytter og nyter de positive effektene på arbeid og liv.
Klikk her for å lære alt om investering i kunstig intelligens.
References:
1. Kundu, R.; Xiong, H.; Mohanty, V.; Balachandran, A.; Roy‑Chowdhury, A. K.; et al. Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI‑Generated Content. arXiv preprint arXiv:2412.12278 (2024). https://doi.org/10.48550/arXiv.2412.12278












