Kunstmatige intelligentie
UNITE AI-model kan elke deepfake detecteren zonder afhankelijk te zijn van gezichten

Onderzoekers van de University of California, Riverside en Google ontwikkelden UNITE, een experimenteel model om gemanipuleerde en volledig synthetische video’s te herkennen. Veel oudere detectors letten vooral op gezichten. UNITE analyseert hele beeldkaders, zodat ook veranderingen in een achtergrond of een video zonder mensen beoordeeld kunnen worden. Het model is onderzocht in de CVPR 2025-publicatie van de onderzoekers.
Een detector kan een redactie, platform of onderzoeker helpen bepalen welke video nader onderzoek verdient. Een modelsignaal is echter geen sluitend bewijs dat een video echt of nep is. Nieuwe generatiemodellen, montage, compressie en onbekende distributiekanalen kunnen de foutkans veranderen.
Waarom zijn deepfakes moeilijk te herkennen?
Een deepfake is beeld-, geluids- of videomateriaal dat met digitale technieken is gemaakt of veranderd om een misleidende indruk te wekken. Een video kan een verwisseld gezicht bevatten, maar ook een gewijzigde omgeving of een volledig gegenereerde scène. Een systeem dat alleen naar gezichten kijkt, mist mogelijk die andere vormen.
De groei van generatieve AI maakt overtuigende beelden toegankelijker. Zulke beelden kunnen voor vermaak of creatieve toepassingen worden gebruikt, maar ook voor oplichting en desinformatie. Bij een verdachte video blijven herkomst, publicatiedatum, oorspronkelijke bestanden en onafhankelijke bronnen belangrijk. Zelfs een geavanceerde detector mag die controles niet vervangen.
Welke hulpmiddelen bestonden al?
| Hulpmiddel | Wat het onderzoekt | Belangrijke beperking |
|---|---|---|
| Microsoft Video Authenticator | Sporen van manipulatie in beelden met gezichten | Niet ontworpen als algemene test voor alle nieuwe videovormen |
| Intel FakeCatcher | Fysiologische aanwijzingen in gezichtsvideo | Afhankelijk van geschikt en voldoende duidelijk beeld van een gezicht |
| Google SynthID Detector | Herkenbare SynthID-watermerken | Een afwezig watermerk bewijst niet dat inhoud door een mens is gemaakt |
| UNITE | Patronen in volledige videokaders | Onderzoeksmodel met prestaties die per dataset kunnen verschillen |
Watermerken en herkomstgegevens beantwoorden een andere vraag dan een deepfake-detector. Zij kunnen informatie verschaffen over de oorsprong of bewerking van materiaal wanneer die gegevens aanwezig en betrouwbaar zijn. Een detector probeert visuele patronen te classificeren. Het ontbreken van metadata of een watermerk is op zichzelf geen bewijs van vervalsing.
Hoe werkt UNITE?
UNITE staat voor Universal Network for Identifying Tampered and synthEtic videos. Het gebruikt kenmerken uit volledige videobeelden in plaats van alleen een uitgesneden gezicht. De onderzoekers bouwden voort op SigLIP-So400M om visuele kenmerken te verzamelen en gebruikten een transformermodel voor de classificatie. Daarmee kan het systeem zowel plaatselijke veranderingen als geheel gegenereerde inhoud beoordelen.
Bij het trainen gebruikten de onderzoekers gegevens van verschillende soorten bewerking. De FaceForensics++-verzameling bevat onder meer gezichtsmanipulaties. Daarnaast gebruikten zij materiaal dat niet uitsluitend op gezichten is gericht, waaronder synthetische scènes. De precieze samenstelling van train- en testgegevens is belangrijk: een model dat goed scoort op bekende voorbeelden kan bij een nieuwe techniek alsnog fouten maken.
Een kernonderdeel van de methode is een verliesfunctie voor attention diversity. Die stimuleert het model om niet steeds op dezelfde plek, zoals het gezicht, te letten maar ook andere delen van het beeld te onderzoeken. De onderzoekers combineerden dit met de gebruikelijke classificatietraining. In de gerapporteerde tests hielp dat om verschillende typen manipulatie te herkennen.
Wat tonen de resultaten aan?
In de door de onderzoekers gebruikte datasets presteerde UNITE beter dan diverse vergeleken detectors bij meerdere soorten synthetische of bewerkte video. Het onderzoek is daarmee een stap naar bredere detectie. De naam «universal» betekent niet dat het model iedere huidige of toekomstige deepfake foutloos opspoort. Verschillende beeldkwaliteit, nieuwe generatoren, hercodering door sociale media en opzettelijke tegenmaatregelen kunnen prestaties verminderen.
Het systeem stelt ook niet vast of de inhoud van een authentieke opname waarheidsgetrouw is. Een echte video kan uit zijn context zijn gehaald of met een misleidend bijschrift worden gedeeld. Omgekeerd kan een synthetische video duidelijk als illustratie zijn aangeduid. Detectie, herkomstcontrole en journalistieke verificatie vullen elkaar aan.
Praktische toepassingen
Redacties kunnen een detector gebruiken om binnenkomend materiaal te prioriteren voor handmatige controle. Platforms kunnen hem combineren met meldingen, herkomstgegevens en bezwaarprocedures. Docenten kunnen laten zien waarom een geloofwaardig beeld niet automatisch betrouwbaar bewijs is. Bij financiële fraude is onafhankelijke bevestiging via een bekend communicatiekanaal belangrijker dan vertrouwen op één geautomatiseerde test.
Beperkingen van cijfers en marktverwachtingen
Brede voorspellingen over de economische waarde van AI, de omvang van deepfakefraude of het gebruik van AI-tekst zijn schattingen met verschillende definities. Ze zijn geen gemeten prestatie van UNITE en zeggen niet rechtstreeks iets over de kans dat één specifieke video vals is. Ook claims van andere aanbieders over bijna perfecte detectie zijn afhankelijk van de gebruikte testverzameling.
Alphabet (GOOG ) leverde via Google onderzoekers en middelen voor het project. Dit is geen bewijs dat UNITE al een breed beschikbare commerciële dienst is of een meetbare bijdrage aan de omzet van Alphabet levert.
Conclusie
UNITE richt zich op een reëel tekort van detectors die alleen gezichten onderzoeken. Door het hele beeld mee te nemen, kan het onderzoeksmodel ook achtergrondmanipulaties en volledig gegenereerde scènes analyseren. Het blijft een hulpmiddel met onzekerheid. Voor een betrouwbare beoordeling van video zijn daarnaast brononderzoek, context en menselijk oordeel nodig.












