Künstliche Intelligenz
Optisches Computing könnte die Kosten für die Deepfake-Erkennung senken

Das Erzeugen überzeugender synthetischer Videos wird immer einfacher. Das Prüfen, ob ein solches Video authentisch ist, stellt eine andere Herausforderung dar: Es muss die erforderliche Rechenleistung, Strom und Prüfkraft bereitgestellt werden, um es zu untersuchen.
Für Plattformen, die große Mengen an Uploads verarbeiten, ist die Erkennungsgenauigkeit nur ein Teil der Gleichung. Ein Verifizierungssystem muss Inhalte zudem kostengünstig verarbeiten und verdächtiges Material zur weiteren Untersuchung weiterleiten, ohne die Prüfer zu überlasten.
Eine neue UCLA-Studie, veröffentlicht in eLight, untersucht einen ungewöhnlichen Ansatz für dieses Problem: die Nutzung von Licht, um einen Teil des Erkennungsprozesses durchzuführen.1 Die Forschenden zeigten ein hybrides System, das 15 Videos parallel prüft und digitale neuronale Verarbeitung mit einem optischen Decoder kombiniert. Seine Bedeutung reicht über Deepfakes hinaus und liefert ein praktisches Beispiel dafür, wie spezialisierte Hardware die Wirtschaftlichkeit von KI-Inferenz verändern könnte.
Wie optisches Computing Deepfake-Videos erkennt
Konventionelle KI-Detektoren analysieren Videos mittels mathematischer Operationen, die auf elektronischen Prozessoren ausgeführt werden. Die UCLA-Architektur behält die digitale Verarbeitung bei, überträgt jedoch eine spätere Klassifikationsstufe auf ein optisches System.
Zunächst extrahiert ein digitales neuronales Netzwerk nützliche Informationen aus ausgewählten Videoframes. Diese kompakte Darstellung wird auf einen programmierbaren räumlichen Lichtmodulator codiert, ein Gerät, das das Verhalten des einfallenden Lichts über seine Oberfläche steuert.
Das Licht durchläuft anschließend den optischen Decoder und erzeugt Intensitätsmuster, die eine Echt‑oder‑Fake‑Klassifikation unterstützen. Anstatt jede Decoder‑Berechnung elektronisch auszuführen, nutzt das System das physikalische Verhalten des Lichts, um eine erlernte Transformation zu implementieren.
Räumliches Multiplexing ermöglicht es, Darstellungen verschiedener Videos in separaten Bereichen desselben Modulators zu platzieren. Der optische Decoder bewertet daher mehrere Eingaben in einem einzigen Durchlauf.
Das bedeutet nicht, dass 15 komplette Videodateien sofort verifiziert werden. Die Auswahl von Frames, die digitale Codierung, das Laden des Modulators und das Auslesen des Ergebnisses bleiben erforderlich. Der Parallelismus bezieht sich auf die optische Stufe, wodurch die Architektur zu einem spezialisierten Beschleuniger innerhalb eines größeren Workflows wird.
Was die Deepfake‑Erkennungsstudie demonstrierte
Die Forschenden evaluierten das Framework mit Datensätzen, die Face‑Swaps, reale Deepfake‑Aufnahmen und vollständig KI‑generierte Videos umfassen. In seiner experimentellen Celeb‑DF‑Konfiguration verarbeitete das System 15 Videos pro optischem Durchlauf und erreichte eine durchschnittliche Genauigkeit von 97,79 %.
Die folgenden Ergebnisse stammen direkt aus dem Papier. Sie beschreiben die experimentelle Celeb‑DF‑Konfiguration und nicht die Leistung über alle Datensätze hinweg oder über zukünftige Video‑Generatoren.
| Metrik | Gemeldetes Ergebnis |
|---|---|
| Videos pro optischem Durchlauf | 15 |
| Erkennungsgenauigkeit | 97.79% |
| Sensitivität | 99.86% |
| Spezifität | 95.72% |
| Genauigkeit bei 18 parallelen Videos | 96.13% |
Sensitivität misst, wie viele gefälschte Videos der Detektor korrekt identifiziert. Spezifität misst, wie viele echte Videos er korrekt erkennt. Die Kombination deutet auf ein System hin, das besonders geeignet ist, verdächtige Inhalte bereits vor einer zweiten Verifizierungsstufe zu erfassen.
Die Erhöhung der Parallelverarbeitung auf 18 Videos reduzierte die experimentelle Genauigkeit auf 96,13 %. Das veranschaulicht einen bekannten ingenieurtechnischen Kompromiss: Eine höhere Kapazität kann Interferenzen und andere physikalische Beschränkungen einführen, die die Leistung beeinflussen.
Die Forschenden untersuchten zudem Degradation, Kompression, Fehljustierung und adversarielle Manipulationen. Diese Tests untermauern das Argument für weitere Entwicklungen, garantieren jedoch keine zuverlässige Erkennung jedes unbekannten Generators oder Immunität gegen Angriffe.
Warum Fehlalarme die Verifizierungskosten bestimmen
Die praktischste kommerzielle Frage ist, was nach einer Alarmmeldung des Detektors geschieht. Ein hochsensibles Screening‑System kann die meisten Fälschungen erfassen und gleichzeitig beträchtliche Mengen echten Materials zur weiteren Analyse weiterleiten.
Betrachten wir einen illustrativen Arbeitsaufwand von 100 000 Videos, von denen 1 % gefälscht sind. Wenn die gemeldete Sensitivität und Spezifität unverändert auf diesen Arbeitsaufwand übertragen würden, würden etwa 999 gefälschte Videos markiert, zusammen mit ungefähr 4 237 echten Videos. Nur etwa 19 % des markierten Inhalts wären tatsächlich gefälscht.
Dies ist eine Berechnung, die die Auswirkung der Prävalenz veranschaulicht, kein Deployment‑Ergebnis der Studie. Die tatsächliche Leistung würde vom Inhaltsmix, dem Entscheidungsschwellenwert und den Unterschieden zwischen Produktions‑Uploads und Benchmark‑Daten abhängen.
Dennoch erklärt sie, warum die Autoren einen Filter der ersten Stufe vorschlagen. Ein Alarm sollte eine Untersuchung auslösen, anstatt automatisch zu einer öffentlichen Anschuldigung oder einer Löschentscheidung zu führen.
Der Business‑Case hängt folglich von mehreren zusammenhängenden Maßnahmen ab:
- Energie- und Verarbeitungskosten pro geprüftem Video.
- Der Anteil der Uploads, die einer weiteren Verifizierung bedürfen.
- Verpasste Manipulationen und falsche Eskalationsraten.
- Hardware‑Nutzung, Wartungs‑ und Integrationskosten.
Eine günstigere Screening‑Stufe könnte eine breitere Verifizierung erschwinglich machen. Allerdings müssen etwaige Einsparungen im Kontext der Kosten der daraus entstehenden nachgelagerten Arbeitslast bewertet werden.
Energieeinsparungen durch optische KI benötigen System‑Ebene‑Kontext
Das Papier schätzt erhebliche Reduzierungen des Energieverbrauchs des Decoders im Vergleich zu einem digitalen Decoder mit vergleichbarer Leistung. Der Unterschied zwischen dieser Komponente und dem Gesamtsystem ist bedeutsam.
Mit dem vollständigen digitalen Encoder verbraucht die hybride Konfiguration geschätzt 180,20–182,93 Millijoule pro Video, verglichen mit 209,26 Millijoule für den gewählten digitalen Referenzwert. Das entspricht etwa 13–14 % geringerem End‑to‑End‑Energieverbrauch.
Der Einsatz eines leichteren Encoders erhöht die geschätzten Einsparungen auf etwa 38–42 % gegenüber der entsprechenden digitalen Konfiguration. Eine Reduzierung der Encoder‑Komplexität wirkt sich zudem auf die Erkennungsleistung aus, wobei zusätzliche passive optische Schichten helfen, Genauigkeit und Spezifität wiederherzustellen.
Dies sind Modellierungs‑Schätzungen, die auf rechnerischen Annahmen und Leistungsbudgets der Komponenten basieren. Sie stellen keine gemessenen Stromersparnisse eines betriebenen Moderations‑Dienstes dar und zeigen auch keine Überlegenheit gegenüber jedem optimierten GPU‑Detektor.
Die übergeordnete Lehre lautet, dass die Beschleunigung einer Stufe nur begrenzte Vorteile bringt, wenn eine andere Stufe den Verbrauch dominiert. Optische Hardware wird wertvoller, wenn die umgebende digitale Pipeline so konzipiert ist, dass sie sie nutzt.
Eine kommerzielle Bewertung müsste zudem Anschaffungskosten, Ausrichtungsstabilität, Ersatzkomponenten und Verarbeitungsverzögerungen berücksichtigen. Ein System, das kontinuierlich mit vollen Stapeln arbeitet, könnte völlig andere Wirtschaftlichkeitsbedingungen haben als eines, das sporadische Anfragen verarbeitet.
Deepfake‑Erkennung ergänzt Inhalts‑Provenienz
Die Verifizierung entwickelt sich entlang mehrerer Pfade. Die Erkennung prüft Inhalte auf Anzeichen von Erzeugung oder Manipulation. Provenienz‑Systeme protokollieren Informationen darüber, woher ein Asset stammt und wie es erstellt oder bearbeitet wurde.
Im Mai 2026 beschrieb OpenAI seinen erweiterten Ansatz zur Inhalts‑Provenienz, einschließlich Content Credentials, SynthID‑Wasserzeichen und Verifizierungs‑Tools. Diese Ansätze liefern Signale, die forensische Detektoren ergänzen können.
Fehlende Credentials beweisen nicht, dass ein Video gefälscht ist. Ebenso beweist ein Nachweis über die Herkunft einer Datei nicht, dass alles, was darin dargestellt oder behauptet wird, wahr ist. Eine echte Aufnahme kann dennoch irreführend präsentiert werden.
Ein praktischer Arbeitsablauf könnte daher Provenienz‑Prüfungen, kostengünstiges Screening, tiefere forensische Analysen und menschliche Untersuchungen kombinieren. Optische Berechnung könnte zur Screening‑Schicht beitragen, ohne das gesamte Authentizitätsproblem lösen zu müssen.
Die finanzielle Relevanz ist bereits greifbar. FINRAs Leitfaden vom Juni 2026 zu Deepfakes und Identitätsbetrugs‑Scams beschreibt Bedrohungen, die gefälschte Ähnlichkeiten und Stimmen umfassen. Der UCLA‑Video‑Detektor adressiert nicht jede dieser Bedrohungen, insbesondere Audio‑Only‑Angriffe, konzentriert sich jedoch auf einen Teil der breiteren Verifizierungs‑Herausforderung.
Texas Instruments bietet Zugang zu optischer Hardware
Diese Entwicklungen passen auch zu einer breiteren Investitionsverschiebung hin zur physischen Infrastruktur, die KI unterstützt. Die Berichterstattung von Securities.io über den AI‑Hardware‑Fokus des Machine Age Fund hebt das zunehmende Interesse an Chips, Netzwerken, Speicher und kompletten Rechensystemen hervor.
Texas Instruments (TXN ) bietet über programmierbare optische Komponenten eine relevante Verbindung. Seine DLP‑Technologie umfasst Phasen‑Lichtmodulatoren, wobei Evaluierungs‑Hardware für Phasen‑Lichtmodulatoren die Entwicklung fortschrittlicher Lichtsteuerungs‑Anwendungen unterstützt.
TXN Preisdiagramm
Das UCLA‑Papier verweist auf Forschungen, die die DLP‑Technologie von Texas Instruments zu einem Phasen‑Spatial‑Light‑Modulator anpassen, im Kontext schnellerer optischer Implementierungen. Dies schafft eine spezifische technische Verbindung, beweist jedoch nicht, dass TI das demonstrierte Laborsystem bereitgestellt hat oder eine kommerzielle Vereinbarung mit UCLA besteht.
Für Investoren stellt TI eine Beteiligung an enable‑Hardware innerhalb eines diversifizierten Halbleitergeschäfts dar. Die Chance hängt davon ab, dass optisches Computing über Prototypen hinausgeht und Nachfrage nach programmierbaren Modulatoren, Controllern und zugehöriger Elektronik erzeugt.
Beobachtenswerte Evidenz umfasst reproduzierbare Leistungen außerhalb von Labordatensätzen, Integration in bestehende Screening‑Systeme und Kundeneinsätze, die geringere Gesamtkosten nachweisen. Diese Studie begründet weder eine wesentliche Umsatzchance für TI noch einen produktionsreifen Erkennungs‑Service.
Der Investitionsfall beginnt mit erschwinglicher Verifizierung
Die UCLA‑Arbeit zeigt eine glaubwürdige Richtung für spezialisierte KI‑Hardware: den Einsatz optischer Berechnung zum Screening mehrerer Videos, während digitale Verarbeitung dort beibehalten wird, wo sie noch nützlich ist.
Seine größere Implikation ist wirtschaftlicher Natur. Da synthetische Medien expandieren, müssen Organisationen möglicherweise mehr Inhalte überprüfen, ohne proportional mehr für jede hochgeladene Datei auszugeben. Ein effizientes erstes Screening könnte helfen, teure Analysen und menschliche Aufmerksamkeit dort zu konzentrieren, wo sie am wertvollsten sind.
Der nächste Meilenstein besteht darin, diesen Vorteil über den gesamten Arbeitsablauf hinweg zu beweisen. Genauigkeit, Energieverbrauch, Fehlalarme, Hardwarekosten und Anpassungsfähigkeit müssen gemeinsam verbessert werden. Dort könnte ein interessantes optisches Experiment zu einer kommerziell nutzbaren Infrastruktur werden.
Referenzen:
1 Ghapandar Kashani, P., Chen, S., & Ozcan, A. (2026). Scalable, energy-efficient optical-neural architecture for multiplexed deepfake video detection. eLight, 6, Artikel 27. https://doi.org/10.1186/s43593-026-00143-y












