Inteligencia artificial

El modelo de IA UNITE puede detectar cualquier deepfake sin depender de rostros

mm
Añade Securities.io a tus fuentes preferidas en Google
Analyzing a video frame for deepfakes

Los científicos ahora están abordando el problema de la IA con la propia IA. Los investigadores de UC Riverside han creado un modelo UNITE para abordar el grave problema de los deepfakes. 

“Las personas merecen saber si lo que están viendo es real”, dijo Rohit Kundu, candidato a doctorado del Marlan and Rosemary Bourns College of Engineering de UCR, quien lideró el artículo ‘Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI-Generated Content.1 “Y a medida que la IA mejora en falsificar la realidad, debemos mejorar en revelar la verdad.”

Los investigadores han colaborado con científicos de Google, una empresa Alphabet (GOOG ) para desarrollar un nuevo modelo de IA que detecta manipulaciones de video y exponer contenido falso, que se está utilizando para difundir desinformación e incitar al daño. El estudio señaló:

“La rápida propagación de la desinformación, particularmente durante períodos críticos como elecciones, destaca la necesidad de modelos de detección generalizables capaces de identificar manipulaciones diversas, incluyendo cara, fondo y contenido T2V/I2V totalmente generado por IA con/sin sujetos humanos.”

El modelo es capaz de detectar tanto videos parcialmente manipulados como totalmente sintéticos. En lugar de centrarse solo en la cara, como hacen la mayoría de los detectores convencionales, este modelo analiza fotogramas completos, independientemente de si hay un sujeto humano presente en los videos. 

Esto lo convierte en una herramienta poderosa que puede ser utilizada por verificadores de datos, educadores, editores, plataformas de redes sociales y otros para evitar que los videos manipulados se vuelvan virales.

El auge de la IA y la sobrecarga sintética resultante

A crowded digital space filled with hyperreal faces/images floating like data shards.

La Inteligencia Artificial (IA) tiene un potencial tremendo para revolucionar varios aspectos de nuestras vidas y trabajo. 

La capacidad de esta tecnología en automatización, análisis de datos y toma de decisiones ya ha comenzado a transformar industrias, y se proyecta que añadirá varios billones de dólares a la economía global para finales de esta década.

Un estudio del gigante de pronósticos de mercado IDC estima que el auge de la IA impulsará la economía global en un total de $19.9 billones para 2030.

La investigación de McKinsey, mientras tanto, espera que el valor añadido por la IA generativa sea de hasta $4.4 billones en los 63 casos de uso analizados por la firma global de consultoría de gestión. Aproximadamente el 75% del valor que la IA podría aportar provendría solo de cuatro campos:

  • I+D
  • Ingeniería de software
  • Marketing y ventas
  • Operaciones de cliente

Aunque se prevé que el impacto de la tecnología sea significativo en todos los sectores, la tecnología y la banca podrían ver el mayor impacto como porcentaje de sus ingresos provenientes de la IA generativa. Goldman Sachs (GS ) compartió la misma visión, esperando un aumento del 7% en el PIB global por la IA. Los economistas del banco, Joseph Briggs y Devesh Kodnani, en ese momento señalaron:

“A pesar de la incertidumbre significativa sobre el potencial de la IA generativa, su capacidad para generar contenido indistinguible del producido por humanos y para romper barreras de comunicación entre humanos y máquinas representa un avance importante con posibles efectos macroeconómicos de gran magnitud.”

Sin embargo, esta misma capacidad del sistema informático para realizar tareas como aprendizaje, resolución de problemas y toma de decisiones que típicamente requieren inteligencia humana, y que está a punto de revolucionar el mundo, también está enviando al mundo al caos. 

Cuanto más sofisticada se vuelve la tecnología, más difusa se vuelve la línea entre lo real y lo falso.

Por qué los detectores de deepfake antiguos ya no funcionan

Empresa Herramienta Enfoque de detección Limitaciones
UC Riverside + Google UNITE Marco completo (cara, fondo, T2V/I2V) Aún en desarrollo
Microsoft Video Authenticator Manipulaciones basadas en la cara Obsoleto frente a la IA generativa moderna
Intel FakeCatcher Autenticidad mediante señales fisiológicas Requiere metraje facial de alta calidad
OpenAI Text Watermarking Salida de IA basada en texto Limitado para contenido visual
Google SynthID Detección de marcas de agua generadas por IA Solo funciona con modelos de IA de Google

En los últimos años, los avances en IA han provocado un auge sin precedentes de medios sintéticos. Estimaciones sugieren que más de la mitad de las publicaciones largas en LinkedIn están siendo escritas actualmente por IA. Luego está el ‘AI slop’, que se refiere a contenido generado por IA de baja calidad y producción masiva.

Pero lo más preocupante de todo son los deepfakes, que son imágenes, videos o grabaciones de audio que han sido generados o alterados usando IA. Es contenido fabricado que utiliza IA para presentar una representación falsa como realista.

Hoy, este tipo de contenido está en todas partes, permeando todos los rincones de Internet. Estos medios digitales hiperrealistas están causando confusión y propagando desinformación. También representan una amenaza para la privacidad y seguridad de las personas. 

Los ciberdelincuentes están utilizando IA para mejorar sus ataques, realizando estafas de phishing y robos de identidad con una precisión alarmante. Según Kundu:

“Da miedo lo accesibles que se han vuelto estas herramientas. Cualquiera con habilidades moderadas puede eludir los filtros de seguridad y generar videos realistas de figuras públicas diciendo cosas que nunca dijeron.”

En un incidente de este tipo, los ciberdelincuentes se hicieron pasar por el director financiero (CFO) de una empresa durante una reunión de Zoom, lo que resultó en una pérdida de $25 millones. 

Esto es solo el comienzo, sin embargo, ya que Deloitte predice que las pérdidas por fraude de este tipo alcanzarán $40 mil millones en EE. UU. para 2027, frente a $12.3 mil millones en 2023. Un informe del Tesoro de EE. UU. también encontró que los “marcos de gestión de riesgos existentes” adoptados por las empresas “pueden no ser adecuados para cubrir las tecnologías emergentes de IA.”

Eso no significa que no existan herramientas para ayudar a detectar contenido de IA y protegerse contra los riesgos de la tecnología. De hecho, hay muchas herramientas disponibles en el mercado.

Las mismas empresas que están lanzando nuevas herramientas de IA para facilitar la creación de contenido también están introduciendo formas de ayudar a detectar datos sintéticos.

En 2020, el gigante tecnológico Microsoft (MSFT ) anunció un Video Authenticator para analizar una foto o video y proporcionar una puntuación de confianza para determinar si el medio está artificialmente manipulado. La herramienta funciona detectando el límite de fusión del deepfake y el desvanecimiento sutil que el ojo humano puede no percibir.

En ese momento, también introdujo tecnología para identificar contenido falsificado y confirmar la autenticidad de los medios con los que la gente interactúa. Incluía una herramienta que permite a un creador añadir hashes digitales y certificados a su contenido, los cuales viven dentro de él como metadatos. Un lector, mientras tanto, podía comprobar los certificados y comparar los hashes para verificar la autenticidad del contenido.

El gigante tecnológico advirtió sobre la utilidad a corto plazo de la tecnología en la era impulsada por IA. Dado que los deepfakes son generados por IA que aprende continuamente, es solo cuestión de tiempo antes de que superen los métodos tradicionales de detección.

Al mismo tiempo, Facebook, una empresa Meta (META ) también inició una competencia para desarrollar un detector de deepfake usando los datos que los investigadores no habían tenido acceso previamente.

Hace algunos años, Intel (INTC ) creó FakeCatcher, un detector de deepfake en tiempo real que afirma tener una precisión del 96%.

La herramienta utilizó OpenVino para ejecutar modelos de IA para algoritmos de detección de cara y puntos de referencia, mientras los bloques de visión por computadora fueron optimizados con sus Integrated Performance Primitives y OpenCV. En cuanto a su hardware, la plataforma puede ejecutar más de setenta flujos de detección diferentes al mismo tiempo en sus procesadores Xeon® Scalable de tercera generación.

En lugar de intentar encontrar lo que está mal, FakeCatcher busca pistas auténticas evaluando lo que nos hace humanos y luego haciendo que los algoritmos traduzcan esas señales en mapas espaciotemporales, y finalmente, usando aprendizaje profundo para detectar instantáneamente si un video es real o falso.

El año pasado, OpenAI también anunció que estaba investigando herramientas para ayudar con la autenticidad del contenido.

Esto incluye la marca de agua de texto, que señaló que es eficaz contra la manipulación localizada pero no tanto contra la manipulación globalizada. También declaró que podría “impactar desproporcionadamente a grupos como los hablantes no nativos de inglés.

Esta actualización llegó después de que el Wall Street Journal informara que la compañía ya había desarrollado una herramienta que marca con agua y detecta texto generado por ChatGPT con “alta precisión durante algún tiempo, pero aún no ha tomado una decisión para lanzarla.

Adicionalmente, OpenAI se ha unido al Comité Directivo de C2PA (la Coalición para la Procedencia y Autenticidad del Contenido), un estándar ampliamente usado para la certificación de contenido digital. La compañía añade metadatos C2PA a todas las imágenes creadas y editadas por todos sus servicios, como parte de sus herramientas de detección de imágenes.

Este año, Google también creó su propia herramienta de detección de texto, imagen, audio y video generados por IA llamada SynthID Detector. 

Sin embargo, la herramienta de Google solo funciona para contenido que ha sido generado usando los propios servicios de IA del gigante tecnológico como Gemini, Imagen, Veo y Lyria. Esto se debe a que la herramienta básicamente identifica la presencia de una “marca de agua que los productos de Google han incrustado en su salida.

Una marca de agua es un elemento único, legible por máquinas que se incrusta en el contenido. Inrecognizable por los humanos, puede ser detectado y extraído por algoritmos creados para ese propósito.

Dentro de la tecnología que impulsa el avance de UNITE

A computer vision system analyzing a full video frame

Así, a medida que la IA avanza rápidamente, también lo hacen las herramientas para detectar el contenido generado con su ayuda. Pero no existe una herramienta universal que pueda ser usada por todos en todo tipo de contenido de IA.

Además, el enfoque de las técnicas de detección de deepfake existentes, en particular, sigue centrado en manipulaciones faciales como la sincronización de labios o el intercambio de caras, y los avances en tecnología los están haciendo inadecuados.

Con la innovación tecnológica avanzando significativamente en modelos generativos de texto a video (T2V) e imagen a video (I2V), ahora es posible que cualquiera cree fácilmente contenido sintético totalmente generado por IA y alteraciones de fondo sin interrupciones. Esto, por supuesto, pone a todos, desde individuos hasta instituciones e incluso naciones, en serio riesgo.

En este contexto, la completa dependencia de los detectores de deepfake anteriores en la cara los vuelve obsoletos en el mundo más avanzado tecnológicamente de hoy. 

“Si no hay cara en el fotograma, muchos detectores simplemente no funcionan. Pero la desinformación puede presentarse de muchas formas. Alterar el fondo de una escena puede distorsionar la verdad con la misma facilidad.”

– Kundu

Así, los detectores convencionales no funcionan con manipulaciones más recientes, ya que el nuevo contenido sintético que ahora presenta escenas y fondos completos plantea un desafío a los métodos de detección centrados en la cara.

Esto exige un enfoque más versátil. Como solución a este problema, los investigadores de UC Riverside han introducido UNITE.

El modelo Universal Network for Identifying Tampered and Synthetic Videos (UNITE) captura manipulaciones de fotogramas completos.

“Los deepfakes han evolucionado, dijo Kundu, cuyo enfoque en UC Riverside es aprovechar los modelos fundacionales para tareas avanzadas de visión, incluida la segmentación de imágenes y la detección de medios falsos. “Ya no se trata solo de intercambios de caras. Ahora la gente está creando videos totalmente falsosdesde caras hasta fondosusando potentes modelos generativos. Nuestro sistema está construido para capturar todo eso.”

El modelo amplía las capacidades de detección a escenarios donde no hay caras o no hay sujetos humanos, y además, puede identificar discrepancias espaciales y temporales sutiles e incluso cubrir modificaciones complejas de fondo que los sistemas anteriores pasaron por alto.

Así, al examinar caras así como fondos y patrones de movimiento, cubrindo fotogramas de video completos, UNITE ofrece una de las primeras herramientas para identificar videos sintéticos que no dependen únicamente del contenido facial.

Para ello, el modelo utiliza un modelo de aprendizaje profundo basado en transformadores,  un tipo de red neuronal que emplea un mecanismo de atención multi-cabeza para procesar datos secuenciales. Aquí, el texto se convierte en representaciones numéricas llamadas tokens. Esta arquitectura es en realidad la base de muchos modelos de lenguaje modernos como GPT. 

Al procesar información en paralelo, los transformadores pueden facilitar un entrenamiento más rápido y un mejor rendimiento.

En el caso de UNITE, la arquitectura basada en transformadores procesa características agnósticas al dominio que son extraídas de los videos a través del modelo fundacional SigLIP-So400M. El marco de IA fundamental SigLIP extrae características no vinculadas a un objeto o persona específica.

Debido a conjuntos de datos limitados que cubren cambios tanto en la cara/fondo como en contenido texto‑a‑video/imagen‑a‑video, el equipo utilizó estrategias de entrenamiento innovadoras para su modelo. Esto significa entrenar usando datos que no son relevantes para la tarea junto con datos deepfake estándar. 

Así, además del popular conjunto de datos FaceForensics++, el equipo también utilizó el conjunto de datos SAIL‑VOS‑3D, que simula entornos complejos, ofreciendo diversas escenas sintéticas útiles para entrenar modelos de detección de IA.  Notablemente, este fue originalmente diseñado para la segmentación de objetos de video 3D en el juego GTA‑V. Aunque no es generado por IA, el conjunto de datos es totalmente sintético y, como tal, ayuda a simular medios generados por IA. Esto, según el equipo, mejora la capacidad del modelo para detectar diversas formas de manipulación sintética.

Google proporcionó acceso a los conjuntos de datos requeridos así como recursos informáticos para entrenar el modelo. 

Para reducir la propensión del modelo a enfocarse excesivamente en caras, el equipo también usó una pérdida de diversidad de atención (AD loss), que fomenta una atención espacial variada a lo largo de los fotogramas de video.

La pérdida AD se ha combinado con la entropía cruzada, también conocida como la función de pérdida logarítmica, y se usa comúnmente en aprendizaje automático (ML) para medir el rendimiento de un modelo de clasificación, con el fin de mejorar el rendimiento del modelo en diversas situaciones.

Just training the model on cross-entropy (CE) loss tends to make it hard for it to handle videos where there’s a real human subject with a manipulated background or content generated by T2V and I2V models.

Por lo tanto, el equipo introdujo la pérdida AD, que incita al sistema a monitorizar múltiples regiones visuales en cada fotograma, aumentando así la capacidad del modelo para capturar señales importantes tanto del primer plano como del fondo.

La pérdida AD marca la innovación clave en el enfoque del equipo, permitiendo a UNITE no solo sobresalir en la detección de videos generados por IA y con fondos alterados, sino también tener una mejora notable en la identificación del contenido típicamente manipulado facialmente.

Al comparar el rendimiento de UNITE con otros modelos, el equipo descubrió que “supera a los detectores de última generación en conjuntos de datos (en configuraciones de datos cruzados) que presentan manipulaciones de cara/fondo y videos T2V/I2V totalmente sintéticos, demostrando su adaptabilidad y capacidades de detección generalizables.”

En un mundo cada vez más digitalizado y automatizado, el nuevo sistema ofrece un detector universal que puede señalar una gama de falsificaciones, desde simples intercambios faciales hasta videos complejos, totalmente sintéticos creados sin metraje real. Según Kundu:

“Es un modelo que maneja todos estos escenarios. Eso es lo que lo hace universal.”

Actualmente en desarrollo, UNITE, según sus creadores, es una herramienta valiosa en el panorama emergente de detección de videos sintéticos. Pronto, se espera que juegue un papel clave en la defensa contra la desinformación en video.

Invertir en detección basada en IA

En el ámbito de la IA, Palantir Technologies (PLTR ) es conocida por su integración de datos impulsada por IA, reconocimiento de patrones y detección de anomalías. 

La compañía opera a través de cuatro plataformas de software principales: Gotham, Foundry, Apollo y AIP. Apollo es una capa de control única que coordina la configuración, actualizaciones de seguridad y entrega de nuevas funciones para asegurar la operación continua de sistemas críticos. Gotham permite a los usuarios identificar patrones ocultos profundamente dentro de los conjuntos de datos, mientras que Foundry sirve como el sistema operativo para una gestión eficaz de activos y riesgos. AIP permite a las empresas ejecutar LLM y otros modelos con control total.

Palantir Technologies (PLTR )

Palantir cuenta con estrechos lazos con el gobierno de EE. UU., el ejército y las agencias de inteligencia. Este año, obtuvo un contrato de $30 millones para llevar a cabo análisis de IA en registros de inmigración.

Con una capitalización de mercado de $372 mil millones, las acciones de PLTR cotizan actualmente a $157.72, con un impresionante aumento del 109.35% en lo que va del año, gracias a la demanda de IA, el enorme interés minorista y la expansión de contratos gubernamentales. Su EPS (TTM) es 0.23, y el P/E (TTM) es 687.90.

PLTR Gráfico de precios

Financieramente, Palantir reportó un aumento del 39% interanual en ingresos, alcanzando $884 millones en el Q1 2025. Sus ingresos en EE. UU., mientras tanto, crecieron un 55% interanual hasta $628 millones, incluidos $255 millones en ingresos comerciales estadounidenses y $373 millones en ingresos gubernamentales estadounidenses.

Durante este período, la compañía registró su mayor trimestre en valor total de contratos comerciales en EE. UU., con el valor restante del acuerdo en $2.32 mil millones. 

El número de clientes de Palantir en el 1T25 aumentó un 39% interanual. Sus ganancias GAAP por acción fueron $0.08, y el EPS ajustado fue $0.13. Efectivo, equivalentes de efectivo y valores del Tesoro de EE. UU. a corto plazo ascendían a $5.4 mil millones al final del trimestre.

“Estamos entregando el sistema operativo para la empresa moderna en la era de la IA. Estamos en medio de un cambio tectónico en la adopción de nuestro software, particularmente en EE. UU.”

CEO Alexander C. Karp

Últimas Palantir Technologies (PLTR) Noticias de acciones y desarrollos

Conclusión

El advenimiento de la inteligencia artificial ha cambiado por completo el mundo, con tanto individuos como organizaciones adoptando cada vez más la tecnología para mejorar la productividad y potenciar la toma de decisiones.

Se proyecta que contribuya con billones a la economía mundial, pero la IA no está exenta de peligros. Los deepfakes y su uso para desinformar y defraudar a las personas son uno de los riesgos críticos de la adopción generalizada de la IA. 

A medida que se vuelve más difícil diferenciar entre lo real y lo sintético, herramientas como UNITE se vuelven cada vez más importantes y urgentes. Con este modelo de IA generalizable como protección contra contenido falsificado, podríamos mitigar el impacto negativo de la IA mientras aprovechamos y disfrutamos sus efectos positivos en nuestro trabajo y vida.

Haga clic aquí para aprender todo sobre invertir en inteligencia artificial.

Referencias:

1. Kundu, R.; Xiong, H.; Mohanty, V.; Balachandran, A.; Roy‑Chowdhury, A. K.; et al. Hacia un detector universal de video sintético: de manipulaciones de cara o fondo a contenido totalmente generado por IA. preimpresión arXiv arXiv:2412.12278 (2024). https://doi.org/10.48550/arXiv.2412.12278

Gaurav comenzó a operar con criptomonedas en 2017 y se enamoró del espacio cripto desde entonces. Su interés en todo lo relacionado con criptomonedas lo convirtió en un escritor especializado en criptomonedas y blockchain. Pronto se encontró trabajando con empresas de criptomonedas y medios de comunicación. También es un gran fanático de Batman.