GolemTechNews
IA

Un détecteur de deepfakes qui calcule avec de la lumière

97,79 % de précision, quinze vidéos analysées en une seule passe optique : l'UCLA déplace la détection hors du silicium.

La rédaction GolemTech News généré le 2026-10-04 5 min de lecture 5 sources
Un détecteur de deepfakes qui calcule avec de la lumière
Illustration : GolemTech News (IA)

La course à l'armement contre les vidéos truquées se joue d'habitude dans des fermes de GPU. L'équipe d'Aydogan Ozcan, à l'UCLA, vient de la sortir du silicium : son détecteur de deepfakes fait une partie du calcul en laissant simplement la lumière se propager dans l'air. Résultat annoncé : 97,79 % de précision moyenne, et quinze vidéos évaluées simultanément en une seule passe optique.

Le problème que personne n'arrive à tenir

Le déséquilibre est brutal. Cloner une voix convaincante demande une trentaine de secondes d'enregistrement. Fabriquer une visioconférence crédible avec un faux dirigeant prend un après-midi à un escroc correctement outillé. Détecter cette vidéo, en revanche, demande de faire tourner un modèle lourd sur chaque flux, image par image.

Le cas d'école reste celui d'Arup : un employé du groupe d'ingénierie a viré l'équivalent de 25 millions de dollars après une visioconférence où tous les autres participants — collègues, directeur financier — étaient des reconstructions générées. Il n'y avait rien d'anormal à l'écran. C'est bien le problème.

Les compilations statistiques du secteur estiment que la fraude de type deepfake est passée d'environ 0,1 % des fraudes constatées en 2022 à 6,5 % en 2025. Ces chiffres agrégés méritent la prudence d'usage — les méthodologies varient d'un fournisseur à l'autre — mais la direction de la courbe n'est contestée par personne.

Et la détection, elle, décroche. Les humains repèrent une fausse vidéo dans moins d'un quart des cas. Les meilleurs outils automatiques affichent des scores de laboratoire proches de 96 % qui s'effondrent nettement en conditions réelles, selon les mêmes compilations. Compression, recadrage, basse lumière, générateur inconnu : tout dégrade.

Comment l'UCLA déplace le calcul

L'architecture décrite dans la revue eLight est hybride, et c'est tout l'intérêt.

  1. Un encodeur numérique léger extrait de chaque vidéo une signature compacte : caractéristiques spatiales, spectrales et temporelles. C'est la seule étape qui ressemble à de l'IA classique, et elle est volontairement minuscule.
  2. Cette signature est convertie en un motif de phase affiché sur un modulateur de lumière programmable.
  3. Le faisceau traverse ensuite un décodeur optique passif en espace libre : des couches diffractives qui ne font que modifier la phase du front d'onde.
  4. Des détecteurs en sortie lisent l'intensité et produisent un score d'authenticité.

La partie qui change tout se trouve au point 3. Ces couches diffractives à phase seule peuvent être fabriquées comme des surfaces optiques statiques et passives. Elles calculent par diffraction de la lumière, sans consommer d'électricité supplémentaire. Le calcul est, littéralement, gratuit une fois la pièce fabriquée.

D'où le multiplexage : puisque la lumière traverse le système en parallèle, on peut faire passer quinze flux encodés dans la même passe optique. Un GPU, lui, les traite les uns après les autres ou multiplie la facture énergétique.

Les chiffres

Sur le jeu de données Celeb-DF, référence courante de la discipline, avec quinze vidéos testées en parallèle par inférence :

  • précision moyenne : 97,79 %
  • sensibilité : 99,86 %, soit un taux de faux négatifs de 0,14 % — presque aucune vidéo manipulée ne passe inaperçue
  • spécificité : 95,72 %

Ce déséquilibre sensibilité/spécificité est un choix. Le système préfère crier au loup sur une vraie vidéo plutôt que de laisser filer un faux. Pour un modérateur de plateforme, c'est le bon réglage ; pour un système de vérification d'identité bancaire, un peu plus de 4 % de faux positifs, c'est beaucoup de clients légitimes bloqués.

Le test le plus intéressant est ailleurs : confronté à des vidéos générées par Google VEO-3 — c'est-à-dire par un modèle qui n'existait pas quand l'architecture a été conçue — le système atteint 94,80 % après un réglage fin minimal. C'est la question qui tue tous les détecteurs : survivre à la génération suivante de générateurs. Perdre trois points en changeant complètement de source, c'est honorable.

Les travaux sont signés Parnian Ghapandar Kashani, Shiqi Chen et Aydogan Ozcan (département d'électrique et informatique, bio-ingénierie, California NanoSystems Institute), publiés dans eLight sous le DOI 10.1186/s43593-026-00143-y, après une préimpression sur arXiv.

Ce que ça ne règle pas

Un banc optique en espace libre dans un labo californien n'est pas un module posé dans un datacenter. Entre les deux : la miniaturisation, l'alignement, la stabilité thermique, la tolérance aux vibrations. L'équipe d'Ozcan a déjà porté ce type d'architecture diffractive sur d'autres tâches, mais le passage à l'échelle industrielle reste à faire.

Deuxième limite, plus gênante : l'encodeur numérique en amont, lui, reste un modèle entraîné. Il garde donc les vulnérabilités classiques — attaques adverses, biais de jeu de données, dépendance aux artefacts de compression. La lumière accélère et dégraisse le calcul ; elle ne rend pas le système conceptuellement incassable.

Troisième point, et c'est le plus structurel : un détecteur ne résout pas un problème de confiance. Si demain chaque plateforme affiche un score d'authenticité à 97 %, que fait-on des 3 % ? Qui tranche ? L'enjeu glisse de la technique vers la gouvernance, et personne n'a de réponse propre.

Et après ?

La piste sérieuse n'est pas « un détecteur contre tous les générateurs » mais la combinaison : provenance signée à la source (standards de type content credentials), détection en aval pour les contenus non signés, et vérification humaine sur les cas critiques. L'architecture optique de l'UCLA trouve sa place dans la deuxième brique, celle où le volume écrase le budget.

Une précision pour finir, qui vaut pour toute cette catégorie d'outils : la vidéo n'est pas le canal le plus exposé. La voix l'est bien davantage, parce qu'elle voyage par téléphone, sans image, sans métadonnée, et qu'elle suffit à déclencher un virement. Un détecteur optique à 97,79 % sur Celeb-DF ne vous protégera pas d'un appel de trente secondes.

Sources

  1. ScienceDaily — This light-powered AI can spot deepfakes with nearly 98% accuracy
  2. eLight — Scalable, energy-efficient optical-neural architecture for multiplexed deepfake video detection
  3. arXiv — Scalable, Energy-Efficient Optical-Neural Architecture (préimpression)
  4. Stingrai — Deepfake Statistics 2026
  5. iArnaque — Deepfake et fraude au président : le cas Arup

À lire aussi