Tech●●●●●Difficulty 4 of 5

Comment quelques autocollants peuvent-ils faire lire à une IA un panneau stop comme une limite de vitesse ?

Quelques autocollants noirs et blancs sur un vrai panneau stop ont suffi pour qu'une IA le lise de travers à chaque test en laboratoire.

▶ Lancer l'histoire

Quelques autocollants peuvent tromper une IA parce qu'elle ne lit pas un panneau comme toi. Des chercheurs ont modifié des panneaux stop pour que le système de vision d'une voiture autonome les lise comme un panneau d'insertion ou de limitation de vitesse. Dans une étude, des autocollants noirs et blancs posés sur un vrai panneau stop ont provoqué l'erreur voulue sur toutes les images testées en laboratoire. Les autocollants exploitent ce que le réseau a vraiment appris : des motifs de pixels, pas l'idée d'un panneau stop.

100 %

des images de labo où des autocollants ont fait mal lire un panneau stop comme prévu

C'est l'apprentissage automatique antagoniste (adversarial machine learning) : l'étude des attaques contre les modèles d'IA et des défenses face à elles. À partir de 2014, Christian Szegedy et d'autres ont montré qu'on pouvait tromper les réseaux de neurones profonds avec de petites modifications calculées d'une image. Une des premières méthodes, signée Ian Goodfellow et ses collègues de Google, ajoute un bruit trop faible pour être remarqué, et le modèle se trompe d'image. D'autres ont trompé des réseaux en changeant un seul pixel, ou ont imprimé en 3D une tortue jouet que l'IA de Google prenait pour un fusil sous tous les angles.

Des astuces simples marchent aussi. La société de sécurité McAfee a trompé l'ancien système Mobileye de Tesla au point de le faire rouler 50 miles par heure (environ 80 km/h) au-dessus de la limite. Il a suffi d'une bande de ruban adhésif noir de cinq centimètres sur un panneau de limitation de vitesse.

Il existe un vieux précédent. Au début des années 1900, un cheval nommé Clever Hans (Hans le Malin) semblait savoir calculer, en tapant les réponses du sabot. En 1907, le psychologue Oskar Pfungst a montré que Hans lisait en réalité de minuscules signaux involontaires de son maître. Les chercheurs en IA parlent aujourd'hui d'effet Clever Hans : un modèle qui donne la bonne réponse pour de mauvaises raisons, par exemple en lisant du texte sur une photo au lieu de regarder l'objet.

Tout le monde ne voit pas là un grand danger sur les routes. Une petite rotation ou un changement d'éclairage peut ruiner une attaque soigneusement conçue. Nick Frosst, de Google Brain, fait aussi remarquer qu'arracher un panneau stop est bien plus facile que d'en truquer un. Google, Microsoft et IBM partagent tout de même des outils pour tester la robustesse de leurs modèles.

Quiz

0/3

  1. 1.Pourquoi quelques autocollants peuvent-ils faire mal lire un panneau stop à un réseau de neurones ?
  2. 2.Pourquoi le chercheur de Google Brain Nick Frosst remet-il en question l'importance de ces attaques de laboratoire sur de vraies routes ?
  3. 3.Qu'illustre l'histoire du cheval Clever Hans à propos des réseaux de neurones trompés par des attaques adversariales ?

Récap

Une IA qui semble comprendre un panneau stop a peut-être seulement appris un motif de pixels qui va avec « panneau stop », un raccourci qu'un attaquant peut détourner.

Le fait surprenant · Une tortue jouet imprimée en 3D avec une texture étudiée a fait dire à l'IA de Google que c'était un fusil sous tous les angles, et une bande de ruban adhésif sur un panneau de vitesse a poussé le système d'une voiture à rouler 50 miles par heure au-dessus de la limite.

Sources (4)

Pas de source, pas d'affirmation. Chacun des 16 faits de cette leçon renvoie à au moins une de ces sources.

  1. [1]Adversarial machine learning · Wikipedia
  2. [2]Ian Goodfellow · Wikipedia
  3. [3]Clever Hans · Wikipedia
  4. [4]Robust Physical-World Attacks on Deep Learning Models (Eykholt et al.) · arXiv
D'autres leçons · 💻 Tech (3) Toutes les leçons « Tech » →

Une lumière de plus sur ta carte.

Reçois une leçon comme celle-ci chaque jour, sur les sujets que tu aimes. Gratuit, en deux ou cinq minutes.

Récupère la carte à partager de cette leçon ↗