Comment quelques autocollants peuvent-ils faire lire à une IA un panneau stop comme une limite de vitesse ?
Quelques autocollants noirs et blancs sur un vrai panneau stop ont suffi pour qu'une IA le lise de travers à chaque test en laboratoire.
▶ Lancer l'histoireQuelques autocollants peuvent tromper une IA parce qu'elle ne lit pas un panneau comme toi. Des chercheurs ont modifié des panneaux stop pour que le système de vision d'une voiture autonome les lise comme un panneau d'insertion ou de limitation de vitesse. Dans une étude, des autocollants noirs et blancs posés sur un vrai panneau stop ont provoqué l'erreur voulue sur toutes les images testées en laboratoire. Les autocollants exploitent ce que le réseau a vraiment appris : des motifs de pixels, pas l'idée d'un panneau stop.
100 %
C'est l'apprentissage automatique antagoniste (adversarial machine learning) : l'étude des attaques contre les modèles d'IA et des défenses face à elles. À partir de 2014, Christian Szegedy et d'autres ont montré qu'on pouvait tromper les réseaux de neurones profonds avec de petites modifications calculées d'une image. Une des premières méthodes, signée Ian Goodfellow et ses collègues de Google, ajoute un bruit trop faible pour être remarqué, et le modèle se trompe d'image. D'autres ont trompé des réseaux en changeant un seul pixel, ou ont imprimé en 3D une tortue jouet que l'IA de Google prenait pour un fusil sous tous les angles.
Des astuces simples marchent aussi. La société de sécurité McAfee a trompé l'ancien système Mobileye de Tesla au point de le faire rouler 50 miles par heure (environ 80 km/h) au-dessus de la limite. Il a suffi d'une bande de ruban adhésif noir de cinq centimètres sur un panneau de limitation de vitesse.
Il existe un vieux précédent. Au début des années 1900, un cheval nommé Clever Hans (Hans le Malin) semblait savoir calculer, en tapant les réponses du sabot. En 1907, le psychologue Oskar Pfungst a montré que Hans lisait en réalité de minuscules signaux involontaires de son maître. Les chercheurs en IA parlent aujourd'hui d'effet Clever Hans : un modèle qui donne la bonne réponse pour de mauvaises raisons, par exemple en lisant du texte sur une photo au lieu de regarder l'objet.
Tout le monde ne voit pas là un grand danger sur les routes. Une petite rotation ou un changement d'éclairage peut ruiner une attaque soigneusement conçue. Nick Frosst, de Google Brain, fait aussi remarquer qu'arracher un panneau stop est bien plus facile que d'en truquer un. Google, Microsoft et IBM partagent tout de même des outils pour tester la robustesse de leurs modèles.
Quiz
0/3
Récap
Une IA qui semble comprendre un panneau stop a peut-être seulement appris un motif de pixels qui va avec « panneau stop », un raccourci qu'un attaquant peut détourner.
Le fait surprenant · Une tortue jouet imprimée en 3D avec une texture étudiée a fait dire à l'IA de Google que c'était un fusil sous tous les angles, et une bande de ruban adhésif sur un panneau de vitesse a poussé le système d'une voiture à rouler 50 miles par heure au-dessus de la limite.
Liens
- 🖼️ Pourquoi l'IA a-t-elle eu besoin de 14 millions de photos étiquetées pour enfin voir ?
- 👁️ Pourquoi les « rêves » générés par l'IA ont-ils l'air psychédéliques ?
- 🤖 Pourquoi les chatbots d'IA inventent-ils avec assurance des faits et des procès ?
- 🧭 Pourquoi des gens intelligents font-ils les mêmes erreurs, de la même façon ?
- Word embedding
- Chinese room
Sources (4)
Pas de source, pas d'affirmation. Chacun des 16 faits de cette leçon renvoie à au moins une de ces sources.