Pourquoi l'eye tracking est-il important pour les modèles du monde de l'IA ?

  • Blog
  • par Tobii
  • 6 min

Blue graphic image about AI

L'IA ne cesse de s'améliorer en matière de reconnaissance et de génération de contenu. Le prochain défi consiste à comprendre le fonctionnement du monde physique. Les modèles du monde ont pour objectif d'aider les systèmes d'IA à construire des représentations des environnements, des objets, des actions et de leurs conséquences. Cependant, l'apprentissage à partir de vidéos seules passe à côté d'un aspect essentiel de la façon dont les humains perçoivent le monde : l'attention.

Une caméra peut enregistrer tout ce qui se trouve dans son champ de vision. Les êtres humains ne traitent pas une scène tout à fait de la même manière. Lorsque nous entrons dans une pièce, que nous effectuons un assemblage de meuble, que nous préparons un repas ou que nous traversons une rue animée, nos yeux sélectionnent en permanence des informations issues de l’environnement. Nous regardons un objet, puis un autre. Nous vérifions quelque chose avant de tendre la main pour l’attraper. Nous reportons notre regard sur ce qui nécessite une attention particulière. Ces schémas contiennent des informations que la vidéo classique ne saisit pas explicitement.

Pour les développeurs travaillant sur les modèles de monde, la robotique et l’IA incarnée, eye tracking peut enrichir les vidéos en vue à la première personne — de données sur l'attention humaine, offrant ainsi des exemples plus complets de la manière dont les personnes perçoivent les environnements réels et interagissent avec eux.

Ai models - a person giving a flower to a robotic arm

Qu'est-ce qu'un modèle mondial ?

Un modèle du monde est un modèle d'IA conçu pour construire une représentation interne d'un environnement et de la manière dont celui-ci évolue. Plutôt que de se contenter de reconnaître la présence d'une tasse, d'une table et d'une main dans une image vidéo, par exemple, un modèle du monde utile pourrait apprendre les relations qui existent entre eux : les objets persistent lorsque l'on détourne le regard, les actions ont des conséquences, et certaines informations visuelles deviennent pertinentes en fonction de la tâche à accomplir.

Cette capacité revêt une importance particulière pour l’IA incarnée —, c’est-à-dire les systèmes d’IA tels que les robots ou les appareils intelligents qui doivent fonctionner dans des environnements physiques. L’apprentissage de ces systèmes nécessite des ensembles de données volumineux et variés illustrant le monde en action. La vidéo devient donc une source de plus en plus importante de données d’apprentissage, mais la vidéo et la perception humaine ne sont pas la même chose.

Passer du simple fait de voir le monde à celui de le comprendre

La vidéo permet de capturer des environnements, des objets, des mouvements et des interactions, fournissant ainsi aux modèles des informations riches sur ce qui se passe dans le monde physique. Il existe toutefois une différence fondamentale entre ce qu’enregistre une caméra et ce à quoi un être humain prête réellement attention : une caméra capture tout ce qui se trouve dans son champ de vision. Eye tracking révèle, quant à lui, où une personne pose réellement son regard.

Associées à des vidéos filmées à la première personne, les données relatives au regard fournissent des informations sur la manière dont les personnes explorent visuellement leur environnement —, sur ce qui attire leur attention, sur ce qu'elles regardent lorsqu'elles effectuent une tâche et sur la façon dont leur regard se déplace lorsqu'elles interagissent avec le monde qui les entoure.

Imaginez que vous filmiez une personne en train de se préparer une tasse de café à l'aide d'une caméra fixée sur la tête. La vidéo pourrait montrer la machine à café, les tasses, les boutons, le plan de travail, d'autres appareils électroménagers, les mains de la personne et des dizaines d'objets présents dans l'environnement. À partir de cette seule vidéo, tous ces pixels sont mis à la disposition du modèle.

A person making coffee at a coffee station

Mais lorsque l'on ajoute les données d'eye tracking à l'ensemble de données, celles-ci peuvent également révéler que la personne a regardé l'écran avant d'appuyer sur un bouton, a jeté un coup d'œil vers la tasse tout en la positionnant, a vérifié le niveau de café pendant qu'il coulait, et a reporté son attention sur l'objet suivant avant de tendre la main vers celui-ci. La scène n'a pas changé. Ce sont les informations disponibles sur la personne qui interagit avec elle qui ont changé.

Pour les modèles du monde, cela apporte une dimension supplémentaire au contexte des actions filmées. Plutôt que de se contenter d'observer ce qui s'est passé, l'ensemble de données peut contenir des informations sur l'attention visuelle qui a accompagné une action —, ce qui contribue à créer des représentations plus riches de la manière dont les humains perçoivent le monde physique et interagissent avec lui.

Savoir distinguer les nuances : débutant vs expert

Les experts et les débutants ne prêtent pas forcément attention aux mêmes éléments. Un technicien expérimenté peut immédiatement inspecter un composant qu’un novice négligerait. Un opérateur chevronné peut surveiller plusieurs indicateurs dans un ordre précis. Une personne qui apprend une tâche peut passer plus de temps à rechercher les informations dont elle a besoin.

Ces différences peuvent s’avérer précieuses lors de la collecte d’exemples de tâches humaines destinées aux systèmes d’IA, mais bon nombre de ces nuances ne peuvent être saisies à partir d’une simple vidéo classique. Deux personnes peuvent, au final, effectuer la même action, tout en empruntant des parcours visuels très différents pour y parvenir.

Les données relatives au regard apportent une dimension supplémentaire à ces démonstrations en révélant les éléments sur lesquels les différents individus concentrent leur attention. Cela permet ainsi de saisir non seulement les gestes des experts, mais aussi certains des comportements visuels qui accompagnent leur expertise.

Un expert peut percevoir un composant différemment d'un novice ; les Eye trackers portables permettent de mettre en évidence ces différences.

Collecte de données de terrain multimodales via les lunettes Tobii Glasses X

Les modèles du monde ont besoin de données riches issues d’ — s du monde réel, couvrant différentes personnes, différents environnements, différentes situations et différentes tâches. Et le monde physique est intrinsèquement multimodal. Nous ne percevons pas notre environnement uniquement par la vue : nous voyons, entendons, bougeons, nous orientons et dirigeons notre attention simultanément.

Tobii Glasses X offre une plateforme portable permettant de capturer plusieurs de ces flux de données du monde réel du point de vue humain.

À la base, les Tobii Glasses X associent l'eye tracking à la vidéo en vue subjective, permettant ainsi de capturer à la fois ce qui se passe autour d'une personne et l'endroit où celle-ci pose son regard. Mais l'appareil intègre également des capteurs supplémentaires capables de fournir des informations contextuelles précieuses pour l'entraînement de l'IA :

  • Son stéréo provenant de deux microphones

  • Accéléromètres

  • Un gyroscope détectant les mouvements

  • Un magnétomètre fournissant des informations d'orientation

L'avantage pour les développeurs en IA ne réside pas simplement dans la disponibilité de plusieurs types de données. Il réside dans la capacité à capter ces différents signaux simultanément, au cours d'une même interaction dans le monde réel et du point de vue d'un même individu.

Prenons à nouveau l’exemple d’une personne qui prépare une tasse de café. La vidéo de la scène fournit l’environnement visuel et la séquence des évènements. L’eye tracking montre où la personne dirige son attention. L'audio peut capturer le bruit de la machine, une instruction vocale ou d'autres évènements se produisant dans l'environnement immédiat. Les données de mouvement peuvent fournir des informations sur la façon dont l'utilisateur bouge la tête lorsqu'il cherche un objet ou effectue une tâche, tandis que les données d'orientation apportent un contexte supplémentaire sur sa position et ses déplacements dans l'environnement.

Ensemble, ces signaux offrent une représentation plus complète de l'expérience que n'importe lequel d'entre eux ne pourrait le faire à lui seul.

Ce même principe prend encore plus tout son sens dans des environnements complexes. Imaginons un technicien expérimenté en train de diagnostiquer une machine défectueuse. Une vidéo à la première personne permet d’enregistrer ce que le technicien voit et fait. Eye tracking peut révéler quels jauges, composants ou voyants d’alerte retiennent son attention et dans quel ordre. L'audio permet de capter un bruit inhabituel provenant de la machine ou une conversation avec un collègue. Les données de mouvement et d'orientation fournissent des informations supplémentaires sur la façon dont le technicien se déplace lorsqu'il inspecte les différentes parties de l'équipement.

Pour les développeurs de modèles du monde et d'IA incarnée, des ensembles de données multimodales comme ceux-ci peuvent fournir des exemples plus riches illustrant la relation entre l'environnement, l'attention, le son, le mouvement et l'action.

Les lunettes Tobii Glasses X sont utilisées dans le cadre de formations portant sur la fabrication, les opérations, l'assemblage et d'autres tâches complexes.
Les lunettes Tobii Glasses X sont utilisées dans le cadre de formations portant sur la fabrication, les opérations, l'assemblage et d'autres tâches complexes.

Rendre compte de la complexité du monde réel

Un autre aspect important des Eye tracker portable est la capacité à sortir des environnements contrôlés.

Les environnements réels sont complexes et imprévisibles. Les personnes se déplacent différemment, abordent les tâches de différentes manières, sont confrontées à des distractions, réagissent aux sons et adaptent leur comportement à l'évolution des circonstances. Les systèmes d'IA destinés à fonctionner dans ces environnements doivent, en fin de compte, tenir compte de cette diversité.

Les lunettes Tobii Glasses X étant portables, elles permettent de collecter des données tandis que les utilisateurs se déplacent naturellement dans leur environnement et interagissent avec celui-ci. Cela offre la possibilité de recueillir des données de formation centrées sur l'humain dans des domaines aussi variés que les activités quotidiennes, la fabrication, la maintenance, la logistique, la robotique et d'autres tâches complexes du monde réel.

Cela permet également de recueillir des démonstrations provenant de différentes personnes et de différents niveaux d'expertise. Au lieu d'entraîner un système d'IA à partir d'un seul exemple standardisé, les développeurs peuvent potentiellement capturer plusieurs façons d'aborder un même problème —, ainsi que l'attention visuelle, les mouvements, le son et le contexte environnemental associés à chaque approche.

Les données multimodales ne permettent pas automatiquement à un système d’IA de comprendre pourquoi une personne s’est comportée d’une certaine manière, et toutes les applications d’IA n’ont pas nécessairement besoin de l’ensemble des flux de données disponibles. Cependant, la combinaison de ces signaux peut fournir aux développeurs un ensemble de données plus riche, à partir duquel ils peuvent identifier des relations et des tendances qui ne seraient pas forcément visibles à partir de la vidéo seule.

Intégrer la dimension humaine dans les modèles mondiaux

En conclusion: les modèles du monde marquent une évolution par rapport à l'IA, qui se contentait principalement de reconnaître ou de générer des informations, vers des systèmes conçus pour construire des représentations plus riches du monde physique et de son évolution.

La vidéo peut montrer l'IA ce qui se passe. Les démonstrations humaines peuvent montrer ce que nous faisons. Eye tracking permet d'ajouter où nous portons notre attention. Et des données supplémentaires issues de capteurs —, notamment des données audio, de mouvement et d’orientation —, peuvent fournir davantage de contexte sur l’expérience et l’environnement dans lesquels ces actions se déroulent.

En ce qui concerne les modèles du monde et l'IA incarnée, cela peut apporter une dimension importante aux données d'entraînement : il ne s'agit pas simplement d'enregistrer le monde physique, mais de saisir davantage le contexte dans lequel les humains le perçoivent, s'y orientent et interagissent avec lui.

Vous souhaitez en savoir plus sur l'eye tracking ?

Contactez nos experts commerciaux pour découvrir comment vous pouvez utiliser l'eye tracking pour améliorer vos recherches, vos études ou vos formations.

En savoir plus sur l'eye tracking et l'IA

S'inscrire à notre lettre d'information

S'inscrire à notre lettre d'information

Inscrivez-vous à notre bulletin d'information pour recevoir les derniers articles de blog et les idées de Tobiidans votre boîte de réception. Découvrez nos articles sur le comportement dans le monde réel, l'attention et les innovations qui façonneront la technologie de demain.