AI 세계 모델에서 시선추적이 중요한 이유

Blue graphic image about AI

AI는 콘텐츠를 인식하고 생성하는 능력이 점점 더 향상되고 있습니다. 다음 과제는 물리적 세계가 어떻게 작동하는지 이해하는 것입니다. 세계 모델은 AI 시스템이 환경, 사물, 행동 및 그 결과를 표현할 수 있도록 돕는 것을 목표로 합니다. 하지만 영상만을 통해 학습하는 방식은 인간이 세상을 경험하는 방식에서 중요한 요소인 ‘주의’를 간과하게 됩니다.

카메라는 시야에 들어오는 모든 것을 기록할 수 있습니다. 하지만 인간은 장면을 그와 똑같은 방식으로 처리하지는 않습니다. 우리가 방에 들어서거나, 가구를 조립하거나, 식사를 준비하거나, 붐비는 거리를 지나갈 때, 우리의 눈은 주변 환경에서 정보를 끊임없이 선별합니다. 우리는 한 물체를 보고, 또 다른 물체를 봅니다. 무언가를 집기 전에 먼저 확인합니다. 더 세심한 주의가 필요한 대상에 시선을 다시 돌리기도 합니다. 이러한 행동 패턴에는 기존의 영상 자료가 명시적으로 포착하지 못하는 정보가 담겨 있습니다.

월드 모델, 로봇 공학, 체화형 AI 분야를 연구하는 개발자들에게, 시선추적 은 1인칭 시점 영상 — 에 인간의 주의력 데이터를 추가하여, 사람들이 실제 환경을 어떻게 인지하고 상호작용하는지에 대한 보다 풍부한 사례를 제공할 수 있습니다.

Ai models - a person giving a flower to a robotic arm

세계 모델이란 무엇인가요?

세계 모델은 환경과 그 변화 양상에 대한 내부적 표현을 구축하도록 설계된 AI 모델입니다. 예를 들어, 유용한 월드 모델은 단순히 영상 프레임에 컵, 테이블, 손이 나타난다는 사실을 인식하는 데 그치지 않고, 이들 사이의 관계를 학습할 수 있습니다. 즉, 우리가 시선을 돌리더라도 사물은 그대로 존재하며, 행동에는 결과가 따르고, 수행 중인 과제에 따라 특정 시각적 정보가 관련성이 높아진다는 점을 학습하는 것입니다.

이 능력은 물리적 환경에서 작동해야 하는 로봇이나 지능형 기기와 같은 신체화된 AI — 시스템에 특히 중요합니다. 이러한 시스템을 훈련시키려면 실제 세상의 움직임을 보여주는 방대하고 다양한 데이터 세트가 필요합니다. 따라서 영상은 훈련 데이터의 원천으로서 점점 더 중요해지고 있지만, 영상과 인간의 지각은 서로 같은 것이 아닙니다.

세상을 단순히 바라보는 것에서 세상을 이해하는 것으로

영상은 환경, 사물, 움직임, 상호작용을 포착하여 모델에 물리적 세계에서 일어나는 일에 대한 풍부한 정보를 제공합니다. 하지만 카메라가 기록하는 것과 사람이 실제로 주의를 기울이는 것 사이에는 근본적인 차이가 있습니다. 카메라는 시야 내에 있는 모든 것을 포착하는 반면, 시선추적은 사람이 실제로 어디를 보고 있는지를 보여줍니다.

1인칭 영상과 결합될 때, 시선 데이터는 사람들이 주변 환경을 시각적으로 어떻게 탐색하는지 —, 무엇이 그들의 주의를 끄는지, 작업을 수행하는 동안 무엇을 바라보는지, 그리고 세상과 상호작용할 때 시선이 어떻게 이동하는지에 대한 정보를 더해줍니다.

머리에 부착한 카메라로 누군가가 커피 한 잔을 만드는 모습을 촬영한다고 상상해 보세요. 이 영상에는 커피 머신, 컵, 버튼, 조리대, 기타 가전제품, 그 사람의 손, 그리고 주변 환경에 있는 수십 가지 사물이 담길 수 있습니다. 영상만으로도 모델은 이 모든 픽셀 정보를 활용할 수 있습니다.

A person making coffee at a coffee station

하지만 데이터셋에 시선추적 데이터를 추가하면, 그 사람이 버튼을 누르기 전에 디스플레이를 바라보았고, 컵을 놓는 동안 컵 쪽을 흘끗 쳐다보았으며, 커피가 따라지는 동안 커피의 양을 확인했고, 다음 물체를 집으려 손을 뻗기 전에 이미 그쪽으로 주의를 돌렸다는 사실도 알 수 있습니다. 장면 자체는 변하지 않았습니다. 단지 그 장면과 상호작용하는 사람에 대해 알 수 있는 정보가 달라졌을 뿐입니다.

세계 모델의 경우, 이는 영상에 포착된 행동에 대한 또 다른 차원의 맥락을 제공합니다. 단순히 발생한 일을 관찰하는 데 그치지 않고, 이 데이터셋에는 행동과 함께 나타난 시각적 주의에 대한 정보가 포함될 수 있으며 —, 이를 통해 인간이 물리적 세계를 어떻게 인식하고 상호작용하는지에 대한 보다 풍부한 표현을 구축하는 데 도움이 됩니다.

미묘한 차이의 인식: 초보자와 전문가의 차이

전문가와 초보자가 반드시 같은 점을 주목하는 것은 아닙니다. 숙련된 기술자는 초보자가 간과하는 부품을 즉시 점검할 수도 있습니다. 숙련된 작업자는 여러 지표를 특정한 순서대로 모니터링할 수도 있습니다. 반면, 업무를 배우는 사람은 필요한 정보를 찾는 데 더 많은 시간을 할애할 수도 있습니다.

이러한 차이점들은 AI 시스템을 위해 인간의 작업 시연을 수집할 때 유용할 수 있지만, 미묘한 차이 중 상당수는 기존의 영상만으로는 포착할 수 없습니다. 두 사람이 궁극적으로 동일한 행동을 수행하더라도, 그 과정에 이르는 시각적 경로는 매우 다를 수 있습니다.

시선 추적 데이터는 각 개인이 무엇에 주의를 기울이는지를 보여줌으로써 이러한 시연에 또 다른 차원을 더해줍니다. 이를 통해 전문가들의 행동뿐만 아니라, 그들의 전문성에 수반되는 시각적 행동 중 일부도 포착할 수 있게 됩니다.

전문가는 초보자와는 다르게 부품을 바라볼 수 있는데, 웨어러블 아이 트래커는 이러한 차이를 포착해 낸다.

Tobii Glasses X를 통해 다중 모달 현장 데이터를 수집하세요

세계 모델에는 다양한 사람, 환경, 상황, 과제에 걸쳐 실제 세계 — 에서 수집된 풍부한 데이터가 필요합니다. 그리고 물리적 세계는 본질적으로 다중 모달적입니다. 우리는 시각만을 통해 주변 환경을 경험하는 것이 아닙니다. 우리는 보고, 듣고, 움직이며, 방향을 파악하고, 주의를 집중하는 모든 과정을 동시에 수행합니다.

Tobii Glasses X 는 인간의 관점에서 이러한 실제 세계의 다양한 데이터 스트림을 포착할 수 있는 웨어러블 플랫폼을 제공합니다.

Tobii Glasses X는 본질적으로 시선추적 기능과 1인칭 시점 영상을 결합하여, 사용자의 주변에서 일어나는 일과 사용자가 어디를 보고 있는지를 모두 포착합니다. 또한 이 장치에는 AI 훈련에 유용한 맥락 정보를 제공할 수 있는 추가 센서들이 탑재되어 있습니다:

  • 두 개의 마이크에서 나오는 스테레오 오디오

  • 가속도계

  • 움직임을 감지하는 자이로스코프

  • 방향 정보를 제공하는 자력계

AI 개발자에게 주어지는 이점은 단순히 여러 유형의 데이터를 이용할 수 있다는 점에 그치지 않습니다. 동일한 실제 상호작용 과정에서, 그리고 동일한 인간의 관점에서 이러한 다양한 신호를 종합적으로 포착할 수 있는 능력에 있습니다.

다시 한 번, 커피 한 잔을 만드는 사람을 생각해 보자. 현장 영상은 시각적 환경과 일련의 이벤트들을 보여준다. 시선추적은 그 사람이 어디에 주의를 기울이고 있는지 보여준다. 오디오는 커피 머신의 작동 소리, 음성 안내, 또는 주변 환경에서 발생하는 기타 이벤트를 포착할 수 있습니다. 동작 데이터는 착용자가 물체를 찾거나 작업을 수행하는 동안 머리를 어떻게 움직이는지에 대한 정보를 제공하며, 방향 데이터는 착용자가 어떤 위치에 있고 환경 내에서 어떻게 이동하는지에 대한 추가적인 맥락을 제공합니다.

이러한 신호들이 결합되면, 그 어느 하나도 단독으로는 제공할 수 없는 것보다 더 풍부한 경험의 모습을 보여줍니다.

이러한 원리는 복잡한 환경에서 더욱 중요해집니다. 고장 난 기계를 진단하는 숙련된 기술자를 상상해 보세요. 1인칭 시점 영상은 기술자가 보고 행하는 모든 것을 기록할 수 있습니다. 시선추적 기술을 통해 어떤 계기, 부품 또는 경고 표시등에 어떤 순서로 주의를 기울이는지 파악할 수 있습니다. 오디오를 통해 기계에서 나는 비정상적인 소리나 동료와의 대화 내용을 포착할 수 있습니다. 동작 및 방향 데이터는 기술자가 장비의 여러 부위를 점검하는 동안 어떻게 움직이는지에 대한 추가적인 맥락을 제공할 수 있습니다.

세계 모델 및 체화형 AI 개발자들에게 있어, 이와 같은 다중 모달 데이터셋은 환경, 주의력, 소리, 움직임, 행동 간의 관계에 대한 보다 풍부한 사례를 제공할 수 있습니다.

Tobii Glasses X는 제조, 운영, 조립 및 기타 복잡한 작업의 교육 과정에서 활용됩니다.
Tobii Glasses X는 제조, 운영, 조립 및 기타 복잡한 작업의 교육 과정에서 활용됩니다.

현실 세계의 복잡성을 포착하기

웨어러블의 또 다른 중요한 측면은 웨어러블 데이터 수집의 또 다른 중요한 측면은 통제된 환경을 넘어설 수 있는 능력입니다.

실제 환경은 복잡하고 예측하기 어렵습니다. 사람들은 각기 다른 방식으로 움직이고, 과제를 다르게 접근하며, 주의가 산만해지는 상황에 직면하고, 소리에 반응하며, 변화하는 상황에 맞춰 행동을 조정합니다. 이러한 환경에서 작동하도록 설계된 AI 시스템은 궁극적으로 이러한 다양성을 고려해야 합니다.

Tobii Glasses X는 웨어러블 기기이기 때문에, 사용자가 주변 환경을 자연스럽게 이동하며 상호작용하는 동안 데이터를 수집할 수 있습니다. 이를 통해 일상적인 활동부터 제조, 유지보수, 물류, 로봇공학 및 기타 복잡한 실제 업무에 이르기까지 다양한 분야에서 인간 중심의 훈련 데이터를 확보할 수 있는 기회가 열립니다.

또한 다양한 사람들과 다양한 전문성 수준을 가진 이들의 시연을 수집할 기회도 마련해 줍니다. 개발자들은 단일한 표준화된 예시를 바탕으로 AI 시스템을 훈련시키는 대신, 동일한 문제에 접근하는 다양한 방식 — 을 포착할 수 있을 뿐만 아니라, 각 접근 방식과 관련된 시각적 주의, 움직임, 오디오, 환경적 맥락까지 함께 파악할 수 있습니다.

다중 모달 데이터는 AI 시스템에 사람이 왜 특정 방식으로 행동했는지를 자동으로 알려주지는 않으며, 모든 AI 응용 분야가 이용 가능한 모든 데이터 스트림을 필요로 하는 것도 아닙니다. 하지만 이러한 신호들을 결합하면 개발자들은 영상만으로는 파악하기 어려운 관계와 패턴을 식별할 수 있는 더 풍부한 데이터 세트를 확보할 수 있습니다.

세계 모델에 인간의 관점을 반영하기

결론적으로, ‘월드 모델(World models)’은 주로 정보를 인식하거나 생성하는 데 그치던 기존 AI에서 벗어나, 물리적 세계와 그 변화 양상을 보다 풍부하게 표현하도록 설계된 시스템으로의 전환을 의미합니다.

영상을 통해 AI가 무슨 일이 일어나는지. 사람의 시연은 우리가 무엇을 하는지. 시선추적은 우리가 주의를 어디에 집중하는지. 또한 오디오, 움직임, 방향 등 — — 을 포함한 추가 센서 데이터는 그러한 행동이 이루어지는 경험과 환경에 대한 더 자세한 맥락을 제공할 수 있습니다.

세계 모델과 체화형 AI의 경우, 이는 훈련 데이터에 중요한 차원을 더할 수 있습니다. 단순히 물리적 세계를 기록하는 데 그치지 않고, 인간이 이를 어떻게 인식하고, 탐색하며, 상호작용하는지에 대한 맥락을 더 폭넓게 포착하는 것입니다.

시선추적에 대해 더 알고 싶으신가요?

시선추적을 활용하여 연구, 학습 또는 교육을 어떻게 개선할 수 있는지 알아보시려면 당사의 영업 전문가에게 문의해 주십시오.

시선추적과 AI에 대해 계속 알아보기

뉴스레터 구독 신청하기

뉴스레터 구독 신청하기

뉴스레터에 등록하여 Tobii의 최신 블로그 게시물과 인사이트를 받은 편지함으로 받아보세요. 실제 행동과 관심, 그리고 미래의 기술을 형성하는 혁신에 초점을 맞춘 기사를 살펴보세요.