:quality(75))
本物の行動と人工的な行動:人工的洞察に関する市場調査員の視点
実際の人間の行動を観察することで、アルゴリズムデータでは再現できないニュアンスや文脈、予期せぬ洞察がもたらされ、市場調査やユーザビリティのプロジェクトにおいて真の強みを発揮します。
:quality(75))
カメラは、その視野内にあるあらゆるものを記録することができます。しかし、人間はシーンをまったく同じように処理しているわけではありません。部屋に入ったり、家具を組み立てたり、食事の準備をしたり、人通りの多い通りを歩いたりするとき、私たちの目は絶えず周囲の環境から情報を選別しています。 ある物を見てから、別の物を見る。手に取る前に、その物を確認する。もっと注意を払う必要があるものには、再び視線を戻す。こうした行動パターンには、従来の映像では明示的に捉えきれない情報が含まれている。
ワールドモデル、ロボティクス、およびエンボディッドAIに取り組む開発者の皆様へ、 アイトラッキング を活用することで、一人称視点の動画— に人間の注意に関するデータを重ね合わせ、人々が実際の環境をどのように認識し、どのように関わり合っているかについて、より豊かな事例を提供することができます。
:quality(75))
ワールドモデルとは、環境とその変化の内部表現を構築するように設計されたAIモデルのことです。 例えば、単に動画のフレーム内にコップ、テーブル、手が出現していることを認識するだけでなく、有用なワールドモデルは、それらの間の関係性を学習する可能性があります。つまり、視線を外しても物体は存在し続け、行動には結果が伴い、実行中のタスクに応じて特定の視覚情報が重要になるといった関係性です。
この能力は、ロボットやスマートデバイスなど、物理的な環境で動作する必要がある「エンボディッドAI」— AIシステムにとって特に重要です。こうしたシステムを学習させるには、現実の世界の動きを捉えた大規模かつ多様なデータセットが必要です。そのため、動画は学習データの重要な情報源としてますます重要になっていますが、動画と人間の知覚は同じものではありません。
動画は、環境や物体、動き、相互作用などを捉えることができ、物理世界での出来事に関する豊富な情報をモデルに提供します。しかし、カメラが記録するものと、人間が実際に注意を向けているものとの間には根本的な違いがあります。カメラは視野内のすべてを捉えるのに対し、アイトラッキングは、人が実際にどこを見ているかを明らかにします。
一人称視点の映像と組み合わせることで、視線データは、人々がどのように視覚的に周囲を把握しているか— 、何に注意を向け、タスクを実行中に何を見ているか、そして外界と関わりながら視線がどのように移動するかといった情報を補完します。
ヘッドマウントカメラを使って、コーヒーを淹れている人の様子を録画すると想像してみてください。その動画には、コーヒーメーカー、カップ、ボタン、カウンター、その他の家電製品、その人の手、そして周囲にある数十もの物体が映り込むかもしれません。動画だけから、それらのピクセルすべてがモデルに利用可能となります。
:quality(75))
しかし、データセットに視線追跡データを追加すると、その人がボタンを押す前にディスプレイを見たこと、カップを置く際にカップの方へ一瞥したこと、コーヒーが注がれる際に残量を確認したこと、そして次の物体に手を伸ばす前にその物体に注意を移したことなども明らかになります。場面自体は変わっていません。変わったのは、その場面と関わる人間に関する入手可能な情報です。
世界モデルにとって、これは動画に記録された行動にさらなる文脈の層をもたらします。単に何が起こったかを観察するだけでなく、データセットには行動に伴う視覚的注意に関する情報が含まれる可能性があり— 、これにより、人間が物理世界をどのように知覚し、それとどのように相互作用するかについて、より豊かな表現を構築するのに役立ちます。
専門家と初心者は、必ずしも同じ点に注目するとは限りません。経験豊富な技術者なら、初心者が見落としがちな部品を即座に点検するかもしれません。熟練したオペレーターは、特定の順序で複数の指標を監視するかもしれません。一方、その作業を学んでいる人は、必要な情報を探すのにより長い時間を費やすかもしれません。
こうした違いは、AIシステム向けに人間の作業のデモンストレーションを収集する際に有用ですが、その微妙なニュアンスの多くは、従来の動画だけでは捉えきれません。2人が最終的に同じ動作を行う場合でも、そこに至るまでの視覚的な経路は大きく異なることがあります。
視線データは、個々人が何に注目しているかを明らかにすることで、こうした実演に新たな側面をもたらします。これにより、専門家の行動だけでなく、その専門知識に伴う視覚的な行動の一部も捉えることが可能になります。
世界モデルには、さまざまな人々、環境、状況、タスクにまたがる現実世界からの豊富なデータ— が必要です。そして、物理世界は本質的にマルチモーダルです。私たちは視覚だけで周囲を認識しているわけではありません。 私たちは、見たり、聞いたり、動いたり、方向を把握したり、注意を向けたりすることを同時に行っているのです。
Tobii Glasses X は、人間の視点からこうした現実世界のデータストリームのいくつかを収集するためのウェアラブルプラットフォームを提供します。
Tobii Glasses Xは、その本質として、アイトラッキングと一人称視点の映像を組み合わせ、利用者の周囲で起きていることと、その利用者がどこを見ているかの両方を捉えます。しかし、このデバイスには、AIの学習に有益なコンテキストを提供できる追加のセンサーも搭載されています:
2つのマイクからのステレオ音声
加速度センサー
動きを検知するジャイロスコープ
方位情報を提供する磁力計
AI開発者にとってのメリットは、単にいくつかの種類のデータが利用可能であるということだけではありません。同じ現実世界のやり取りの中で、同じ人間の視点から、これらの異なるシグナルをまとめて捉えることができる点にあります。
もう一度、コーヒーを淹れている人を例に考えてみましょう。現場の映像は、視覚的な環境や一連の出来事を捉えています。アイトラッキングは、その人がどこに注意を向けているかを示します。 音声データには、コーヒーマシンの動作音、音声による指示、あるいは周囲の環境におけるその他の出来事が記録されます。動作データからは、対象物を探したり作業を行ったりする際に、装着者がどのように頭を動かしているかという情報が得られ、姿勢データからは、その人が環境内でどのような位置にいて、どのように移動しているかという追加の文脈情報が得られます。
これらのシグナルを組み合わせることで、いずれか一つが単独で提供できるものよりも、体験をより豊かに表現することができる。
この原則は、複雑な環境においてさらに重要性を増します。経験豊富な技術者が故障した機械の診断を行っている場面を想像してみてください。一人称視点の動画なら、技術者が何を見て、何をしているかを記録できます。アイトラッキングを用いれば、どの計器、部品、警告表示に、どのような順序で注意が向けられているかを明らかにすることができます。 音声データからは、機械から発せられる異常な音や、同僚との会話の内容を捉えることができます。また、動作や位置情報のデータからは、技術者が機器のさまざまな部分を点検する際にどのように移動しているかといった、さらなる背景情報を得ることができます。
世界モデルやエンボディッドAIの開発者にとって、このようなマルチモーダルデータセットは、環境、注意、音、動き、そして行動の関係性について、より豊富な事例を提供することができる。
:quality(75))
ウェアラブルのもう一つの重要な側面は ウェアラブル データ収集におけるもう一つの重要な側面は、管理された環境の枠を超えて活動できる点である。
現実世界の環境は複雑で予測不可能です。人々はそれぞれ異なる動きをし、物事に異なるアプローチを取り、注意をそらす要素に遭遇し、音に反応し、状況の変化に応じて行動を適応させます。こうした環境で動作することを目的としたAIシステムは、最終的にはこうした多様性を考慮に入れる必要があります。
Tobii Glasses Xはウェアラブルであるため、ユーザーが周囲を自然に移動したり、周囲とやり取りしたりしている最中でもデータを収集することができます。これにより、日常的な活動から製造、保守、物流、ロボット工学、その他の複雑な実世界での作業に至るまで、人間中心のトレーニングデータを収集する機会が広がります。
また、さまざまな人々や専門知識のレベルに応じた実演を収集する機会も生まれます。開発者は、単一の標準化された例だけでAIシステムを学習させるのではなく、同じ問題に対する複数のアプローチ方法— を、それぞれのアプローチに関連する視線の向き、動き、音声、および環境的文脈とともに捉えることができるようになります。
マルチモーダルデータは、人がなぜ特定の行動をとったのかをAIシステムに自動的に教えてくれるわけではありませんし、すべてのAIアプリケーションが利用可能なすべてのデータストリームを必要とするわけでもありません。しかし、これらのシグナルを組み合わせることで、開発者はより豊富なデータセットを得ることができ、動画だけでは見過ごされがちな関係性やパターンを特定できるようになります。
結論として、ワールドモデルは、主に情報を認識・生成するAIから、物理世界とその変化についてより豊かな表現を構築するように設計されたシステムへの転換を表している。
動画はAIに 何が起きるかを。人間のデモンストレーションでは、 私たちが何をしているか。アイトラッキングは、私たちがどこに注意を向けているか どこに注意を向けているか. また、音声、動き、向きなどの追加のセンサーデータ— — は、それらの行動が行われる体験や環境に関するさらなる文脈を提供してくれます。
ワールドモデルやエンボディッドAIにおいては、これによりトレーニングデータに重要な側面が加わることになります。つまり、単に物理的な世界を記録するだけでなく、人間がそれをどのように知覚し、移動し、相互作用しているかという文脈をより多く捉えることができるのです。
アイトラッキングを活用して、調査、研究、または研修の効果を高める方法については、当社の営業担当までお問い合わせください。
:quality(75))
実際の人間の行動を観察することで、アルゴリズムデータでは再現できないニュアンスや文脈、予期せぬ洞察がもたらされ、市場調査やユーザビリティのプロジェクトにおいて真の強みを発揮します。
:quality(75))
この記事では、予測アイトラッキングツールの科学的限界を探り、実際のアイトラッキングと心理分析を組み合わせることで、店内ディスプレイやパッケージ、その他のショッパーマーケティングの介入を測定するための優れた洞察が得られる理由を論じている。
:quality(75))
AIモデルは本当に正確か?現実世界の人間の意思決定を予測するために、アイトラッキングと注意の予測モデルを使用することの課題を発見してください。