Die Komplexität der realen Welt erfassen
Ein weiterer wichtiger Aspekt von tragbare Datenerfassung ist die Möglichkeit, über kontrollierte Umgebungen hinauszugehen.
Umgebungen in der realen Welt sind komplex und unvorhersehbar. Menschen bewegen sich unterschiedlich, gehen Aufgaben auf unterschiedliche Weise an, werden abgelenkt, reagieren auf Geräusche und passen ihr Verhalten an sich ändernde Umstände an. KI-Systeme, die in solchen Umgebungen eingesetzt werden sollen, müssen diesen Unterschieden letztlich Rechnung tragen.
Da die Tobii Glasses X tragbar sind, können Daten erfasst werden, während sich Menschen ganz natürlich in ihrer Umgebung bewegen und mit ihr interagieren. Dies eröffnet Möglichkeiten zur Erfassung von menschenzentrierten Trainingsdaten in allen Bereichen – von alltäglichen Aktivitäten bis hin zu Fertigung, Wartung, Logistik, Robotik und anderen komplexen Aufgaben im realen Leben.
Außerdem eröffnet dies die Möglichkeit, Demonstrationen von verschiedenen Personen und mit unterschiedlichem Fachwissen zu sammeln. Anstatt ein KI-System anhand eines einzigen standardisierten Beispiels zu trainieren, können Entwickler potenziell mehrere Lösungsansätze für dasselbe Problem erfassen — – zusammen mit der visuellen Aufmerksamkeit, den Bewegungen, den Audioinhalten und dem Umgebungskontext, die mit jedem Ansatz verbunden sind.
Multimodale Daten liefern einem KI-System nicht automatisch Aufschluss darüber, warum sich eine Person auf eine bestimmte Weise verhalten hat, und auch nicht jede KI-Anwendung benötigt jeden verfügbaren Datenstrom. Durch die Kombination dieser Signale erhalten Entwickler jedoch einen umfangreicheren Datensatz, anhand dessen sie Zusammenhänge und Muster erkennen können, die allein anhand von Videomaterial möglicherweise nicht erkennbar sind.
Die Einbeziehung der menschlichen Perspektive in Weltmodelle
Zusammenfassend lässt sich sagen: Weltmodelle stellen eine Abkehr von KI dar, die in erster Linie Informationen erkennt oder generiert, hin zu Systemen, die darauf ausgelegt sind, umfassendere Darstellungen der physischen Welt und ihrer Veränderungen zu erstellen.
Das Video zeigt, was KI , was passiert. Menschliche Vorführungen können zeigen, , was wir tun. Eye Tracking kann ergänzen, , wohin wir unsere Aufmerksamkeit richten. Und zusätzliche Sensordaten — – darunter Audio-, Bewegungs- und Orientierungsdaten — – können weiteren Kontext über das Erlebnis und die Umgebung liefern, in der diese Handlungen stattfinden.
Für Weltmodelle und verkörperte KI kann dies den Trainingsdaten eine wichtige Dimension hinzufügen: Es geht nicht nur darum, die physische Welt zu erfassen, sondern auch darum, den Kontext besser zu erfassen, in dem Menschen diese Welt wahrnehmen, sich darin orientieren und mit ihr interagieren.