独立站轮播図1

ニュース

こんにちは、弊社の製品についてお問い合わせいただきありがとうございます!

エゴカメラ|ヘッドマウント型双眼グローバルシャッターカメラ – 身体化されたAI模倣学習のための専用一人称データキャプチャ

Ego Camera – ロボット学習データ収集のためのヘッドマウント型ステレオビジョンツール
人間のデモンストレーションデータ取得専用に設計された、頭部装着型双眼カメラモジュール。ハードウェア同期され、工場出荷時に事前調整された自己中心的な生センサーデータを提供し、模倣学習や身体化されたAIパイプラインの基盤となる。

物理AIを悩ませるデータボトルネック

2026年までに、ロボット業界全体で共通認識が形成されるだろう。それは、データがスケーラブルな物理AIの展開を阻む決定的なボトルネックであるという認識だ。大規模な言語モデルは数兆個のテキストトークンで学習するが、実世界の物理的な相互作用の映像データとして、実際に利用できるのはそのうちの1万分の1にも満たない。
この格差は、進歩にとって大きな障害となっている。主要なロボット工学研究所は、高度な操作ポリシーのトレーニングには、今後2~3年以内に1億時間から10億時間もの一人称視点の映像が必要になると推定している。単一の個別の操作タスクであっても、トレーニングデータセットには10​​万時間から100万時間もの人間の活動記録が必要となる。
業界関係者の間では、自己中心的データ収集が最高の拡張性を実現するという点で意見が一致している。研究チームやデータベンダーは、1台あたり数万ドルもする高価な遠隔操作装置に頼る代わりに、軽量のヘッドマウントカメラを活用し、人間が日常的な作業を行う様子を撮影するデモンストレーション映像を収集している。
この変化は、すでに実際の現場での展開において顕著に表れている。2026年4月、インドのデリー首都圏全域の数千人の繊維労働者が、Egolab.AI社製の小型ヘッドマウントカメラを装着している様子を捉えた映像が拡散した。これらの作業員は現在、次世代ヒューマノイドロボットのトレーニングに用いるための、膨大な量の自己中心型ビデオデータセットを生成している。

一人称視点データが不可欠な理由

ロボットは、人間の運動能力を正確に再現するために、人間が見る視覚情報と全く同じものを認識する必要がある。2025年から2026年にかけて発表された一連の研究は、自己中心的なデータセットの革新的な価値を実証している。

1.
人間のエゴ 1つのタスクにつきわずか30分の人間中心のビデオ映像で、現実世界の操作タスクにおいて平均92.5%の成功率を達成し、人間からロボットへのスキル移転をゼロショットで実現できる。

2.
EgoMimic 人間のデモンストレーションデータを統合することで、ロボットのみのトレーニングデータと比較して、タスクのパフォーマンスが34%から228%向上します。1時間分の人間の手の動きの補足映像は、1時間分のロボット自身で収集した追加データよりもはるかに大きなモデル改善効果をもたらします。また、長距離遠隔操作ワークフローの映像を含む、人間とロボットを組み合わせたハイブリッドデータセットは、優れたトレーニングおよび展開パフォーマンスを実現します。

3.
エゴスケール NVIDIAの研究者によって開発されたこのフレームワークは、20,854時間分の人間視点映像からなる多様なデータセットを活用し、一般的なタスク全体にわたって器用な操作能力を拡張します。

4.
オープンAoE 同期された手の運動学データと、動作の最小単位の注釈が付加された、2,000時間分の自己中心型ビデオデータセットを公開します。

5.
最先端のフレームワーク EgoGuideやEgoLiveといった最先端のフレームワークは、ロボットを使わないデモンストレーションのキャプチャと、大規模な自己中心型データセットの生成をさらに効率化する。
こうした業界の勢いにもかかわらず、高品質な一人称視点撮影のためのハードウェアソリューションは依然として断片化されている。研究者やデータチームは、市販のアクションカメラ、ARメガネ、特注のリグなどを寄せ集めて使用せざるを得ず、その過程で同期精度、キャリブレーションの一貫性、長時間の装着時の快適性などが犠牲になっている。

Egoカメラ製品概要

Ego Cameraは、ロボット学習、身体化AI、模倣学習のワークフローにおける自己中心的なデータ収集のためにゼロから設計された、頭部装着型の双眼ステレオカメラモジュールです。
研究用途向けに改造された市販のアクションカメラとは異なり、Ego Cameraは学術および産業用ロボット開発パイプライン向けに専用設計されています。工場出荷時に事前校正された、ハードウェア同期済みのクリーンな生センサーデータを、後処理設定不要でそのまま出力します。

主要技術仕様

仕様 詳細
イメージセンサー デュアル2MPグローバルシャッターCMOSセンサー
水平視野角(HFOV) 60~65°、人間の自然な視覚範囲に相当
シャッター技術 グローバルシャッター:高速動作時のローリングシャッター歪みを解消します。
IMUモジュール 6軸ICM-26888-P(3軸加速度計+3軸ジャイロスコープ)、サンプリング周波数200~500Hz
同期メカニズム ハードウェアGPIOトリガー;フレーム-IMU同期誤差<10マイクロ秒
タイムスタンプ すべての画像フレームとIMU読み取り値に対するハードウェアレベルの統一ナノ秒タイムスタンプ
有線インターフェース USB 2.0 Type-C、UVC準拠。Windows、Linux、ROS向けのクロスプラットフォームSDKをサポート。
ワイヤレス展開 オンボードWi-FiとMicroSDカードストレージ搭載。映像はローカルストレージに優先的に保存され、ネットワーク再接続時に自動的にクラウドにアップロードされます。
取り付け基準 1/4インチ-20ネジ穴付きで、アフターマーケットのヘッドストラップやカスタム治具にも対応。
較正 工場出荷時に事前調整されたステレオの内部/外部パラメータとカメラ-IMU変換は、オンボードフラッシュメモリに永続的に保存されます。

ロボット学習においてグローバルシャッターが不可欠な理由

民生用カメラは、ピクセル列を順次露光するローリングシャッターセンサーに依存している。デモ映像によく見られる人間の素早い手の動きは、「ゼリー効果」と呼ばれる深刻なローリングシャッター現象を引き起こす。これは、被写体の輪郭の歪み、形状の変形、特徴点の追跡の不安定さなどを意味する。
これらの歪みはロボット工学のパイプラインを著しく阻害します。VIOフロントエンド、ビジュアルSLAMアルゴリズム、および模倣学習ポリシーは、予測不可能なフレーム間特徴シフトに耐えることができず、モデルの汎化性能と実世界のタスクパフォ​​ーマンスが大幅に低下します。
Egoカメラのグローバルシャッターセンサーは、単一のキャプチャウィンドウ内で全てのピクセルを同時に露光します。各フレームは、幾何学的歪みがゼロの明確な剛体姿勢に対応しており、これは厳密なロボット研究や商用モデルのトレーニングにおいて必須の基準です。
業界がますます大規模な自己中心的なデータセット(例えば、EgoLiveが保有する、実際の家庭や産業作業を網羅した数千時間にも及ぶ高忠実度ステレオ映像のアーカイブなど)を追求するにつれ、歪みのない、フレーム単位で正確なキャプチャハードウェアへの需要は高まり続けている。

ハードウェア同期:低品質トレーニングデータと実用グレードトレーニングデータの境界線

人間が物体を掴む、保持する、配置するといった一連の操作を実行する際、ロボットの制御には、視覚的な手の動きと慣性的な身体の動きとの正確な時間的同期が求められます。カメラフレームとIMUの読み取り値の間にわずか数ミリ秒のずれが生じるだけでも、トレーニングデータセット全体が汚染されます。ソフトウェアベースのタイムスタンプ同期(ソフト同期)では、記録セッション中にドリフトが蓄積され、高精度なVIO(視覚情報最適化)や模倣学習パイプラインの精度基準を満たせなくなります。
Ego Cameraは専用のGPIOパルスを使用して双眼センサーとIMUを同時にトリガーし、10マイクロ秒以下の同期精度を実現します。すべての画像フレームと慣性サンプルには共通のハードウェアタイムスタンプが付与されており、VINS-FusionやOpenVINSといった主流のVIOフレームワークの厳しい時間要件を満たしています。
Open-AoEのような主要なアノテーション付き一人称視点データセットは、同期されたテキストラベル、MANOSベースの手の姿勢推定、カメラの軌跡ログ、および時間的に局所化されたアトミックアクションタグを提供するために、このレベルのハードウェア同期に依存しています。これらはすべて、Ego Cameraがネイティブにサポートするように設計されている主要な成果物です。

工場出荷時事前校正:時間のかかる現場校正を不要にします

手動キャリブレーションは、マルチカメラデータ取得ワークフローにおいて、最も多くのリソースを必要とするボトルネックの一つです。レンズの内部パラメータ、ステレオ外部オフセット、カメラとIMU間の変換行列を調整するには、専用の光学機器、高度な技術、そしてデバイスごとに何時間もの作業時間が必要となります。
Ego Cameraは、このワークフローを完全に排除します。すべてのユニットは、工場出荷前にエンドツーエンドの完全なキャリブレーションを受けます。焦点距離、主点座標、歪み係数、ステレオ外部パラメータ、カメラ-IMU変換など、すべての重要なパラメータは、内蔵フラッシュメモリに永続的に書き込まれます。
研究チームやデータベンダーは、開封後わずか5分以内に有効な映像の記録を開始できます。チェッカーボードターゲット、キャリブレーション装置、半日かかるキャリブレーションセッションは一切不要です。最新の高水準な一人称視点データセットでは、工場出荷時にキャリブレーション済みのカメラハードウェアが必須となりますが、この仕様はすべてのEgo Cameraユニットに直接組み込まれています。

2つの展開モード、単一の統合ハードウェアプラットフォーム

1. USB有線モード
ノートパソコンやワークステーションに接続して、リアルタイムのライブプレビューと低遅延の録画を実現します。研究者がオンデマンドでデータ品質を検証できる、管理された実験室環境に最適化されています。Windows、Linux、ROSロボティクスフレームワークに対応したクロスプラットフォームSDKで完全にサポートされています。

2. WiFi + microSDカードオフラインモード
大規模な分散データ収集のための、ケーブル不要の録画機能。キャプチャされた映像はすべて、ネットワーク障害時のデータ損失を防ぐため、まずローカルのMicroSDストレージに書き込まれます。接続が復旧すると、ファイルは自動的にリモートのクラウドサーバーまたはオンプレミスのデータウェアハウスに同期されます。キッチン、製造工場、オフィスなど、さまざまな実環境におけるマルチシーン撮影に最適で、数千時間分のデモンストレーション映像を生成できます。

構造化された生データ出力(AI処理なし)

このユニットは、画像平滑化、自動注釈、デバイス上でのAI推論などを一切行わず、改変されていない純粋な生のセンサーデータを出力します。これにより、カスタムトレーニングパイプラインへの統合に必要な生データの忠実度が完全に維持されます。
  1. left_video.mp4 / right_video.mp4同期ステレオ双眼ビデオストリーム
  2. imu_6axis.csv: ハードウェアのタイムスタンプが付与された6軸慣性計測ログ(加速度計+ジャイロスコープ)
  3. タイムスタンプ_ns.txtすべての画像フレームとIMUサンプルに統一されたナノ秒単位のハードウェアタイムスタンプ
  4. calibration_params.yaml工場出荷時に生成された内部、外部、およびカメラ-IMUキャリブレーション変換

対象ユーザー層

身体化されたAIと模倣学習に関する学術研究室
人型ロボットおよび器用な操作ロボットのメーカー
物理AIクライアント向けのトレーニングデータセットを生成する専門データサービスプロバイダー
VIOおよびビジュアルSLAMアルゴリズムを開発する研究開発チーム
ロボットチームが大規模な自己中心的なデモンストレーションデータ収集ワークフローを拡張する

投稿日時:2026年8月11日