دوربین Ego - ابزار دید استریوی قابل نصب روی سر برای جمعآوری دادههای یادگیری ربات
یک ماژول دوربین دوچشمی قابل نصب روی سر که منحصراً برای ثبت دادههای نمایشی انسان ساخته شده است. این ماژول دادههای خام حسگر خودمحورِ از پیش کالیبره شده در کارخانه و هماهنگشده با سختافزار را برای تقویت یادگیری تقلیدی و خطوط لوله هوش مصنوعیِ تجسمیافته ارائه میدهد.
گلوگاه دادهای که هوش مصنوعی فیزیکی را به ستوه آورده است
تا سال ۲۰۲۶، یک اجماع جهانی در صنعت رباتیک شکل گرفته است: دادهها گلوگاه حیاتی جلوگیری از استقرار فیزیکی مقیاسپذیر هوش مصنوعی هستند. مدلهای زبانی بزرگ بر روی تریلیونها توکن متنی آموزش میبینند، با این حال سیستمهای هوش مصنوعی تجسمیافته به کمتر از یک ده هزارم این حجم در فیلمهای تعامل فیزیکی دنیای واقعی دسترسی دارند.
این اختلاف، مانع بزرگی برای پیشرفت است. آزمایشگاههای پیشرو در رباتیک تخمین میزنند که آموزش سیاستهای پیشرفته دستکاری، به ۱۰۰ میلیون تا ۱ میلیارد ساعت فیلم از شخص اول خودمحور در ۲ تا ۳ سال آینده نیاز دارد. حتی برای یک کار دستکاری مجزا، مجموعه دادههای آموزشی به ۱۰۰۰۰۰ تا ۱ میلیون ساعت فعالیت ثبتشده انسانی نیاز دارند.
دستاندرکاران صنعت موافقند که ضبط دادههای خودمحور، بالاترین مقیاسپذیری را ارائه میدهد. به جای تکیه بر دکلهای گرانقیمت تلهاپراسیون که دهها هزار دلار آمریکا برای هر واحد هزینه دارند، تیمهای تحقیقاتی و فروشندگان داده اکنون از دوربینهای سبک وزن نصب شده روی سر برای ضبط فیلمهای نمایشی در حالی که انسانها کارهای روزمره طبیعی خود را انجام میدهند، استفاده میکنند.
این تغییر در حال حاضر در استقرارهای دنیای واقعی قابل مشاهده است. در آوریل 2026، فیلمی ویروسی هزاران کارگر نساجی را در سراسر منطقه دهلی NCR هند نشان داد که دوربینهای سربند جمع و جور ساخته شده توسط Egolab.AI را به سر داشتند. این اپراتورها اکنون مجموعه دادههای ویدیویی خودمحور عظیمی را برای آموزش رباتهای انساننمای نسل بعدی تولید میکنند.
چرا دادههای خودمحورِ اول شخص ضروری هستند؟
رباتها باید دقیقاً همان ورودی بصری را که انسانها میبینند، درک کنند تا بتوانند مهارتهای حرکتی انسان را به طور دقیق تکرار کنند. موجی از تحقیقات منتشر شده بین سالهای ۲۰۲۵ و ۲۰۲۶، ارزش دگرگونکنندهی مجموعه دادههای خودمحور را تأیید میکند:
1.
انسانمن تنها 30 دقیقه ویدیوی خودمحور انسانی برای هر کار، به طور متوسط 92.5 درصد نرخ موفقیت در کارهای دستکاری در دنیای واقعی را به دست میآورد و امکان انتقال مهارت صفر درصدی از انسانها به رباتها را فراهم میکند.
2.
ایگو میمیک ادغام دادههای نمایشی انسان، عملکرد وظیفه را در مقایسه با دادههای آموزشی صرفاً ربات، ۳۴٪ تا ۲۲۸٪ افزایش میدهد. یک ساعت فیلم تکمیلی از دست انسان، بهبود مدل بسیار بیشتری نسبت به یک ساعت دادههای اضافی جمعآوریشده توسط ربات ارائه میدهد. مجموعه دادههای ترکیبی انسان-ربات همچنین عملکرد آموزش و استقرار برتر، از جمله فیلمهایی از گردشهای کاری دوربرد عملیات را به همراه دارد.
3.
مقیاس اگو این چارچوب که توسط محققان انویدیا توسعه داده شده است، از مجموعه دادههای متنوعی متشکل از ۲۰۸۵۴ ساعت فیلم خودمحور انسانی برای سنجش قابلیتهای دستکاری ماهرانه در وظایف عمومی استفاده میکند.
4.
باز کردن AoE یک مجموعه داده ویدیویی خودمحور ۲۰۰۰ ساعته را منتشر میکند که با سینماتیک دست هماهنگشده و حاشیهنویسیهای عمل اتمی جفت شده است.
5.
چارچوبهای پیشرفته چارچوبهای پیشرفتهای از جمله EgoGuide و EgoLive، ضبط نمایش بدون ربات و تولید مجموعه دادههای خودمحور در مقیاس بزرگ را بیش از پیش ساده میکنند.
با وجود این شتاب در صنعت، راهحلهای سختافزاری برای ثبت تصاویر خودمحور با کیفیت بالا همچنان پراکنده هستند. محققان و تیمهای داده مجبورند دوربینهای اکشن مصرفی، عینکهای واقعیت افزوده و تجهیزات سفارشی را کنار هم بگذارند - که در این فرآیند، دقت همگامسازی، ثبات کالیبراسیون و راحتی استفاده طولانیمدت به خطر میافتد.
بررسی اجمالی محصول دوربین Ego
دوربین Ego یک ماژول دوربین استریو دوچشمی قابل نصب روی سر است که از پایه برای ثبت دادههای خودمحور در یادگیری ربات، هوش مصنوعی تجسمیافته و گردشهای کاری یادگیری تقلیدی مهندسی شده است.
برخلاف دوربینهای اکشن مصرفی که برای مصارف تحقیقاتی تغییر کاربری داده شدهاند، دوربین Ego مخصوص خطوط تولید رباتیک دانشگاهی و صنعتی ساخته شده است. این دوربین دادههای خام حسگر را به صورت تمیز، هماهنگ با سختافزار و از پیش کالیبره شده در کارخانه، بدون نیاز به تنظیمات پس از پردازش، ارائه میدهد.
مشخصات فنی اصلی
| مشخصات | جزئیات |
|---|---|
| حسگرهای تصویر | دو حسگر CMOS با شاتر جهانی ۲ مگاپیکسلی |
| میدان دید افقی (HFOV) | ۶۰-۶۵ درجه، مطابق با محدوده دید طبیعی انسان |
| فناوری شاتر | شاتر سراسری؛ اعوجاج شاتر چرخشی را در حین حرکت با سرعت بالا از بین میبرد |
| ماژول IMU | ICM-26888-P شش محوره (شتابسنج سه محوره + ژیروسکوپ سه محوره)، فرکانس نمونهبرداری ۲۰۰ تا ۵۰۰ هرتز |
| مکانیسم همگامسازی | تریگر سختافزاری GPIO؛ خطای همگامسازی فریم-IMU کمتر از 10 میکروثانیه |
| مهر زمانی | مهرهای زمانی نانوثانیه یکپارچه در سطح سختافزار برای هر فریم تصویر و خوانش IMU |
| رابط سیمی | USB 2.0 Type-C، سازگار با UVC؛ پشتیبانی از SDK بین پلتفرمی برای ویندوز، لینوکس و ROS |
| استقرار بیسیم | وایفای داخلی + حافظه کارت حافظه microSD؛ اولویتبندی فیلمها در حافظه داخلی، آپلود خودکار در فضای ابری هنگام اتصال مجدد به شبکه |
| استاندارد نصب | سوراخهای نصب رزوهدار ۱/۴ اینچ تا ۲۰ اینچ، سازگار با هدبندهای پس از فروش و فیکسچرهای سفارشی |
| کالیبراسیون | پارامترهای داخلی/خارجی استریو و تبدیلهای دوربین-IMU از پیش کالیبره شده در کارخانه، که به طور دائم در حافظه فلش داخلی ذخیره میشوند |
چرا گلوبال شاتر برای یادگیری رباتها غیرقابل مذاکره است؟
دوربینهای مصرفی به حسگرهای شاتر چرخشی متکی هستند که ردیفهای پیکسل را به ترتیب در معرض نور قرار میدهند. حرکات سریع دست انسان - که عنصری همیشه حاضر در فیلمهای نمایشی است - باعث ایجاد مصنوعات شدید شاتر چرخشی میشود که به عنوان "اثر ژلهای" شناخته میشود: لبههای کج اشیاء، تاب هندسی و ردیابی ویژگی غیرقابل اعتماد.
این اعوجاجها، خطوط لوله رباتیک را فلج میکنند. رابطهای VIO، الگوریتمهای SLAM بصری و سیاستهای یادگیری تقلیدی نمیتوانند تغییرات غیرقابل پیشبینی ویژگیهای بین فریمی را تحمل کنند، که به طور چشمگیری تعمیم مدل و عملکرد وظیفه در دنیای واقعی را کاهش میدهد.
حسگر شاتر سراسری دوربین Ego تمام پیکسلها را به طور همزمان در یک پنجره ثبت تصویر نمایش میدهد. هر فریم مطابق با یک ژست جسم صلب بدون ابهام و بدون اعوجاج هندسی است - یک استاندارد اجباری برای تحقیقات دقیق رباتیک و آموزش مدلهای تجاری.
همچنان که این صنعت به دنبال مجموعه دادههای خودمحورِ بزرگتر و گستردهتری است (مانند آرشیو چند هزار ساعته EgoLive از فیلمهای استریو با کیفیت بالا که شامل کارهای خانگی و صنعتی واقعی میشود)، تقاضا برای سختافزار ضبط بدون اعوجاج و با دقت فریم بالا همچنان رو به افزایش است.
همگامسازی سختافزار: مرز بین دادههای آموزشی بیکیفیت و دادههای آموزشی در سطح تولید
وقتی انسانها توالیهای دستکاری - رسیدن به اشیاء، گرفتن آنها، قرار دادن آنها - را اجرا میکنند، سیاستهای ربات نیاز به هماهنگی زمانی دقیق بین حرکت بصری دست و حرکت اینرسی بدن دارد. حتی چند میلیثانیه ناهمگامی بین فریمهای دوربین و خوانشهای IMU کل مجموعه دادههای آموزشی را آلوده میکند. هماهنگی مهر زمانی مبتنی بر نرمافزار (همگامسازی نرم) در طول جلسات ضبط، رانش را جمع میکند و نمیتواند استانداردهای دقیق برای خطوط لوله یادگیری تقلیدی و VIO با وفاداری بالا را برآورده کند.
دوربین Ego از یک پالس GPIO اختصاصی برای تحریک همزمان حسگرهای دوچشمی و IMU استفاده میکند و دقت همگامسازی بهتر از 10 میکروثانیه را ارائه میدهد. هر فریم تصویر و نمونه اینرسی دارای یک برچسب زمانی سختافزاری مشترک است که الزامات زمانی دقیق چارچوبهای اصلی VIO از جمله VINS-Fusion و OpenVINS را برآورده میکند.
مجموعه دادههای خودمحور حاشیهنویسیشدهی پرچمدار مانند Open-AoE برای ارائه برچسبهای متنی هماهنگ، تخمین حالت دست مبتنی بر MANOS، گزارشهای مسیر دوربین و برچسبهای عمل اتمیک محلیشدهی زمانی - که همگی خروجیهای اصلی هستند و دوربین Ego برای پشتیبانی بومی از آنها طراحی شده است - به این سطح از همگامسازی سختافزاری متکی هستند.
کالیبراسیون اولیه در کارخانه: کالیبراسیون زمانبر در محل را حذف کنید
کالیبراسیون دستی یکی از گلوگاههای پرمصرف منابع برای گردشهای کاری ثبت دادههای چند دوربینی است. تنظیم پارامترهای ذاتی لنز، آفستهای بیرونی استریو و ماتریسهای تبدیل دوربین-IMU به تجهیزات نوری تخصصی، تخصص فنی و ساعتها کار به ازای هر دستگاه نیاز دارد.
دوربین Ego این روند کاری را به طور کامل حذف میکند. هر واحد قبل از خروج از کارخانه، کالیبراسیون کامل و دقیقی را پشت سر میگذارد. تمام پارامترهای مهم - فاصله کانونی، مختصات نقطه اصلی، ضرایب اعوجاج، پارامترهای خارجی استریو و تبدیلهای IMU دوربین - به طور دائم در حافظه فلش داخلی نوشته میشوند.
تیمهای تحقیقاتی و فروشندگان داده میتوانند ضبط فیلمهای معتبر را ظرف پنج دقیقه پس از جعبهگشایی، بدون نیاز به اهداف شطرنجی، تجهیزات کالیبراسیون یا جلسات کالیبراسیون نیمروزه، آغاز کنند. مجموعه دادههای خودمحور مدرن و با استاندارد بالا، سختافزار دوربین از پیش کالیبره شده در کارخانه را الزامی میکنند - مشخصاتی که مستقیماً در هر واحد دوربین Ego تعبیه شده است.
دو حالت استقرار، یک پلتفرم سختافزاری یکپارچه
۱. حالت سیمی USB
برای پیشنمایش زنده و ضبط با تأخیر کم، به لپتاپها یا ایستگاههای کاری متصل شوید. برای محیطهای آزمایشگاهی کنترلشده که در آنها محققان کیفیت دادهها را بر اساس تقاضا تأیید میکنند، بهینه شده است. بهطور کامل توسط SDKهای چند پلتفرمی سازگار با ویندوز، لینوکس و چارچوبهای رباتیک ROS پشتیبانی میشود.
۲. حالت آفلاین وایفای + کارت حافظه میکرو اسدی
ضبط بدون اتصال برای جمعآوری دادههای توزیعشده در مقیاس بزرگ. تمام فیلمهای ضبطشده ابتدا روی حافظه MicroSD محلی نوشته میشوند تا از از دست رفتن دادهها در هنگام قطع شبکه جلوگیری شود. پس از برقراری مجدد اتصال، فایلها به طور خودکار با سرورهای ابری از راه دور یا انبارهای داده داخلی همگامسازی میشوند. ایدهآل برای ضبط چند صحنه در آشپزخانهها، کارگاههای تولیدی، دفاتر و سایر محیطهای دنیای واقعی برای تولید هزاران ساعت فیلم نمایشی.
خروجی داده خام ساختاریافته (بدون پردازش هوش مصنوعی داخلی)
این واحد، دادههای خام حسگر را بدون تغییر و خالص و بدون هیچ گونه هموارسازی تصویر داخلی، حاشیهنویسی خودکار یا استنتاج هوش مصنوعی روی دستگاه، خروجی میدهد - و صحت کامل دادههای خام را برای ادغام در خطوط لوله آموزشی سفارشی حفظ میکند:
ویدیوی_چپ.mp4/right_video.mp4: پخش همزمان ویدیوهای استریو دوچشمیimu_6axis.csv: لاگهای اندازهگیری اینرسی ۶ محوره (شتابسنج + ژیروسکوپ) برچسبگذاری شده با مهرهای زمانی سختافزاریtimestamps_ns.txtمهرهای زمانی سختافزاری نانوثانیه یکپارچه برای همه فریمهای تصویر و نمونههای IMUcalibration_params.yamlتبدیلهای کالیبراسیون داخلی، خارجی و IMU دوربین که به صورت پیشفرض در کارخانه تولید شدهاند
بخشهای کاربر هدف
آزمایشگاههای تحقیقاتی دانشگاهی هوش مصنوعی تجسمی و یادگیری تقلیدی
تولیدکنندگان رباتهای انساننما و رباتیکهای ماهر و دستکاریکننده
ارائه دهندگان خدمات داده تخصصی که مجموعه دادههای آموزشی را برای مشتریان فیزیکی هوش مصنوعی تولید میکنند
تیمهای تحقیق و توسعه، الگوریتمهای VIO و SLAM بصری را میسازند.
تیمهای رباتیک، گردشهای کاری جمعآوری دادههای خودمحور در مقیاس بزرگ را مقیاسبندی میکنند
زمان ارسال: ۱۱ آگوست ۲۰۲۶
