Ego Camera – Công cụ thị giác lập thể gắn trên đầu để thu thập dữ liệu học tập cho robot.
Một mô-đun camera hai mắt gắn trên đầu được chế tạo dành riêng cho việc thu thập dữ liệu mô phỏng hành động của con người. Nó cung cấp dữ liệu cảm biến thô từ góc nhìn người dùng, được đồng bộ hóa phần cứng và hiệu chuẩn sẵn tại nhà máy, để hỗ trợ quá trình học tập bắt chước và các quy trình trí tuệ nhân tạo thể hiện qua hành động.
Nút thắt cổ chai dữ liệu đang gây cản trở cho Trí tuệ nhân tạo vật lý
Đến năm 2026, một sự đồng thuận chung đã hình thành trong toàn ngành công nghiệp robot: dữ liệu là nút thắt quan trọng ngăn cản việc triển khai trí tuệ nhân tạo vật lý trên quy mô lớn. Các mô hình ngôn ngữ lớn được huấn luyện trên hàng nghìn tỷ từ vựng văn bản, nhưng các hệ thống trí tuệ nhân tạo có hình thể lại chỉ có quyền truy cập vào chưa đến một phần mười nghìn khối lượng đó trong các đoạn phim tương tác vật lý thực tế.
Sự chênh lệch này tạo ra một trở ngại lớn cho sự tiến bộ. Các phòng thí nghiệm robot hàng đầu ước tính rằng việc huấn luyện các chính sách thao tác tiên tiến đòi hỏi từ 100 triệu đến 1 tỷ giờ quay phim góc nhìn người thứ nhất trong vòng 2-3 năm tới. Ngay cả đối với một nhiệm vụ thao tác riêng lẻ, bộ dữ liệu huấn luyện cũng cần từ 100.000 đến 1 triệu giờ ghi lại hoạt động của con người.
Các chuyên gia trong ngành đều đồng ý rằng việc thu thập dữ liệu từ góc nhìn người dùng mang lại khả năng mở rộng cao nhất. Thay vì dựa vào các thiết bị điều khiển từ xa đắt tiền, có giá hàng chục nghìn đô la Mỹ mỗi thiết bị, các nhóm nghiên cứu và nhà cung cấp dữ liệu hiện đang tận dụng các camera gắn trên đầu có trọng lượng nhẹ để ghi lại cảnh quay minh họa trong khi con người thực hiện các công việc thường nhật.
Sự thay đổi này đã được thể hiện rõ trong các ứng dụng thực tế. Vào tháng 4 năm 2026, đoạn video lan truyền trên mạng cho thấy hàng nghìn công nhân dệt may trên khắp vùng Delhi NCR của Ấn Độ đeo những chiếc camera gắn trên đầu nhỏ gọn do Egolab.AI sản xuất. Những người vận hành này hiện đang tạo ra các bộ dữ liệu video góc nhìn cá nhân khổng lồ để huấn luyện các robot hình người thế hệ tiếp theo.
Vì sao dữ liệu góc nhìn thứ nhất, vị kỷ là không thể thiếu
Robot phải nhận thức chính xác các thông tin thị giác mà con người nhìn thấy để có thể tái tạo chính xác các kỹ năng vận động của con người. Một loạt nghiên cứu được công bố từ năm 2025 đến năm 2026 đã chứng minh giá trị đột phá của các tập dữ liệu lấy con người làm trung tâm:
1.
Bản ngã con người Chỉ cần 30 phút video ghi hình góc nhìn chủ quan của con người cho mỗi nhiệm vụ là có thể đạt được tỷ lệ thành công trung bình 92,5% trong các nhiệm vụ thao tác thực tế, cho phép chuyển giao kỹ năng từ con người sang robot mà không cần huấn luyện trước.
2.
EgoMimic Việc tích hợp dữ liệu minh họa từ con người giúp tăng hiệu suất thực hiện nhiệm vụ từ 34% đến 228% so với dữ liệu huấn luyện chỉ từ robot. Một giờ quay phim bổ sung từ bàn tay con người mang lại sự cải thiện mô hình vượt trội hơn nhiều so với một giờ dữ liệu tự thu thập bổ sung từ robot. Các bộ dữ liệu kết hợp giữa con người và robot cũng mang lại hiệu suất huấn luyện và triển khai vượt trội, bao gồm cả dữ liệu từ các quy trình điều khiển từ xa tầm xa.
3.
EgoScale Được phát triển bởi các nhà nghiên cứu của NVIDIA, khung phần mềm này tận dụng một tập dữ liệu đa dạng gồm 20.854 giờ video quay từ góc nhìn người dùng để mở rộng khả năng thao tác khéo léo trong các nhiệm vụ thông thường.
4.
Mở rộng phạm vi ảnh hưởng Phát hành bộ dữ liệu video góc nhìn người thứ nhất dài 2.000 giờ, kết hợp với dữ liệu động học bàn tay được đồng bộ hóa và chú thích hành động cơ bản.
5.
Các khuôn khổ tiên tiến Các khung công nghệ tiên tiến như EgoGuide và EgoLive giúp đơn giản hóa hơn nữa việc ghi lại các bản demo không cần robot và tạo ra bộ dữ liệu lấy người dùng làm trung tâm quy mô lớn.
Bất chấp đà phát triển của ngành, các giải pháp phần cứng cho việc thu thập dữ liệu từ góc nhìn người dùng chất lượng cao vẫn còn rời rạc. Các nhà nghiên cứu và nhóm dữ liệu buộc phải ghép nối các camera hành động dành cho người tiêu dùng, kính AR và các thiết bị tự chế – dẫn đến việc phải đánh đổi độ chính xác đồng bộ hóa, tính nhất quán hiệu chuẩn và sự thoải mái khi đeo trong thời gian dài.
Tổng quan sản phẩm camera Ego
Ego Camera là một mô-đun camera lập thể hai mắt gắn trên đầu được thiết kế từ đầu để thu thập dữ liệu theo góc nhìn người dùng trong quá trình học máy robot, trí tuệ nhân tạo thể hiện và các quy trình học tập bắt chước.
Không giống như các camera hành động dành cho người tiêu dùng được cải tiến để sử dụng trong nghiên cứu, Ego Camera được chế tạo chuyên dụng cho các quy trình robot học thuật và công nghiệp. Nó xuất ra dữ liệu cảm biến thô sạch, được đồng bộ hóa phần cứng và hiệu chuẩn sẵn tại nhà máy mà không cần thiết lập xử lý hậu kỳ.
Thông số kỹ thuật cốt lõi
| Thông số kỹ thuật | Chi tiết |
|---|---|
| Cảm biến hình ảnh | Hai cảm biến CMOS màn trập toàn cầu 2MP |
| Góc nhìn ngang (HFOV) | 60–65°, phù hợp với phạm vi thị giác tự nhiên của con người. |
| Công nghệ màn trập | Màn trập toàn cầu; loại bỏ hiện tượng méo hình do màn trập cuốn trong quá trình chuyển động tốc độ cao. |
| Mô-đun IMU | ICM-26888-P 6 trục (gia tốc kế 3 trục + con quay hồi chuyển 3 trục), tần số lấy mẫu 200–500 Hz |
| Cơ chế đồng bộ hóa | Kích hoạt bằng GPIO phần cứng; sai số đồng bộ khung hình-IMU < 10 micro giây |
| Ghi dấu thời gian | Dấu thời gian nano giây thống nhất ở cấp độ phần cứng cho mỗi khung hình và dữ liệu đọc từ IMU. |
| Giao diện có dây | USB 2.0 Type-C, tương thích UVC; hỗ trợ SDK đa nền tảng cho Windows, Linux và ROS. |
| Triển khai không dây | Tích hợp WiFi + bộ nhớ thẻ MicroSD; ưu tiên lưu trữ dữ liệu vào bộ nhớ trong, tự động tải lên đám mây khi kết nối lại mạng; video được ưu tiên lưu vào bộ nhớ cục bộ, tự động tải lên đám mây khi kết nối lại mạng. |
| Tiêu chuẩn lắp đặt | Lỗ ren lắp đặt 1/4″-20, tương thích với dây đeo đầu và các phụ kiện tùy chỉnh khác. |
| Sự định cỡ | Các thông số nội tại/ngoại tại stereo và phép biến đổi camera-IMU được hiệu chuẩn sẵn tại nhà máy, được lưu trữ vĩnh viễn trong bộ nhớ flash tích hợp. |
Vì sao màn trập toàn cầu là điều không thể thiếu đối với học máy robot
Máy ảnh dân dụng dựa trên cảm biến màn trập cuốn, trong đó các hàng điểm ảnh được phơi sáng tuần tự. Các chuyển động nhanh của tay người – một yếu tố luôn hiện diện trong các đoạn phim trình diễn – tạo ra các hiện tượng méo hình do màn trập cuốn gây ra, được gọi là “hiệu ứng thạch”: các cạnh vật thể bị méo mó, biến dạng hình học và khả năng theo dõi chi tiết không đáng tin cậy.
Những biến dạng này làm tê liệt các quy trình robot. Các giao diện VIO, thuật toán SLAM hình ảnh và các chính sách học bắt chước không thể chịu đựng được sự thay đổi đặc trưng giữa các khung hình không thể đoán trước, điều này làm suy giảm nghiêm trọng khả năng khái quát hóa của mô hình và hiệu suất thực hiện nhiệm vụ trong thế giới thực.
Cảm biến màn trập toàn cầu của Ego Camera cho phép tất cả các điểm ảnh được phơi sáng đồng thời trong một cửa sổ chụp duy nhất. Mỗi khung hình tương ứng với một tư thế vật thể rắn rõ ràng, không bị biến dạng hình học — một tiêu chuẩn bắt buộc cho nghiên cứu robot nghiêm ngặt và huấn luyện mô hình thương mại.
Khi ngành công nghiệp theo đuổi các bộ dữ liệu lấy người dùng làm trung tâm ngày càng lớn (chẳng hạn như kho lưu trữ hàng nghìn giờ video lập thể chất lượng cao của EgoLive, bao gồm các công việc thực tế trong gia đình và công nghiệp), nhu cầu về phần cứng thu hình không bị méo hình và chính xác từng khung hình tiếp tục tăng cao.
Đồng bộ hóa phần cứng: Khoảng cách giữa dữ liệu huấn luyện chất lượng thấp và dữ liệu huấn luyện đạt tiêu chuẩn sản xuất
Khi con người thực hiện các chuỗi thao tác—vươn tới, nắm bắt, đặt vật thể—các thuật toán của robot yêu cầu sự đồng bộ thời gian chính xác giữa chuyển động tay trực quan và chuyển động cơ thể quán tính. Ngay cả một vài mili giây lệch pha giữa khung hình camera và dữ liệu từ IMU cũng làm sai lệch toàn bộ tập dữ liệu huấn luyện. Việc đồng bộ dấu thời gian dựa trên phần mềm (đồng bộ hóa mềm) tích lũy sự sai lệch qua các phiên ghi hình và không đáp ứng được các tiêu chuẩn độ chính xác cho các quy trình học tập mô phỏng và nhận diện hình ảnh trực quan có độ chính xác cao.
Camera Ego sử dụng xung GPIO chuyên dụng để kích hoạt đồng thời cả hai cảm biến hai mắt và IMU, mang lại độ chính xác đồng bộ hóa tốt hơn 10 micro giây. Mỗi khung hình và mẫu quán tính đều mang một dấu thời gian phần cứng chung—đáp ứng các yêu cầu thời gian nghiêm ngặt của các khung VIO phổ biến bao gồm VINS-Fusion và OpenVINS.
Các bộ dữ liệu lấy người dùng làm trung tâm được chú thích hàng đầu như Open-AoE dựa vào cấp độ đồng bộ phần cứng này để cung cấp các nhãn văn bản được đồng bộ hóa, ước tính tư thế tay dựa trên MANOS, nhật ký quỹ đạo camera và các thẻ hành động nguyên tử được định vị theo thời gian — tất cả đều là các sản phẩm cốt lõi mà Ego Camera được thiết kế để hỗ trợ một cách tự nhiên.
Hiệu chuẩn trước tại nhà máy: Loại bỏ quy trình hiệu chuẩn tại chỗ tốn thời gian.
Việc hiệu chỉnh thủ công là một trong những điểm nghẽn tốn nhiều tài nguyên nhất trong quy trình thu thập dữ liệu đa camera. Việc tinh chỉnh các thông số nội tại của ống kính, độ lệch ngoại vi lập thể và ma trận biến đổi camera-IMU đòi hỏi thiết bị quang học chuyên dụng, chuyên môn kỹ thuật và hàng giờ lao động cho mỗi thiết bị.
Camera Ego loại bỏ hoàn toàn quy trình này. Mỗi thiết bị đều trải qua quá trình hiệu chuẩn toàn diện từ đầu đến cuối trước khi xuất xưởng. Tất cả các thông số quan trọng—tiêu cự, tọa độ điểm chính, hệ số méo hình, tham số ngoại vi stereo và phép biến đổi camera-IMU—đều được ghi vĩnh viễn vào bộ nhớ flash tích hợp.
Các nhóm nghiên cứu và nhà cung cấp dữ liệu có thể bắt đầu ghi lại cảnh quay hợp lệ trong vòng năm phút sau khi mở hộp, không cần mục tiêu bàn cờ, thiết bị hiệu chuẩn hoặc các buổi hiệu chuẩn kéo dài nửa ngày. Các bộ dữ liệu góc nhìn người dùng hiện đại đạt tiêu chuẩn cao yêu cầu phần cứng máy ảnh được hiệu chuẩn sẵn tại nhà máy—một thông số kỹ thuật được tích hợp trực tiếp vào mỗi thiết bị Ego Camera.
Hai chế độ triển khai, một nền tảng phần cứng thống nhất duy nhất.
1. Chế độ có dây USB
Kết nối với máy tính xách tay hoặc máy trạm để xem trước trực tiếp và ghi hình độ trễ thấp. Được tối ưu hóa cho môi trường phòng thí nghiệm được kiểm soát, nơi các nhà nghiên cứu xác thực chất lượng dữ liệu theo yêu cầu. Được hỗ trợ đầy đủ bởi các bộ công cụ phát triển phần mềm đa nền tảng tương thích với Windows, Linux và các khung phần mềm robot ROS.
2. Chế độ ngoại tuyến WiFi + Thẻ MicroSD
Ghi hình không dây cho phép thu thập dữ liệu phân tán quy mô lớn. Tất cả cảnh quay được ghi trước tiên vào bộ nhớ MicroSD cục bộ để tránh mất dữ liệu trong trường hợp mất kết nối mạng; sau khi kết nối được khôi phục, các tệp sẽ tự động đồng bộ hóa với máy chủ đám mây từ xa hoặc kho dữ liệu tại chỗ. Lý tưởng cho việc ghi hình đa cảnh tại nhà bếp, xưởng sản xuất, văn phòng và các môi trường thực tế khác để tạo ra hàng nghìn giờ video minh họa.
Dữ liệu thô được cấu trúc (Không có xử lý AI tích hợp)
Thiết bị này xuất ra dữ liệu cảm biến thô, nguyên bản, không qua chỉnh sửa, không tích hợp tính năng làm mịn ảnh, tự động chú thích hoặc suy luận AI trên thiết bị — bảo toàn độ trung thực của dữ liệu thô để tích hợp vào các quy trình huấn luyện tùy chỉnh:
left_video.mp4/right_video.mp4: Luồng video lập thể hai mắt được đồng bộ hóaimu_6axis.csv: Nhật ký đo lường quán tính 6 trục (gia tốc kế + con quay hồi chuyển) được gắn thẻ thời gian phần cứngtimestamps_ns.txt: Dấu thời gian phần cứng nano giây thống nhất cho tất cả các khung hình và mẫu IMUcalibration_params.yaml: Các phép biến đổi hiệu chuẩn nội tại, ngoại tại và hiệu chuẩn camera-IMU được tích hợp sẵn trong nhà máy
Phân khúc người dùng mục tiêu
Phòng thí nghiệm nghiên cứu học thuật về Trí tuệ nhân tạo thể hiện và học tập bắt chước
Các nhà sản xuất robot hình người và robot thao tác khéo léo
Các nhà cung cấp dịch vụ dữ liệu chuyên biệt tạo ra các tập dữ liệu huấn luyện cho khách hàng AI vật lý.
Các nhóm nghiên cứu và phát triển đang xây dựng thuật toán VIO và SLAM hình ảnh.
Các nhóm nghiên cứu robot đang mở rộng quy mô quy trình thu thập dữ liệu trình diễn góc nhìn người điều khiển.
Thời gian đăng bài: 11/08/2026
