ロボットデータ収集の課題とAXISのアプローチ
従来のロボット操作データセットは、専門家が研究室のハードウェアでデモンストレーションを収集し、オフラインで処理するという閉鎖的で中央集権的な方法が主流でした。このため、一度作成されたベンチマークはその後更新されず、モデルの成長速度に比べてデータセットの拡張が遅れるという課題がありました。
Axis Roboticsなどが提案する「AXIS」は、この問題に対し、まったく異なるアプローチを取っています。彼らはデモンストレーションの収集をブラウザ上で行い、それ以外の負荷の高い処理はバックエンドのGPUに任せるという非対称なシステム設計を採用しました。
これにより、データセットは一度提供される固定的なものではなく、継続的に拡張されていくものとして扱われる点が画期的です。(出典)
ロボット操作データセットの収集をブラウザベースに移行し、継続的な拡張を可能にする「AXIS」は、従来の閉鎖的なアプローチを根本から変える可能性を秘めています。
Pythonバインディングなどがあれば、自分の個人プロダクトのシミュレーション環境構築に応用してみたいですね。ブラウザベースで手軽にデータ収集できるのは、開発者にとって大きなメリットだと感じます。
ブラウザとバックエンドの役割分担
AXISのシステム設計の核は、その非対称性にあります。貢献者は、MuJoCo WebAssemblyフロントエンド内で、キーボード、マウス、仮想ジョイスティック、またはゲームパッドを使用してFranka Research 3ロボットをテレオペレートします。物理シミュレーションのステップ処理やThree.jsによるレンダリングは、React UIスレッドとは別の場所で実行され、ログに記録される状態・アクションのサンプルがインターフェースではなくシミュレータと同期するように設計されています。
一方で、高負荷な処理はすべてバックエンドで行われます。
| 項目 | フロントエンド(ブラウザ) | バックエンド |
|---|---|---|
| 役割 | ロボットのテレオペレーション、シミュレーション実行、レンダリング(UIスレッド外) | 高品質レンダリング、モデル学習、評価、タスク生成 |
| 使用技術 | MuJoCo WebAssembly, Three.js, React UI | 8x RTX 4090 GPU (レンダリング), 8x A100 GPU (学習・評価) |
| 入力デバイス | キーボード、マウス、仮想ジョイスティック、ゲームパッド | - |
タスク自体も手動で作成するのではなく、自動生成されます。TaskGenは、自然言語の指示をタスク、シーン、オブジェクトの構成に分解し、画像から3Dへのパイプラインを通じてメッシュを取得または生成し、物理的に妥当なサイズに再スケーリングした後、2.5Dのレイアウトを提案します。レイアウト監視機能が生成されたシーンを検証し、制約が満たされない場合はオブジェクトを再配置、再方向付け、または再生成します。
各タスクには構造化された成功チェッカーが付属しており、バックエンドがこれを再実行することで、フロントエンドの成功フラグを盲目的に信頼しない設計になっています。(出典)
8x RTX 4090と8x A100というのは、まさに個人でStable Diffusionを動かしている身としては憧れの構成ですね。これだけのGPUリソースをバックエンドに持つことで、ブラウザ側の負担を最小限に抑えつつ、高品質なデータ生成と高速な学習を実現しているのだと感じます。
公開されたデータセットとクリーンアップ
今回公開されたデータセットのスナップショットには、以下のような内容が含まれています。(出典)
- タスク数: 207種類
- エピソード数: 50,129件
- タスクまたはシーンのバリアント: 60,000件以上(7つのシーンカテゴリにわたる)
各軌跡には、タスクメタデータ、エンボディメント、シミュレータバージョン、ロボットとオブジェクトの状態、アクション、成功ラベル、およびサードビューと手首からのRGB-D観測が含まれています。このデータセットは、70,000人以上のコミュニティメンバーからの貢献によるものとされています。
データクリーニングも重要な工程として扱われています。静止しているサンプルはドロップされ、Savitzky-Golayフィルターで連続的な動きがスムージングされ、ウェブインターフェースが生成する6Hzから8Hzのデータを20Hzの目標までキュービックスプラインでリサンプリングしています。これは、データ品質を維持するための非常に洗練されたアプローチだと感じます。
現在、Hugging Faceで公開されているデータセットは2.36TBと非常に大きく、非商用・学術利用に限定されています。トレーニングコードはOpenPIのパッチレイヤーとして公開されており、テレオペレーションプラットフォームはブラウザで利用可能です。しかし、ポリシーチェックポイントはリリースされていません。
これは、ロボット学習の分野におけるオープンソースの強力な推進力となるでしょう。特に、データ収集の民主化という側面は、AIの発展に不可欠な要素だと私は考えます。