論文の概要: Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
- arxiv url: http://arxiv.org/abs/2605.31196v1
- Date: Fri, 29 May 2026 12:04:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.586716
- Title: Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
- Title(参考訳): 安全な人間-ロボット協調のための視覚言語モデルにおける衝突グラウンドの探索
- Abstract要約: 視覚言語モデル(VLM)における衝突基盤の評価のためのベンチマークであるTouchSafeBenchを紹介する。
TouchSafeBenchには、ソーシャルナビゲーションとソーシャルアレンジメントの2,940のシミュレーション屋内共催エピソードが含まれている。
本研究では,現在の安全状態を分類し,接触前の緊急衝突を警告する2つの配置タスクについて検討する。
- 参考スコア(独自算出の注目度): 19.192199380267393
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safe human--robot collaboration requires more than visual description: a monitor must determine whether the robot body is safely separated, already colliding with the scene or a person, or about to collide. We call this capability collision grounding: binding visual observations to robot body geometry, camera viewpoint, scene layout, human proximity, and temporal motion in order to infer present and imminent contact. We introduce TouchSafeBench, a physics-grounded benchmark for evaluating collision grounding in vision-language models (VLMs). Built in Habitat~3.0, TouchSafeBench contains 2,940 simulated indoor co-presence episodes across social navigation and social rearrangement, with synchronized multi-view RGB-D observations, top-down trajectory maps, calibrated camera metadata, and simulator-derived contact labels. We study two deployment-facing tasks: classifying the current safety state and warning about imminent collision before contact. Across three frontier or robotics-oriented VLMs and nine visual representations, current models remain far from reliable: the best average Macro-F1 stays below 50\%, explicit depth is not automatically transformed into robot-body collision evidence, and robot--scene contact is consistently harder than human-contact risk. TouchSafeBench reveals a central limitation of embodied VLMs: visual fluency does not imply physical accountability. Reliable robot safety monitors will need representations that explicitly bind viewpoint, robot morphology, metric geometry, and future collision. We will release the benchmark upon acceptance.
- Abstract(参考訳): ロボットの体が安全に分離されているか、すでに現場や人間と衝突しているか、衝突しようとしているかをモニターが判断しなければならない。
ロボットの身体形状、カメラの視点、シーンのレイアウト、人間の近接、時間的動きに視覚的観察を結びつけることで、現在と差し迫った接触を推測する。
本稿では,視覚言語モデル(VLM)における衝突場評価のための物理グラウンドベンチマークであるTouchSafeBenchを紹介する。
Habitat~3.0で構築されたTouchSafeBenchには、ソーシャルナビゲーションとソーシャルアレンジメントにまたがる2,940のシミュレーションされた屋内コプレゼンエピソードが含まれており、同期されたマルチビューのRGB-D観測、トップダウンの軌跡マップ、キャリブレーションされたカメラメタデータ、シミュレータ由来のコンタクトラベルがある。
本研究では,現在の安全状態を分類し,接触前の緊急衝突を警告する2つの配置タスクについて検討する。
3つのフロンティアまたはロボット指向のVLMと9つの視覚的表現のうち、現在のモデルは信頼性に欠け、平均的なマクロF1は50%以下にとどまり、明示的な深さは自動的にロボット本体の衝突証拠に変換されず、ロボットとシーンの接触は人間の接触リスクよりも一貫して困難である。
TouchSafeBenchは、VLMを具現化した中心的な制限を明らかにしている。
信頼性の高いロボット安全モニターには、視点、ロボット形態、計量幾何学、将来の衝突を明確に拘束する表現が必要である。
承認後、ベンチマークを公開します。
関連論文リスト
- Collision-Aware Humanoid Whole-Body Control under Imperfect Tracking Targets [11.010074477825272]
全体コントローラ(WBC)は、バランスと安定性を維持しながら目標を追跡するコマンドを実行する。
ほとんどのWBCはシーン幾何学に盲目であり、知覚、計画、遠隔操作の誤りによる衝突につながる可能性がある。
本稿では,視覚障害者を包むレイヤであるRECALを提案する。
論文 参考訳(メタデータ) (2026-09-14T22:22:02Z) - RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction [33.04319504310729]
RoboGestureは、完全に対話的な人間-ヒューマノイドシステムを動かすために、データ、モデリング、制御を共同設計するロボット中心のフレームワークである。
まず,300以上のジェスチャーカテゴリを備えたRoboGestureデータセットを構築し,大規模オーディオモーションペアを合成する自動パイプラインを開発した。
Unitree G1のヒューマノイドの実験では、RoboGestureは最先端のベースラインに比べて安全で、よりリズミカルで、セマンティックに適切な応答を生成する。
論文 参考訳(メタデータ) (2026-08-27T02:13:46Z) - RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction [51.76737991200891]
H2R(Human-to-robot)オブジェクトハンドオーバは、人間とロボットのコラボレーションの基本的な能力である。
本稿では,RGB-DビデオデータセットであるHand2Botを紹介する。
ハンドオブジェクトの一貫性を確保しつつ,現実的なハンドオーバシーケンスを合成する生成パイプラインであるPassGenを提案する。
論文 参考訳(メタデータ) (2026-08-13T09:55:59Z) - GenHOI: Contact-Aware Humanoid-Object Interaction by Imitating Generated Videos without Task-Specific Training [20.414478780328437]
既存の方法は、しばしば時間を要するタスク固有のポリシートレーニングを必要とするか、厳格な軌跡の再生に依存している。
我々は,人型ロボットがゼロショット方式で多様なオブジェクトインタラクションタスクを実行できるフレームワークであるtextitGenHOIを提案する。
提案手法を多種多様なオブジェクト・インタラクション・タスクにまたがる広範囲なシミュレーションおよび実世界の実験で検証する。
論文 参考訳(メタデータ) (2026-06-11T07:31:05Z) - OmniRobotHome: A Multi-Camera Platform for Real-Time Multiadic Human-Robot Interaction [21.78933851010173]
OmniRobotHomeは、リアルタイムな3次元人間と物体の認識を協調したマルチロボットアクチュエーターで統合する最初のルームスケールの住宅用プラットフォームである。
我々は、共有ロボット環境における安全性と、人間の予想するロボット支援の2つの中心的な問題に焦点をあてる。
論文 参考訳(メタデータ) (2026-04-30T17:59:58Z) - EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents [85.77432303199176]
EmbodMocapは2つの動くiPhoneを使ったポータブルで安価なデータ収集パイプラインである。
私たちのキーとなるアイデアは、二重RGB-Dシーケンスを共同で校正し、人間とシーンの両方を再構築することです。
収集したデータに基づいて、我々は3つの具体的AIタスクを強化した: モノクラーヒューマン・シーン・リコンストラクション(モノクラーヒューマン・シーン・リコンストラクション)、メトリックスケールで世界空間に整合した人間とシーンを出力するフィードフォワードモデル、物理ベースのキャラクターアニメーション。
論文 参考訳(メタデータ) (2026-02-26T16:53:41Z) - Real-Time Human-Robot Interaction Intent Detection Using RGB-based Pose and Emotion Cues with Cross-Camera Model Generalization [0.8839687029212673]
公共空間におけるサービスロボットは、自然な相互作用のための人間の行動意図をリアルタイムに理解する必要がある。
モノクラーRGBビデオから抽出した2次元骨格ポーズと顔の感情特徴を融合したフレーム精度の人-ロボットインタラクション意図検出のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-18T08:44:22Z) - HOSIG: Full-Body Human-Object-Scene Interaction Generation with Hierarchical Scene Perception [57.37135310143126]
HO SIGは階層的なシーン認識を通じて全体インタラクションを合成するための新しいフレームワークである。
我々のフレームワークは、自己回帰生成による運動長の無制限化をサポートし、手動による介入を最小限に抑える。
この研究は、シーン認識ナビゲーションとデクスタラスオブジェクト操作の間に重要なギャップを埋める。
論文 参考訳(メタデータ) (2025-06-02T12:08:08Z) - Is Single-View Mesh Reconstruction Ready for Robotics? [78.14584238127338]
本研究では,ロボット操作のための物理シミュレータを用いたリアルタイム計画と動的予測のためのディジタル双対生成の実現の可能性について,単一ビューメッシュ再構成モデルの評価を行った。
我々の研究は、コンピュータビジョンの進歩とロボティクスの必要性の間に重要なギャップがあることを浮き彫りにし、この交差点における将来の研究を導く。
論文 参考訳(メタデータ) (2025-05-23T14:35:56Z) - Exploring 3D Human Pose Estimation and Forecasting from the Robot's Perspective: The HARPER Dataset [52.22758311559]
本研究では,ユーザとスポット間のダイアドインタラクションにおける3次元ポーズ推定と予測のための新しいデータセットであるHARPERを紹介する。
キーノーベルティは、ロボットの視点、すなわちロボットのセンサーが捉えたデータに焦点を当てることである。
HARPERの基盤となるシナリオには15のアクションが含まれており、そのうち10つはロボットとユーザの間の物理的接触を含んでいる。
論文 参考訳(メタデータ) (2024-03-21T14:53:50Z) - COPILOT: Human-Environment Collision Prediction and Localization from
Egocentric Videos [62.34712951567793]
エゴセントリックな観測から人間と環境の衝突を予測する能力は、VR、AR、ウェアラブルアシストロボットなどのアプリケーションにおける衝突回避を可能にするために不可欠である。
本稿では、ボディマウントカメラから撮影した多視点エゴセントリックビデオから、多様な環境における衝突を予測するという課題を紹介する。
衝突予測と局所化を同時に行うために,COPILOTと呼ばれるトランスフォーマーモデルを提案する。
論文 参考訳(メタデータ) (2022-10-04T17:49:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。