論文の概要: Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance
- arxiv url: http://arxiv.org/abs/2608.00652v1
- Date: Sat, 01 Aug 2026 13:13:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.848302
- Title: Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance
- Title(参考訳): Assistant Placement Aria: Egocentric Placement Assistanceのベンチマーク
- Abstract要約: 我々は、仮想配置(VP)の文脈において、この課題に焦点をあてる。
VP問題は、シーンの幾何学、意味論、そして妥当性に関するグローバルとローカルの両方の推論を必要とするため、複雑である。
我々は、グローバル、ローカル、人間中心の制約を含むVPのさまざまな側面を探索する最初のベンチマークであるbf Assistant Placement Ariaを紹介する。
- 参考スコア(独自算出の注目度): 13.737958428370368
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Human assistance in robotics spans around several tasks such as navigation, object manipulation, and placement, where a key challenge is selecting target destinations that align with human intentions or preferences. We focus on this challenge in the context of Virtual Placement (VP), the task of identifying all plausible target locations given scene context and human-centric constraints. This differs from traditional placement tasks that typically focus on a single, predefined target location. The VP problem is complex, as it requires both global and local reasoning about the scene's geometry, semantics, and plausibility. To address this gap, we introduce {\bf Assistant Placement Aria}, the first benchmark to explore diverse aspects of VP, including global, local, and human-centric constraints. It contains both synthetic and real indoor scenes annotated for three tasks: (i)~2D Panel Placement, (ii)~Sitting Suggestion, and (iii)~TV Placement. Each scene includes 2D images, a 3D point cloud, and a textual description of the objects within the scene. By contributing this benchmark, we aim to encourage further research in this underexplored and challenging field that is critically dependent on relevant data. We also evaluate several foundation models for object detection and segmentation on our benchmark.
- Abstract(参考訳): ロボット工学におけるヒューマンアシストは、ナビゲーション、オブジェクト操作、配置など、いくつかのタスクにまたがっている。
我々は,この課題を仮想配置(VP)のコンテキスト,シーンコンテキストと人間中心の制約が与えられたすべての可視なターゲット位置を特定するタスクに焦点をあてる。
これは、通常、1つの予め定義されたターゲット位置に集中する伝統的な配置タスクとは異なる。
VP問題は、シーンの幾何学、意味論、そして妥当性に関するグローバルとローカルの両方の推論を必要とするため、複雑である。
このギャップに対処するために、我々は、グローバル、ローカル、人間中心の制約を含むVPのさまざまな側面を探求する最初のベンチマークである {\bf Assistant Placement Aria}を紹介します。
室内の合成シーンと実際のシーンの両方が3つの課題に注釈付けされている。
(i)~2Dパネル配置
(ii)~誘惑の沈静化、及び
(3)〜TVプレイスメント。
各シーンには、2Dイメージ、3Dポイントクラウド、シーン内のオブジェクトのテキスト記述が含まれている。
このベンチマークに貢献することで、関連するデータに批判的に依存する未発見で挑戦的な分野のさらなる研究を奨励することを目指している。
また,オブジェクト検出とセグメンテーションのための基礎モデルをベンチマークで評価した。
関連論文リスト
- SpatialPoint: Spatial-aware Point Prediction for Embodied Localization [6.970630364284529]
身体的な知性は、3D空間でどこで行動すべきかを決定する能力を必要とする。
具体的位置決めを2つの相補的ターゲットタイプでインスタンス化する。
本研究では,構造化深度を視覚言語モデルに統合した,注意深く設計した視覚言語フレームワークであるSpatialPointを提案する。
論文 参考訳(メタデータ) (2026-03-16T07:03:48Z) - ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos [44.050522958181496]
ToG-Benchは、Egoビデオのためのタスク指向固有の時間的ビデオグラウンドティングベンチマークである。
ToG-Benchは、ScanNetからソースされたビデオに基づいて、100の注釈付きクリップと2,704のタスク指向の接地命令で構成されている。
広範囲な実験により、タスク指向STVGの課題と、明示的かつ多目的的なグラウンドリングにおけるパフォーマンスギャップが明らかになる。
論文 参考訳(メタデータ) (2025-12-03T10:54:44Z) - PersONAL: Towards a Comprehensive Benchmark for Personalized Embodied Agents [47.44972258523047]
PersONALは、Embodied AIのパーソナライゼーションを研究するためのベンチマークである。
HM3Dデータセットから、30以上のフォトリアリスティックな家庭に2,000以上の高品質なエピソードを収録する。
ベンチマークでは,(1)見えない環境でのアクティブナビゲーション,(2)マップされたシーンでのオブジェクトグラウンドの2つの評価モードがサポートされている。
論文 参考訳(メタデータ) (2025-09-24T07:39:16Z) - SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes [105.8644620467576]
Stextscurprise3Dは複雑な3次元シーンにおける言語誘導空間推論のセグメンテーションを評価するために設計された新しいデータセットである。
Stextscurprise3Dは、ScanNet++ v2から900以上の詳細な屋内シーンにわたる200k以上の視覚言語ペアで構成されている。
データセットには、オブジェクト名なしで意図的に作成される89k以上の人間アノテーション付き空間クエリが含まれている。
論文 参考訳(メタデータ) (2025-07-10T14:01:24Z) - Grounding 3D Scene Affordance From Egocentric Interactions [52.5827242925951]
接地型3Dシーンアベイランスは、3D環境におけるインタラクティブな領域を見つけることを目的としている。
我々は,エゴセントリックなインタラクションから3Dシーンの空き時間を確保するという,新しい課題を紹介した。
論文 参考訳(メタデータ) (2024-09-29T10:46:19Z) - SOON: Scenario Oriented Object Navigation with Graph-based Exploration [102.74649829684617]
人間のように3Dエンボディ環境のどこからでも言語ガイドされたターゲットに向かって移動する能力は、インテリジェントロボットの「聖杯」目標の1つです。
ほとんどのビジュアルナビゲーションベンチマークは、ステップバイステップの詳細な命令セットに導かれ、固定された出発点から目標に向かって移動することに焦点を当てている。
このアプローチは、人間だけが物体とその周囲がどのように見えるかを説明する現実世界の問題から逸脱し、ロボットにどこからでも航行を依頼する。
論文 参考訳(メタデータ) (2021-03-31T15:01:04Z) - SIRI: Spatial Relation Induced Network For Spatial Description
Resolution [64.38872296406211]
言語誘導型ローカライゼーションのための新しい関係誘導型ネットワーク(SIRI)を提案する。
提案手法は,80ピクセルの半径で測定した精度で,最先端手法よりも約24%優れていた。
提案手法は,Touchdownと同じ設定で収集した拡張データセットをうまく一般化する。
論文 参考訳(メタデータ) (2020-10-27T14:04:05Z) - Depth Based Semantic Scene Completion with Position Importance Aware
Loss [52.06051681324545]
PALNetはセマンティックシーン補完のための新しいハイブリッドネットワークである。
詳細な深度情報を用いて,多段階から2次元特徴と3次元特徴の両方を抽出する。
オブジェクトのバウンダリやシーンの隅といった重要な詳細を復元することは有益である。
論文 参考訳(メタデータ) (2020-01-29T07:05:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。