論文の概要: Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution
- arxiv url: http://arxiv.org/abs/2607.14341v1
- Date: Wed, 15 Jul 2026 20:10:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.911846
- Title: Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution
- Title(参考訳): Visual Graspingを超えて: 検出から実行までの複雑なGraspingのベンチマーク
- Abstract要約: GCA-Benchは複雑なアクションシナリオを用いたテキストグラフ作成に挑戦するベンチマークである。
従来の把握検出パイプラインからエンドツーエンドの学習方法まで,さまざまなベースラインを実装しています。
さらに,我々は,新たな評価指標を提案し,臨界故障モデルを分析し,より堅牢で一般化可能な把握戦略の開発を指導するための洞察を提供する。
- 参考スコア(独自算出の注目度): 20.75638062019513
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robust robotic grasping remains a fundamental challenge for complex real-world applications. Recent advances in large-scale models demonstrate promising capabilities for reasoning in robotic tasks. However, existing benchmarks for grasping primarily focus on isolated, visual-based grasp pose detection, failing to capture the complexity of grasping tasks that require multi-step reasoning and semantic understanding during execution. To address this gap, we propose GCA-Bench, a benchmark featuring challenging \textit{grasping with complex action} scenarios that involve both scene-level reasoning and semantic constraints. GCA-Bench enables the evaluation of recent large foundation models under the same settings. To demonstrate the effectiveness of our new benchmark, we implement a diverse set of baselines, ranging from traditional grasp detection pipelines to end-to-end learning methods. Empirical studies achieve success rates below 70\% on complex grasping scenarios, underscoring critical limitations. In addition, we propose new evaluation metrics, analyze critical failure models, and provide insights to guide the development of more robust and generalizable grasping strategies.
- Abstract(参考訳): 複雑な現実世界のアプリケーションにとって、ロバストなロボットグルーピングは依然として根本的な課題である。
大規模モデルの最近の進歩は、ロボット作業における推論の有望な能力を示している。
しかし、既存のベンチマークでは、主に分離された視覚ベースのグリップポーズ検出に焦点を当てており、実行中に多段階の推論とセマンティック理解を必要とするタスクの把握の複雑さを捉えていない。
このギャップに対処するために、シーンレベルの推論とセマンティック制約の両方を含む、複雑なアクションを伴う‘textit{grasping with complex action’シナリオを特徴付けるベンチマークであるGCA-Benchを提案する。
GCA-Benchは、最近の大規模基盤モデルの同一設定による評価を可能にする。
新しいベンチマークの有効性を示すため,従来の把握検出パイプラインからエンドツーエンドの学習方法まで,さまざまなベースラインを実装した。
実証的研究は、複雑な把握シナリオにおいて70%未満の成功率を達成する。
さらに,我々は,新たな評価指標を提案し,臨界故障モデルを分析し,より堅牢で一般化可能な把握戦略の開発を指導するための洞察を提供する。
関連論文リスト
- StAR: Segment Anything Reasoner [11.958150552719296]
Segment Anything Reasoner (StAR)は、複数の視点からデザイン空間を洗練する包括的なフレームワークである。
StARは、広範囲なベンチマークでベースモデルよりも大幅に向上している。
論文 参考訳(メタデータ) (2026-03-15T13:43:34Z) - The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning [54.67958855362658]
複雑な構造化クエリを用いたアンラーニングテストを強調する動的フレームワークを提案する。
提案手法はまず,対象モデル(事前学習)から知識を抽出し,単純なクエリからマルチホップチェーンまで,対象プローブを構築する。
本フレームワークは,テストセットを手作業で構築することなく,非学習手法の実用的でスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2026-03-11T19:51:33Z) - Is This Tracker On? A Benchmark Protocol for Dynamic Tracking [6.23176842962524]
ITTOは、ポイントトラッキングメソッドの機能と制限を評価し、診断するための新しいベンチマークスイートである。
我々はITTOにおける最先端追跡手法の厳密な分析を行い、動きの複雑さの鍵軸に沿って性能を損なう。
論文 参考訳(メタデータ) (2025-10-22T17:53:56Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - Overcoming Over-Fitting in Constraint Acquisition via Query-Driven Interactive Refinement [0.7874708385247353]
Constraint Acquisition (CA)は、制約プログラミングにおける手動モデリングを自動化することを目的としている。
受動的CAメソッドは、過度に適合する傾向があり、しばしば、限られたデータでトレーニングされた時に、急激なグローバル制約を含むモデルを学習する。
本稿では,CAにおける過剰適合の課題に対処するために設計されたハイブリッドCAフレームワークを紹介する。
論文 参考訳(メタデータ) (2025-09-29T09:02:16Z) - Rethinking Evaluation of Infrared Small Target Detection [105.59753496831739]
本稿では,画素レベルと目標レベルのパフォーマンスを取り入れたハイブリッドレベルのメトリクスを導入し,システム的エラー解析手法を提案し,クロスデータセット評価の重要性を強調した。
標準化されたベンチマークを容易にするオープンソースツールキットがリリースされた。
論文 参考訳(メタデータ) (2025-09-21T02:45:07Z) - GRADE: Generating multi-hop QA and fine-gRAined Difficulty matrix for RAG Evaluation [5.002953635224383]
Retrieval-Augmented Generation (RAG) システムは知識集約型NLPタスクに広く採用されている。
現在の評価は、実世界のシナリオで必要とされる構造的な複雑さと多段階の推論を見落としていることが多い。
タスクの難易度を2次元でモデル化する新しい評価フレームワークであるtextscGRADEを提案する。
論文 参考訳(メタデータ) (2025-08-23T11:26:41Z) - The Devil is in Fine-tuning and Long-tailed Problems:A New Benchmark for Scene Text Detection [2.4829769683482437]
シーンテキスト検出手法は、現実のシナリオでこのような成功を再現できないことが多い。
この相違に寄与する2つの重要な要因を、広範な実験を通して明らかにした。
本稿では,様々な長期課題に対処する能力を評価するために,Long-Tailed Benchmark (LTB)を提案する。
論文 参考訳(メタデータ) (2025-05-21T15:26:46Z) - Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space [92.6187727249868]
テスト時間インスタンスレベルの適応(TTIA)を通じて推論を強化するフレームワークであるLatentSeekを紹介した。
LatentSeekは、GSM8K、MATH-500、AIME2024など、さまざまな推論ベンチマークで評価されている。
結果は、LatentSeekが一貫して強力なベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-05-19T16:26:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。