論文の概要: LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
- arxiv url: http://arxiv.org/abs/2604.16788v1
- Date: Sat, 18 Apr 2026 02:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 13:58:48.022064
- Title: LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
- Title(参考訳): LongBench: 実世界の長距離タスクにおけるロボットマニピュレーションポリシーの評価
- Authors: Xueyao Chen, Jingkai Jia, Tong Yang, Yibo Fu, Wei Li, Wenqiang Zhang,
- Abstract要約: LongBenchは、ロングホライゾン操作を評価するための実世界のベンチマークである。
1000以上の現実世界のエピソードで構成され、コンテキスト非依存(完全に観察可能)とコンテキスト依存(あいまいさ駆動)の2つの補完的な体制をカバーしている。
- 参考スコア(独自算出の注目度): 32.21400090659012
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Robotic manipulation policies often degrade over extended horizons, yet existing benchmarks provide limited insight into why such failures occur. Most prior benchmarks are either simulation-based or report aggregate success, making it difficult to disentangle the distinct sources of temporal difficulty in real-world execution. We introduce LongBench, a real-world benchmark for evaluating long-horizon manipulation. LongBench consists of over 1,000 real-world episodes, covering two complementary regimes: Context-Independent (fully observable) and Context-Dependent (ambiguity-driven). By organizing tasks into capability- and ambiguity-specific subsets, LongBench enables mechanism-aware evaluation of execution robustness, temporal consistency, and context-dependent reasoning. Evaluating six state-of-the-art policies reveals that long-horizon performance is not governed by a single factor. We observe that performance in fully observable settings is more strongly associated with execution robustness, while contextual difficulty varies across tasks and is not consistently improved by memory-based methods. We hope that LongBench serves as a useful benchmark for studying long-horizon manipulation and for developing policies with stronger robustness across both execution and contextual challenges.
- Abstract(参考訳): ロボット操作のポリシーは、しばしば拡張された地平線よりも劣化するが、既存のベンチマークは、そのような障害が発生した理由について限定的な洞察を提供する。
以前のベンチマークはシミュレーションベースか、集合的な成功を報告しているため、実際の実行において時間的困難の原因を区別することは困難である。
我々はLongBenchを紹介した。LongBenchは、ロングホライゾン操作を評価するための実世界のベンチマークである。
LongBenchは1,000以上の現実世界のエピソードで構成され、コンテキスト非依存(完全に観察可能)とコンテキスト依存(曖昧さ駆動)の2つの補完的なレギュレーションをカバーしている。
タスクを能力とあいまいさ固有のサブセットに整理することで、LongBenchは、実行の堅牢性、時間的一貫性、コンテキストに依存した推論をメカニズム対応で評価できる。
最先端の6つの政策を評価することは、長期的なパフォーマンスが単一の要因によって管理されていないことを示している。
完全に観測可能な環境でのパフォーマンスは実行の堅牢性に強く結びついているのに対し、コンテキストの難しさはタスクによって異なり、メモリベースの手法では一貫して改善されない。
ロングベンチは、長期にわたる操作の研究や、実行とコンテキストの両課題にまたがる強力な堅牢性を持つポリシー開発に有用なベンチマークとして機能することを願っている。
関連論文リスト
- LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards [57.993003392037174]
LongRは動的"Think-and-Read"メカニズムを統合することで、長時間コンテキストのパフォーマンスを向上させるフレームワークである。
LongRは様々なRLアルゴリズムのパフォーマンスを継続的に向上する。
論文 参考訳(メタデータ) (2026-02-05T15:26:47Z) - LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark [24.104346815675886]
LongBench Proは、英語と中国語で自然に発生する1500の長文サンプルのより現実的なベンチマークである。
タスク固有のメトリクスによるきめ細かい分析と、コンテキスト要求の多次元分類をサポートする。
LongBench Proは、長いコンテキスト理解を進めるための堅牢なテストベッドを提供する。
論文 参考訳(メタデータ) (2026-01-06T10:01:59Z) - LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability [60.451734326001564]
textbfLongWeaveを導入し、Constraint-Verifier Evaluation(CoV-Eval)による実世界と検証のバランスをとる。
LongWeaveは7つの異なるタスクに対して、カスタマイズ可能な入出力長(最大64K/8Kトークン)をサポートする。
23大言語モデルの評価は、実世界の複雑さと出力長の増加に伴い、最先端モデルでさえ、長文生成において重大な課題に直面していることを示している。
論文 参考訳(メタデータ) (2025-10-28T12:11:12Z) - UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios [63.67884284105684]
textbfUltraHorizonは、複雑な現実世界の課題に不可欠な基礎的能力を測定する新しいベンチマークである。
エージェントは、隠されたルールを反復的に発見しなければならない、長期にわたる発見タスクで設計されている。
実験の結果, LLM-agents はこれらの設定において常に不利な成績を示し, ヒトは高いスコアを得ることができた。
論文 参考訳(メタデータ) (2025-09-26T02:04:00Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - 100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability? [28.694112253150983]
リアルタイムベースの長期コンテキスト評価ベンチマークには2つの大きな欠点がある。
LongBenchのようなベンチマークは、しばしばモデルのベースライン能力とロングコンテキストのパフォーマンスを分離するための適切なメトリクスを提供しない。
長さ制御可能な長文ベンチマークと,ベースライン知識を真の長文能力から切り離す新しいメトリクスを導入する。
論文 参考訳(メタデータ) (2025-05-25T19:58:31Z) - LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams [4.917265821383127]
実世界のシナリオの冗長性に富む会話の性質を反映した,ライブストリームから派生した最初の音声長文データセットを構築した。
我々は、これらのタスクにおける長文理解能力を評価するために、人気のあるLLMと特殊手法の両方を評価した。
本研究は,現在の手法の限界を浮き彫りにし,長文理解の改善に向けた今後の方向性を示唆するものである。
論文 参考訳(メタデータ) (2025-04-24T08:27:48Z) - A Controlled Study on Long Context Extension and Generalization in LLMs [85.4758128256142]
広義のテキスト理解とテキスト内学習は、完全な文書コンテキストを利用する言語モデルを必要とする。
長期コンテキストモデルを直接訓練する際の実装上の課題のため、長期コンテキストを扱うためにモデルを拡張する多くの方法が提案されている。
我々は,一貫したベースモデルと拡張データを利用して,標準化された評価による拡張メソッドの制御プロトコルを実装した。
論文 参考訳(メタデータ) (2024-09-18T17:53:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。