論文の概要: Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance
- arxiv url: http://arxiv.org/abs/2607.27283v1
- Date: Wed, 29 Jul 2026 13:57:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.282326
- Title: Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance
- Title(参考訳): Residualのベンチマーク: マッチしたショート・タスクのパフォーマンスを超えて、ロングホライズン・アセスメントがどんな影響を及ぼすか
- Authors: Chao Peng, Zhiheng Lyu, Peijie Dong, Hande Dong, Qiang Lin,
- Abstract要約: ロングホライズン障害(long-horizon failure)"を主張するためには、ベンチマークは実際のフルタスクの成功と、短い個々のステージから構築されたベースライン予測を比較する必要がある、と我々は主張する。
比較は、同じエージェント設定を使用して、ステージ、チェックポイント、情報、予算をどのように選択するかを事前に指定する必要があります。
- 参考スコア(独自算出の注目度): 17.507456751410977
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon benchmarks often show that agents fail more as tasks become longer. This observation is useful for deployment, but it does not by itself explain why failure occurs. More stages create more opportunities for ordinary errors to compound; longer tasks may also contain harder individual decisions or become harder as conversation history, tool outputs, and environment changes accumulate. We use trajectory-induced degradation to mean this last possibility: earlier execution makes later work harder. When the harmful accumulation is specifically the text visible to the model, it is often called context rot. In this position paper, we argue that to claim a "long-horizon failure", benchmarks must compare actual full-task success against a baseline prediction built from short, individual stages. We call the log-ratio between this prediction and actual success the horizon residual. The comparison must use the same agent configuration and specify in advance how stages, checkpoints, information, and budgets will be chosen. The residual shows that the full rollout differs from the chosen baseline; targeted experiments are still needed to explain why.
- Abstract(参考訳): ロングホライゾンベンチマークでは、タスクが長くなるとエージェントが失敗することが多い。
この観察はデプロイメントに役立ちますが、失敗の発生理由をそれ自体は説明していません。
より長いタスクは、会話の歴史やツールのアウトプット、環境の変化が蓄積されるにつれて、個々の決定を難しくしたり、難しくなったりもします。
トラジェクトリによって引き起こされる劣化は、この最後の可能性を意味します。
有害な蓄積が特にモデルに可視なテキストである場合、しばしばコンテキストロートと呼ばれる。
本論文では,「長期水平故障」を主張するには,短い個々の段階から構築したベースライン予測と実際のフルタスクの成功を比較する必要がある。
この予測と実際の成功の間の対数比を地平線残差と呼ぶ。
比較は、同じエージェント設定を使用して、ステージ、チェックポイント、情報、予算をどのように選択するかを事前に指定する必要があります。
残余は、完全なロールアウトが選択されたベースラインと異なることを示している。
関連論文リスト
- Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning [56.67877550139192]
さまざまなモデルスケール、推論モード、計画的地平線をまたいだ実験を行います。
空間ナビゲーションを分離する5つの難易度を持つ3つのカスタムゲームからなる集中型GVGAIベンチマークを提案する。
提案手法により, より正確な位置の同定が可能であるが, 座標マッチングの全体的な性能は, より小さなモデルに限られていることがわかった。
論文 参考訳(メタデータ) (2026-07-22T12:10:45Z) - DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? [57.585275546688116]
VLM(Vision-Language Models)は、エンボディエージェントの高レベルプランナーとしてますます普及している。
テストタイムの計算をいつ、どこで使うかを選択することは、実際の世界にフロンティアパフォーマンスをもたらす中心である、と私たちは主張する。
我々はマルチモーダルシーンコンテキストを用いてプロンプト毎に計算を割り当てるルーティングフレームワークであるDIRECTを紹介した。
論文 参考訳(メタデータ) (2026-06-10T17:58:49Z) - LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks [32.21400090659012]
LongBenchは、ロングホライゾン操作を評価するための実世界のベンチマークである。
1000以上の現実世界のエピソードで構成され、コンテキスト非依存(完全に観察可能)とコンテキスト依存(あいまいさ駆動)の2つの補完的な体制をカバーしている。
論文 参考訳(メタデータ) (2026-04-18T02:25:30Z) - Context-Length Robustness in Question Answering Models: A Comparative Empirical Study [0.0]
本稿では,SQuADとHotpotQAの2つのベンチマークを用いて,大規模言語モデルにおける文脈長頑健性の実証的研究を行った。
モデル精度を全文脈長の関数として評価し,応答を含む信号を保持しながら,無関係な文脈の量を体系的に増加させることで評価する。
その結果、コンテキスト長が増加するにつれて性能が一貫した低下を示し、マルチホップ推論タスクではシングルスパン抽出タスクよりもはるかに大きな低下が観測された。
論文 参考訳(メタデータ) (2026-03-16T17:14:05Z) - Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning [50.62037276161025]
視覚言語モデル(VLM)は、視覚とテキストのモダリティを共同で活用することを目的としている。
主な障害は、視覚的な入力は通常、生成開始時に1回だけ提供されることである。
EmphSaliency-Aware Principle (SAP) の選択を提案する。
論文 参考訳(メタデータ) (2026-02-18T18:49:56Z) - UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios [63.67884284105684]
textbfUltraHorizonは、複雑な現実世界の課題に不可欠な基礎的能力を測定する新しいベンチマークである。
エージェントは、隠されたルールを反復的に発見しなければならない、長期にわたる発見タスクで設計されている。
実験の結果, LLM-agents はこれらの設定において常に不利な成績を示し, ヒトは高いスコアを得ることができた。
論文 参考訳(メタデータ) (2025-09-26T02:04:00Z) - The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs [39.5095344448076]
単一ステップ精度の限界ゲインであっても、モデルが正常に完了できるタスク長の指数的な改善に結びつくことを示す。
単純なタスクの失敗は、推論ができないというよりも、実行時のミスによるものである、と我々は主張する。
論文 参考訳(メタデータ) (2025-09-11T17:59:34Z) - LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation [79.90766312484489]
回復蒸留(LongReD)による長期事前トレーニング
LongReDは、選択されたレイヤの隠れた状態をオリジナルのモデルから短いテキストで蒸留する。
一般的なテキストベンチマークの実験では、LongReDはモデルの短文性能を効果的に維持することを示した。
論文 参考訳(メタデータ) (2025-02-11T08:37:16Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。