論文の概要: When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents
- arxiv url: http://arxiv.org/abs/2610.00372v1
- Date: Wed, 30 Sep 2026 07:04:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.624997
- Title: When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents
- Title(参考訳): ハーネスが信号を失ったとき:LSM剤の回復の因果的評価
- Abstract要約: 回復は通常、平均的なタスクの成功によってのみ判断される。
我々は因果判定問題として回復の枠組みを定めている。
本稿では、回復前に利用可能な情報を用いて介入の価値を判断する軽量なポリシーであるCausal Intervention Router(CIR)を紹介する。
- 参考スコア(独自算出の注目度): 8.731853612388315
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model agents rely on external harnesses to pass information between the model and its environment and to recover from execution errors. Yet recovery is usually judged only by average task success. This hides an important tension. The same operation can rescue a failing trajectory or disrupt one that would otherwise succeed. We frame recovery as a causal decision problem. Starting from the same execution state, we compare what happens with and without recovery, separate rescue from harm, and study how the value of recovery changes over time. We then introduce the Causal Intervention Router (CIR), a lightweight policy that uses information available before recovery to decide when intervention is worthwhile. On long-horizon ALFWorld tasks with Qwen3-14B, CIR raises success from 70.33% to 73.33%, a gain of 3.00 percentage points. It leaves all evaluated trajectories with correct observations untouched. Additional controls show that the benefit of recovery cannot be explained solely by the new observation returned by the environment. These results provide a practical way to evaluate recovery and apply it selectively.
- Abstract(参考訳): 大規模言語モデルエージェントは、モデルとその環境間で情報を渡すために外部ハーネスに依存し、実行エラーから回復する。
しかし、回復は通常、平均的なタスクの成功によってのみ判断される。
これは重要な緊張を隠している。
同じ作戦は失敗する軌道を救ったり、そうでなければ成功する軌道を乱したりすることができる。
我々は因果判定問題として回復の枠組みを定めている。
同じ実行状態から始めて、リカバリと無リカバリを比較し、障害からの救済を分離し、リカバリの価値が時間とともにどのように変化するかを調べます。
次に、回復前に利用可能な情報を用いて介入の価値を決定する軽量なポリシーであるCausal Intervention Router(CIR)を紹介する。
Qwen3-14Bの長期ALFWorldタスクでは、CIRは70.33%から73.33%に上昇し、3.00ポイントを獲得した。
評価された軌道は全て、正確な観測を無傷で残している。
追加の制御は、環境によって返される新しい観測によってのみ、回復の利点を説明できないことを示している。
これらの結果は、リカバリを評価し、それを選択的に適用する実用的な方法を提供する。
関連論文リスト
- Recova: Agent-Guided Failure Recovery for Autonomous Robotic Manipulation [104.46042352396563]
Recovaはエージェント誘導型フレームワークで、再構築されたデジタルツインでタスク実行とリカバリを共同で開発する。
双子では、エージェントは障害を診断し、修正プログラムをテストし、異なるポリシーのために正常なタスクとリカバリのロールアウトを収集する。
適切なリカバリが得られない場合、人間のデモによって障害が解決され、システムがリカバリ機能を拡張することができる。
論文 参考訳(メタデータ) (2026-10-01T06:52:05Z) - Kintsugi-VLA: Turning Failed Robot Rollouts into Recovery Data through Interventional Recoverability [2.2935396753701065]
Kintsugi-VLAは、失敗したロールアウトをターゲットとする合成リカバリデータに変換するフレームワークである。
Kintsugi-VLAは、失敗したシミュレータのロールアウトが、捨てられた経験から構造化されたリカバリトレーニングデータにどのように変換されるかを示した。
論文 参考訳(メタデータ) (2026-09-25T09:42:20Z) - Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents [56.434418859203085]
大規模言語モデル(LLM)エージェントは、多段階の環境相互作用を通じて、長い水平タスクに対処する。
単一の誤動作は、その後の状態や観測を変更でき、時間とともにエラーが複雑になる。
信頼性回復はロールバック境界制御問題として扱われるべきである。
論文 参考訳(メタデータ) (2026-09-16T08:26:14Z) - Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes [70.64622557376505]
リフレクティブリカバリは、推論中のミスを認識し、修正するようにモデルに教える。
AIME 2025では30.0%から37.5%、Minervaでは37.6%から47.8%に精度が向上している。
論文 参考訳(メタデータ) (2026-07-24T02:51:42Z) - Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning [48.22526014304726]
本稿では,診断後インシデント応答に対するリカバリアクション評価フレームワークであるR2Actについて述べる。
R2Actはインシデントスキーマ、品質ゲート、アクション空間表現、リカバリ妥当性メトリクス、オフライン評価器、ライブ再生プロトコルを定義する。
システムから品質監査されたインシデント302件のベンチマークデータセットとして、このフレームワークをインスタンス化する。
論文 参考訳(メタデータ) (2026-07-06T03:05:17Z) - Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations [103.16279860448874]
新たな二分探索強化報酬(RAR)を用いたオンライン強化学習手法を提案する。
オープンエンド世代では、バイナリRARは幻覚率を39.3%減少させる。
短い形式の質問応答では、モデルは、パラメトリック知識の不足に直面した時に、戦略的に"I don't know"を出力して、控えめに学習する。
論文 参考訳(メタデータ) (2025-10-20T16:45:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。