論文の概要: When History Fails to Become Experience: Action Calibration in Language Agents
- arxiv url: http://arxiv.org/abs/2610.02769v1
- Date: Fri, 02 Oct 2026 03:50:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.201242
- Title: When History Fails to Become Experience: Action Calibration in Language Agents
- Title(参考訳): 歴史が経験に欠ける時 - 言語エージェントの行動校正
- Abstract要約: 言語エージェントは、同じタスク内で後の意思決定を改善するために、事前の試行と環境フィードバックを引き出す必要がある。
履歴は全体のタスク完了を改善するが、このメリットの多くは過去のアクションがシャッフルされたとしても持続する。
過去の行動を明示的に再評価し、経験を選択的に記録し、その後の意思決定を導く学習校正器を導入する。
- 参考スコア(独自算出の注目度): 14.773308083944562
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Language agents should draw on prior attempts and environmental feedback to improve subsequent decisions within the same task. However, providing additional interaction history can sometimes reduce task success, suggesting that agents do not consistently use this information effectively. To investigate this limitation, we examine how agents use history. We find that history improves task completion overall, yet much of this benefit persists even when past actions are shuffled. Disrupting the correspondence between actions and observations causes only a modest decline in task success. We therefore hypothesize that agents do not reliably connect past actions with their outcomes when deciding how to proceed. To test this hypothesis, we explicitly label each returned observation as the outcome of the preceding action. This simple annotation improves task success and reduces next-action repetition without introducing new environmental information. Building on this insight, we introduce a learned calibrator that explicitly reassesses past actions and selectively records experience to guide subsequent decisions, improving task success beyond outcome labeling alone.
- Abstract(参考訳): 言語エージェントは、同じタスク内で後の意思決定を改善するために、事前の試行と環境フィードバックを引き出す必要がある。
しかしながら、追加のインタラクション履歴を提供することは、時にタスクの成功を減少させ、エージェントがこの情報を効果的に利用しないことを示唆する。
この制限を調査するために,エージェントが履歴をどのように利用するかを検討する。
履歴は全体のタスク完了を改善するが、このメリットの多くは過去のアクションがシャッフルされたとしても持続する。
行動と観察の対応を乱すことは、タスクの成功をわずかに減少させるだけである。
したがって、エージェントは、どのように進むかを決める際に、過去の行動と結果とを確実に結び付けない、という仮説を立てる。
この仮説を検証するために、返却された各観測結果を前回の行動の結果として明示的にラベル付けする。
このシンプルなアノテーションはタスクの成功を向上し、新しい環境情報を導入することなく、次のアクションの繰り返しを減らす。
この知見に基づいて、過去の行動を明示的に再評価し、経験を選択的に記録し、その後の意思決定をガイドし、結果ラベル付け以外のタスク成功を改善する学習キャリブレータを導入する。
関連論文リスト
- Shockingly Simple Self-retrospection Improves Agentic Models Without RL [56.88703385147974]
本研究は,説明のみの訓練がその後の行動に与える影響を分離するために,レトロスペクティブ・オンリー・ファインチューニングについて検討する。
Qwen3.5-4B を用いたソフトウェア工学実験では、ROFT は成功と失敗の混合したベースモデルの試行に関する問題で訓練されている。
また、64のサンプルベースモデル試みが失敗する個々のタスクの解決も学べる。
論文 参考訳(メタデータ) (2026-09-28T17:54:24Z) - What if LLMs Ate Their Words: Causal History Effects in Multi-Turn Interaction [21.294220918464525]
モデル、タスク、ターン、およびモデル内における効果がどのように現れるかは、まだ不明である。
ターン手術は、一度に1つのアシスタントターンでさらに介入する。
全体として、アシスタント生成履歴は、多ターン性能にアクティブだが選択的に影響を及ぼす。
論文 参考訳(メタデータ) (2026-09-05T05:06:01Z) - S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? [66.17176838165994]
大規模言語モデル(LLM)は、ますます外部環境と相互作用し、かなりの行動経験を蓄積する。
エージェントがその振る舞いを積極的にテストし、得られた経験を判断し、その経験を使って将来の意思決定を改善することができるかどうかは不明だ。
LLM自己改善評価のための対話型ベンチマークである textbfStextsuperscript3Gym を導入する。
論文 参考訳(メタデータ) (2026-08-31T17:05:41Z) - On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification [37.24852847838588]
メモリベースの自己改善エージェントは、最近の文献で非常に有望である。
しかし、これらの手法の信頼性の側面は著しく見過ごされている。
本研究では,メモリベースの2つの手法の総合的な再評価を行う。
論文 参考訳(メタデータ) (2026-08-18T17:55:07Z) - Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents [21.029076711222917]
ProactAgentは、構造化経験ベース上でのプロアクティブ検索のための、経験駆動の生涯学習フレームワークである。
ExpOnEvoは、過去のインタラクションを、事実記憶、エピソード記憶、行動スキルを含む型付きリポジトリに整理することで、検索が関連するエビデンスと実行可能なガイダンスの両方を提供する。
ProactRLは、検索決定のためのステップレベルの監視を提供し、より良いタスク結果やより高い効率につながる場合にのみ、検索を奨励する。
論文 参考訳(メタデータ) (2026-04-22T13:50:55Z) - ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory [57.517214479414726]
ReasoningBankは、エージェントの自己判断の成功と失敗の経験から一般化可能な推論戦略を抽出するメモリフレームワークである。
テスト時には、エージェントがReasoningBankから関連する記憶を取得してそのインタラクションを知らせ、新しい学習を統合することで、時間が経つにつれてより有能になる。
本稿では,エージェントのインタラクションエクスペリエンスをスケールアップすることにより,学習プロセスの高速化と多様化を図るメモリ対応テストタイムスケーリング(MaTTS)を提案する。
論文 参考訳(メタデータ) (2025-09-29T17:51:03Z) - How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior [65.70584076918679]
メモリは、大きな言語モデル(LLM)ベースのエージェントにおいて重要なコンポーネントである。
本稿では,メモリ管理の選択がLLMエージェントの行動,特に長期的パフォーマンスに与える影響について検討する。
論文 参考訳(メタデータ) (2025-05-21T22:35:01Z) - Relational Experience Replay: Continual Learning by Adaptively Tuning
Task-wise Relationship [54.73817402934303]
本稿では,2段階の学習フレームワークである経験連続再生(ERR)を提案する。
ERRは、すべてのベースラインの性能を一貫して改善し、現在の最先端の手法を超えることができる。
論文 参考訳(メタデータ) (2021-12-31T12:05:22Z) - Fighting Copycat Agents in Behavioral Cloning from Observation Histories [85.404120663644]
模倣学習は、入力観察から専門家が選択したアクションにマップするポリシーを訓練する。
本稿では,従来の専門家の行動ニュアンスに関する過剰な情報を除去する特徴表現を学習するための敵対的アプローチを提案する。
論文 参考訳(メタデータ) (2020-10-28T10:52:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。