論文の概要: Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2609.18304v2
- Date: Thu, 17 Sep 2026 03:45:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.711173
- Title: Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents
- Title(参考訳): ロールバック・ザ・ワールドとリフレクション:長軸LLM剤のロールバック誘起反射
- Abstract要約: 大規模言語モデル(LLM)エージェントは、多段階の環境相互作用を通じて、長い水平タスクに対処する。
単一の誤動作は、その後の状態や観測を変更でき、時間とともにエラーが複雑になる。
信頼性回復はロールバック境界制御問題として扱われるべきである。
- 参考スコア(独自算出の注目度): 56.434418859203085
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents increasingly tackle long-horizon tasks through multi-step environment interaction, yet a single erroneous action can alter subsequent states and observations, causing errors to compound over time. Existing methods either correct the context without repairing altered environment states or restore earlier states while discarding useful experience, making it difficult to both eliminate failure conditions and avoid repeating past mistakes. We argue that reliable recovery should instead be treated as a rollback-boundary control problem that jointly determines when to intervene, where to resume, and what information should survive recovery. Based on this view, we propose Rollback-Induced Reflection (RIR), a unified recovery framework that restores execution to a selected prior state while carrying forward reusable knowledge distilled from the abandoned trajectory to guide subsequent decisions. We further characterize recovery through a unified operator over rollback depth and retained memory, providing a general view of state restoration and knowledge retention. Experiments on three long-horizon benchmarks demonstrate that RIR consistently improves task performance across multiple LLM backbones, with structured reflection memory preserving useful experience and selective rollback enabling efficient recovery.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、多段階の環境相互作用を通じて、ますます長い水平タスクに取り組むようになるが、単一の誤動作は、その後の状態と観測を変更でき、時間とともにエラーが複雑になる。
既存の手法では、修正済みの環境状態を修復することなくコンテキストを修正するか、有用な経験を捨てながら以前の状態を復元する。
信頼性回復をロールバックバウンダリ制御の問題として扱うべきであり、いつ介入するか、どこで再開するか、どの情報がリカバリを生き残るべきかを共同で決めるべきである。
この観点から, 廃軌道から抽出した再利用可能な知識を導出しながら, 実行を選択済みの状態に復元する統合回復フレームワークであるロールバック誘導反射法(RIR)を提案する。
我々はさらに、ロールバック深度以上の統一演算子によるリカバリを特徴付け、記憶を保ち、状態回復と知識保持の一般的な見方を提供する。
3つのロングホライゾンベンチマークの実験により、RIRは複数のLLMバックボーンのタスク性能を一貫して改善し、構造化されたリフレクションメモリは有用なエクスペリエンスを維持し、選択的ロールバックは効率的なリカバリを可能にすることを示した。
関連論文リスト
- LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation [25.555783105371574]
本稿では,リフレクションをメモリ制御ポリシとして定式化するトレーニングフレームワークを提案する。
LoongReflectは、ルックアヘッドとイントラグラディエントスタイルの調整機構を通じて、2つの補完的な信号を結合する。
マルチホップ検索強化生成および数学的推論ベンチマークの実験は、一貫した改善を示す。
論文 参考訳(メタデータ) (2026-08-12T11:56:03Z) - From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents [19.125716338799545]
textbfdependency-guided rollback repairは、出所からの型付きメモリ対アクショングラフを構築し、明示的な下流依存性をトレースし、応答関連処理のみを選択的に再生する。
本手法は,3つのツール使用領域と4つのメモリ障害タイプにまたがる150ケースのベンチマークで評価する。
論文 参考訳(メタデータ) (2026-08-11T05:19:55Z) - MemHarness: Memory Is Reconstructed, Not Replayed [28.869068760142667]
本稿では,過去体験を積極的に活用・再構築するためのLLMエージェントを備えたフレームワークであるMemHarnessを提案する。
MemHarnessは純粋なRLと静的メモリ拡張ベースラインを大幅に上回り、アウト・オブ・ディストリビューション(OOD)シナリオで強い堅牢性を示す。
論文 参考訳(メタデータ) (2026-07-30T14:25:49Z) - RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning [11.148362747759917]
本稿では,長距離マルチモーダル推論のためのリフレクティブメモリフレームワークであるReflective Retrieval Memory (RRM)を紹介する。
RRMは、転送可能な手続き的検索知識を蒸留する反射経験記憶を備えたエンティティ中心のマルチモーダルメモリグラフを増強する。
RRMは、M3-Bench-Robot、M3-Bench-Web、Video-MME-Longの最先端アプローチを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-30T12:58:57Z) - Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents [54.85451496831771]
Causal-AgentIRは階層的なマルチエージェントフレームワークであり、画像復元インテリジェンスのための自己進化型因果記憶を持つ。
分解パターン、画像領域、復元ツール、アクション、品質変更、ユーザの好みを構造化された因果記憶グラフに整理する。
このグラフはグラフベースの検索とマルチホップ因果推論をサポートしており、エージェントは特定の復元操作やツールシーケンスが異なる劣化条件下での修復品質にどのように影響するかを推測することができる。
論文 参考訳(メタデータ) (2026-07-23T09:59:44Z) - Exploratory and Assimilating Reflection: Reflective Recall Cycle for Long-term Memory [3.9297698032556596]
LLMベースの自律エージェントは、ステートレス性と限られたコンテキストウィンドウを克服するために外部メモリを必要とする。
本研究では,探索・近似反射法(EAR)を提案する。
論文 参考訳(メタデータ) (2026-07-20T12:30:17Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation [71.16738415436458]
本稿では、生の障害フィードバックを補正管理のアクティブソースに変換するフレームワークであるReflection-Enhanced Self-Distillation(RESD)を紹介する。
RESDは、局所的なエラーを診断するために振り返りリフレクションを生成し、持続的なグローバルなプレイブックをキュレートすることで、障害の軌跡を解釈する。
複数の連続学習課題に対する実証的な評価は、RESDが標準の自己蒸留ベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-12T20:46:05Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - Self-RAG: Learning to Retrieve, Generate, and Critique through
Self-Reflection [74.51523859064802]
我々は、自己回帰検索拡張生成(Self-RAG)と呼ばれる新しいフレームワークを導入する。
自己RAGは、検索と自己回帰によってLMの品質と事実性を高める。
様々なタスクセットにおいて、最先端のLCMや検索強化モデルよりも大幅に優れています。
論文 参考訳(メタデータ) (2023-10-17T18:18:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。