論文の概要: Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts
- arxiv url: http://arxiv.org/abs/2607.01767v1
- Date: Thu, 02 Jul 2026 06:31:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.700565
- Title: Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts
- Title(参考訳): 症状ではなく増幅器を修復する: エージェントロールアウトのための安定なワールドモデル補正
- Abstract要約: フルグラフのリプレイは、大きなコンテキスト予算を消費し、LLMを多くの無関係な症状に晒し、長いコンテキストの検索を低下させる。
本稿では,失敗した計画図を修復するワールドモデル補正器について検討する。
我々は、強力なエンジニアリングLLM修正器を実装し、特に非常に大きなコンテキストを与えられた場合、それらが役立つことを見つけます。
第2のファミリーは我々のアプローチであるWM-SAR (World-Model Subgraph Amplification repair): 目に見える症状をスキャンする代わりに、サブグラフ増幅から後方に動作し、エラーを再増幅するノードとエッジを識別する。
- 参考スコア(独自算出の注目度): 2.571318992830046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As agent planning moves from short tool chains toward persistent workflows with thousands or tens of thousands of steps, failures will occur inside large planning graphs rather than in isolated predictions. Replanning the entire graph after every mistake is neither computationally realistic nor desirable: full-graph replay consumes large context budgets, exposes the LLM to many irrelevant symptoms, and can degrade long-context retrieval. This paper studies the missing component in such systems: a world-model corrector that repairs the failed planning graph in place. We compare two families of correctors. The first is the common engineering approach: scan nodes and edges, choose a suspicious local region, and ask an LLM to repair it. We implement strong engineering LLM correctors and find that they can help, especially when given very large contexts. The second family is our approach, WM-SAR (World-Model Subgraph Amplification Repair): instead of scanning for visible symptoms, it works backward from subgraph amplification, identifies the nodes and edges that keep re-amplifying error, and sends only that causal subgraph to the LLM. Across graph simulations and LLM repair experiments, WM-SAR substantially outperforms engineering correctors under realistic token budgets, achieves near-whole-graph stabilization with a compact region, and gives the LLM a cleaner repair target.
- Abstract(参考訳): エージェント計画が短いツールチェーンから数千から数万のステップで永続的なワークフローに移行するにつれ、独立した予測ではなく、大規模な計画グラフ内で障害が発生する。
フルグラフのリプレイは、大きなコンテキスト予算を消費し、LCMを多くの無関係な症状に晒し、長いコンテキストの検索を低下させることができる。
本稿では,失敗した計画図を修復するワールドモデル補正器について検討する。
修正者の2つの家系を比較します。
1つは、ノードとエッジをスキャンし、疑わしいローカルリージョンを選択し、LLMに修復を求める、一般的なエンジニアリングアプローチである。
我々は、強力なエンジニアリングLLM修正器を実装し、特に非常に大きなコンテキストを与えられた場合、それらが役立つことを見つけます。
第2のファミリーは、WM-SAR (World-Model Subgraph Amplification repair): 可視性症状をスキャンする代わりに、サブグラフ増幅から後方に動作し、エラーを再増幅するノードとエッジを特定し、その因果部分グラフのみをLSMに送信する。
グラフシミュレーションとLLM修復実験を通じて、WM-SARは、現実的なトークン予算の下で工学的補正器を著しく上回り、コンパクトな領域でほぼ1枚のグラフの安定化を実現し、LLMによりクリーンな修復目標を与える。
関連論文リスト
- Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems [16.78530745432555]
本稿では,2段階のエージェントフレームワークであるAdaptive Influence Graphs(AIGs)を紹介する。
複数のモデルにまたがって、よりリッチなトレース表現がフェール属性を継続的に改善することを示す。
この仮説は、帰属は診断モデルだけでなく、どのようにトレースが表現され、探索されるかにも依存する、という我々の仮説を裏付けるものである。
論文 参考訳(メタデータ) (2026-08-25T10:18:19Z) - Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction [22.654396704495934]
開発セット障害は、どのリカバリ介入が許容可能かを決定することにより、欠落診断基板の一部を回復することができる。
DARCは、タスクファミリー障害モードをプロファイリングし、共有リカバリライブラリから不正な介入を発生させ、検証者選択によるデプロイメント成功コストポリシーを凍結する、診断誘導型リカバリハーネスである。
論文 参考訳(メタデータ) (2026-08-12T08:14:45Z) - Experience Memory Graph: One-Shot Error Correction for Agents [9.23684438376937]
大規模言語モデル(LLM)エージェントは、エラーを複雑にし、障害から回復するのに苦労する。
既存の自己補正機構は本質的に不安定なプロンプトベースの反射に依存している。
本稿では,エージェント障害回復をグラフマッチング問題として再構成するフレームワークであるExperience Memory Graph (EMG)を提案する。
論文 参考訳(メタデータ) (2026-07-15T14:33:15Z) - ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents [52.531681772560724]
Supervised Fine-tuning (SFT) は主に軌道軌道上で構築されており、ツール故障後の回復のための信号はほとんど得られない。
ツール使用エージェントの反射誘導補正を学習するフレームワークであるReGRPOを紹介する。
GTAとGAIAの実験では、同じバックボーンとツールスイートの下で、ReGRPOは一貫して強力なオープンソースベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-30T09:19:38Z) - Adaptive Recurrent Message Passing for Test Time Computing on Graphs [80.56829418752513]
繰り返しグラフモデルでは,グラフデータとアーキテクチャ設計の固有のミスマッチを克服できることを示す。
本稿では,アダプティブ・リカレントグラフモデルであるAdaRを提案する。
論文 参考訳(メタデータ) (2026-06-21T12:14:11Z) - Reducing Hallucinations in Complex Question Answering using Simple Graph-based Retrieval-Augmented Generation (long version) [0.0]
大規模言語モデル(LLM)は、自然言語処理のランドスケープを根本的に変えてきた。
検索拡張世代システム(RAG)は、LLMの「ハロシン化」情報のリスクを回避すべく、一般的な展開シナリオとして登場した。
本研究では,比較的単純なグラフスキーマを用いた軽量グラフ構造を用いて,専用のツールセットを通じてRAGサブシステムをサポートする方法を検討する。
論文 参考訳(メタデータ) (2026-06-04T09:07:06Z) - ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning [12.44509691077682]
本稿では,繰り返し発生する障害をプロセス知識グラフのシンボル編集に変換する神経シンボルエージェントであるANNEALを紹介する。
その中核となるメカニズムであるFDKA(Failure-Driven Knowledge Acquisition)は、責任のあるオペレータをローカライズし、制約付きLLM生成を通じて型付きパッチを合成し、提案を検証する。
4つのドメインと27のマルチシードランをまたいだANNEALは、永続的な構造修復を行う唯一の評価システムである。
論文 参考訳(メタデータ) (2026-05-04T05:24:03Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - GNNVerifier: Graph-based Verifier for LLM Task Planning [26.77252346424261]
大規模言語モデル(LLM)は、自律エージェントの開発を促進する。
近年の研究では、潜在的な欠陥を特定し、修正するための計画検証器が導入されている。
既存のほとんどのアプローチは、検証子として LLM に依存している。
LLMタスク計画のためのグラフベースの検証器を提案する。
論文 参考訳(メタデータ) (2026-03-16T02:05:21Z) - AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs [15.570965946461255]
グラフベースの検索強化生成(RAG)は構造化知識でLarge Language Models(LLMs)を増強する大きな可能性を証明している。
既存の手法では、不正確なグラフ構築、不適切な推論能力、不適切な解答の3つの重要な課題に直面している。
本稿では,高度なグラフベースの検索拡張生成フレームワークであるAGRAGを提案する。
論文 参考訳(メタデータ) (2025-11-02T06:13:06Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z) - GRIL: Knowledge Graph Retrieval-Integrated Learning with Large Language Models [59.72897499248909]
本稿では,Large Language Models (LLM) を用いたエンドツーエンド学習のための新しいグラフ検索手法を提案する。
抽出したサブグラフでは, 構造的知識と意味的特徴をそれぞれ軟式トークンと言語化グラフで符号化し, LLMに注入する。
提案手法は、複雑な推論タスクに対する結合グラフ-LLM最適化の強みを検証し、最先端の性能を一貫して達成する。
論文 参考訳(メタデータ) (2025-09-20T02:38:00Z) - Repairing vulnerabilities without invisible hands. A differentiated replication study on LLMs [5.10123605644148]
自動脆弱性修復(AVR: Automated Vulnerability repair)は、プログラム修復の急激な分岐である。
近年の研究では、大きな言語モデル(LLM)が従来の手法より優れていることが示されている。
論文 参考訳(メタデータ) (2025-07-28T16:39:16Z) - Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning [65.23593936798662]
LLM生成データによる微調整により,目標タスクの性能が向上し,非目標タスクの劣化が低減されることを示す。
微調整後のLSMにおける破滅的忘れを緩和するために、トークンの難易度低減に基づく経験的説明を提供する最初の研究である。
論文 参考訳(メタデータ) (2025-01-24T08:18:56Z) - Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration [68.29746557968107]
本稿では,多エージェント協調のための新しいフレームワークを提案する。これは,効率的な自己調整のための強化アドバンテージフィードバック(Reinforced Advantage feedback, ReAd)を導入する。
Over-AIと難解なRoCoBenchの実験は、ReAdが成功率のベースラインを超え、エージェントの相互作用ステップを著しく減少させることを示している。
論文 参考訳(メタデータ) (2024-05-23T08:33:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。