論文の概要: Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents
- arxiv url: http://arxiv.org/abs/2607.12267v1
- Date: Tue, 14 Jul 2026 02:10:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.01052
- Title: Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents
- Title(参考訳): 追跡, ランク, ひび割れ: 言語エージェントにおけるマルチホップ推論のエピステマティックな作業記憶尺度
- Authors: Ning Liu,
- Abstract要約: 推論とツールをインターリーブする言語エージェントは、推論チェーンが長くなるにつれて急速に低下する。
SLEUTHを導入し、この状態を明示し、構造化されたワーキングメモリを通して実行可能にする。
SLEUTHの優位性は難易度とともに増大し,複数のエピソードを伴わずにReflexionを上回った。
- 参考スコア(独自算出の注目度): 6.241883798820154
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language agents that interleave reasoning and tool use degrade sharply as reasoning chains lengthen, even when each individual step is easy. We trace this to context dilution: an agent's investigative state (what it has confirmed, what it suspects, and what it still needs) lives only implicitly in a growing context window, where early discoveries are buried under later retrievals. We introduce SLEUTH, which makes this state explicit and actionable through a structured epistemic working memory: the agent maintains Confirmed Facts grounded to sources, Active Hypotheses ranked by evidence, and Open Questions that directly drive its next action. Across five multi-hop benchmarks and five established baselines, SLEUTH's advantage grows with difficulty, from +5 points on HotpotQA to +11 on 4-hop chains, surpassing Reflexion without multiple episodes. Analyzing where the remaining gap lies, we identify the evidence sufficiency problem: agents often find the answer but fail to commit, exhausting their budget on needless verification. A lightweight commitment trigger fixes this, but only when the agent already maintains structured state: the identical trigger applied to an unstructured agent yields no improvement, isolating organized epistemic state as the necessary condition for effective commitment. Finally, enforcing protocol adherence on a weaker model recovers up to +19 points on the hardest problems, showing that how an agent organizes its reasoning, not raw model capability, is the active ingredient for scaling multi-hop reasoning.
- Abstract(参考訳): 推論とツールをインターリーブする言語エージェントは、個々のステップが簡単であっても、推論チェーンが長くなるにつれて急速に低下する。
エージェントの調査状態(それが確認したもの、それを疑うもの、そしてまだ必要なもの)は、成長するコンテキストウィンドウにのみ暗黙的に存在し、初期の発見は後続の検索の下に埋もれている。
SLEUTHを導入し、この状態を構造化されたてんかんの作業記憶を通じて明示的かつ実行可能なものにする:エージェントは、情報源に基づく確認された事実、証拠によってランク付けされたアクティブ仮説、そして、その次の行動を直接駆動するオープン質問を維持できる。
5つのマルチホップベンチマークと5つの確立されたベースラインにまたがって、SLEUTHのアドバンテージは、HotpotQAの+5ポイントから4ホップチェーンの+11まで、複数のエピソードなしでReflexionを上回っている。
残りのギャップがどこにあるかを分析して、証拠不十分な問題を特定する。エージェントは多くの場合、答えを見つけるが、コミットに失敗し、不要な検証で予算を浪費する。
軽量なコミットメントトリガーがこれを修正するが、エージェントが既に構造化状態を維持している場合のみ、非構造化エージェントに適用される同一のトリガーは改善を得られず、効果的なコミットメントに必要な条件として組織化されたてんかん状態を分離する。
最後に、より弱いモデルに対するプロトコルの順守は、最も難しい問題に対して+19ポイントまで回復し、エージェントがその推論を、生のモデル能力ではなく、どのように整理するかが、マルチホップ推論をスケールするための有効成分であることを示す。
関連論文リスト
- Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses [5.887807565440711]
FARMA(Forged Amplifying Rationale Memory Attack)について紹介する。
FARMAは、エージェントの実際の知識よりも、エージェントの記憶された推論を毒する。
SENTINELは,鍛造推論エントリを検出するための層状防衛パイプラインである。
論文 参考訳(メタデータ) (2026-07-06T13:10:13Z) - Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution [50.50276752935017]
AgentReviveは、レジリエントなマルチエージェント進化のためのMarkovステートアウェアフレームワークである。
我々の手法はソフト状態遷移を通じてエージェントの協調を動的に管理する。
ステートアウェアなエージェントスケジューリングによってトークンの消費を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-17T09:38:18Z) - Deep Reasoning in General Purpose Agents via Structured Meta-Cognition [58.185853639335896]
構造化メタ推論を用いてタスク固有の足場を構築するための推論時アプローチを提案する。
我々は、より制御された推論スレッドに複雑なタスクを分散する汎用エージェントでこのアプローチをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-12T01:21:37Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation [5.191980417814362]
LLMエージェントは、ほとんどの環境が静的で、必要な情報がモデルのコンテキストウインドウに適合する場合、排他的になる。
直腸型薬剤は、この体制では特に脆い。
本稿では,LLMが限定的な局所的エビデンスマイニングとラベリングを行うためのフレームワークであるEoGを提案する。
論文 参考訳(メタデータ) (2026-01-25T17:27:19Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation [42.38513187601995]
強化学習と検証可能な報酬で訓練された大規模言語モデル(LLM)は、複雑な推論タスクにおいて大きな成果を上げている。
最近の研究は、メタ思考エージェントが計画を提案し、進捗を監視し、推論エージェントが逐次的な会話のターンを通じてサブタスクを実行するというマルチエージェント設定にまで拡張されている。
1つのエージェントが支配的であり、もう1つのエージェントがほとんど貢献せず、コラボレーションが損なわれ、セットアップが非効率なシングルエージェントに崩壊する。
我々は、推論エージェントがノイズのある出力を破棄し、指示を集約し、推論プロセスを再起動させることで、議論を促す検証可能な報酬機構を提案する。
論文 参考訳(メタデータ) (2025-11-04T06:37:31Z) - GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments [56.007498767771075]
GSM-Agentは複雑な環境でエージェント推論を評価するための新しいベンチマークである。
我々は,環境文書の埋め込みをノードにクラスタ化することでエージェント推論パターンを分析し,各ツールコールを最も近いノードにマッピングする。
本稿では,LLMのエージェント推論性能を向上させるためのツール拡張テストタイムスケーリング手法を提案する。
論文 参考訳(メタデータ) (2025-09-26T07:24:37Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。