論文の概要: Reasoning Graphs: Deterministic Agent Accuracy through Evidence-Centric Chain-of-Thought Feedback
- arxiv url: http://arxiv.org/abs/2604.07595v1
- Date: Wed, 08 Apr 2026 20:57:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.56265
- Title: Reasoning Graphs: Deterministic Agent Accuracy through Evidence-Centric Chain-of-Thought Feedback
- Title(参考訳): 推論グラフ:Evidence-Centric Chain-of-Thought Feedbackによる決定論的エージェントの精度
- Abstract要約: 言語モデルエージェントは、クエリ毎にスクラッチから推論する。
エージェントが証拠と意図を検索するたびに、思考の連鎖は破棄され、次の類似のクエリは、事前の洞察なしに開始される。
エージェントが評価するエビデンスアイテムに関連付けられた構造化されたエッジとして、エージェントのエビデンス毎の思考連鎖を持続するグラフ構造である推論グラフを導入する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language model agents reason from scratch on every query: each time an agent retrieves evidence and deliberates, the chain of thought is discarded and the next similar query starts with no prior insight. This produces lower accuracy and high variance, as the same type of query can succeed or fail unpredictably. We introduce reasoning graphs, a graph structure that persists an agent's per-evidence chain of thought as structured edges connected to the evidence items they evaluate. Unlike prior memory mechanisms that store distilled strategies as flat records indexed by query similarity or appended by recency, reasoning graphs enable evidence-centric feedback: given a new candidate set, the system traverses all incoming evaluation edges for each evidence item across all prior runs, surfacing how that specific item has been judged before. This backward traversal from evidence inward is a structurally different capability from query-similarity retrieval, because the feedback is tied to the specific evidence the agent is currently examining, not to the query. We further introduce retrieval graphs, a complementary structure that feeds a pipeline planner to tighten the candidate funnel over successive runs. Together, both graphs form a self-improving feedback loop: accuracy rises and variance collapses over successive runs, with every decision fully traceable through the graph. This improvement requires no retraining; the base model remains frozen and all gains come from context engineering via graph traversal. We formalize the graph structure, traversal algorithms, and feedback mechanisms, and describe a sequential cluster evaluation protocol for measuring accuracy convergence and variance collapse on multi-hop question answering benchmarks.
- Abstract(参考訳): 言語モデルエージェントは、各クエリのスクラッチから推論する: エージェントがエビデンスと意図を検索するたびに、思考の連鎖は破棄され、次の同様のクエリは、事前の洞察なしに開始される。
これは、同じタイプのクエリが成功するか、予測不能に失敗する可能性があるため、より低い精度と高い分散を生み出す。
エージェントが評価するエビデンスアイテムに関連付けられた構造化されたエッジとして、エージェントのエビデンス毎の思考連鎖を永続化するグラフ構造である推論グラフを導入する。
クエリ類似性によってインデックス付けされたフラットレコードとして蒸留戦略を格納する以前のメモリメカニズムとは異なり、推論グラフはエビデンス中心のフィードバックを可能にする。
この証拠からの後方移動は、クエリ類似性検索とは構造的に異なる能力である。なぜなら、フィードバックは、クエリではなく、エージェントが現在調査している特定の証拠に結びついているからだ。
さらに,パイプラインプランナに補完構造である検索グラフを導入し,連続的な実行に対して候補ファンネルを厳格化させる。
それぞれのグラフは自己改善的なフィードバックループを形成し、全ての決定がグラフを通して完全にトレース可能となり、精度が上昇し、連続的な実行で分散が崩壊する。
ベースモデルは凍結状態のままであり、すべての利益はグラフトラバーサルによるコンテキストエンジニアリングから得られます。
本稿では, グラフ構造, トラバースアルゴリズム, フィードバック機構を定式化し, マルチホップ質問応答ベンチマークにおける精度収束と分散崩壊を測定するための逐次クラスタ評価プロトコルについて述べる。
関連論文リスト
- Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA [0.4351760066527804]
検索強化されたQAシステムは、要求されたモデル識別子、プロンプト、検索ポリシー、エビデンス深さ、レンダリング、露出した生成制御が固定された場合でも、インデックス展開後に異なる回答を返すことができる。
我々は、隠れた現象の正確さを正解とみなし、クロスショットの相違から反則を減じて過剰な解答を推定するemphSnapshot Compatibility Auditを導入する。
論文 参考訳(メタデータ) (2026-08-24T06:40:09Z) - Dual Spatial-Temporal Attribution: Architecture-Aligned Post-Hoc Explainability for Recurrent Graph Anomaly Detection [1.8899300124593645]
動的グラフにおける異常検出のためのポストホックな説明可能性フレームワークであるX-AddGraphを提案する。
検出器は凍結されているため、検出性能は正確に保存される。
X-AddGraphはすべてのスコアを同一に再現し、存在しない説明を追加します。
論文 参考訳(メタデータ) (2026-08-12T15:58:27Z) - Analysis of Federated Aggregation under Model Poisoning and Backdoor Attacks: A Reconstructed Cross-Dataset and Cross-Architecture Benchmark [0.0]
500セルのシード-1評価マトリックスを5つのアグリゲーション法で再構成した。
実行ログは454回のオリジナルランと36回の修復または再実行で特定された。
クルムは、サインフリップとガウス構成の両方で記録された最高精度を達成した。
論文 参考訳(メタデータ) (2026-08-11T20:42:56Z) - Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds [43.5891705224868]
自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
論文 参考訳(メタデータ) (2026-07-31T04:02:51Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks [0.8699677835130409]
ランレベルのパスレートは、リトライフリーのカバレッジを最大17.8ポイント上回っている。
本稿では,実行レベルの精度,再試行自由度,確率ごとの変動率を指標とした繰り返し実行評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-05-30T23:03:05Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories [61.51984029109709]
グラフベースのフレームワークであるTraceGraphを紹介した。
各タスクに対して、TraceGraphは、モデルIDが導入される前に、プールされたロールアウトから観測可能なアクション・オブザーブレーション状態のグラフを構築する。
次に、結果インフォームされた生産的なコアとトラップリージョンをオーバーレイし、各ロールアウトを3つのイベント – アクセス、トラップ露出、修復 – で要約する。
論文 参考訳(メタデータ) (2026-05-29T13:40:31Z) - Retrieving Minimal and Sufficient Reasoning Subgraphs with Graph Foundation Models for Path-aware GraphRAG [27.22974957852695]
グラフベースの検索強化生成(GraphRAG)は、構造化知識を利用して知識集約推論を支援する。
本稿では,事前学習したグラフファウンデーションモデルがクロスドメインレトリバーとして機能するサブグラフを用いて,ユーザクエリに直接応答するGCM-Retrieverを提案する。
GFM-Retrieverは、効率を保ちながら、検索品質と回答生成の両方において最先端の性能を達成する。
論文 参考訳(メタデータ) (2026-03-07T12:39:21Z) - SAGE: Structure Aware Graph Expansion for Retrieval of Heterogeneous Data [47.930782177987446]
不均一なコーパスに答える検索拡張された質問は、テキスト、テーブル、グラフノード間で接続されたエビデンスを必要とする。
標準レトリバーリーダーパイプラインは、独立にチャンクされたテキスト上の平坦な類似性検索を使用し、モダリティ間のマルチホップエビデンスチェーンを欠いている。
SAGE(Structure Aware Graph Expansion)フレームワークを提案する。これは、パーセンタイルベースのプルーニングとメタデータ駆動の類似性を利用して、チャンクレベルのグラフをオフラインで構築する。
暗黙的クロスモーダルコーパスと明示的スキーマグラフのエージェント検索であるSPARK(Structure Aware Planning Agent for Retrieval over Knowledge Graphs)のハイブリッド高密度スパース検索を用いて初期検索をインスタンス化する。
論文 参考訳(メタデータ) (2026-02-18T23:57:19Z) - Breaking the Static Graph: Context-Aware Traversal for Robust Retrieval-Augmented Generation [12.71443292660797]
堅牢なRAGのためのコンテキスト認識トラバーサルであるCatRAGを提案する。
CatRAGはHippoRAG 2アーキテクチャ上に構築され、静的なKGをクエリ適応ナビゲーション構造に変換する。
4つのマルチホップベンチマークの実験では、CatRAGはアートベースラインの状態を一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-02T11:13:38Z) - N2N-GQA: Noise-to-Narrative for Graph-Based Table-Text Question Answering Using LLMs [0.0]
ハイブリッドテーブルテキストデータに対するマルチホップ質問応答には,大規模コーパスからの複数のエビデンス部分の検索と推論が必要である。
Standard Retrieval-Augmented Generation (RAG) パイプラインは文書をフラットなランクリストとして処理し、検索ノイズがあいまいな推論連鎖を引き起こす。
N2N-GQAは、ノイズの多い検索出力から動的エビデンスグラフを構成する、オープンドメインハイブリッドテーブルテキストQAのための最初のゼロショットフレームワークである。
論文 参考訳(メタデータ) (2026-01-10T15:55:15Z) - Hierarchical Sequence Iteration for Heterogeneous Question Answering [27.22775290181187]
本稿では,文書,表,知識グラフを可逆的階層列に線形化する統一フレームワークであるHSEQを紹介する。
HotpotQA(テキスト)、HybridQA/TAT-QA(テーブル+テキスト)、MetaQA(KG)の実験では、強いシングルパス、マルチホップ、エージェントRAGベースラインを高い効率で一貫したEM/F1が得られた。
論文 参考訳(メタデータ) (2025-10-23T12:48:18Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think [51.0691253204425]
我々は2つの質問に答えるために中間的推論ステップを解析する: 最終的な答えはモデルの最適結論を確実に表すか?
我々のアプローチは、推論トレースを言語的手がかりに基づくシーケンシャルなサブソートに分割することである。
これらの解答を最も頻繁な解(モード)を選択して集約すると、元の完全トレースから得られる解のみに依存するよりも、はるかに高い精度が得られることが判明した。
論文 参考訳(メタデータ) (2025-04-29T12:39:07Z) - ReCEval: Evaluating Reasoning Chains via Correctness and Informativeness [67.49087159888298]
ReCEvalは2つの重要な特性(正確性と情報性)を通じて推論チェーンを評価するフレームワークである。
本稿では、ReCEvalが様々なエラータイプを効果的に識別し、従来の手法と比較して顕著な改善をもたらすことを示す。
論文 参考訳(メタデータ) (2023-04-21T02:19:06Z) - Explanation Selection Using Unlabeled Data for Chain-of-Thought
Prompting [80.9896041501715]
非専門家によって書かれたオフ・ザ・シェルフの説明のように、タスクのために"チューニング"されていない説明は、中途半端なパフォーマンスをもたらす可能性がある。
本稿では,ブラックボックス方式で説明拡散プロンプトを最適化する方法の課題に対処する。
論文 参考訳(メタデータ) (2023-02-09T18:02:34Z) - QuTE: decentralized multiple testing on sensor networks with false discovery rate control [93.1040521878626]
本稿では、偽発見率(FDR)の証明可能な保証を備えたグラフ上での分散多重仮説検定法を設計する。
異なるエージェントが無向グラフのノードに存在し、各エージェントはそのノードに局所的な1つ以上の仮説に対応するp値を持つ。
各エージェントは、グラフ全体の大域的FDRが予め定義されたレベルで制御されなければならないという共同目的のもと、隣人とのみ通信することで、それぞれのローカル仮説の1つ以上の拒絶を個別に決めなければならない。
論文 参考訳(メタデータ) (2022-10-09T19:48:39Z) - ExplaGraphs: An Explanation Graph Generation Task for Structured
Commonsense Reasoning [65.15423587105472]
スタンス予測のための説明グラフ生成の新しい生成および構造化コモンセンスリゾニングタスク(および関連するデータセット)を紹介します。
具体的には、信念と議論が与えられた場合、モデルは、議論が信念を支持しているかどうかを予測し、予測されたスタンスに対する非自明で完全で曖昧な説明として機能する常識強化グラフを生成する必要がある。
グラフの83%は、様々な構造と推論深度を持つ外部のコモンセンスノードを含んでいる。
論文 参考訳(メタデータ) (2021-04-15T17:51:36Z) - Approximate Knowledge Graph Query Answering: From Ranking to Binary
Classification [0.20999222360659608]
不完全グラフ上の構造化クエリは、不完全解の集合をもたらす。
近似構造化クエリ応答のためのいくつかのアルゴリズムが提案されている。
ランキングに基づく評価を行うことは、複雑な問合せ応答の方法を評価するのに十分ではないと我々は主張する。
論文 参考訳(メタデータ) (2021-02-22T22:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。