論文の概要: From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents
- arxiv url: http://arxiv.org/abs/2608.16002v2
- Date: Wed, 19 Aug 2026 01:59:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.194695
- Title: From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents
- Title(参考訳): 配列から構造へ:LLM剤の相関不確実性伝播
- Abstract要約: 大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
- 参考スコア(独自算出の注目度): 75.69180947909148
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable uncertainty quantification (UQ) is essential for deploying large language model (LLM) agents in complex interactive environments. Existing UQ methods largely rely on local signals, such as token probabilities, predictive entropy, or per-step confidence, and therefore overlook the long-range dependencies through which errors accumulate across an execution trajectory. As a result, they may fail to identify agent failures whose causes originate several reasoning or interaction steps before the final answer. We propose RUPA (Relational Uncertainty Propagation for Agents), a trajectory-level UQ framework for LLM agents. RUPA represents an execution history as a directed trajectory graph in which reasoning states, tool interactions, and environment feedback are nodes connected by temporal and semantic dependency edges. It then propagates uncertainty over this graph to capture how execution risk accumulates and transfers across interaction steps. The propagated signal is combined with trajectory-level behavioral features and goal-alignment information to produce a confidence estimate for the full agent trajectory. We evaluate RUPA on representative agent benchmarks, including $τ$-2, Terminal-Bench-2, and GAIA, using 6 open-source LLMs spanning multiple model families. Experimental results show that RUPA consistently outperforms existing UQ methods by providing more accurate uncertainty estimates, enabling earlier failure detection, and improving uncertainty-guided agent execution across diverse agent tasks. These results demonstrate that explicitly modeling relational dependency is crucial to reliable UQ for long-horizon LLM agents, providing a practical foundation for trustworthy agent execution.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントの複雑な対話環境への展開には,信頼性の高い不確実性定量化(UQ)が不可欠である。
既存のUQ手法は、トークン確率、予測エントロピー、ステップごとの信頼といった局所的な信号に大きく依存しているため、エラーが実行軌跡に蓄積される長距離依存関係を見落としている。
結果として、最終回答の前にいくつかの推論や相互作用のステップを発生させる原因となるエージェントの失敗を特定するのに失敗する可能性がある。
LLMエージェントのための軌道レベルのUQフレームワークであるRUPA(Relational Uncertainty Propagation for Agents)を提案する。
RUPAは実行履歴を、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存エッジで接続されたノードである有向トラジェクトリグラフとして表現している。
その後、このグラフ上で不確実性を伝播し、実行リスクの蓄積と相互作用ステップ間の転送をキャプチャする。
伝搬信号は、軌道レベルの挙動特徴とゴールアライメント情報とを組み合わせて、全エージェント軌道に対する信頼度推定を生成する。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク(τ$-2, Terminal-Bench-2, GAIA)でRUPAを評価した。
実験結果から、RUPAは既存のUQ手法より精度の高い不確実性推定を提供し、早期の故障検出を可能にし、多様なエージェントタスクにおける不確実性誘導エージェントの実行を改善することにより、一貫した性能を発揮した。
これらの結果から, 長期LLMエージェントの信頼性UQには, 関係依存を明示的にモデル化することが不可欠であることが示唆された。
関連論文リスト
- PropUQ-MAS: Propagation-Aware Uncertainty Quantification for LLM Multi-Agent Systems [8.348628811300268]
PropUQ-MASはマルチエージェントシステムのためのエラー伝搬対応UQフレームワークである。
上流メッセージから受け継いだローカル不確実性と不確実性を組み合わせることで、各ステップの信頼性を推定する。
PropUQ-MASはMASのUQを継続的に改善し、平均相対利得はAUROCで+6.10%、PRRで+47.58%である。
論文 参考訳(メタデータ) (2026-08-22T23:07:39Z) - Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution [47.70578021328887]
大規模言語モデル(LLM)ベースのマルチエージェントシステムは、しばしば複雑な障害モードを示す。
AFANetは、ステップレベルの意味信号とエージェントレベルの関係を通して相互作用軌跡をモデル化する軽量なグラフベースのフレームワークである。
以上の結果から, エージェント障害の効果的な帰属は大きな推論を必要とせず, 軽量で構造化されたアプローチで高い性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2026-08-19T06:16:09Z) - STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training [25.087853601817688]
強化学習(英語: Reinforcement Learning, RL)は、長期的タスクにおいて大規模言語モデル(LLM)エージェントを訓練するための主要なパラダイムである。
本研究では,与えられた状態下でのエージェントの平均行動に対する信頼性逸脱を測定する正規化エントロピーを提案する。
階層型グループベースRLフレームワークであるSTAPO(Selective Trajectory-Aware Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2026-07-06T11:50:06Z) - Trust-Aware Multi-Agent Traceability: Confidence-Calibrated Knowledge Graphs for Consistent Software Artifact Management [0.7329200485567826]
ソフトウェアエンジニアリングでは、要求分析、アーキテクチャ設計、テスト生成、トレーサビリティリンクを自動化するために、マルチエージェントAIシステムがますます使われています。
本稿では,共有知識グラフを集中型セマンティックメモリと協調曲面の両方として機能する信頼対応協調フレームワークを提案する。
我々は,リンク予測キャリブレーション,プロトコルの有効性,しきい値感度,トレーサビリティシードの影響を自動車ソフトウェア工学のケーススタディで評価した。
論文 参考訳(メタデータ) (2026-06-15T18:41:50Z) - From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents [69.07911499189129]
エージェントのメタ認知判断(Knowing)を自発的実行(Acting)から切り離して認知行動アライメントを評価するフレームワークであるKAPROを紹介する。
実験の結果,自己認識能力はタスク成功と強く相関するが,内部能力設定では著しく低下することがわかった。
プロプライエタリで推論指向のモデルは、より信頼性の高い認知ゲーティングを示します。
論文 参考訳(メタデータ) (2026-06-09T17:17:08Z) - FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search [11.638321375070047]
LLMエージェントトラジェクトリにおける障害帰属の診断フレームワークであるFALATを提案する。
我々は、アルゴリズム生成と手作りのマルチエージェント障害軌跡を含むWho&WhenベンチマークでFALATを評価する。
論文 参考訳(メタデータ) (2026-05-30T15:11:35Z) - Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning [11.914433611519359]
不正行為を隠蔽する自律型大規模言語モデル(LLM)エージェントの監視は、遅延、コンテキスト依存、長期攻撃パターンのために困難である。
自律エージェントのセキュリティ分析を前提とした学習監視フレームワークである textbfAgent-ToM を提案する。
論文 参考訳(メタデータ) (2026-05-22T20:57:20Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - AgentV-RL: Scaling Reward Modeling with Agentic Verifier [63.55502685076245]
試験時間スケーリング(TTS)によるLCM推論を強化する検証器が実証されている。
本稿では,報酬モデリングを多ターンツール拡張型検討プロセスに変換するフレームワークであるエージェント検証を提案する。
Agentic Verifier は並列およびシーケンシャルTS の両方で一貫した性能向上が得られることを示す。
論文 参考訳(メタデータ) (2026-04-17T12:27:36Z) - AgentTrace: Causal Graph Tracing for Root Cause Analysis in Deployed Multi-Agent Systems [0.0]
本稿では,デプロイされたマルチエージェントAIシステムにおけるポストホック障害診断のための軽量因果トレースフレームワークであるAgentTraceを紹介する。
AgentTraceは、実行ログから因果グラフを再構築し、エラー発生から後方にトレースし、解釈可能な構造信号と位置信号を使って候補根本原因をランク付けする。
この結果から,因果トレースはエージェントシステムの信頼性と信頼性を向上させるための実践的な基盤となることが示唆された。
論文 参考訳(メタデータ) (2026-03-16T00:46:44Z) - DLLM Agent: See Farther, Run Faster [94.74432470237817]
拡散大言語モデル(DLLM)は、自己回帰(AR)デコーディングの代替として、魅力的な効率とモデリング特性を持つ。
我々は、DLLMとARのバックボーンを同一のエージェントワークフロー内でインスタンス化することで、制御された環境でこれを研究する。
DLLMエージェントはARエージェントよりも平均30%以上速く、場合によっては8倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2026-02-07T09:01:18Z) - Towards Reducible Uncertainty Modeling for Reliable Large Language Model Agents [72.26774492844167]
大規模言語モデル(LLM)に対する不確実性定量化(UQ)は、日常的なLLMアプリケーションの安全ガードレールの鍵となるビルディングブロックである。
本稿では,既存のUQ設定の幅広いクラスを仮定したエージェントUQの汎用的な定式化について述べる。
エージェントの軌道上での再現可能な不確実性を明示的にモデル化する,新しい視点,条件付き不確実性低減プロセスを提案する。
論文 参考訳(メタデータ) (2026-02-04T21:47:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。