論文の概要: Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations
- arxiv url: http://arxiv.org/abs/2609.09448v1
- Date: Tue, 08 Sep 2026 20:58:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.817069
- Title: Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations
- Title(参考訳): エージェントはいつ理解したか? : エージェントの信頼性を内部表現から判断する
- Authors: Priyanka Mary Mammen, Emil Joswin, Srujananjali Medicherla,
- Abstract要約: 従来の機械学習システムと比較すると、エージェントは計画、ツール呼び出し、動的環境相互作用を伴う複雑な障害モードを持つ。
モデルの内部表現が,マルチターンエージェント構成における最終的なタスク成功のシグナルをより強くするかどうかを検討する。
- 参考スコア(独自算出の注目度): 0.09085204695117637
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As agentic systems getting adopted rapidly in safety critical applications, it is vital to measure the confidence associated with the agentic actions. In comparison to the traditional machine learning systems, agentic workflows have complex failure modes with planning, tool invocation and dynamic environment interactions. In this paper, we investigate whether model's internal representations provide stronger signals of eventual task success in multi-turn agentic setups. We introduce two complementary methods: Latent Trajectory Dynamics (LTD), which summarizes changes in residual-stream representations across an an interaction trajectory, and the Action Representation Probe (ARP), which predicts success from representations formed at action decisions. Across three interactive benchmarks (Bash, SQL, Python) and three model families (Qwen14B, Qwen7B, DeepSeek6.7B), our methods consistently outperform surface level generation and sequence-based calibration baselines providing a zero-overhead reliability monitor that requires neither prompt alterations nor multi-sample rollouts.
- Abstract(参考訳): エージェントシステムは、安全クリティカルな応用において急速に採用されるため、エージェントアクションに関連する信頼度を測定することが不可欠である。
従来の機械学習システムと比較すると、エージェントワークフローは計画、ツール呼び出し、動的環境の相互作用を伴う複雑な障害モードを持つ。
本稿では,モデルの内部表現が,マルチターンエージェント設定における最終的なタスク成功のシグナルを与えるかどうかを検討する。
本稿では,対話軌跡全体にわたる残差ストリーム表現の変化を要約するLatent Trajectory Dynamics (LTD) と,行動決定時に生成された表現から成功を予測するAction Representation Probe (ARP) の2つの補完手法を紹介する。
3つのインタラクティブなベンチマーク(Bash、SQL、Python)と3つのモデルファミリ(Qwen14B、Qwen7B、DeepSeek6.7B)で、当社のメソッドは、即時変更もマルチサンプルロールアウトも不要なゼロオーバーヘッド信頼性モニタを提供する表面レベル生成とシーケンスベースのキャリブレーションベースラインを一貫して上回っている。
関連論文リスト
- From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution [63.61358761489141]
LLM(Large Language Model)ベースのエージェントは、カスタマーサービス、Webナビゲーション、ソフトウェアエンジニアリングといった現実世界のアプリケーションで広く使われている。
本稿では,タスク結果に関係なく,エージェントの動作を駆動する内部要因を識別する,テキスト汎用エージェント属性のための新しいフレームワークを提案する。
標準ツールの使用やメモリ誘起バイアスのような微妙な信頼性リスクなど、さまざまなエージェントシナリオでフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-21T15:22:21Z) - Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions [0.0]
エージェントドリフト(エージェントドリフト)は、エージェントの挙動、決定品質、およびエージェント間コヒーレンスを、拡張された相互作用シーケンス上で段階的に劣化させる。
12次元にわたるドリフトを定量化するための新しい合成計量であるエージェント安定度指数(ASI)を導入する。
未確認エージェントドリフトがタスク完了精度を大幅に低下させ、人間の介入要求が増大することを示す。
論文 参考訳(メタデータ) (2026-01-07T18:37:26Z) - Convergence dynamics of Agent-to-Agent Interactions with Misaligned objectives [3.9351446512514947]
マルチエージェントシナリオにおけるエージェントとエージェントの相互作用に関する理論的枠組みを開発する。
エージェントが不整合目的を持つ場合の相互作用に関連する生成ダイナミクスを特徴付ける。
本フレームワークは,マルチエージェントシステムの研究,予測,防衛を行うためのセットアップを提供する。
論文 参考訳(メタデータ) (2025-11-11T19:18:55Z) - Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm [60.36837655498119]
本稿では,トラジェクトリをベースとしたエージェント・ベンチマーク・複雑度進化フレームワークを提案する。
このフレームワークは、既存のベンチマークから元のタスクを受け取り、エージェントがそれをより難しい新しいタスクに進化させるよう促す。
GAIAベンチマークの実験では、TRACEフレームワークはタスクの複雑さを継続的に向上し、正確性の信頼性を向上させる。
論文 参考訳(メタデータ) (2025-10-01T01:52:52Z) - AgentCompass: Towards Reliable Evaluation of Agentic Workflows in Production [4.031479494871582]
本稿では,エージェントパイプラインのデプロイ後監視と推論に特化して設計された,最初の評価フレームワークであるAgentを紹介する。
Agentは、主要なメトリクスに関する最先端の結果を達成すると同時に、人間のアノテーションで見逃された重要な問題を明らかにする。
論文 参考訳(メタデータ) (2025-09-18T05:59:04Z) - AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models [23.916663925674737]
これまでの研究によると、現在のLSMベースのエージェントは攻撃を受けなくても多くの悪意あるタスクを実行している。
本稿では,安全なアライメントデータ合成の媒体として抽象的行動連鎖を利用する新しいフレームワークであるAgentAlignを提案する。
本フレームワークは,複雑なマルチステップのダイナミックスを捕捉しながら,高精度かつ実行可能な命令の生成を可能にする。
論文 参考訳(メタデータ) (2025-05-29T03:02:18Z) - SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning [23.032729815716813]
現実世界の環境の複雑さは信用割当問題を悪化させる。
大規模シナリオにおけるエージェント集団の多様性は、スケーラブルな意思決定メカニズムを必要とする。
逐次値推定を用いた逐次ロールアウト(SrSv)を提案する。
論文 参考訳(メタデータ) (2025-03-03T12:17:18Z) - DCIR: Dynamic Consistency Intrinsic Reward for Multi-Agent Reinforcement
Learning [84.22561239481901]
本稿では,エージェントの行動が他のエージェントの行動と一致しているかどうかを学習するための新しいアプローチを提案する。
マルチエージェント粒子, Google Research Football および StarCraft II Micromanagement を含む複数の環境における DCIR の評価を行った。
論文 参考訳(メタデータ) (2023-12-10T06:03:57Z) - Interactive Autonomous Navigation with Internal State Inference and
Interactivity Estimation [58.21683603243387]
本稿では,関係時間的推論を伴う3つの補助的タスクを提案し,それらを標準のディープラーニングフレームワークに統合する。
これらの補助的なタスクは、他の対話的エージェントの行動パターンを推測するための追加の監視信号を提供する。
提案手法は,標準評価指標の観点から,頑健かつ最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-11-27T18:57:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。