論文の概要: Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces
- arxiv url: http://arxiv.org/abs/2607.04419v3
- Date: Mon, 13 Jul 2026 16:54:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.253583
- Title: Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces
- Title(参考訳): エージェントステップ値:ブラックボックスエージェントトレースにおける評価器チャネル逆転の検証
- Authors: Andrew Zhang, Chengzhan Li,
- Abstract要約: 評価器由来のステップ報酬がスコアリングチャネル間でプールされたり比較されたりした場合、それらのサインは輸送可能なものとして扱われる。
エージェントステップ値(ASV)をチャネルインデクシングされたターゲットマージンゲインとして定義し、チャネル間相互作用の欠如を識別する。
- 参考スコア(独自算出の注目度): 2.4293637634506404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When evaluator-derived step rewards are pooled or compared across scoring channels, their sign is treated as transportable. Yet the same frozen transition can change sign with the scoring channel. Process rewards vary agent states, while evaluator audits vary scoring configurations; neither first difference isolates their interaction. We define Agent Step Value (ASV) as channel-indexed target-margin gain and identify the missing state-by-channel interaction by replaying complete faces. Of 1,100 PubMed open question-answering transitions, 1,004 were complete across four cyclic layouts. Their mean update is positive under direct scoring (+0.163 [0.102, 0.218]) and negative with an externally generated view (-0.160 [-0.244, -0.079]), giving an interaction of -0.323 [-0.418, -0.232]. Across paired transitions, 507/1,004 cross zero in one direction or the other. Matched templates isolate a generated-minus-quote interaction of -1.121 [-1.534, -0.703]. Its direction remains negative after the readout and evaluator-stack changes, and quote yields a higher paired area under the receiver operating characteristic curve (AUC) for stored success at all three bridge vertices. Because the two views preserve the same task information conditional on the retained state, a representation-invariance null predicts equal responses and success rankings across them. ASV provides a transport audit for evaluator-derived step measurements; causal actor credit lies outside its estimand.
- Abstract(参考訳): 評価器由来のステップ報酬がスコアリングチャネル間でプールされたり比較されたりした場合、それらのサインは輸送可能なものとして扱われる。
しかし、同じ凍結した遷移はスコアリングチャネルで符号を変更することができる。
プロセスの報酬はエージェントの状態によって異なるが、評価器の監査はスコアリングの構成によって異なる。
エージェントステップ値(ASV)をチャネルインデクシングされたターゲットマージンゲインとして定義し、完全な顔の再生によってチャネル間相互作用の欠如を識別する。
PubMedのオープンな質問応答トランジションのうち、1,004は4つの周期的なレイアウトで完了した。
彼らの平均更新値は、直接スコア(+0.163[0.102, 0.218])で正であり、外部に生成されたビュー(-0.160[-0.244, -0.079])と負であり、-0.323[-0.418, -0.232]の相互作用を与える。
ペア遷移を横切ると、507/1,004は一方の方向にゼロを横切る。
マッチングテンプレートは、-1.121[-1.534, -0.703]の生成された最小クォート相互作用を分離する。
読み出しと評価器スタックが変化した後もその方向は否定的であり、引用文は3つの橋の頂点に格納された成功のために受信器操作特性曲線(AUC)の下でより高いペア領域を出力する。
2つのビューは保持状態に条件付きで同じタスク情報を保持するため、表現不変なnullは、それら全体で同じ応答と成功ランキングを予測する。
ASVは評価者由来のステップ測定のためのトランスポート監査を提供する。
関連論文リスト
- ScratchWorld: Evaluating If World Models Compute Executable Consequences [2.3981743514438087]
我々は、Scratchプロジェクトを実行可能な世界として扱うオフライン診断ベンチマークであるScratchWorldを紹介した。
ScratchWorldは、次の状態予測、ロングホライゾントラッキング、因果イベント属性、および反事実予測を評価する。
論文 参考訳(メタデータ) (2026-06-30T14:02:25Z) - StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents [67.03593791535786]
強化学習(Reinforcement Learning, RL)は、長期のデジタル環境においてGUIエージェントを改善するための有望なアプローチである。
この問題を軽減するため、最近の研究はプロセス・リワード・モデル(PRM)を導入している。
PRMは、グローバルマイルストーン検証やローカルステップレベルの評価を通じて、よりきめ細かいトレーニングフィードバックを提供する。
本稿では,GUIエージェントのためのエンティティ・スタンフロープロセス報酬モデルであるStainFlowを提案する。
論文 参考訳(メタデータ) (2026-06-05T08:17:28Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation [0.0]
本稿では,プランナー指向実行,特殊なツール使用,テレメトリ駆動評価を中心に構築されたツール拡張型自律推論フレームワークを提案する。
クリーンな評価制約の下でGAIA 2023 Level-1バリデーションタスクのクロマフローを解析する。
論文 参考訳(メタデータ) (2026-05-13T20:40:37Z) - Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance [9.771590610969918]
WMF-AM(Working Memory Fidelity-Active Manipulation)を紹介する。
その結果,20種類のオープンウェイトモデル (0.5B-35B, 13ファミリー) で10タスク・エージェント・バッテリを発売した。
論文 参考訳(メタデータ) (2026-03-28T17:25:11Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering [52.69447404069251]
大規模視覚言語モデル(VLM)は、オープン語彙推論のための強力なセマンティック先行情報を提供することにより、EQAエージェントの改良を行った。
ステップレベルキャリブレーションによる探索を安定化するフレームワークPrune-Then-Planを提案する。
論文 参考訳(メタデータ) (2025-11-24T22:50:50Z) - Rethinking Metrics and Benchmarks of Video Anomaly Detection [58.37571339811799]
ビデオ異常検出(VAD)は、期待から外れた異常を検出することを目的としている。
既存のVADメトリクスは、単一のアノテーションバイアスの影響を受けます。
既存のベンチマークには、完全に/弱い教師付きアルゴリズムのシーンオーバーフィットを評価する能力がない。
論文 参考訳(メタデータ) (2025-05-25T08:09:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。