論文の概要: Agent Step Value: Probing the Observer Effect in Black-Box Traces
- arxiv url: http://arxiv.org/abs/2607.04419v2
- Date: Tue, 07 Jul 2026 17:26:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.239386
- Title: Agent Step Value: Probing the Observer Effect in Black-Box Traces
- Title(参考訳): エージェントステップ値:ブラックボックストレースにおけるオブザーバ効果の探索
- Authors: Andrew Zhang, Chengzhan Li,
- Abstract要約: Agent Step Value (ASV) は、固定された候補セットに対してステートレスLLM評価器で状態の前/後の状態をスコアするリプレイフレームワークである。
ASVはエントロピー運動とベイジアン・サプライズ測度信念運動を報告し、オフライン金銀利得測度はレビュー対象に向けた動きを報告している。
また、変化した射影、合理性、プロンプト、スコアリングルールの下で同じ凍結遷移を再生することで、評価器チャネル感度を定量化する。
- 参考スコア(独自算出の注目度): 2.4293637634506404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Final-answer scores hide which agent transitions helped or harmed a trace. We introduce Agent Step Value (ASV), a replay framework that scores before/after states with a stateless LLM evaluator over a fixed candidate set. ASV reports entropy movement and Bayesian surprise measure belief movement, while offline gold-margin gain measures movement toward a reviewed target. It also quantifies evaluator-channel sensitivity by replaying the same frozen transitions under changed projection, rationale, prompt, or scoring rules. In a 100-question open-QA study with live PubMed retrieval and DeepSeek log-probability scoring, ASV evaluates 1,100 transitions. Entropy movement is 0.000 while mean Bayesian surprise is 2.693, exposing near-one-hot belief pivots. Under a 128-token rationale-conditioned protocol, mean gold-margin gain is -2.335 (95\% CI [-3.395, -1.272]); direct one-token scoring on the same traces gives +4.033. A 100-transition component audit traces the reversal to short generated rationales over full states. ASV turns prompt sensitivity into a measured channel effect and localizes the largest rationale-conditioned losses to extraction and audit.
- Abstract(参考訳): 最終回答スコアは、どのエージェント遷移がトレースを助けたり傷つけたかを隠す。
我々は、固定された候補セットに対してステートレスLLM評価器を用いて、前/後状態のスコアをスコアするリプレイフレームワークであるAgent Step Value (ASV)を紹介する。
ASVはエントロピー運動とベイジアン・サプライズ測度信念運動を報告し、オフライン金銀利得測度はレビュー対象に向けた動きを報告している。
また、変化した射影、合理性、プロンプト、スコアリングルールの下で同じ凍結遷移を再生することで、評価器チャネル感度を定量化する。
ライブPubMed検索とDeepSeekログ確率スコアを用いた100件のオープンQA調査で、ASVは1,100のトランジションを評価した。
エントロピー運動は0.000であり、ベイジアン・サプライズ(英語版)は2.693であり、ほぼ1ホットの信念の転換点を露呈する。
128tokenの有理条件付きプロトコルでは、金銀利得は-2.335(95\% CI [-3.395, -1.272])であり、同じトレース上で直接1tokenスコアは+4.033である。
100-transitionコンポーネント監査は、全状態に対する逆転から短い生成された有理数にトレースする。
ASVは、迅速な感度を測定されたチャネル効果に変換し、抽出と監査に最大の合理的条件付き損失をローカライズする。
関連論文リスト
- ScratchWorld: Evaluating If World Models Compute Executable Consequences [2.3981743514438087]
我々は、Scratchプロジェクトを実行可能な世界として扱うオフライン診断ベンチマークであるScratchWorldを紹介した。
ScratchWorldは、次の状態予測、ロングホライゾントラッキング、因果イベント属性、および反事実予測を評価する。
論文 参考訳(メタデータ) (2026-06-30T14:02:25Z) - StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents [67.03593791535786]
強化学習(Reinforcement Learning, RL)は、長期のデジタル環境においてGUIエージェントを改善するための有望なアプローチである。
この問題を軽減するため、最近の研究はプロセス・リワード・モデル(PRM)を導入している。
PRMは、グローバルマイルストーン検証やローカルステップレベルの評価を通じて、よりきめ細かいトレーニングフィードバックを提供する。
本稿では,GUIエージェントのためのエンティティ・スタンフロープロセス報酬モデルであるStainFlowを提案する。
論文 参考訳(メタデータ) (2026-06-05T08:17:28Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation [0.0]
本稿では,プランナー指向実行,特殊なツール使用,テレメトリ駆動評価を中心に構築されたツール拡張型自律推論フレームワークを提案する。
クリーンな評価制約の下でGAIA 2023 Level-1バリデーションタスクのクロマフローを解析する。
論文 参考訳(メタデータ) (2026-05-13T20:40:37Z) - Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance [9.771590610969918]
WMF-AM(Working Memory Fidelity-Active Manipulation)を紹介する。
その結果,20種類のオープンウェイトモデル (0.5B-35B, 13ファミリー) で10タスク・エージェント・バッテリを発売した。
論文 参考訳(メタデータ) (2026-03-28T17:25:11Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering [52.69447404069251]
大規模視覚言語モデル(VLM)は、オープン語彙推論のための強力なセマンティック先行情報を提供することにより、EQAエージェントの改良を行った。
ステップレベルキャリブレーションによる探索を安定化するフレームワークPrune-Then-Planを提案する。
論文 参考訳(メタデータ) (2025-11-24T22:50:50Z) - Rethinking Metrics and Benchmarks of Video Anomaly Detection [58.37571339811799]
ビデオ異常検出(VAD)は、期待から外れた異常を検出することを目的としている。
既存のVADメトリクスは、単一のアノテーションバイアスの影響を受けます。
既存のベンチマークには、完全に/弱い教師付きアルゴリズムのシーンオーバーフィットを評価する能力がない。
論文 参考訳(メタデータ) (2025-05-25T08:09:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。