論文の概要: Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay
- arxiv url: http://arxiv.org/abs/2608.19760v2
- Date: Tue, 25 Aug 2026 17:45:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:33.783793
- Title: Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay
- Title(参考訳): クレジット・イン・グラウンド・トゥルース:LLMエージェントのステップ・レベル・クレジット・アサインメント(動画)
- Authors: Haiyue Zhang,
- Abstract要約: 単一エージェント環境において,実行されたリプレイからポリシー条件の真偽を検査する。
段階的な信用シグナルは、限界整合シャッフル制御以上の信頼度の高いインクリメンタル忠実度を示すものではない。
信頼のみのルータは、チャンスレベルにおいて重要なステップを回復するが、1ターンあたりの審査コストを13.1%削減する。
- 参考スコア(独自算出の注目度): 0.6768558752130311
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audited against policy-conditional ground truth from executed replay in a single-agent tool environment (ALFWorld), none of the step-level credit signals we audit -- LLM-judge scores, outcome-conditioned logprob ratios, or the policy's own confidence -- shows reliable incremental fidelity beyond its own marginal-matched shuffled control. Correcting for replay-target reliability leaves implicit fidelity bounded near zero and judge fidelity inconclusive at the achieved target reliability. Existing evaluations grade these signals against annotated step *correctness*; we audit them against step *contribution* -- what re-sampling the policy's own alternatives at each decision point and rolling forward changes about the outcome -- and they come apart. The ground truth is structured: 30.5% of decision points where it is defined exhibit a nonzero replay contrast at the achieved sampling resolution, and measurability is model-dependent -- the fraction of points with no policy-supported counterfactual differs twofold (13.1% vs. 26.8%) between two similar-scale policies. The failure mode is identifiable: implicit credit echoes the policy's fluency (median rank correlation +0.75, replicating at +0.70 in a second family under a corrected instrument), while outcome conditioning adds no causal information (partial correlation -0.004, Qwen). A confidence-only router recovers pivotal steps at chance level, but cuts judge cost by 13.1% per turn (14.0% per trajectory). In a seven-arm pre-registered training experiment, no arm reliably outperforms the untrained policy, and the checkpoints' apparent instrument signature is statistically consistent with mediation by effective training dose in this design -- sparser credit retains fewer examples, an order-of-magnitude spread in optimizer steps -- not credit content. Comparisons of credit rules must match effective sample size, or they measure dose, not credit.
- Abstract(参考訳): 単一エージェントのツール環境(ALFWorld)で実行されたリプレイから、政策条件の根拠の真実に反して、監査対象のステップレベルの信用シグナル -- LLM-judgeスコア、結果条件のログプロブ比率、あるいはポリシー自身の信頼 – は、独自の限界整合シャッフルコントロールを越えて、信頼性の高いインクリメンタルな忠実さを示している。
リプレイ対象信頼性の補正は、暗黙の忠実度をゼロ付近に制限し、達成された目標信頼度に不定意性を判断する。
既存の評価では、これらのシグナルを注釈付きステップ *正確性* に対して評価し、ステップ *貢献* に対して監査します。
決定ポイントの30.5%は、達成されたサンプリング解像度においてゼロでないリプレイコントラストを示しており、測定可能性はモデル依存である。
暗黙のクレジットはポリシーの流速(中間ランク相関+0.75、修正された楽器の下で第2ファミリーで+0.70で複製)を反映し、結果条件付けには因果情報(部分相関−0.004、Qwen)が付加されない。
信頼のみのルータは、チャンスレベルにおいて重要なステップを回復するが、1ターンあたりの審査コストを13.1%削減する(軌道当たり14.0%)。
7本腕の事前登録訓練実験では、腕はトレーニングされていないポリシーを確実に上回り、チェックポイントの明示的な楽器のサインは、この設計における効果的なトレーニング用量による調停と統計的に一致している。
クレジットルールの比較は有効なサンプルサイズと一致しなければならない。
関連論文リスト
- Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation [6.047519836191728]
有限行動ポリシークラス上でプロトコルレベルの識別可能性監査を形式化する。
監査はモデルコールをゼロにし、診断ケースを解決します。
このケースは、モデル推論の前に、どのように評価設計の妥当性を構造的に確認できるかを示す。
論文 参考訳(メタデータ) (2026-08-13T14:49:47Z) - When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner's Guide [0.0]
5つのデータセットと2つの既知のエフェクトスイープにまたがる6つの推定器をベンチマークし、非シミュレートされたペア参照に対してそのメカニズムを検証する。
ターゲット自身のスコアからロガーをシャープすると、テスト対象範囲をわずかにオーバーラップし、アクションレベルの不一致が崩壊する。
結果のニュアンスのみを適合させることは、再利用バイアスをその場に残し、それを悪化させます。
論文 参考訳(メタデータ) (2026-08-12T18:10:10Z) - Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents [7.774009529494805]
LLMエージェントは、各アクションが後続の判断条件の状態を変更し、1つの間違ったステップが相互作用予算を無駄にしたり、最終失敗が観測されるずっと前に不可逆的な副作用を引き起こす可能性がある外部環境において作用する。
LLM批判者が過去の判断と観察結果から証拠を蓄積する自己進化的批判フレームワーク(methodshort)を導入する。
論文 参考訳(メタデータ) (2026-07-14T06:17:09Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - AgentFairBench: Do LLM Agents Discriminate When They Act? [2.3004655342211078]
AgentFairBenchは、LLMエージェントの動作における人口格差に対する、安価で再現可能なマルチドメインベンチマークである。
これは、雇用、貸与、医療トリアージという、規制対象の3つの領域にまたがっている。
NumPyのみのハーネスは、反ファクト的なフリップ率、平均絶対スコア差(MASD)、アクションレートの相違、ツール起動の相違を計算する。
論文 参考訳(メタデータ) (2026-06-15T13:50:26Z) - Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures [0.0]
Causal Agent Replay (CAR) は、エージェントが構造的因果モデルとして実行されることをモデル化する。
ステップにダブルオペレーションを適用し、同じポリシーの下で軌道を再実行します。
CARはオープンソースで、ホストまたはフリーのローカルモデルで動作する。
論文 参考訳(メタデータ) (2026-06-06T17:44:23Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。