論文の概要: STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle
- arxiv url: http://arxiv.org/abs/2607.13618v1
- Date: Wed, 15 Jul 2026 09:08:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.716144
- Title: STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle
- Title(参考訳): STOCKTAKE: 公正なオラクルによるLLMエージェントの知覚と行動のギャップの測定
- Abstract要約: LLMエージェントは、コストを駆動する状態が直接観察されない複数週間の意思決定タスクにおいて、ますます評価される。
一部観測可能なマルコフ決定プロセスとして構築された26週間のサプライチェーン補充ベンチマークであるSTOCKTAKEを紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents are increasingly evaluated on multi-week decision tasks in which the state that drives cost is never directly observed. On such tasks the final cost cannot say why an agent failed: it may have misread the world, or read it correctly and still failed to act (the knowing-doing gap). Existing evaluations cannot separate these two failures; their reference policies either read privileged information the agent never sees, or are missing altogether. We introduce STOCKTAKE, a 26-week supply-chain replenishment benchmark built as a factored partially observable Markov decision process with six hidden factor processes, designed so that a fair reference policy is computable: an exact Bayes filter per factor drives a rollout policy on the identical observation stream the agent receives. Scoring each run between a symptom-blind base-stock floor (0) and this oracle (1) yields a skill score, and grading each week's written rationale yields a stated-belief detection lag and a knowing-doing rate, so state estimation and control are measured separately. On fifty seeds with curated stress profiles, Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro, and Grok 4.5 detect 84-88% of hidden failures, typically within a week of onset, yet span skill scores from 0.62 to -0.23: two of the four end below the symptom-blind floor while naming factors slightly faster than the two that beat it. The failure has two faces. Where stress persists, 34-43% of correctly diagnosed stress weeks still end in stockout for every model, a rate that partly reflects the severity of the weeks models notice. That rate also runs opposite to skill: the two models under the floor stock out least on diagnosed weeks, so under-response is only one face of the gap, and their traces point to the other, responses whose cost exceeds what they protect. STOCKTAKE measures both directions of that failure.
- Abstract(参考訳): LLMエージェントは、コストを駆動する状態が直接観察されない複数週間の意思決定タスクにおいて、ますます評価される。
そのようなタスクにおいて、最終コストは、エージェントが失敗した理由を言うことはできない。
既存の評価では、これらの2つの障害を分離することはできない。
STOCKTAKE(26週間のサプライチェーン補充ベンチマーク)は、6つの隠蔽因子プロセスで部分的に観測可能なマルコフ決定プロセスとして構築され、公正な参照ポリシーが計算可能であるように設計されている。
症状ブラインドベースストックフロア(0)とこのオラクル(1)の間の各走行を検査すると、スキルスコアが得られ、各週の書面の合理性を評価すると、所定検出ラグとノウハウ率が得られるので、状態推定と制御を別々に計測する。
クロード・ソネット5, GPT-5.4, DeepSeek-V4-Pro, Grok 4.5の50種の種子は、通常1週間以内に隠れた故障の84-88%を検知するが、スキルスコアは0.62から0.23にまで達する。
失敗には2つの顔があります。
ストレスが持続する場合、正しく診断されたストレス週間の34~43%は、すべてのモデルでまだ在庫切れ状態にある。
床の下にある2つのモデルは、診断された数週間で少なくとも在庫を減らしているので、アンダーレスポンスはギャップの1つの面に過ぎず、その痕跡は、コストが保護するものを超える応答を指し示している。
STOCKTAKEはその障害の両方向を測定する。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality [1.350933217151331]
FinalityBenchは、ファイナリティゲーティング決定のための実行可能なベンチマークである。
グラディングは実行された金銭的効果に基づいており、あるエピソードは商人の経済的な立場によって記録される。
権威的ファイナリティプローブ上の不可逆的なアクションをゲーティングするランタイムは85.4%に達し、全てのポーリングポリシーとは異なり、パス5には何も失われない。
論文 参考訳(メタデータ) (2026-09-04T04:24:10Z) - When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner's Guide [0.0]
5つのデータセットと2つの既知のエフェクトスイープにまたがる6つの推定器をベンチマークし、非シミュレートされたペア参照に対してそのメカニズムを検証する。
ターゲット自身のスコアからロガーをシャープすると、テスト対象範囲をわずかにオーバーラップし、アクションレベルの不一致が崩壊する。
結果のニュアンスのみを適合させることは、再利用バイアスをその場に残し、それを悪化させます。
論文 参考訳(メタデータ) (2026-08-12T18:10:10Z) - Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations [0.0]
3つのオープンエージェントトレースベンチマークで、エージェントのメインエフェクトが各データセットとチェックタイプにおける全分散の3%未満を占めていることを示す。
3つの推定器に適合する4面の一般化可能性理論の分散分解を通してこれを達成する。
これをデプロイ決定信頼性(DDR:Deployment Decision Reliability)という,分散コンポーネントテーブルを企業購入者が防御できる5つの決定に変換する,ワンページレポートの規律にパッケージ化します。
論文 参考訳(メタデータ) (2026-08-11T18:16:51Z) - Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No [2.531680975633497]
イベントを確実に認識するマルチモーダルLLMは、いつ発生したかはいまだに言えない。
この失敗はタスクインターフェースに存在し、知覚にはないことを示す。
論文 参考訳(メタデータ) (2026-08-08T19:57:47Z) - CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents [0.9924185669370708]
CLQTはクローズドループ取引の評価をランキングではなく診断として再設定する。
CLQTは、完全にクローズドループで、コストを意識し、戦略に一貫性があり、時間的に制限された環境である。
論文 参考訳(メタデータ) (2026-06-29T04:26:30Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - AgentFairBench: Do LLM Agents Discriminate When They Act? [2.3004655342211078]
AgentFairBenchは、LLMエージェントの動作における人口格差に対する、安価で再現可能なマルチドメインベンチマークである。
これは、雇用、貸与、医療トリアージという、規制対象の3つの領域にまたがっている。
NumPyのみのハーネスは、反ファクト的なフリップ率、平均絶対スコア差(MASD)、アクションレートの相違、ツール起動の相違を計算する。
論文 参考訳(メタデータ) (2026-06-15T13:50:26Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures [0.0]
Causal Agent Replay (CAR) は、エージェントが構造的因果モデルとして実行されることをモデル化する。
ステップにダブルオペレーションを適用し、同じポリシーの下で軌道を再実行します。
CARはオープンソースで、ホストまたはフリーのローカルモデルで動作する。
論文 参考訳(メタデータ) (2026-06-06T17:44:23Z) - When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation [9.055086193088083]
10大言語モデルによって駆動されるチェーン・オブ・シンクとReActエージェントに経験的現象を記述した。
平均的な摂動は、同等の厳しさのプレゼンテーション摂動よりも、最終的な答えを頻繁に変更する。
論文 参考訳(メタデータ) (2026-05-25T15:57:11Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - LLMs Can Get "Brain Rot"! [68.08198331505695]
ジャンクウェブテキストへの連続曝露は、大規模言語モデル(LLM)の持続的認知低下を誘導する
実Twitter/Xコーパスで制御された実験を行い、ジャンクと逆制御されたデータセットを構築します。
その結果、データ品質がLLM能力の崩壊の原因であることを示す重要な多視点的証拠が得られた。
論文 参考訳(メタデータ) (2025-10-15T13:28:49Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models [79.76293901420146]
大規模言語モデル(LLM)は、出力の信頼性が不可欠である様々な高い領域で採用されている。
本研究では,不確実性推定の脆弱性を調査し,攻撃の可能性を探る。
攻撃者がLSMにバックドアを埋め込むことができ、入力中の特定のトリガーによって起動されると、最終的な出力に影響を与えることなくモデルの不確実性を操作できることを示す。
論文 参考訳(メタデータ) (2024-07-15T23:41:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。