論文の概要: When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation
- arxiv url: http://arxiv.org/abs/2608.14940v1
- Date: Fri, 14 Aug 2026 23:39:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.130754
- Title: When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation
- Title(参考訳): エージェントの評価はいつ終わるか? アウトカムファイナリティとクロスユニット分離
- Authors: Avyay M. Casheekar,
- Abstract要約: 現在のエージェントは、停止した実行の最後に見える状態のスコアモデルを評価し、試行錯誤とみなす。
最終的な結果としてスコアを解釈するには、エンドポイントが必ずしも確立しない2つの条件が必要である。
最終的なラベルは、請求結果がまだ変更可能なものが解決、境界づけられ、不確実性として保持されている場合にのみ正当化される、と私たちは主張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current agent evaluations score models on the state visible at the end of a stopped run which they count as one trial. However, interpreting the score as a final result would require two conditions that the endpoint does not itself necessarily establish: outcome finality and cross-unit separation. These conditions are independent, since reconciling a delayed outcome can settle the label while runs still share state and isolating runs can prevent carryover while the scored outcome remains unfinished. We develop a completion argument that specifies the evidence needed for each decision and argue that a final label is justified only when anything that could still change the claimed outcome is resolved, bounded, or retained as uncertainty. First, in a controlled replay to demonstrate the mechanism where an agent's actions were held fixed, we find that the endpoint and terminal labels differ for every delayed operation, while a delayed write changes the next run's score when service state persists between runs but not after isolation or verified reset. Second, in a review of ten public protocols, we find that all protocols identify when a run stops and what is scored, while unfinished operations and the evidence for treating runs as separate trials are documented less consistently. Finally, we propose an open-effects record that lists operations or resources that may remain relevant after the endpoint, their current status, and whether they could change the scored outcome or affect another run.
- Abstract(参考訳): 現在のエージェントは、停止した実行の最後に見える状態のスコアモデルを評価し、試行錯誤とみなす。
しかし、最終的な結果としてスコアを解釈するには、エンドポイントが必ずしも確立しない2つの条件が必要である。
これらの条件は独立しており、遅れた結果の調整はラベルを落ち着かせることができるが、実行は共有状態であり、分離された実行は、得られた結果が未完成のままである間、転送を防止することができる。
各決定に必要となる証拠を特定し、請求結果がまだ変更可能なものが解決されたり、境界づけられたり、不確実性として保持された場合のみ、最終ラベルが正当であると論じる完結論を発展させる。
まず、エージェントの動作が固定されたメカニズムを実証する制御されたリプレイにおいて、遅延操作毎にエンドポイントと端末ラベルが異なることが判明した。
第二に、10の公開プロトコルのレビューでは、すべてのプロトコルが実行が停止し、何が得点されたかを識別しているのに対して、未完了の操作や実行を別個のトライアルとして扱う証拠は、文書化されていない。
最後に、エンドポイントの後に関連性のある操作やリソースをリストアップするオープンエフェクトレコードを提案する。
関連論文リスト
- From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents [47.678562263387214]
研究エージェントは、産業レコメンデーション設定において、多段階の機械学習実験をますます実施している。
生成されたアーティファクトは、サポートされないか、不完全かもしれないし、実行されたラウンドは無効かもしれないし、あるいは廃止されるかもしれないし、後の修正は、以前の発見を曖昧にするかもしれない。
本稿では,連続的アーティファクトのバウンダリ検証と実行後のクレーム資格を結合するエビデンス・グラウンド・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:37:38Z) - ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision [0.0]
LLMエージェントの評価は、ベンチマークの実行が完了するずっと前にタスク結果を生成することが多い。
部分的なスコアは報告を誘惑するが、観察されたタスクが完了した評価と同じ結論を支持するかどうかは示さない。
本稿では,2つのエージェントシステムのペア化結果を読み取る決定層であるParEvalLayerと,事前に選択した比較ポリシを紹介する。
論文 参考訳(メタデータ) (2026-08-03T16:22:51Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents [14.988334585821939]
コーディングエージェントは、ほぼ完全に解決率でランク付けされる。
単一のパス/フェイルラベルは、なぜ実行が失敗したのか、なぜ承認された実行が追加のステップ、時間、トークンを費やしたのかについて何も述べていない。
TraceProbeは、リゾルフレートが隠すものを回復するトラジェクトリに依存しないフレームワークである。
論文 参考訳(メタデータ) (2026-07-07T12:09:46Z) - Verify-Gated Completion as Admission Control in a Governed Multi-Agent Runtime: A Bounded Architecture Case Study [0.6875312133832079]
制御されたマルチエージェントランタイムの入出力制御パターンとして,検証ゲート補完について検討する。
観測条件下では,読み取り専用検証ゲートとパケット化入力記録が検査可能で,フェールクロースされた。
論文 参考訳(メタデータ) (2026-05-18T07:52:13Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation [8.049844623361725]
インタラクティブエージェントベンチマークは、結果チェックを通じてエージェントの実行をバイナリ結果にマッピングする。
これらのチェックは、表面レベル信号に依存するか、エージェントの実際のアクションパスをキャプチャできない。
既存のベンチマークに対して、結果エビデンスレポート層を導入します。
論文 参考訳(メタデータ) (2026-05-11T12:20:15Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。