論文の概要: Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents
- arxiv url: http://arxiv.org/abs/2605.08747v3
- Date: Thu, 14 May 2026 03:36:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 15:19:49.855892
- Title: Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents
- Title(参考訳): 独身エージェントの自傷行為から世界完結を遠ざける(動画あり)
- Abstract要約: VIGILは、端末のコミットメントを独立して測定できる評価フレームワークである。
VIGILのデフォルトプロトコルでは、エージェントはエゴセントリックなRGBのみを観察し、アクション・サクセス・シグナルを受信せず、各エピソードは、隠された世界状態に対して決定論的にチェックされたセマンティック・レポートで終了しなければならない。
これにより、ワールドステートコンプリート(W)とベンチマーク成功(B)の2つのスコアが得られます。
- 参考スコア(独自算出の注目度): 11.233308795768465
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Standard embodied evaluations do not independently score whether an agent correctly commits to task completion at episode closure, a capacity we call terminal commitment. Behaviorally distinct failures--never completing the task, completing it but failing to stop, and reporting success without sufficient evidence--collapse into the same benchmark failure. We introduce VIGIL, an evaluation framework that makes terminal commitment independently measurable. Under VIGIL's default protocol, agents observe only egocentric RGB, receive no action-success signals, and must end each episode with a semantic report checked deterministically against hidden world state. This yields two separate scores: world-state completion (W) and benchmark success (B), where B additionally requires a correct terminal report. This decoupling makes four outcome categories distinguishable: missed execution, post-attainment drift, unsupported commitment, and verified success. Across 20 models on 1,000 frozen episodes, systems with comparable W differ by up to 19.7 pp in B: one model converts achieved states into correct reports, while another with near-identical execution drifts past the goal without closing. An action-feedback intervention further tests the separation: execution-oriented signals improve W broadly, yet commitment failures persist in models that do not already ground terminal reports in the achieved state. VIGIL provides a protocol that makes terminal commitment independently visible and scorable.
- Abstract(参考訳): 標準実施評価は、エージェントがエピソード終了時にタスク完了を正しくコミットするかどうかを独立してスコア付けしない。
動作的に異なる失敗 — タスクを完了し、完了せず、停止せず、十分な証拠のない成功を報告する — は、同じベンチマーク失敗に崩壊する。
本稿では,端末のコミットメントを独立に測定可能な評価フレームワークであるVIGILを紹介する。
VIGILのデフォルトプロトコルでは、エージェントはエゴセントリックなRGBのみを観察し、アクション・サクセス・シグナルを受信せず、各エピソードは、隠された世界状態に対して決定論的にチェックされたセマンティック・レポートで終了しなければならない。
これにより、世界状態完了(W)とベンチマーク成功(B)の2つのスコアが得られる。
この分離は、実行の欠如、完了後のドリフト、約束の約束、そして検証された成功の4つの結果カテゴリを区別できる。
1つのモデルでは達成した状態を正しいレポートに変換し、もう1つのモデルでは終了せずにほぼ同一の実行がゴールを越えてドリフトする。
アクションフィードバックの介入は分離をさらにテストする: 実行指向の信号はWを広範囲に改善するが、完了した状態の端末レポートを根拠にしていないモデルではコミットメントの失敗は継続する。
VIGILは、端末のコミットメントを独立して可視化し、装飾可能にするプロトコルを提供する。
関連論文リスト
- IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier [0.0]
監査された18のベンチマークはすべて、広告付きモデルの識別子をスコア付けする。
ゴールドブラインド機能バインディングプレフライトは、どのタスクが到達する前に、ルートが評価契約を実行可能であることを確認する。
信頼性非包括的なファーストパススコアリングルールは、有効性を保ちながらスコアの失敗を維持する。
論文 参考訳(メタデータ) (2026-09-09T17:31:29Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents [16.24087700490158]
大規模言語モデルエージェントは、自律ループとしてますますデプロイされる。
これは実装の詳細ではなく、構成の失敗であることを示す。
LoopHarnessは、ループレベルでの永続的非遅延安全状態を復元する。
論文 参考訳(メタデータ) (2026-08-27T13:52:31Z) - ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices [48.36933831982682]
我々はADEPTS機能フレームワークを基盤とした信頼性ベンチマークであるADeptS-Benchを紹介する。
Safetyストリームは、視覚インターフェースに埋め込まれた脅威を伴うペアの良心/悪意のあるタスクを提供する。
曖昧さストリームは、意図が曖昧である場合、エージェントが明確化を求めるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-25T23:21:57Z) - Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol [3.202978695204522]
言語モデルエージェントは、失敗後に改善したり、成功と見なすものを再検討することなく、エピソード間でテキストを運ぶことができる。
CMB-0.1を12例,腕4例で検討した。
モデルトライアルが5つの条件すべてを満たすことはないが、このゼロは一般能力の欠如を証明していない。
論文 参考訳(メタデータ) (2026-08-21T04:21:28Z) - When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation [0.0]
現在のエージェントは、停止した実行の最後に見える状態のスコアモデルを評価し、試行錯誤とみなす。
最終的な結果としてスコアを解釈するには、エンドポイントが必ずしも確立しない2つの条件が必要である。
最終的なラベルは、請求結果がまだ変更可能なものが解決、境界づけられ、不確実性として保持されている場合にのみ正当化される、と私たちは主張する。
論文 参考訳(メタデータ) (2026-08-14T23:39:47Z) - Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems [0.815557531820863]
Onto-EV-WMは、EV-WMの上に重ねられた診断および検証-ゲート補正インタフェースである。
Onto-EV-WMは8,526のタスクで成功し、スイートレベルの成功率はLIBERO-10で65.98%、LIBERO-Goalで91.39%、LIBERO-ObjectとLIBERO-Spatialで91.38%であった。
論文 参考訳(メタデータ) (2026-08-14T03:13:57Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents [58.49879338545782]
ロングホライゾンタスクは、現実のロボット展開では一般的なものだが、そのようなタスクの障害検出は未調査のままである。
動作条件付き世界モデルからの潜在表現を用いて、操作軌跡をモニタする故障検出フレームワークであるForesightを提案する。
この結果から, 動作条件付きワールドモデル埋め込みは, 長距離操作における信頼性のある故障監視のためのスケーラブルな表現を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-06-22T09:32:28Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents [2.3488056916440856]
既存のベンチマークでは、エージェントがタスクが不明確かどうかを無視して、パイプラインが動作しているかどうかをスコア付けしている。
本稿では,予測対象曖昧さと評価対象曖昧さの2つの診断スイートであるAmbig-DSを紹介する。
すべてのタスクに対して、元の完全に指定されたバージョンと、コントロールされた編集によって生成されるあいまいなバリエーションをペアにします。
論文 参考訳(メタデータ) (2026-05-10T18:34:12Z) - Reconstructive Authority Model: Runtime Execution Validity Under Partial Observability [0.4929694290403903]
認証された状態の予測は必要であるが、実行の有効性には十分でないことを示す。
本稿では,リコンストラクティブ・オーソリティ・モデル(RAM)を紹介する。
特権不足を伴うハイブリッドRAM+Attestationアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-04-24T13:19:27Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - Toward Faithful Segmentation Attribution via Benchmarking and Dual-Evidence Fusion [4.726028690278432]
本稿では、Pascal VOC上で、介入に基づく忠実度、ターゲット外リーク、実行時、再現可能なベンチマークを提案する。
本稿では、地域レベルの干渉信号と証拠を融合させる軽量な補正であるDual-Evidence Attribution(DEA)を提案する。
論文 参考訳(メタデータ) (2026-03-23T22:52:00Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks [0.38991526486631006]
信頼性障害の多くは、タスクの潜在解構造からのドリフトに起因するものであり、能力障害ではない、と我々は主張する。
我々は、モデル能力と作業難易度を維持できる自然実験を用いて、これを因果的に確立する。
論文 参考訳(メタデータ) (2026-02-22T02:37:57Z) - OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence [0.0]
本稿では,防衛インシデント対応エージェントの評価を行う,二重制御強化学習環境であるOpenSecを紹介する。
静的な能力ベンチマークとは異なり、OpenSecは敵のエビデンスの下で世界状態を変える封じ込めアクションをスコアする。
GPT-5.2、Gemini 3、DeepSeekは100%のエピソードを90-97%の偽陽性率で封じ込めている。
論文 参考訳(メタデータ) (2026-01-28T22:12:54Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。