論文の概要: No Free Checker: A Survey of Verifiers for Robot Policies
- arxiv url: http://arxiv.org/abs/2609.09250v2
- Date: Sun, 13 Sep 2026 14:00:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.72349
- Title: No Free Checker: A Survey of Verifiers for Robot Policies
- Title(参考訳): No Free Checker: ロボットポリシー検証のサーベイ
- Abstract要約: ロボットポリシーの検証者は、候補者の行動を読み出し、それがいかにうまくいったかのスコアを返し、視覚言語アクションポリシーの評価とトレーニングの両方に使用する。
約150個の検証器を調査し、2つの特性について比較する。
我々は, 人的検証者, 規則に基づく形式的検証者, 学習および事前訓練された検証者, モデル固有の検証者など, 判断を提供する者によって, 検証者をグループ化する。
- 参考スコア(独自算出の注目度): 37.86049134524515
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A verifier for robot policies reads a candidate behavior and returns a score for how well it did, used both to evaluate vision-language-action policies and to train them. Verifiers range from success detectors and reward models to runtime monitors, safety filters, and temporal-logic specifications. We survey roughly 150 verifiers and compare them along two properties. Availability is how much a verdict costs, how early in a rollout the verdict arrives, and how often a verdict can be asked for. Availability rises as verdicts get cheaper, earlier, and denser. Credibility is how much a high score tells us about the task. Credibility falls as the judgment becomes gameable and self-serving. We group the verifiers by who supplies the judgment: human verifiers, rule-based and formal verifiers, learned and pretrained verifiers, and model-intrinsic verifiers. Across the four families, we find that credibility falls as availability rises. Regardless of who supplies the judgment, there is no free checker. We then examine what validates a verifier itself, and how much a high score tells us. Three measures appear in the literature: agreement with human labels, the performance of the policy it trains, and behavior under reward hacking. We close with nine metrics that make a verifier claim checkable, and coordinates for the verifiers still to be built.
- Abstract(参考訳): ロボットポリシーの検証者は、候補者の行動を読み出し、それがいかにうまくいったかのスコアを返し、視覚言語アクションポリシーの評価とトレーニングの両方に使用する。
検証対象は成功検知器と報酬モデルからランタイムモニタ、安全フィルタ、時間論理仕様まで様々である。
約150個の検証器を調査し、2つの特性について比較する。
可用性は、判断のコストの程度、判断のロールアウトの時期、判断が要求される頻度である。
評決がより安く、早く、より密集するにつれて、可用性は上昇する。
信頼性は、そのタスクについてどれだけ高いスコアが教えてくれるかです。
判断がゲーム可能で自己維持的になると、信頼性が低下する。
我々は, 人的検証者, 規則に基づく形式的検証者, 学習および事前訓練された検証者, モデル固有の検証者など, 判断を提供する者によって, 検証者をグループ化する。
4つのファミリーで、可用性が上昇すると信頼性が低下する。
誰が判決を下すかに関わらず、無料のチェッカーは存在しない。
次に、検証器自体の検証方法と、高いスコアがどのくらい教えてくれるかを調べます。
文献には、人間のラベルとの合意、それが訓練するポリシーのパフォーマンス、報酬ハッキングによる行動の3つの手段が記載されている。
検証者のクレームを検証可能にする9つのメトリクスと、検証者のコーディネートを構築する必要がある。
関連論文リスト
- LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails [0.0]
自己改善エージェントパイプラインは、その中心に問題がある。
評価信号は、判定バイアス、ハーネスとメートル法故障、地道エラー、報酬ハッキングの11のクラスで失敗した。
ProCTORは、ステートフルオーケストレータがすべてのツールアクセスを保持し、ステートレスサブエージェントが障害を診断し、それらが適用できないドラフト突然変異を診断する、教師と学生のループである。
論文 参考訳(メタデータ) (2026-09-02T07:54:23Z) - What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models [3.3598755777055374]
ICS(Internal Compliance Score)は、10組のラベル付きペアからのトレーニング不要のアクティベーション読み出しであり、単一のプロジェクションで得点される。
この状態は、現在のコンプライアンス・ディテクターのクラスにまたがって失敗することを示し、これはルール・ブラインドネスと呼ばれる失敗である。
対策プロトコルとクロスルールベンチマークを公開し、将来の調査でルールの盲点をテストし、クレームを保護します。
論文 参考訳(メタデータ) (2026-08-17T17:37:07Z) - Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - CrowdChecked: Detecting Previously Fact-Checked Claims in Social Media [19.688259030184508]
修正された自己適応学習に基づいてノイズの多いデータから学習するエンド・ツー・エンドのフレームワークを提案する。
CLEF'21 CheckThat!テストセットの実験では,2点の絶対値による技術状況の改善が示されている。
論文 参考訳(メタデータ) (2022-10-10T06:05:52Z) - Fact-Saboteurs: A Taxonomy of Evidence Manipulation Attacks against
Fact-Verification Systems [80.3811072650087]
証拠のクレームサレントスニペットを微調整し,多様かつクレームアラインな証拠を生成することが可能であることを示す。
この攻撃は、主張のポストホックな修正に対しても堅牢である。
これらの攻撃は、インスペクタブルとヒューマン・イン・ザ・ループの使用シナリオに有害な影響を及ぼす可能性がある。
論文 参考訳(メタデータ) (2022-09-07T13:39:24Z) - Claim Check-Worthiness Detection as Positive Unlabelled Learning [53.24606510691877]
クレームチェックの信頼性検出はファクトチェックシステムにおいて重要な要素である。
これらの課題の根底にあるクレームチェックの信頼性検出における中心的な課題を照明する。
我々の最良の手法は、正の非競合学習の変種を用いて、これを自動的に修正する統一的なアプローチである。
論文 参考訳(メタデータ) (2020-03-05T16:06:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。