論文の概要: A Low Grounding Score Is Not an Ungrounded Judge: Identifying the Perceptibility Confound in Multimodal Oversight
- arxiv url: http://arxiv.org/abs/2610.00111v1
- Date: Wed, 09 Sep 2026 05:55:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.372333
- Title: A Low Grounding Score Is Not an Ungrounded Judge: Identifying the Perceptibility Confound in Multimodal Oversight
- Title(参考訳): ローグラウンドスコアは、無地裁判員ではない:マルチモーダル監視における認識の難しさを識別する
- Abstract要約: 画像側の反事実スコアを単独で報告すべきでないことを示す。
画像上の検出プローブが上部にバウンドし、その誤報を認証し、実行に余分な費用がかからない。
- 参考スコア(独自算出の注目度): 0.8594140167290097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model judges now supervise multimodal systems at scale, filtering training data, selecting outputs, and supplying the reward that shapes multimodal reasoning models. Trusting one means first checking that it uses its evidence, and that check is itself worth scrutinizing, so we ask whether a counterfactual probe of visual grounding measures what it claims to. The probe edits the image so the ground truth flips, holds the reasoning trace fixed, and asks whether the verdict follows. We formalize it as the Verdict Grounding Score and show it cannot be read the way such scores are read. A verdict responds only to an edit that reaches the judge's decision-relevant reading, so the score is capped by how perceptible the edit is, and unless editing makes the attribute easier to read, the error is one-sided: the score can only make a judge look less grounded than it is. The practical failure is therefore a false alarm, an auditor discarding a usable overseer. Under assumptions we state, we show this missing quantity is not merely bounded but identified from three quantities the same audit protocol already collects, which makes the false-alarm rate directly measurable rather than merely a concern. Auditing nine judges, we find the predicted ordering holds strictly across our entire primary pool, and the typical judge there acts on only about half of the edits whose attribute it can otherwise resolve. Applying a conservative rejection threshold certifies several cells as false alarms outright, the clearest being a judge that detects the injected error essentially every time while still scoring as if it had not used the image at all. The rule that follows is that an image-side counterfactual score should never be reported alone: a detection probe on the unedited image upper-bounds it, certifies its false alarms, and costs nothing extra to run.
- Abstract(参考訳): モデル審査員は、大規模なマルチモーダルシステムを監督し、トレーニングデータをフィルタリングし、出力を選択し、マルチモーダル推論モデルを形成する報酬を提供する。
信頼できるということは、まずその証拠を使い、そのチェック自体を精査する価値があることを意味している。
プローブは画像を編集し、地平線が反転し、推論トレースを固定し、判定が従うかどうかを問う。
我々は、このスコアをVerdict Grounding Scoreとして定式化し、そのようなスコアの読み方では読めないことを示す。
評決は、審査員の判断関連読解に到達した編集にのみ反応するので、そのスコアは、編集がどの程度認識可能かによって制限される。
したがって、実際の失敗は誤報であり、監査役は使用可能な監督官を捨てる。
仮定では、この欠落量は単に有界であるだけでなく、同じ監査プロトコルが既に集めている3つの量から特定されていることを示す。
9人の審査員から判断すると、予測された順序は一次プール全体にわたって厳格に保持され、典型的な審査員は、その属性が解決できる編集の約半分でしか機能しない。
保守的な拒絶しきい値を適用することで、複数の細胞を誤報として直接認証することができる。最も明確なのは、画像が全く使われていないかのようにスコアを付けながら、基本的には挿入されたエラーを検出する裁判官である。
下記のルールは、画像側の反事実スコアは、単独で報告すべきではない、ということだ。未編集画像上の検出プローブは、それを上からバウンドし、誤報を認証し、実行に余分な費用をかからない。
関連論文リスト
- Learning Strategies to Break Judges [14.254472131009654]
本稿では,解釈可能な障害機構を公開するエージェント判断器の弱点を見つけるためのエージェント誘導手法を提案する。
GPT-5.6-solとClaude Opus 5にメソッドをデプロイし、エージェントオーケストレータ、Codex、Claude Codeと組み合わせる。
すべてのエージェント・ジャッジにおいて、一貫して評価をバイパスする突然変異戦略を蒸留できることがわかりました。
論文 参考訳(メタデータ) (2026-09-27T17:13:52Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails [0.0]
自己改善エージェントパイプラインは、その中心に問題がある。
評価信号は、判定バイアス、ハーネスとメートル法故障、地道エラー、報酬ハッキングの11のクラスで失敗した。
ProCTORは、ステートフルオーケストレータがすべてのツールアクセスを保持し、ステートレスサブエージェントが障害を診断し、それらが適用できないドラフト突然変異を診断する、教師と学生のループである。
論文 参考訳(メタデータ) (2026-09-02T07:54:23Z) - Commit-first LLM judging inherits the judge's own errors [0.0]
LLMジャッジは、他のシステムの出力をスコアするモデルであり、彼らがスコアするシステムによってゲームをすることができる。
裁判官は最初にタスクを解決し、その答えにコミットし、2つが一致した場合のみ候補者を受け入れる。
これをコミットファースト判断と呼び、出荷されたソフトウェアがそれを実装しているかどうか、そのコストについて尋ねます。
論文 参考訳(メタデータ) (2026-08-31T12:14:14Z) - Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization [9.9751102700286]
テキスト空間スキル最適化は、自然言語スキルドキュメントを進化させ、検証ゲートを介して各候補を受け入れることで凍結エージェントに適応する。
審査員をループに配置する前に、そのスコアが不正な回答とは全く違うかどうかを判断できますか?
我々は、基準のない裁判官を潜在問題解決者として定式化し、その評決は、その結論と一致しているので、評価する能力は解決する能力によって制限される。
我々は、もし能力が床の近くにあり、その上に使用可能な場合、偶然に差別性を見出す。
論文 参考訳(メタデータ) (2026-08-19T09:19:23Z) - What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models [3.3598755777055374]
ICS(Internal Compliance Score)は、10組のラベル付きペアからのトレーニング不要のアクティベーション読み出しであり、単一のプロジェクションで得点される。
この状態は、現在のコンプライアンス・ディテクターのクラスにまたがって失敗することを示し、これはルール・ブラインドネスと呼ばれる失敗である。
対策プロトコルとクロスルールベンチマークを公開し、将来の調査でルールの盲点をテストし、クレームを保護します。
論文 参考訳(メタデータ) (2026-08-17T17:37:07Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - The Decisive Power of Indecision: Low-Variance Risk-Limiting Audits and Election Contestation via Marginal Mark Recording [51.82772358241505]
リスクリミット監査(リスクリミット監査、RLA)は、大規模な選挙の結果を検証する技術である。
我々は、効率を改善し、統計力の進歩を提供する監査の新たなファミリーを定めている。
新しい監査は、複数の可能なマーク解釈を宣言できるように、キャストボイトレコードの標準概念を再考することで実現される。
論文 参考訳(メタデータ) (2024-02-09T16:23:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。