論文の概要: Not Self-Decidable: LLMs Cannot Draw the Boundary of What an Agent Verifier Can Check
- arxiv url: http://arxiv.org/abs/2610.04699v1
- Date: Sat, 03 Oct 2026 18:25:12 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:25:25.54869
- Title: Not Self-Decidable: LLMs Cannot Draw the Boundary of What an Agent Verifier Can Check
- Title(参考訳): 自己決定不能: LLMはエージェント検証者がチェックできる境界線を引けない
- Abstract要約: エージェントの検証者は、固定チェックが解決できるものと、裁判官を必要とするものとの2種類のルールに直面します。
CoVerは全会一致を指名として扱い、そのために合成されたチェックが介入を生き残る場合にのみ述語を認める。
自己決定性はモデルから引き出す能力ではなく、検証者が構築しなければならない境界である。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: A verifier for an agent faces rules of two kinds: the ones a fixed check can settle and the ones that require a judge. A team that derives its own checks fixes that split up front. Where the requirements come from outside, as in finance, healthcare and law, the agent enforces rules it did not write, so the split falls to runtime, recurring for every predicate of every rule on every action at a rate no reviewer can audit. Every escalation scheme assumes a model can make that decision itself, that it is self-decidable. Across six corpora, including the EU AI Act, FINRA guidance and a deployed credit agent, we collect roughly 22,000 labels from four models built by three labs. They agree almost perfectly where the answer is obvious and collapse on regulatory text; their errors run in opposite directions, so no model can be trusted as the conservative choice; and on the deployed agent's own rule-set they err together, over-claiming that a fixed check will do, the direction that never gets escalated. We introduce CoVer (corroborate-then-verify), which treats unanimity as a nomination, admitting a predicate only when the check synthesized for it survives intervention, reading fields the agent cannot write and holding under deterministic rewording. That gate rejects most of what corroboration wrongly admits, at a cost in coverage we report rather than tune away. The obvious alternative, agreement with a reference judge, certifies nothing: it climbs from 30% to 77% across calibration bands while the genuinely decidable share does not move, because a judge drawn from the population under indictment ratifies the blind spot it shares. Self-decidability is not a capability to elicit from a model but a boundary the verifier must construct.
- Abstract(参考訳): エージェントの検証者は、固定チェックが解決できるものと、審査を必要とするものとの2種類のルールに直面します。
独自のチェックを導き、前もって分割するチーム。
金融、医療、法律のように外部から要求が出ている場合、エージェントは書かなかった規則を強制するので、分裂は実行時まで続き、レビュアーが監査できない速度で全ての規則の述語を繰り返す。
すべてのエスカレーションスキームは、モデルがその決定そのものを自己決定可能であると仮定する。
EU AI Act、FINRAガイダンス、デプロイされたクレジットエージェントを含む6つのコーパスで、3つのラボが構築した4つのモデルから約22,000のラベルを収集しました。
そして、デプロイされたエージェント自身のルールセットでは、固定チェックが実行され、決してエスカレートされない方向を過度に宣言する。
提案するCoVer (corroborate-then-verify) は,一様性を候補として扱い,チェックが介入を継続した場合のみ述語を付与し,エージェントが記述できないフィールドを読み,決定論的リワードの下で保持する。
このゲートは、私たちが報告する範囲のコストで、不正に認めたことの大部分を拒否します。
明らかな代替案として、基準判事との合意は、何も証明していない:それはキャリブレーション・バンド全体で30%から77%まで上昇するが、真に決定可能なシェアは動かない。
自己決定性はモデルから引き出す能力ではなく、検証者が構築しなければならない境界である。
関連論文リスト
- CART: Closed-Loop Adaptive Red Teaming for Large Language Models [91.66397227953821]
CART(Closed-Loop Adaptive Red Teaming)は、各結果を使用して、次にテストするものをガイドするフレームワークである。
テストを生成するChallengeと、テスト中のTarget、テキストのみのモデルや境界ツール使用エージェント、結果を評価するJuiceを分離する。
論文 参考訳(メタデータ) (2026-09-23T04:16:46Z) - Why LLM Agents Collapse Without Oversight: The Enforcement Gap as the Mechanism Behind Emergence World Failures [19.162716475205308]
リフレクションスタイルのエージェントで監査フラグをバインドすると、監査官を変更することなく、攻撃の成功率が大幅に低下する。
実行確率から検出確率を分離する$p_d$$$p_e$は、すべてのフレームワークでデフォルトで$p_e approx 0$を確立する。
論文 参考訳(メタデータ) (2026-09-14T09:46:59Z) - AUDITA: certified auditing and causal attribution of adverse outcomes in autonomous multi-agent systems [6.628624625332095]
AUDITAは、段階的な因果帰属エンジンと、すべてのエージェント間コマンドのタンパー・エビデント・レコードをペアリングする監査層である。
これにより、標準審査基準の責任エラーをおよそ3倍に減らす。
ライブ言語モデルパイプラインでは、標準判断基準の責任エラーをおよそ3倍に削減する。
論文 参考訳(メタデータ) (2026-08-23T01:22:09Z) - Sharding Prevents LLM Oversight Failures and Adversarial Exploitation [45.380649793616705]
シャーディングは要求を小さなグループに分割し、各グループを別の呼び出しに割り当て、評決を集約する。
シャードの弱い裁判官は、より有能な総合的な裁判官よりも優れており、後者がパネルの全予算を受け取ったとしても、その裁判官と一致することができる。
論文 参考訳(メタデータ) (2026-08-05T18:21:21Z) - CrossAudit: A Git-Native, Cross-Vendor Audit Loop for Agentic Science [5.610929955077264]
CrossAuditは、自律的な研究パイプラインを監督するためのプロトコルである。
それぞれのインクリメントは、異なるベンダーのエージェントによって、人間が書いたりバージョン付けされたルールブックに対して監査される。
報告、評決、論争、裁定はgitコミットであり、監督履歴を再読して引用することができる。
論文 参考訳(メタデータ) (2026-08-05T12:35:59Z) - Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation [38.06569764716213]
我々は,Emphbudget-Constrained confidence-scheduled limited response (CS-RNR)を導入する。
CS-RNRは、安全保証がエージェントが実際に展開する戦略に基づいて計算する証明書である最初の相手探索方式である。
論文 参考訳(メタデータ) (2026-07-30T16:57:57Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents [32.5466552510287]
漏れは累積的であり、個々に無害な放出は、正直だが、真正に曲がりくねった流しに蓄積される。
我々は、秘密に対する敵の信念がどれほど改善するかを予算化するランタイム仲介者であるOCELOTを提示する。
OCELOTは高いタスクユーティリティでのリークを著しく低減し、適応注入、ジェイルブレイク、累積推論、シンク共謀に抵抗する。
論文 参考訳(メタデータ) (2026-06-10T17:13:35Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。