論文の概要: Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs
- arxiv url: http://arxiv.org/abs/2607.12985v2
- Date: Tue, 21 Jul 2026 08:33:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.099556
- Title: Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs
- Title(参考訳): レジストと更新: インセンティブ対応型LCMの非現実報告コーディネート
- Abstract要約: 修飾言語モデルは、非証拠的な圧力下で定期的に誤レポートされる。
我々は2つの要求を調査し、抵抗(不当な圧力)と更新(認可された証拠をフォロー)する。
低ランクレポートのコーディネートを慎重にローカライズして,回答,信頼,注意を喚起する。
- 参考スコア(独自算出の注目度): 4.721990925113432
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aligned language models routinely misreport under non-evidential pressure: they cave to a confident user, yet fail to revise when genuine evidence arrives. We cast this as a failure of internal incentive-compatibility and study the two demands, resist (ignore forbidden pressure) and update (follow licensed evidence), on a Bayesian-witness benchmark with known posteriors, where the same user disagreement is evidence or pressure purely by stated source reliability, removing the evidence/pressure confound by construction. Using interchange interventions rather than probes, we causally localize low-rank report coordinates for answer, confidence, and caveat, establishing causal sufficiency at a late intervention site rather than uniqueness or necessity, with a causal cross-talk matrix showing strong own-coordinate control and only small cross-effects (partial functional disentanglement). We then introduce a training-free counterfactual report-coordinate (CRC) clamp that references the model's own report under an incentive-neutralized counterfactual of the prompt. The two-pass full-window clamp attains resist and update of $1.00$ jointly (Wilson 95% CI $[0.99,1.00]$; the rank-16 projection alone reaches $0.88/0.90$), which we read as a causal certificate and upper bound under a constructible reference, not a claim of a deployed solution. Tested global decoding and fixed-direction steering trade one objective against the other, and resist-only training collapses updating to $0.01$. The deployable single-pass compilation is lossy ($0.73/0.97$). The mechanism and the clamp reproduce across three model families and transfer to a natural sycophancy benchmark with significant paired improvements. Our contribution is the interface and certification method: activation-level counterfactual incentive-invariance as a structural primitive for internal incentive-compatibility.
- Abstract(参考訳): 無関係な言語モデルは、不確実な圧力の下で定期的に誤報告される:彼らは自信のあるユーザーを悩ませるが、真正な証拠が届いたときに修正を怠る。
我々は、これを内部のインセンティブ適合性の失敗とみなし、2つの要求、抵抗(無視された圧力)、および更新(認可された証拠)、既知の後部を持つベイズウィットネスベンチマークにおいて、同じユーザ不一致は、記述されたソース信頼性によって純粋にエビデンスまたはプレッシャーであり、建設によるエビデンス/プレッシャの混同を除去する。
プローブではなくインターチェンジ介入を用いて,回答,信頼,注意のための低ランクレポート座標を因果的に局所化し,独自性や必然性よりも遅延介入部位に因果補充性を確立し,強い自己調整制御と小さな相互効果(部分機能的不整合)のみを示す因果的クロストーク行列を用いて検討した。
次に、インセンティブに中立化されたインセンティブに基づいて、モデル自体のレポートを参照する訓練不要な対応報告コーディネート(CRC)クランプを導入する。
2パスフルウィンドウのクランプは1.00ドル(Wilson 95% CI $[0.99,1.00]$; rank-16プロジェクションだけで0.88/0.90$)のレジストと更新を達成します。
テストされたグローバルデコーディングと固定方向ステアリングの取引は、一方が他方に対して目標であり、抵抗のみのトレーニングは0.01ドルに更新される。
デプロイ可能なシングルパスコンパイルは損失(0.73/0.97$)である。
機構とクランプは3つのモデルファミリーにまたがって再現され、ペアの大幅な改善を施した天然の薬効ベンチマークに転送される。
我々の貢献は、内部インセンティブ適合性のための構造的プリミティブとしてのアクティベーションレベルの反ファクトインセンティブ不変性であるインタフェースと認定方法である。
関連論文リスト
- Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [66.44527094471619]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - Principled Detection of Coordinated Manipulation from Aggregate Distortion and Account Reuse [10.023638697449062]
調整可能なアカウントは、評価、ランキング、エンゲージメントを共同で歪めることができる。
我々は,文脈レベルの結果分布の歪みを主証拠として扱うアグリゲートファーストエビデンス層を導入する。
制御された回転実験とペアの対実的介入によるメカニズムを過去のAmazonレビューストリームで評価した。
論文 参考訳(メタデータ) (2026-09-11T18:16:42Z) - Repeated-Game Security for Restaking-Based Verifiable Inference [2.9661360665913574]
本論文は,1ラウンドスラッシング条件が同一の利害関係下での推論を繰り返すと,セキュリティを過小評価できることを示す。
本稿では,歴史に依存した課題,評価ヘビー級のスラッシュ,利得の優位性を組み合わせた展開可能なメカニズムを提案する。
論文 参考訳(メタデータ) (2026-08-10T03:03:56Z) - CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift [4.0604823050005345]
CausalNavは、特定状態座標上の署名付きアクション条件遷移グラフを中心に構築されたコントローラである。
CausalNavはデプロイメント時に、介入シーケンスの小さなライブラリをシミュレートし、客観的エラーをポリシ-ログアドバイスに変換する。
我々はCartPole-v1とPendulum-v1の9つの制御基線について評価した。
論文 参考訳(メタデータ) (2026-08-07T23:16:57Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation [0.0]
モデルが生成した統計量を検出する能力を持っているが、マルチソース合成においてこの能力を採用していないことを示す。
具体的には、ソースの影響は、解析テキストの分布レジスタに応答するが、数値の有効性には反応しない方法論登録ゲートによって制御される。
論文 参考訳(メタデータ) (2026-06-03T20:15:48Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents [0.0]
検索強化エージェントに対するメモリ中毒攻撃を,統合評価フレームワークを用いたStackelbergゲームとして定式化する。
ASR-R: 0.25〜1.00$) による攻撃成功度を4倍に向上させる。
私たちの主な貢献は、勾配結合に接地したキャリブレーションに基づく防御であるMEMSADである。
論文 参考訳(メタデータ) (2026-05-05T08:15:41Z) - Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models [53.279391576560755]
大規模言語モデル(LLM)は、広範囲のNLPタスクにおいて顕著な流速と汎用性を示してきたが、実際的な不正確さと制限が伴う傾向にある。
これは、信頼と妥当性が最優先される医療、法律、科学コミュニケーションといった、高リスク領域に重大なリスクをもたらす。
LLM出力の事実的信頼性と解釈可能性を高めるために設計されたDAVinCI - Dual Attribution and Verificationフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-04-23T01:37:50Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - Preregistered Belief Revision Contracts [2.28438857884398]
PBRC(Preregistered Belief Revision Contracts)は,オープン通信と許容可能な変更を分離するプロトコルレベルのメカニズムである。
PBRC契約は、ファーストオーダーのエビデンストリガー、許容可能なリビジョンオペレータ、優先ルール、フォールバックポリシーを公に修正する。
本報告では,信頼軌道と正準化された監査トレースを保存したPBRC正規形式を,監査可能なトリガープロトコルで認めていることを示す。
論文 参考訳(メタデータ) (2026-04-16T22:22:54Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Toward Faithful Segmentation Attribution via Benchmarking and Dual-Evidence Fusion [4.726028690278432]
本稿では、Pascal VOC上で、介入に基づく忠実度、ターゲット外リーク、実行時、再現可能なベンチマークを提案する。
本稿では、地域レベルの干渉信号と証拠を融合させる軽量な補正であるDual-Evidence Attribution(DEA)を提案する。
論文 参考訳(メタデータ) (2026-03-23T22:52:00Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z) - Explicit Tradeoffs between Adversarial and Natural Distributional
Robustness [48.44639585732391]
実際、モデルは信頼性を確保するために両方のタイプの堅牢さを享受する必要があります。
本研究では, 対角線と自然分布の強靭性の間には, 明らかなトレードオフが存在することを示す。
論文 参考訳(メタデータ) (2022-09-15T19:58:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。