論文の概要: Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs
- arxiv url: http://arxiv.org/abs/2607.12985v1
- Date: Tue, 14 Jul 2026 17:28:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.235273
- Title: Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs
- Title(参考訳): レジストと更新: インセンティブ対応型LCMの非現実報告コーディネート
- Abstract要約: 非証拠的なインセンティブ・プレッシャーの下で、アライテッド言語モデルは頻繁に誤レポートされる。
本稿では, 事実報告仲介者の学習と認定を行う手法を提案する。
- 参考スコア(独自算出の注目度): 4.721990925113432
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aligned language models routinely misreport under non-evidential incentive pressure: they agree with a confident user or overstate certainty even when their internal belief is unchanged. We cast this as a failure of internal incentive-compatibility (IC) and present a method for learning and certifying counterfactual report mediators that hold a model's reports to a causal contract: invariant to forbidden influences (pressure, prestige, restyling) and responsive to licensed ones (genuine evidence). These two demands, resist and update, pull in opposite directions. We study them on a Bayesian-witness benchmark with known posteriors, in which the same user disagreement is licensed evidence or forbidden pressure purely by stated source reliability. We (i) causally identify, by interchange interventions rather than probe accuracy, low-rank report coordinates for answer, confidence, and caveat that are near-orthogonal and independently controllable, and (ii) introduce a training-free counterfactual report-coordinate (CRC) clamp that references the model's own report under a counterfactually incentive-neutralized context. On the witness benchmark the two-pass clamp attains resist and update of 1.00 jointly (Wilson 95% CI [0.99,1.00]), a causal certificate under a constructible reference, not a deployed solution. Global decoding and steering show a single-parameter tradeoff; output-level fine-tuning matches both objectives only when both are enumerated; resist-only training loses evidence-responsiveness. The deployable single-pass compilation is lossy (0.73/0.97). The mechanism and clamp reproduce across three model families and transfer to a natural sycophancy benchmark (SycophancyEval). Our contribution is the interface and certification method: activation-level counterfactual incentive-invariance as a structural primitive for internal IC.
- Abstract(参考訳): 言語モデルは、不確実なインセンティブのプレッシャーの下で定期的に誤報告される:彼らは、内部の信念が変わらない場合でも、自信のあるユーザーや過剰な確信に同意する。
我々は、これを内部インセンティブ・コンパチビリティ(IC)の失敗とみなし、モデルレポートを因果契約に保持する反事実報告仲介者を学習し、認定する手法として提示した。
これら2つの要求は、抵抗と更新、反対方向のプルである。
ベイジアン・ウィットネス・ベンチマーク(英語版)で調査し、同じユーザ不一致が証明されたり、ソース信頼性によって純粋に圧力を禁ずる。
我が家
一 調査精度よりむしろ相互干渉により、ほぼ直交的かつ独立的に制御可能な回答、信頼及び注意のための低ランク報告座標を因果的に識別すること。
(II)非実効性報告コーディネート(CRC)クランプを導入し、そのモデル自身のレポートを反実的インセンティブニュートラル化状況下で参照する。
証人ベンチマークでは、2パスのクランプが1.00の抵抗と更新を共同で達成する(Wilson 95% CI [0.99,1.00])。
グローバルデコーディングとステアリングは単一パラメータのトレードオフを示し、出力レベルの微調整は両方の目標が列挙された場合にのみ一致し、抵抗のみのトレーニングはエビデンス応答性を失う。
デプロイ可能なシングルパスコンパイルは損失(0.73/0.97)である。
この機構とクランプは3つのモデルファミリーにまたがって複製され、天然のサイコファンシーベンチマーク(SycophancyEval)に転送される。
我々の貢献は、内部ICの構造的プリミティブとしてのアクティベーションレベルの反ファクトインセンティブ不変性であるインタフェースと認証手法である。
関連論文リスト
- Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [66.44527094471619]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - Principled Detection of Coordinated Manipulation from Aggregate Distortion and Account Reuse [10.023638697449062]
調整可能なアカウントは、評価、ランキング、エンゲージメントを共同で歪めることができる。
我々は,文脈レベルの結果分布の歪みを主証拠として扱うアグリゲートファーストエビデンス層を導入する。
制御された回転実験とペアの対実的介入によるメカニズムを過去のAmazonレビューストリームで評価した。
論文 参考訳(メタデータ) (2026-09-11T18:16:42Z) - Repeated-Game Security for Restaking-Based Verifiable Inference [2.9661360665913574]
本論文は,1ラウンドスラッシング条件が同一の利害関係下での推論を繰り返すと,セキュリティを過小評価できることを示す。
本稿では,歴史に依存した課題,評価ヘビー級のスラッシュ,利得の優位性を組み合わせた展開可能なメカニズムを提案する。
論文 参考訳(メタデータ) (2026-08-10T03:03:56Z) - CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift [4.0604823050005345]
CausalNavは、特定状態座標上の署名付きアクション条件遷移グラフを中心に構築されたコントローラである。
CausalNavはデプロイメント時に、介入シーケンスの小さなライブラリをシミュレートし、客観的エラーをポリシ-ログアドバイスに変換する。
我々はCartPole-v1とPendulum-v1の9つの制御基線について評価した。
論文 参考訳(メタデータ) (2026-08-07T23:16:57Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation [0.0]
モデルが生成した統計量を検出する能力を持っているが、マルチソース合成においてこの能力を採用していないことを示す。
具体的には、ソースの影響は、解析テキストの分布レジスタに応答するが、数値の有効性には反応しない方法論登録ゲートによって制御される。
論文 参考訳(メタデータ) (2026-06-03T20:15:48Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents [0.0]
検索強化エージェントに対するメモリ中毒攻撃を,統合評価フレームワークを用いたStackelbergゲームとして定式化する。
ASR-R: 0.25〜1.00$) による攻撃成功度を4倍に向上させる。
私たちの主な貢献は、勾配結合に接地したキャリブレーションに基づく防御であるMEMSADである。
論文 参考訳(メタデータ) (2026-05-05T08:15:41Z) - Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models [53.279391576560755]
大規模言語モデル(LLM)は、広範囲のNLPタスクにおいて顕著な流速と汎用性を示してきたが、実際的な不正確さと制限が伴う傾向にある。
これは、信頼と妥当性が最優先される医療、法律、科学コミュニケーションといった、高リスク領域に重大なリスクをもたらす。
LLM出力の事実的信頼性と解釈可能性を高めるために設計されたDAVinCI - Dual Attribution and Verificationフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-04-23T01:37:50Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - Preregistered Belief Revision Contracts [2.28438857884398]
PBRC(Preregistered Belief Revision Contracts)は,オープン通信と許容可能な変更を分離するプロトコルレベルのメカニズムである。
PBRC契約は、ファーストオーダーのエビデンストリガー、許容可能なリビジョンオペレータ、優先ルール、フォールバックポリシーを公に修正する。
本報告では,信頼軌道と正準化された監査トレースを保存したPBRC正規形式を,監査可能なトリガープロトコルで認めていることを示す。
論文 参考訳(メタデータ) (2026-04-16T22:22:54Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Toward Faithful Segmentation Attribution via Benchmarking and Dual-Evidence Fusion [4.726028690278432]
本稿では、Pascal VOC上で、介入に基づく忠実度、ターゲット外リーク、実行時、再現可能なベンチマークを提案する。
本稿では、地域レベルの干渉信号と証拠を融合させる軽量な補正であるDual-Evidence Attribution(DEA)を提案する。
論文 参考訳(メタデータ) (2026-03-23T22:52:00Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z) - Explicit Tradeoffs between Adversarial and Natural Distributional
Robustness [48.44639585732391]
実際、モデルは信頼性を確保するために両方のタイプの堅牢さを享受する必要があります。
本研究では, 対角線と自然分布の強靭性の間には, 明らかなトレードオフが存在することを示す。
論文 参考訳(メタデータ) (2022-09-15T19:58:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。