論文の概要: Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
- arxiv url: http://arxiv.org/abs/2607.20379v1
- Date: Wed, 22 Jul 2026 17:10:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.164205
- Title: Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
- Title(参考訳): モデルのトレーニング - アクティベーションの説明を検証するためのDeodability Supervision
- Abstract要約: テストは2つの方法でパスされますが、忠実ではありません。
リリースされた Qwen-2.5-7B では、説明はチャンスよりもはるかに早く再構築されている。
AI安全性のために、RECAPは指定された内部コンテンツを独立してチェック可能にする。
- 参考スコア(独自算出の注目度): 0.11280931253550518
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Natural-language autoencoders score explanations of hidden activations by reconstruction: an explanation is deemed faithful if the activation can be regenerated from it. The test is structurally insensitive to individual false claims: if flipping a claim does not change the reconstruction, the claim is never penalized. We show the test is passed in two ways, neither faithful. On a released Qwen-2.5-7B verbalizer, explanations reconstruct well above chance while ~2% of specific claims are reconstruction-dependent, so the score tracks gist, not specific facts. Under exact synthetic ground truth, the standard recipe develops co-adapted private codes (false wording the reconstruction depends on) in 5/5 runs, and fixes that leave the target model unchanged do not help. We contribute two audit protocols, the grounded-vs-true cross and the evaluator swap, and RECAP (Readable Encodings via Co-trained Auxiliary Predictors): linear heads trained alongside the target model to keep designated content decodable. On RECAP-trained sandbox models, fresh verbalizers state the designated content truly and the codes vanish, at a +0.001-nat cost. This replicates on a pretrained Pythia-160M: the content becomes reliably probe-decodable, though a fresh verbalizer conveys it only in part (truth 0.44-0.46 vs a near-zero control). For interpretability, high reconstruction does not certify individual claims. For AI safety, RECAP makes designated internal content independently checkable against probes rather than asserted by prose a model can game: an independent probe scores the verbalizer's true claims above its false ones (AUC 0.96, vs 0.82 without RECAP). Against an adversary that edits an explanation to maximize the reconstruction score while lying (suppressing ~87% of its lie penalty), the RECAP probe still flags the lies (AUC 0.95) while the control probe collapses to chance (0.51).
- Abstract(参考訳): 自然言語のオートエンコーダは、リコンストラクションによって隠れたアクティベーションの説明をスコア付けする: アクティベーションが再生可能ならば、説明は忠実であるとみなされる。
クレームをひっくり返すことでリコンストラクションが変更されない場合、クレームはペナルティ化されない。
テストは2つの方法でパスされますが、忠実ではありません。
リリースされたQwen-2.5-7Bでは、特定のクレームの約2%が再構成に依存しているのに対して、説明はチャンスよりもはるかに高く再構成されているため、スコアは特定の事実ではなくジストを追跡している。
正確な合成基盤の真理の下で、標準レシピは5/5ランで、共適応されたプライベートコード(リコンストラクションが依存する言葉)を開発し、ターゲットモデルをそのまま残す修正は役に立たない。
我々は2つの監査プロトコル、グラウンドドvs-true Cross と評価器スワップ、RECAP (Readable Encodings via Co-trained Auxiliary Predictor) をコントリビュートする。
RECAPで訓練されたサンドボックスモデルでは、新鮮な動詞化者が指定した内容を真に記述し、符号は+0.001ナットのコストで消滅する。
これは、事前訓練されたPythia-160Mに複製される: 内容物は確実に探傷可能になるが、新鮮な動詞化器は部分的にのみ伝達する(真実 0.44-0.46 対 ほぼゼロ制御)。
解釈可能性について、高い再現性は個々のクレームを証明しない。
AIの安全性のために、RECAPは、モデルがゲームできると主張されるのではなく、特定の内部コンテンツに対して独立してチェックできるようにする:独立したプローブは、その偽のコンテンツ(AUC 0.96, vs 0.82, RECAPなし)よりも、動詞の真のクレームをスコアする。
嘘をついでに再現スコアを最大化するために説明を編集する敵に対して、RECAPプローブは依然として嘘を宣言する(AUC 0.95)一方で、制御プローブは偶然に崩壊する(0.51)。
関連論文リスト
- Reversibility-Verified De-identification for Cloud-Local LLM Inference: A Locally Certified Dehydrate-Rehydrate Loop with Layered Assurance (DR-SL) [1.802678437602184]
DR-SL (Dehydrate-Rehydrate with Self-Learning loop) は、脱同定完全性を2つの測定可能な条件として定式化する。
完全局所二分岐検証器は、終了が保証されたレキソグラフィゲートの下で脱水を繰り返す。
ファノ型の低い境界、フグの目撃者、そしてレート・プライバシ・フィージビリティの基準を証明し、その範囲を明確化します。
論文 参考訳(メタデータ) (2026-09-14T01:04:58Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol [3.202978695204522]
言語モデルエージェントは、失敗後に改善したり、成功と見なすものを再検討することなく、エピソード間でテキストを運ぶことができる。
CMB-0.1を12例,腕4例で検討した。
モデルトライアルが5つの条件すべてを満たすことはないが、このゼロは一般能力の欠如を証明していない。
論文 参考訳(メタデータ) (2026-08-21T04:21:28Z) - Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models [4.1626636325601405]
我々の防衛はデコイの硬化であり、拒絶の帯を譲り受け、その支払いを毒する。
5つのファミリー(9B-122B、高密度と混合)から7つのモデルでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-17T23:26:32Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs [4.721990925113432]
修飾言語モデルは、非証拠的な圧力下で定期的に誤レポートされる。
我々は2つの要求を調査し、抵抗(不当な圧力)と更新(認可された証拠をフォロー)する。
低ランクレポートのコーディネートを慎重にローカライズして,回答,信頼,注意を喚起する。
論文 参考訳(メタデータ) (2026-07-14T17:28:25Z) - Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric [0.0]
ベンダーニュートラルでランナブルな計器は、評価妥当性の指標として再構成可能性を示すものはない。
本稿では,8つの意思決定クラスに対する特性レベルの再構成可能性指標を提案する。
論文 参考訳(メタデータ) (2026-07-14T07:54:37Z) - LatentRevise: Learning from Zero-Hit Reasoning [46.1536368072511]
検証可能な報酬を伴う強化学習は、正しい軌道の確率が低いハードプロンプトによってボトルネックされる。
我々は、RLVRのサンプリングフロンティアのようなゼロヒットプロンプトをフレーム化します。
本稿では,このゼロヒット方式のトレーニング信号を復元する1次遅延修正手法であるLatentReviseを紹介する。
論文 参考訳(メタデータ) (2026-06-29T08:14:47Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Probing for Knowledge Attribution in Large Language Models [45.47366023067617]
大規模言語モデル(LLM)は、しばしば流動的だが根拠のないクレームや幻覚を生成する。
適切な緩和は、モデルの答えがプロンプトまたは内部の重みに基づいているかどうかを知ることに依存する。
モデル隠れ表現に基づいて訓練された単純な線形分類器であるプローブは、帰納的帰属を確実に予測できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:21:12Z) - IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking [67.20568716300272]
Reinforcement Learning from Human Feedback (RLHF)は強力なLDMアライメントを実現するが、報酬ハッキングを導入することができる。
IR3(Interpretable Reward Reconstruction and Rectification)は,RLHFモデルを用いた暗黙的目標をリバースエンジニアリングし,解釈し,外科的に修復するフレームワークである。
我々は、IR3が地道報酬と0.89の相関を達成し、90%以上の精度でハッキング機能を識別し、元のモデルの3%以内の機能を維持しながら、ハッキングの挙動を著しく低減することを示した。
論文 参考訳(メタデータ) (2026-02-23T01:14:53Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation [12.503662455234954]
現代の言語モデルでは、誤った回答が破滅的な結果をもたらす場合でも、自信ある幻覚が生じることを示す。
RLVR(Reinforceed Hesitation)は,2進法ではなく3進法を用いた強化学習(Reinforcement Learning from Verifiable Rewards, RLVR)の修正である。
論文 参考訳(メタデータ) (2025-11-14T17:20:45Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Contrastive Learning to Improve Retrieval for Real-world Fact Checking [84.57583869042791]
ファクト・チェッキング・リランカ(Contrastive Fact-Checking Reranker, CFR)を提案する。
我々はAVeriTeCデータセットを活用し、証拠文書からの人間による回答とクレームのサブクエストを注釈付けする。
データセットの精度は6%向上した。
論文 参考訳(メタデータ) (2024-10-07T00:09:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。