論文の概要: Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models
- arxiv url: http://arxiv.org/abs/2607.20436v1
- Date: Mon, 11 May 2026 13:44:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.160447
- Title: Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models
- Title(参考訳): ルーティングサブスペース: 微調整言語モデルにおける評価とデプロイのミスマッチの検証
- Abstract要約: 安全性評価は、テスト中に観察された振る舞いが通常の使用時の振る舞いを反映していると仮定することが多いが、微調整はこの仮定を破る可能性がある。
チェックポイントは評価スタイルのプロンプトで固定され、同じ動作は通常の使用プロンプトで持続する。
安定な内部サイトにおいて,その区別が符号化されているかどうかを検証し,パスパッチインフォームド中深度ウィンドウにおいて,ペアのアクティベーションコントラストに適合するアプローチを提案する。
- 参考スコア(独自算出の注目度): 0.6882042556551609
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Safety evaluations often assume that behavior observed during testing reflects behavior in ordinary use, but fine-tuning can break this assumption. A checkpoint can appear fixed under evaluation-style prompts while the same behavior persists under ordinary-use prompts. Output scores reveal this mismatch but do not locate it. We investigate whether the distinction is encoded in a stable internal site and introduce an approach that fits a paired activation contrast at a path-patching-informed mid-depth window, then modifies the resulting coordinate on held-out prompts. The intervention closes the evaluation-to-deployment gap in ten of twelve model--behavior settings (six of the eight settings with $n{\geq}120$ paired questions) across four full-matrix instruction-tuned model instances; a fifth model supports localization and edit-provenance checks, and deployment-framed rates change by at most $6.1$pp. The two flat cells, both sycophancy, indicate that a single-coordinate audit is not sufficient when the installed distinction is higher-rank or missed by the depth heuristic. The audit is a diagnostic for fine-tuned checkpoints, not a training-time defense or a guarantee of deployment safety.
- Abstract(参考訳): 安全性評価は、テスト中に観察された振る舞いが通常の使用時の振る舞いを反映していると仮定することが多いが、微調整はこの仮定を破る可能性がある。
チェックポイントは評価スタイルのプロンプトで固定され、同じ動作は通常の使用プロンプトで持続する。
アウトプットスコアは、このミスマッチを明らかにしますが、それを見つけることはできません。
安定な内部サイトにおいて,その区別が符号化されているかどうかを検証し,経路パッチインフォームド中深度ウィンドウにおいて,ペアのアクティベーションコントラストに適合するアプローチを導入し,ホールドアウトプロンプトの座標を修正した。
この介入は、12のモデルのうち10のモデル($n{\geq}120$ペア付き8つの設定のうち6つ)において、4つのフルマトリックス命令チューニングモデルインスタンスに対して評価とデプロイのギャップを埋める。
2つの扁平な細胞は、両者とも、インストールされた区別がより高い場合や深度ヒューリスティックによって欠落した場合、単一調整の監査が不十分であることを示している。
監査は微調整されたチェックポイントの診断であり、トレーニング時の防御やデプロイメントの安全性を保証するものではない。
関連論文リスト
- PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence [4.87376023514389]
この研究は、ポイントレベルの接地を学習する検証可能な強化学習フレームワークであるPointRLを提示する。
PointRLは、バウンディングボックス、マスク、インスタンスラベルをポインティング命令に変換し、ターゲットサポート、インスタンスメンバシップ、セット制約を保持する。
提案した報酬は、解析可能性、ポイント妥当性、インスタンスカバレッジ、濃度一貫性、冗長または欠落予測を評価する。
論文 参考訳(メタデータ) (2026-08-26T02:10:29Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models [3.3598755777055374]
ICS(Internal Compliance Score)は、10組のラベル付きペアからのトレーニング不要のアクティベーション読み出しであり、単一のプロジェクションで得点される。
この状態は、現在のコンプライアンス・ディテクターのクラスにまたがって失敗することを示し、これはルール・ブラインドネスと呼ばれる失敗である。
対策プロトコルとクロスルールベンチマークを公開し、将来の調査でルールの盲点をテストし、クレームを保護します。
論文 参考訳(メタデータ) (2026-08-17T17:37:07Z) - BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries [82.41764922522565]
BOUNDは、永続的な探索ドリフトのための短いガイド付き修正選好蒸留フレームワークである。
Trajectory SFT は Bamboogle で 5.6 EM 、BrowseComp-Plus で 4.8 の精度で上回っている。
論文 参考訳(メタデータ) (2026-08-09T15:32:16Z) - Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings [2.065887219290771]
CoT(Chain-of- Thought)モニタリングは、フロンティア推論モデルにとって重要な安全レイヤとして扱われる。
CoTモニタ評価の補完軸は暗黙的な影響設定であり、プロンプトには隠す命令がない。
2つの体制下でCoTの監視可能性を直接比較した最初のベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-08-05T11:59:20Z) - Probing the Misaligned Thinking Process of Language Models [32.29324298373053]
大規模な言語モデルは、様々な不整合行動を示す。
このような動作を確実に検出し、安全で責任のある使用を保証することが重要である。
微粒化認知プロセスに分解して誤認識を監視することを提案する。
論文 参考訳(メタデータ) (2026-06-23T07:40:28Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning [13.759856460598087]
創発的ミスアライメント(EM)は、モデルが微調整タスクの外で危険な振る舞いをするときに発生する。
標準的な訓練信号はこのシフトを見逃しかねず、繰り返しの行動評価に依存する場合、信頼性の高い検出にコストがかかる。
微調整中に内部表現から創発的不整合を検出することができるかどうかを問う。
論文 参考訳(メタデータ) (2026-05-31T04:28:21Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone [11.663456969895462]
機械学習におけるアライメント評価は、主にモデルの評価となっている。
本稿では, モデルレベルの評価だけでは, 配置関連アライメントを推定できないことを論じる。
論文 参考訳(メタデータ) (2026-05-06T03:28:30Z) - Agentic Control in Variational Language Models [0.0]
本研究では,変分言語モデルが,内的根拠に基づく最小かつ測定可能なエージェント制御をサポートできるかどうかを考察する。
本モデルでは, 局所変動隠蔽計算(EVE), ホメオスタティック潜伏制御器, 構造的に認識されたチェックポイント保持と, 保持モデル上で動作する校正不確実性認識コントローラを組み合わせる。
論文 参考訳(メタデータ) (2026-04-14T09:47:53Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation [0.0]
部分観測可能性下での統計的識別可能性のレンズによるアライメント評価について検討した。
我々は、アライメント検証可能性問題を定式化し、ノーマティブ識別可能性を導入する。
以上の結果から,行動ベンチマークは,評価意識下での遅延アライメントに必要だが不十分な証拠を提供することが示された。
論文 参考訳(メタデータ) (2026-02-05T13:40:56Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。