論文の概要: Predictive Memory Localization: Forecasting Selective Intervention Paths from Internal Signals
- arxiv url: http://arxiv.org/abs/2608.12892v2
- Date: Fri, 14 Aug 2026 12:31:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.220282
- Title: Predictive Memory Localization: Forecasting Selective Intervention Paths from Internal Signals
- Title(参考訳): 予測メモリローカライゼーション:内部信号からの選択的干渉経路の予測
- Authors: Jinhao Jing, Tian Zeyu, Lucas Qingyang Fang, Zhisheng Chen, Shuang Chen, Yuhao Luo, Qiannian Zhao,
- Abstract要約: 本稿では,PML(Predictive Memory Localization)を導入し,メモリローカライゼーションの予測対象として計測グリッド介入経路を取り扱う。
PMLは、ランダムキャリブレーションされた目標運動を、セマンティック近傍と能力的損傷から分離し、静的な局在化と教師あり幾何を、強度に相反する低線量因果応答と比較する。
3つの残留ノルムマッチングベースモデル全体で、学習方向は選択的パスゲインを保持し、低線量応答は0.801-0.828レコード保持マクロAUROCを生成する。
- 参考スコア(独自算出の注目度): 4.075831906880532
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Activation steering turns localized representations into control directions, but localization alone does not reveal whether a direction has a selective operating regime. We introduce Predictive Memory Localization (PML), which treats the measured-grid intervention path as the predictive object of memory localization. PML separates random-calibrated target movement from semantic-neighbor and capability damage, and compares static localization and supervised geometry with a strength-disjoint low-dose causal response. Our frozen study covers 3,000 records from nine datasets and fourteen domains, yielding 30,000 distinct record-direction-layer paths and 210,000 distinct path-strength evaluations. At layer 7, the geometry-derived RFM/AGOP direction reaches 13.1% target-any and 12.3% clean-any, exceeding random by 3.6 and 3.4 percentage points under a record-paired bootstrap. Across record-, dataset-, and domain-grouped splits, responses at $|α|=0.1$ are the strongest signal for outcomes at disjoint strengths $|α|\in\{0.25,0.5\}$. On held-out records, a predictor-driven selector chooses a coefficient or abstains, improves utility and reduces semantic-neighbor damage relative to a train-tuned fixed-strength policy, and avoids most evaluations in a dense scan. Across three residual-norm-matched base models, learned directions retain selective-path gains and low-dose responses yield 0.801-0.828 record-held-out macro AUROC. PML therefore turns memory localization into a falsifiable forecast of margin-level selective outcomes and a risk-aware intervention decision.
- Abstract(参考訳): 活性化ステアリングは、局所化表現を制御方向に変換するが、局所化だけでは、ある方向が選択的な操作状態を持っているかどうかを明らかにしない。
本稿では,PML(Predictive Memory Localization)を導入し,メモリローカライゼーションの予測対象として計測グリッド介入経路を取り扱う。
PMLは、ランダムキャリブレーションされた目標運動を、セマンティック近傍と能力的損傷から分離し、静的な局在化と教師あり幾何を、強度に相反する低線量因果応答と比較する。
凍結解析では、9つのデータセットと14のドメインから3000のレコードをカバーし、3万のレコード指向層パスと210,000のパス強度評価を得た。
層7では、幾何由来のRAM/AGOP方向が13.1%の目標値と12.3%のクリーン値に達し、無作為なブートストラップで3.6および3.4ポイントを超える。
レコード分割、データセット分割、ドメイングループ分割の合計で、|α|=0.1$の応答は、非結合強度が$|α|\in\{0.25,0.5\}$の結果にとって最強の信号である。
ホールドアウト記録では、予測器駆動のセレクタが係数またはアブスタンスを選択し、有効性を向上し、列車調整固定強度ポリシーに対するセマンティック隣りの損傷を低減し、高密度スキャンにおけるほとんどの評価を回避する。
3つの残留ノルムマッチングベースモデル全体で、学習方向は選択的パスゲインを保持し、低線量応答は0.801-0.828レコード保持マクロAUROCを生成する。
したがって、PMLはメモリローカライゼーションを、マージンレベルの選択的な結果とリスク対応の介入決定の偽りの予測に変換する。
関連論文リスト
- GeoID-PINN: Identifiability-Aware Regional Epidemic Inference with Geographic Coupling [1.0875426095207128]
本稿では,物理インフォームドニューラルネットワーク(PINN)を導入する。
我々は、距離、隣接性、通勤性、およびリードラグ情報から構築された空間先行を正規化する。
Forecast-Trained Geo-PINNは自己回帰的な負二項基底に対して、平均二乗誤差(MSE)を32,957から11,468、平均絶対誤差(MAE)を70.60から57.73に減少させる。
論文 参考訳(メタデータ) (2026-07-28T05:59:23Z) - How Useful is Causal Invariance for Domain Adaptation in Finite-Sample Settings? [58.740078141879984]
機械学習モデルは、トレーニングされたソースディストリビューションとは異なるターゲットディストリビューションにデプロイされると、しばしば劣化する。
因果関係に基づく領域一般化における最近の研究は、共用因果構造が不変な予測因子を誘導する方法を示している。
本稿では,完全あるいは部分的な因果知識が,教師付きドメイン適応を確実に改善できるかどうかについて検討する。
論文 参考訳(メタデータ) (2026-06-10T21:07:49Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Decision-Path Patterns as Tree Reliability Signals: Path-based Adaptive Weighting for Random Forest Classification [0.9607593117607193]
ランダムフォレストは、特徴空間の異なるランダム化された表現で各木を構築する。
彼らの一様投票は、誤った表現を持つ木が正しいものより多い地域では誤りを訂正できない。
本稿では,各木の決定経路の構造パターンをサンプルごとの信頼性信号として用いることを提案する。
論文 参考訳(メタデータ) (2026-05-20T05:15:09Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams [0.0]
有害な意図は、大きな言語モデル残ストリームから幾何的に回復可能である。
我々はこの幾何学を6つの方向決定戦略によって特徴づける。
AdvBenchはホールドアウトのHarmBenchとJailbreakBenchにAUROC 0.96で転送される。
論文 参考訳(メタデータ) (2026-04-20T23:02:37Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains [13.58151841630302]
本稿では,RAGにおける再ランク付けを合理的な選択手法で置き換える新しい方法であるMETEORAを提案する。
METEORAは、最先端の再評価手法よりも約50%少ないチャンクを使用しながら、生成精度を33.34%向上させる。
敵対的な設定では、METEORAはF1スコアを0.10から0.44に大幅に改善する。
論文 参考訳(メタデータ) (2025-05-21T20:57:16Z) - ROPO: Robust Preference Optimization for Large Language Models [59.10763211091664]
外部モデルの助けを借りずにノイズ耐性とノイズサンプルのフィルタリングを統合する反復アライメント手法を提案する。
Mistral-7BとLlama-2-7Bで広く使われている3つのデータセットの実験では、ROPOが既存の嗜好アライメント法を大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2024-04-05T13:58:51Z) - Divide and Contrast: Source-free Domain Adaptation via Adaptive
Contrastive Learning [122.62311703151215]
Divide and Contrast (DaC) は、それぞれの制限を回避しつつ、両方の世界の善良な端を接続することを目的としている。
DaCは、ターゲットデータをソースライクなサンプルとターゲット固有なサンプルに分割する。
さらに、ソースライクなドメインと、メモリバンクベースの最大平均離散性(MMD)損失を用いて、ターゲット固有のサンプルとを整合させて、分散ミスマッチを低減する。
論文 参考訳(メタデータ) (2022-11-12T09:21:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。