論文の概要: Learning Only What Valid Adapters Can Express: Subspace-Constrained Adaptation Against Fine-Tuning Poisoning
- arxiv url: http://arxiv.org/abs/2607.05300v1
- Date: Mon, 06 Jul 2026 16:43:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.242914
- Title: Learning Only What Valid Adapters Can Express: Subspace-Constrained Adaptation Against Fine-Tuning Poisoning
- Title(参考訳): 適応者が表現できるもののみを学ぶ:細調整中毒に対するサブスペース制約付き適応
- Abstract要約: 既存のタスクアダプタの信頼できるプールから推定される部分空間への適応。
Flan-t5-large with 196 public LoRA adapters, we show that the relevant content of an adapter is lies in a low-dimensional shared subspace。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Parameter-efficient fine-tuning still leaves a broad space of behavior-changing updates reachable, so a poisoned objective can be represented and optimized. We study an alternative: adaptation constrained to the subspace estimated from a trusted pool of existing task adapters. On flan-t5-large with 196 public LoRA adapters, we show that (1) the functionally relevant content of an adapter lies in a low-dimensional shared subspace, 30 to 38 percent of its weight norm being redundant under the evaluated task distributions; (2) gradient adaptation restricted to 128 coordinates on this subspace matches full LoRA fine-tuning on clean classification data, while under targeted label inversion LoRA collapses to 3-26 percent exact match and the constrained learner keeps 62-96 percent on the tasks the pool covers; (3) the constrained learner cannot fit corrupted data, its adaptation loss separating clean from garbage by two orders of magnitude (120x), an out-of-distribution signal without an extra detector; and (4) against an adaptive backdoor attacker who optimizes within the subspace, the attack is blocked (8 percent success versus 100 for LoRA) on the task where its target behavior is unlike anything in the pool, and only partially blocked (85 percent) when the target coincides with a common pool behavior. On these two tasks the outcome is consistent with how close the target is to the pool's directions, which suggests but does not establish a pool-relative boundary. The mechanism trades peak plasticity for these properties: on tasks the pool covers poorly, unconstrained fine-tuning wins, and the protection assumes the pool itself is trusted. Code and data are public.
- Abstract(参考訳): パラメータ効率のよい微調整は、行動を変える更新の広いスペースを到達可能であるため、有毒な目的を表現し、最適化することができる。
既存のタスクアダプタの信頼できるプールから推定される部分空間に制約された適応について検討する。
一般のLoRAアダプタ196個のFlan-t5-largeでは,(1)低次元共有部分空間に適応するアダプタの機能的関連コンテンツ,(2) 評価されたタスク分布下では冗長なウェイトノルムの30~38%,(2) このサブスペース上での勾配適応は128個の座標に制限される クリーンな分類データにマッチする。
この2つのタスクでは、目標がプールの向きにどの程度近いかは一致しているが、プール相対境界は確立していない。
このメカニズムは、これらの特性に対して最大可塑性を交換する: タスクでは、プールは貧弱で、制約のない微調整の勝利をカバーし、保護はプール自体が信頼されていると仮定する。
コードとデータは公開されています。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset [8.27333944529512]
本稿では,都市規模屋外環境における自律型UAVナビゲーションのためのLLM-Agent-Based Path Finder (LAPF) フレームワークを提案する。
LAPFは認識、記憶、計画、行動モジュールをクローズドループ認知アーキテクチャに統合することでLLM支援ナビゲーションを拡張している。
LAPFは512.83mと506.37mの平均経路長を、497.33mの直線最適化と比較する。
論文 参考訳(メタデータ) (2026-08-15T11:28:21Z) - Capacity Confounds and Coverage Guarantees in Adaptive Sub-model Federated Learning [5.586191108738563]
サブモデルフェデレーション学習により、リソース制約のあるクライアントは、グローバルモデルの幅制限されたバージョンをトレーニングできるが、既存のメソッドはデバイスリソース単独でキャパシティを割り当てる。
適応型キャパシティアロケーションフレームワークであるHAS-FLをテストケースとして使用して、このステップが可能かどうかを問う。
論文 参考訳(メタデータ) (2026-08-07T12:26:03Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers [0.0]
デプロイされた安全分類器における分散シフトのオンラインモニタリングシステムを提案する。
検出後、共形吸収層は、目標誤差を回復する決定に適応する。
このシステムは平均遅延39.5800ステップで86.6%の検知を実現している。
論文 参考訳(メタデータ) (2026-06-10T11:24:25Z) - CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing [5.661334639541121]
CRANEは、シンキング・インストラクトデルタを、インストラクトバックボーンの候補推論編集のプールとして扱う、トレーニング不要なパラメータ編集手法である。
ペア化されたインストラクトとシンキングのチェックポイントを組み合わせることで、CRANEはどちらのモデルよりも強力なゲインを提供する。
論文 参考訳(メタデータ) (2026-05-13T20:09:35Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z) - LAW & ORDER: Adaptive Spatial Weighting for Medical Diffusion and Segmentation [3.6879658915311997]
Learnable Adaptive Weighter (LAW) は拡散訓練のための特徴とマスクから画素当たりの損失変調を予測する。
ORDERは、効率的なセグメンテーションのために、遅延デコーダ段階で選択的双方向スキップ注意を適用する。
ポリープおよび腎腫瘍データセットの実験により、LAWは20%のFID産生改善を達成することが示された。
論文 参考訳(メタデータ) (2026-03-05T04:20:32Z) - Resolving Primitive-Sharing Ambiguity in Long-Tailed Industrial Point Cloud Segmentation via Spatial Context Constraints [9.6402526621774]
リデューサやバルブなどの安全クリティカルなコンポーネントは、体系的に誤って分類される。
この研究は、工業用3Dデータに特有の2つの危機を、極端に不均衡な215:1比で特定する。
本研究では,局所的な類似構造を曖昧にするために,近傍の予測整合性を利用する空間的文脈制約を提案する。
論文 参考訳(メタデータ) (2026-01-27T02:52:28Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - G$^2$uardFL: Safeguarding Federated Learning Against Backdoor Attacks
through Attributed Client Graph Clustering [116.4277292854053]
Federated Learning (FL)は、データ共有なしで協調的なモデルトレーニングを提供する。
FLはバックドア攻撃に弱いため、有害なモデル重みがシステムの整合性を損なう。
本稿では、悪意のあるクライアントの識別を属性グラフクラスタリング問題として再解釈する保護フレームワークであるG$2$uardFLを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:15:04Z) - AdaptGuard: Defending Against Universal Attacks for Model Adaptation [129.2012687550069]
モデル適応アルゴリズムにおいて、ソースドメインから転送されるユニバーサルアタックに対する脆弱性について検討する。
本稿では,モデル適応アルゴリズムの安全性を向上させるために,AdaptGuardというモデル前処理フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-19T07:53:31Z) - Lifelong Unsupervised Domain Adaptive Person Re-identification with
Coordinated Anti-forgetting and Adaptation [127.6168183074427]
本稿では,LUDA (Lifelong Unsupervised Domain Adaptive) という新たなタスクを提案する。
これは、モデルがターゲット環境のラベル付けされていないデータに継続的に適応する必要があるため、難しい。
我々は、CLUDA-ReIDと呼ばれるこのタスクのための効果的なスキームを設計し、そこでは、アンチフォージェッティングが適応と調和して調整される。
論文 参考訳(メタデータ) (2021-12-13T13:19:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。