論文の概要: Backdoor Mitigation in Decentralized LLM Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.37367v1
- Date: Tue, 29 Sep 2026 12:25:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.481117
- Title: Backdoor Mitigation in Decentralized LLM Fine-Tuning
- Title(参考訳): 分散LDMファインチューニングにおけるバックドア緩和
- Abstract要約: 大規模言語モデル(LLM)の微調整により、中央コーディネータを使わずに、共有LLMをプールできないデータで協調的にトレーニングすることができる。
これは隠れた振る舞いであり、モデルが正常にクリーンな入力で実行するが、アタッカー・チョウン出力を生成することができる。
1つのノードが自身のモデルに毒を塗ると、毒を塗った例を見たことのないノードのアダプタをバックドアで使用でき、シークレットトリガーを含むプロンプトを拒否できることを示す。
これは各ノードがアグリゲーションの前に隣人からバックドアアダプタを検出して拒否することのできる分散メカニズムである。
- 参考スコア(独自算出の注目度): 8.79766075691136
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decentralized large language model (LLM) fine-tuning lets organizations collaboratively train a shared LLM on data they cannot pool, without a central coordinator. In every round, each node exchanges a trainable adapter with its neighbors over a communication graph, and then aggregates them. This setting, however, is vulnerable to propagated backdoors, which is a hidden behavior that lets a model perform normally on clean inputs but produce an attacker-chosen output whenever a secret trigger appears. We show that a single node poisoning its own model can backdoor adapters of nodes that have never seen a poisoned example, making them refuse prompts that contain a secret trigger. We present Chorus, a decentralized mechanism that lets each node detect and reject backdoored adapters from its neighbors before aggregation, without requiring shared validation data or any knowledge of the attacker's trigger or target. Chorus judges each adapter by its behavior, using the receiver's own adapter as a trusted reference. Crucially, no node in Chorus judges adapters alone: the receivers of each adapter update probe it independently, pool their findings in the neighborhood, and vote to make a decision. So a backdoor that slips past one receiver is still caught by the others. We evaluate the effectiveness of Chorus using two instruction-tuning datasets and LLM architectures, and against a state-of-the-art baseline. Chorus cuts the average attack success rate (ASR) of the attacker's neighbors from 48-63% to at most 2.2%, within 0.6 percentage points of an omniscient oracle that knows the exact malicious nodes. Even the worst-affected honest node never exceeds 10% ASR, the same bound as the oracle, against up to 78% without defense. This all comes at a negligible communication overhead.
- Abstract(参考訳): 分散型大規模言語モデル(LLM)の微調整により、中央コーディネータを使わずに、共有LLMをプールできないデータで協調的にトレーニングすることができる。
各ラウンドにおいて、各ノードは通信グラフ上で隣人と訓練可能なアダプタを交換し、それらを集約する。
これは隠れた振る舞いであり、モデルが正常にクリーンな入力で実行するが、シークレットトリガーが現れるたびにアタッカー・チョーゼン出力を生成する。
1つのノードが自身のモデルに毒を塗ると、毒を塗った例を見たことのないノードのアダプタをバックドアで使用でき、シークレットトリガーを含むプロンプトを拒否できることを示す。
これは、各ノードがアグリゲーション前に隣人からバックドアアダプタを検出して拒否できる分散型メカニズムで、共有バリデーションデータや攻撃者のトリガーやターゲットに関する知識を必要としない。
Chorusは、レシーバ自身のアダプタを信頼できる参照として使用して、それぞれのアダプタの動作を判断する。
重要なことに、Chorusのノードは、アダプタのみを判断する。各アダプタの受信側は、個別にそれを調査し、その発見を近所に集め、決定を下す。
だから、片方の受信機を抜けるバックドアは、もう片方の受信機に引っかかる。
2つの命令チューニングデータセットとLLMアーキテクチャを用いて、Chorusの有効性を評価し、最先端のベースラインに対して評価する。
コーラスは攻撃者の隣人の平均攻撃成功率(ASR)を48-63%から2.2%に減らし、正確な悪意のあるノードを知っており、その0.6ポイント以内である。
最悪の影響を受けた正直なノードでさえ、オラクルと同じ境界である10%のASRを、防御なしで78%まで越えることはない。
これらはすべて、無視できる通信オーバーヘッドにあります。
関連論文リスト
- Your Neighbors Know: Leveraging Local Neighborhoods for Backdoor Detection in Decentralized Learning [11.324089946683204]
分散学習(DL)に固有の新しいバックドア検出フレームワークArgusを紹介する。
Argusでは、正直なノードが受信したモデル更新をローカルに分析し、潜在的バックドアトリガーを特定する。
その結果,Argusは攻撃成功率を90ポイントまで下げることができた。
論文 参考訳(メタデータ) (2026-05-19T15:17:01Z) - Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models [74.1970982768771]
確立されたデータポゾンパイプラインは,MDLMにバックドアを埋め込むことに成功した。
拡散自己浄化(Diffusion Self-Purification)と呼ばれるMDLMのバックドア防御フレームワークについて紹介する。
論文 参考訳(メタデータ) (2026-02-24T15:47:52Z) - Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation Models [62.87838888016534]
Graph Foundation Models(GFM)は、さまざまなソースドメインで事前トレーニングされ、目に見えないターゲットに適応する。
GFMに対するバックドア攻撃は、3つの主要な課題のために簡単ではない。
グラフ基礎モデルに対する新たなバックドア攻撃モデルであるGFM-BAを提案する。
論文 参考訳(メタデータ) (2025-11-22T08:52:09Z) - Attack-in-the-Chain: Bootstrapping Large Language Models for Attacks Against Black-box Neural Ranking Models [111.58315434849047]
本稿では,アタック・イン・ザ・チェーン(Attack-in-the-Chain)という新しいランキングアタックフレームワークを紹介する。
大型言語モデル(LLMs)とニューラルランキングモデル(NRMs)の相互作用をチェーン・オブ・ソートに基づいて追跡する。
2つのWeb検索ベンチマークによる実験結果から,本手法の有効性が示された。
論文 参考訳(メタデータ) (2024-12-25T04:03:09Z) - FLARE: Toward Universal Dataset Purification against Backdoor Attacks [16.97677097266535]
ディープニューラルネットワーク(DNN)は、バックドア攻撃の影響を受けやすい。
隠れたバックドアを埋め込むために、敵に特定されたトリガーを持つ敵の毒のデータセット。
各種バックドア攻撃に対する汎用的浄化法であるFLAREを提案する。
論文 参考訳(メタデータ) (2024-11-29T05:34:21Z) - Graph Agent Network: Empowering Nodes with Inference Capabilities for Adversarial Resilience [50.460555688927826]
グラフニューラルネットワーク(GNN)の脆弱性に対処するグラフエージェントネットワーク(GAgN)を提案する。
GAgNはグラフ構造化エージェントネットワークであり、各ノードは1-hop-viewエージェントとして設計されている。
エージェントの限られたビューは、悪意のあるメッセージがGAgNでグローバルに伝播するのを防ぎ、グローバル最適化ベースのセカンダリアタックに抵抗する。
論文 参考訳(メタデータ) (2023-06-12T07:27:31Z) - G$^2$uardFL: Safeguarding Federated Learning Against Backdoor Attacks
through Attributed Client Graph Clustering [116.4277292854053]
Federated Learning (FL)は、データ共有なしで協調的なモデルトレーニングを提供する。
FLはバックドア攻撃に弱いため、有害なモデル重みがシステムの整合性を損なう。
本稿では、悪意のあるクライアントの識別を属性グラフクラスタリング問題として再解釈する保護フレームワークであるG$2$uardFLを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:15:04Z) - Jamming Attacks on Decentralized Federated Learning in General Multi-Hop
Wireless Networks [3.509171590450989]
我々は、ジャマーを用いてノード間のモデル交換を防止する効果的な攻撃について検討する。
無線ネットワークで発生した攻撃を妨害することにより,DFLの性能を大幅に低下させることができることを示す。
論文 参考訳(メタデータ) (2023-01-12T19:03:05Z) - Trap and Replace: Defending Backdoor Attacks by Trapping Them into an
Easy-to-Replace Subnetwork [105.0735256031911]
ディープニューラルネットワーク(DNN)は、バックドア攻撃に対して脆弱である。
本研究は,バックドアの有害な影響を除去しやすくする,新たなバックドア防衛戦略を提案する。
我々は10種類のバックドア攻撃に対して本手法を評価した。
論文 参考訳(メタデータ) (2022-10-12T17:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。