論文の概要: What Response Marginals Miss: Adaptive Query Complexity of Functional Backdoor Recovery
- arxiv url: http://arxiv.org/abs/2610.07771v1
- Date: Tue, 06 Oct 2026 05:06:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.820662
- Title: What Response Marginals Miss: Adaptive Query Complexity of Functional Backdoor Recovery
- Title(参考訳): バックドアリカバリにおけるアダプティブクエリの複雑さ
- Abstract要約: 機能的なバックドアリカバリは、植えられたトリガを回復するよりも、攻撃成功率が少なくとも所定の閾値であるトリガを見つける。
予測されたクラスラベルを返すラベルフィードバックの下で,このタスクに必要なクエリの最小数について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Functional backdoor recovery finds any trigger whose attack success rate is at least a given threshold rather than to recover the planted trigger. We study the minimum number of queries required for this task under label feedback which returns the predicted class label. We construct two finite families of victim models that have exactly the same attack success rate for every victim and trigger candidate. The distribution of returned labels for every query is also identical under a uniformly chosen victim. These families form an explicit counterexample that despite the matched quantities, their optimal adaptive query complexities are \(Θ(\log H)\) and \(Θ(H)\) where \(H\) is the number of possible victims. The difference arises because the same non-target labels are associated with different sets of victims, so successive queries eliminate possible victims at different rates. This separation disappears when the response is reduced to binary feedback, which reports only whether the target label is returned. The separation also persists for every fixed failure probability below one. Finally, we realize the same recovery problems with trained CIFAR-10 ResNet-18 classifiers and verify the predicted optimal query budgets. These results show that attack success rate and the distribution of returned labels for each query are insufficient to determine the query complexity of functional backdoor recovery.
- Abstract(参考訳): 機能的なバックドアリカバリは、植えられたトリガを回復するよりも、攻撃成功率が少なくとも所定の閾値であるトリガを見つける。
予測されたクラスラベルを返すラベルフィードバックの下で,このタスクに必要なクエリの最小数について検討する。
被害者の攻撃成功率とトリガー候補が全く同じである2種類の被害者モデルを構築した。
クエリ毎に返されるラベルの配布も、均一に選択された犠牲者の下で同じである。
これらの族は、一致した量にもかかわらず、最適適応的なクエリ複雑度は \(\log H)\) と \(\(H)\) であり、そこで \(H\) は犠牲者の数である、という明示的な反例を形成する。
この違いは、同じターゲットではないラベルが異なる犠牲者のセットと関連付けられているため、連続的なクエリにより、異なるレートで被害者を排除できるためである。
この分離は、応答がバイナリフィードバックに還元されたときに消え、ターゲットラベルが返されるかどうかのみ報告される。
分離はまた、1以下の固定失敗確率に対して持続する。
最後に、トレーニングされたCIFAR-10 ResNet-18分類器で同じリカバリ問題を実現し、予測された最適なクエリ予算を検証する。
これらの結果から,各クエリに対する攻撃成功率と返却ラベルの分布は,機能的バックドアリカバリのクエリ複雑性を決定するのに不十分であることが示唆された。
関連論文リスト
- TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety [24.920876389236373]
安全に整合した大規模言語モデル(LLM)は、しばしば有害な要求を拒否するが、同じ目標が複数のターンにまたがると従う。
選好目標は、単一のプロンプトに対する全応答をスコアするので、トレーニングの損失だけでは、目に見えない歴史のリスクをコントロールできない。
我々の分析は、教師付き単一ターンコンテキストにおける抑制が多ターン軌道リスクに束縛される十分な条件を与える。
論文 参考訳(メタデータ) (2026-10-01T08:49:41Z) - Learning from the Gap Between Pass@K and Pass@1 [5.390994765967647]
本研究では,各クエリが検索なしで1つの応答を受信する単一サンプル復号法について検討し,検索対象の振る舞いをモデルに吸収できるかどうかを問う。
既存のトレーニング後レシピは、Kサンプル内で回収された障害から、最初のデコードで既に解決されている問題を一般的に区別するものではない。
本稿では、ソースチェックポイントの単一サンプル結果とPass@K-Pass@1ギャップ上の微調整によってトレーニングエビデンスを選択するGapFTを紹介する。
論文 参考訳(メタデータ) (2026-09-17T04:34:33Z) - Client-Side Probing of Deleted Ridge Statistics in Federated Unlearning [8.170162585703787]
Federated Unlearningは、共有モデルからクライアントのデータを取り除き、スクラッチからリトレーニングすることを目的としている。
いくつかの効率的なシステムは、訓練機能のコンパクトで付加的な要約を格納することで、削除を正確にする。
これらの放送は、隠れた要約を明らかにすることもできる。
論文 参考訳(メタデータ) (2026-09-03T20:59:09Z) - What Would Fix This RAG Failure? Auditing Counterfactual Response with Paired Evidence Interventions [0.0]
我々はPair-IDを紹介した。Pair-IDは1つのクエリ、検索状態、読み取り定数を格納し、次に2つの操作を横断する。
19,981のベンチマーククエリで11,105のQwen障害が特定され、SHA-256オーダーが1200を選択して、サンプリングされた応答を生成する。
その結果,ハッシュ選択された有資格障害サンプルにおいて有意な速度でエビデンスが発生し,観察された故障から部分的に予測可能であり,読者に条件付きであることが示唆された。
論文 参考訳(メタデータ) (2026-08-09T22:43:27Z) - Relational Response Fields: A General Theory of Black-Box LLM Response Consistency and Recovery [0.0]
ブラックボックス言語モデルの信頼性は、サンプリング、プロンプト、投票、検証、または個別の回答の反復的な修正によって追求される。
我々は、クエリの型変換に対する応答を、エンフレレーション応答場(RRF)として表現する。
アンカーは、パラフレーズ、スケーリング、分解、その他のタスク対称性の下で、有効なレスポンスがどのように変化するかをエンコードする。
リレーショナル演算子$D$、アンカー演算子$A$、最大で$k$の応答ノードに対して、ブラックボックス応答回復の本質的な難しさとして$_k(D,A)$を識別する。
論文 参考訳(メタデータ) (2026-08-05T07:43:41Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Re-Rankers as Relevance Judges [65.37611299805856]
再ランカ・アズ・レバレンス・ジャッジ設定で再ランカを再現する。
TREC-DL 2019〜2023では,220Mから32Bの3家族から8人の再ランカを対象に実験を行い,再ランカに基づく審査員による評価バイアスを分析した。
論文 参考訳(メタデータ) (2026-01-08T00:02:59Z) - BURN: Backdoor Unlearning via Adversarial Boundary Analysis [73.14147934175604]
Backdoor Unlearningは、モデル本来の機能を保持しながら、バックドア関連の情報を削除することを目的としている。
本稿では, 偽相関疎結合, プログレッシブデータリファインメント, モデル浄化を統合した新しい防御フレームワーク, BURNによるバックドア・アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-07-14T17:13:06Z) - Generating Unbiased Pseudo-labels via a Theoretically Guaranteed
Chebyshev Constraint to Unify Semi-supervised Classification and Regression [57.17120203327993]
分類におけるしきい値と擬似ラベルプロセス(T2L)は、ラベルの品質を決定するために信頼性を使用する。
本質的には、レグレッションは高品質なラベルを生成するためにバイアスのない方法も必要である。
チェビシェフの不等式に基づく不偏ラベルを生成するための理論的に保証された制約を提案する。
論文 参考訳(メタデータ) (2023-11-03T08:39:35Z) - Correcting Underrepresentation and Intersectional Bias for Classification [49.1574468325115]
我々は、表現不足のバイアスによって破損したデータから学習する問題を考察する。
偏りのないデータの少ない場合、グループワイドのドロップアウト率を効率的に推定できることが示される。
本アルゴリズムは,有限VC次元のモデルクラスに対して,効率的な学習を可能にする。
論文 参考訳(メタデータ) (2023-06-19T18:25:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。