論文の概要: Generalised Eigenvalue Geometry of Semantic Adversarial Attacks
- arxiv url: http://arxiv.org/abs/2606.19212v1
- Date: Wed, 17 Jun 2026 15:47:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:51.250185
- Title: Generalised Eigenvalue Geometry of Semantic Adversarial Attacks
- Title(参考訳): セマンティック・アタックの一般固有値幾何
- Authors: Martin Anthony, Kaveh Salehzadeh Nobari,
- Abstract要約: セマンティック・パラフレーズ摂動の連続的局所モデルを構築した。
対象表現の最悪の局所変位は、行列鉛筆の最大一般化固有値によって制御される。
アフィンの読み出しのクラスを均一に制御するために、二値攻撃可能性指標の分布自由VCを導出する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent empirical work shows that semantically equivalent paraphrases can fool financial sentiment classifiers: although a paraphrase remains close to the original under a strong reference embedding, it may shift the target model's representation enough to change the predicted class. Existing robustness theory either assumes a single-model threat model or focuses mainly on empirical attack algorithms. We develop a continuous local model of semantic paraphrase perturbations that captures this two-model structure. We show that the worst-case local displacement of the target representation, subject to a proxy-model budget, is governed by the largest generalised eigenvalue of a matrix pencil $(A,B)$ constructed from the Jacobians of the two embedding maps. The resulting attackability index $λ^*(x)$ is intrinsic to the local paraphrase geometry and the chosen embedders, yields a closed-form prediction-flip condition for affine readouts, and supports conservative population and finite-sample attackability certificates. For uniform control over classes of affine readouts, we derive a distribution-free VC bound for binary attackability indicators and a scale-sensitive margin bound based on an attackability-adjusted margin that subtracts a local geometric penalty from the standard classifier margin. We also connect the continuous theory to discrete paraphrase search, identify an asymmetry between successful and unsuccessful finite searches, and give a covering condition under which the discrete and continuous settings agree. Finally, we propose an empirical verification framework using soft-token relaxations and generated paraphrase sets to assess the local eigenvalue geometry, prediction-flip condition, and finite-search approximation on a deployed financial-text classifier.
- Abstract(参考訳): 最近の経験的な研究は、意味論的に等価なパラフレーズは、財務的な感情分類を騙す可能性があることを示している: パラフレーズは、強い参照埋め込みの下で原語に近いままであるが、予測されたクラスを変更するのに十分なターゲットモデルの表現をシフトする可能性がある。
既存の堅牢性理論は単一モデル脅威モデルを想定しているか、主に経験的攻撃アルゴリズムに焦点を当てている。
この2モデル構造をキャプチャする意味的パラフレーズ摂動の連続的局所モデルを開発する。
本稿では,2つの埋め込み写像のヤコビアンから構築された行列鉛筆$(A,B)$の最大一般化固有値により,ターゲット表現の最悪の局所変位がプロキシモデル予算によって制御されることを示す。
結果として生じる攻撃可能性指数 $λ^*(x)$ は、局所的なパラフレーズ幾何学と選択された埋め込み器に固有のものであり、アフィンの読み出しに対して閉形式の予測フリップ条件を与え、保守的な集団と有限サンプルの攻撃可能性証明をサポートする。
アフィンの読み出しのクラスを均一に制御するために、二分攻撃可能性指標のための分布自由VCと、標準分類器のマージンから局所的な幾何学的ペナルティを減じる攻撃可能性調整マージンに基づくスケール敏感マージンを導出する。
また、連続理論を離散パラフレーズ探索に結び付け、成功した有限探索と失敗した有限探索の間の非対称性を特定し、離散的かつ連続的な設定が一致する被覆条件を与える。
最後に, 局所固有値幾何, 予測フリップ条件, 有限探索近似を評価するために, ソフトトークン緩和と生成パラフレーズ集合を用いた実証検証フレームワークを提案する。
関連論文リスト
- Finite Certificates for In-Context Determinacy and a Threshold Theory of Emergence in Language Models [0.2864713389096699]
本稿では,文脈条件付き言語モデル行動を検証するためのモデル理論フレームワークを開発する。
有限コンテキスト証明書、ペアセパレータのヒットセット、クエリ教育のディメンション、プロンプト保存基準、スケール制限証人を提供する。
論文 参考訳(メタデータ) (2026-05-30T14:07:58Z) - Mind the Gap: Structure-Aware Consistency in Preference Learning [42.67092904252001]
嗜好学習は、大規模言語モデルと人間の意図との整合の基礎となっている。
ニューラルネットワークに典型的な等連続仮説集合に対して、標準代理は理論的に矛盾することを示す。
分離マージンの強制に依存する厳格な$H$一貫性境界を導出する。
我々はこれをStructure-Aware $H$-consistencyに拡張し、同義語とハードペアを扱うための応答間の意味的距離に基づいてマージンを適応する新しい目的(SA-DPO)を導入する。
論文 参考訳(メタデータ) (2026-04-30T11:24:04Z) - Gaussian Joint Embeddings For Self-Supervised Representation Learning [0.0]
自己パラメトリック表現学習は、しばしば決定論的予測アーキテクチャに頼り、潜在空間におけるコンテキストとターゲットビューを整列させる。
生成的関節モデルに基づく確率的代替案を提案する。
論文 参考訳(メタデータ) (2026-03-26T00:54:54Z) - ARGENT: Adaptive Hierarchical Image-Text Representations [12.724220731465392]
本稿では,より強力な双曲型VLMベースラインARGENT,Adaptive hieRarchical imaGe-tExt rereseNTationを導入する。
本稿では,より強力な双曲型VLMベースラインARGENT,Adaptive hieRarchical imaGe-tExt rereseNTationを提案する。
論文 参考訳(メタデータ) (2026-03-24T15:14:12Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation [17.405818788700234]
本稿では,視覚合成から意味的計画を明確に分離する協調的マルチエージェント推論フレームワークを提案する。
提案手法は,画素生成前の構造的,明示的なプランを生成し,視覚的,意味的に整合した単一パス合成を可能にする。
従来の評価基準の限界に対処し,新しい人間対応評価指標MAC-Scoreを導入する。
論文 参考訳(メタデータ) (2025-12-24T04:39:45Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - Variational Classification [51.2541371924591]
我々は,変分オートエンコーダの訓練に用いるエビデンスローバウンド(ELBO)に類似した,モデルの訓練を目的とした変分目的を導出する。
軟質マックス層への入力を潜伏変数のサンプルとして扱うことで, 抽象化された視点から, 潜在的な矛盾が明らかとなった。
我々は、標準ソフトマックス層に見られる暗黙の仮定の代わりに、選択された潜在分布を誘導する。
論文 参考訳(メタデータ) (2023-05-17T17:47:19Z) - CC-Cert: A Probabilistic Approach to Certify General Robustness of
Neural Networks [58.29502185344086]
安全クリティカルな機械学習アプリケーションでは、モデルを敵の攻撃から守ることが不可欠である。
意味的に意味のある入力変換に対して、ディープラーニングモデルの証明可能な保証を提供することが重要である。
我々はChernoff-Cramer境界に基づく新しい普遍確率的証明手法を提案する。
論文 参考訳(メタデータ) (2021-09-22T12:46:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。