論文の概要: Why Does Robustness Reduce Superposition?
- arxiv url: http://arxiv.org/abs/2608.22155v1
- Date: Sun, 23 Aug 2026 00:53:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.638658
- Title: Why Does Robustness Reduce Superposition?
- Title(参考訳): ロバストネスはなぜ重畳を減らすのか?
- Abstract要約: 逆の例は重ね合わせから生じるが、なぜこのようなことが起こるのかは説明できない。
Ilyas et al. の特徴分類から着想を得た経験的説明を行い,以下の機械的因果関係の連鎖をたどる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The study of adversarial examples and their origins remains an open area of research. Mechanistic interpretability, and superposition in particular, offers new avenues for approaching this problem. Gorton & Lewis (2025) demonstrate that adversarial examples arise from superposition and show empirically that adversarial training reduces superposition, yet provide no mechanistic account of why this occurs. We present an empirical explanation inspired by the feature taxonomy of Ilyas et al. (2019), tracing the following chain of causalities: adversarial training abandons non-robust features, leading to fewer total features to represent, resulting in less superposition.
- Abstract(参考訳): 敵の例とその起源の研究は研究のオープンな領域として残っている。
機械的解釈可能性(英語版)および特に重ね合わせ(英語版)は、この問題にアプローチするための新しい道を提供する。
Gorton & Lewis (2025) は、敵の例が重ね合わせから生じることを実証し、敵の訓練が重ね合わせを減らすことを実証的に示すが、なぜこのようなことが起こるのかは機械学的に説明できない。
Ilyas et al (2019) の特徴分類から着想を得た経験的説明として, 敵対的訓練は非破壊的特徴を放棄し, 全特徴の表現を減らし, 重畳を減らした。
関連論文リスト
- In defense of temporal Tsirelson bound [0.0]
提案する進化は,より従来型の枠組みで理解可能であることを示す。
測定量は、レゲット=ガーグのシナリオの仮定と一致しないため、境界の明らかな違反が生じることを実証する。
論文 参考訳(メタデータ) (2025-12-30T15:53:39Z) - Consistency Is Not Always Correct: Towards Understanding the Role of Exploration in Post-Training Reasoning [75.79451512757844]
基礎モデルは幅広い知識を示すが、タスク固有の推論は限定的である。
RLVRと推論スケーリングは、RLVRや推論スケーリングのようなトレーニング後の戦略を動機付けます。
RLVRはスキューズ効果を誘発し,推論エントロピーを減少させ,正しい経路を忘れることを示した。
論文 参考訳(メタデータ) (2025-11-10T18:25:26Z) - Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models [15.797612515648412]
大きな推論モデル (LRMs) は、Chain-of-Thought (CoT) 推論を通じて複雑な問題を解く際、前例のない能力を示す。
最近の研究では、彼らの最後の答えは、しばしば彼ら自身の推論の痕跡と矛盾していることが明らかになっている。
この矛盾は、CoT推論とメモリ検索という2つの競合メカニズムに起因していると仮定する。
本稿では,メモリアンラーニングと強化学習を統合したファインチューニングフレームワークFARLを紹介する。
論文 参考訳(メタデータ) (2025-09-29T01:13:33Z) - Adversarial Examples Are Not Bugs, They Are Superposition [0.17188280334580197]
アドリラルな例は、深層学習の最も難解な現象の1つとして残されている。
重ね合わせは大きな寄与要因かもしれないし、主要な原因かもしれない。
重ね合わせは理論的には様々な逆転現象を説明できる。
論文 参考訳(メタデータ) (2025-08-24T17:19:53Z) - Lost at the Beginning of Reasoning [85.17612793300238]
第1の推論ステップが最終予測に不当に大きな影響を与えることを示す。
本稿では、報酬モデルを利用して高品質な第1推論ステップを特定し、維持する効率的なサンプリング戦略を提案する。
論文 参考訳(メタデータ) (2025-06-27T09:53:57Z) - Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers [80.70134000599391]
我々は、両方の行動は、アウト・オブ・コンテクスト推論(OCR)として知られる単一のメカニズムに由来すると論じる。
OCRは、関連する概念が因果関係であるかによって、一般化と幻覚の両方を駆動する。
我々の研究は、OCR現象を理解するための理論的基盤を提供し、知識注入から望ましくない行動を分析し緩和するための新しいレンズを提供する。
論文 参考訳(メタデータ) (2025-06-12T16:50:45Z) - How do Transformers Learn Implicit Reasoning? [67.02072851088637]
制御されたシンボリック環境下でトランスフォーマーをスクラッチからトレーニングすることで、暗黙のマルチホップ推論がどのように現れるかを研究する。
原子三重項によるトレーニングは必要ではなく学習を加速し,第2ホップの一般化は特定の構成構造へのクエリレベル露出に依存する。
論文 参考訳(メタデータ) (2025-05-29T17:02:49Z) - Class-wise Activation Unravelling the Engima of Deep Double Descent [0.0]
二重降下は、機械学習領域内の反直観的な側面を示す。
本研究では,二重降下現象を再考し,その発生状況について考察した。
論文 参考訳(メタデータ) (2024-05-13T12:07:48Z) - Causal Triplet: An Open Challenge for Intervention-centric Causal
Representation Learning [98.78136504619539]
Causal Tripletは、視覚的に複雑なシーンを特徴とする因果表現学習ベンチマークである。
この結果から,不整合表現やオブジェクト中心表現の知識によって構築されたモデルが,分散表現よりもはるかに優れていることを示す。
論文 参考訳(メタデータ) (2023-01-12T17:43:38Z) - The Dimpled Manifold Model of Adversarial Examples in Machine Learning [6.6690527698171165]
本稿では,なぜ敵対的な例が存在するのかを簡潔に説明する,新しい概念的枠組みを提案する。
本論文の最後の部分では,この新モデルを強く支持する多数の実験結果について述べる。
論文 参考訳(メタデータ) (2021-06-18T14:32:55Z) - ACRE: Abstract Causal REasoning Beyond Covariation [90.99059920286484]
因果誘導における現在の視覚システムの系統的評価のための抽象因果分析データセットについて紹介する。
Blicket実験における因果発見の研究の流れに触発され、独立シナリオと介入シナリオのいずれにおいても、以下の4種類の質問で視覚的推論システムに問い合わせる。
純粋なニューラルモデルは確率レベルのパフォーマンスの下で連想戦略に向かう傾向があるのに対し、ニューロシンボリックな組み合わせは後方ブロッキングの推論に苦しむ。
論文 参考訳(メタデータ) (2021-03-26T02:42:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。