論文の概要: Variational-Ising-Attention (VIA):TailoredAttentionMattersfor Science
- arxiv url: http://arxiv.org/abs/2607.23634v1
- Date: Sun, 26 Jul 2026 12:44:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.175853
- Title: Variational-Ising-Attention (VIA):TailoredAttentionMattersfor Science
- Title(参考訳): 可変Ising-Attention (VIA):TaloredAttentionMatters for Science
- Abstract要約: 本稿では,対話型Isingモデルによりソフトマックス正規化を増大させる変分Ising-Attentionを提案する。
実験の結果、VIAは標準ソフトマックスよりも一貫して、実質的に優れていた。
- 参考スコア(独自算出の注目度): 3.744103474408833
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Attention enables context modeling via query-key scoring with softmax normalization. Driven by industrial long-context demands, mainstream research has converged toward sparsity and efficiency--yet softmax's independence assumption persists. For scientific tasks unburdened by long-token constraints, however, richer structured coupling may often be essential, making tailored attention both viable and more appropriate. To this end, we propose Variational-Ising-Attention (VIA), which augments softmax normalization with an interacting Ising model; attention patterns emerge from learnable pairwise couplings via variational mean-field inference, redefining attention from a ranking over isolated items to a collective state over interacting entities. We instantiate VIA on retrosynthesis reaction center prediction, a task inherently governed by cooperative bond-breaking constraints. Comprehensive experiments across model variants, coupled with mechanistic analyses, demonstrate that VIA consistently and substantially outperforms standard softmax attention. More broadly, our findings suggest that for scientific problems, the optimal solution is not general-purpose efficiency, but appropriately tailored attention aligned with intrinsic domain structure. This work provides a theoretically grounded and empirically validated instantiation of this paradigm.
- Abstract(参考訳): Attentionは、ソフトマックス正規化によるクエリキースコアリングによるコンテキストモデリングを可能にする。
産業の長期的要求によって駆動され、主流研究は疎遠と効率性へと収束している。
しかし、長期にわたる制約に満たされない科学的タスクには、よりリッチな構造化された結合が不可欠であり、より有効かつ適切な注意を喚起する。
そこで本研究では,対話型Isingモデルによるソフトマックス正規化を向上する変動型Ising-Attention(VIA)を提案する。
協調的結合破壊制約によって本質的に支配されるタスクであるレトロシンセシス反応中心予測のVIAをインスタンス化する。
モデル変種全体にわたる総合的な実験と力学解析が組み合わさって、VIAが標準ソフトマックスの注意を一貫して、実質的に上回ることを示した。
より広範に,本研究は科学的問題に対して,最適解は汎用的効率ではなく,本質的なドメイン構造に整合した注意を適切に調整したものであることを示唆している。
この研究は、理論的に基礎付けられ、実証的に検証されたこのパラダイムのインスタンス化を提供する。
関連論文リスト
- CDFM: Towards a General-Purpose Causal Discovery Foundation Model [62.32138962508216]
因果発見は、観測データから根底にある因果構造を復元する過程である。
ゼロショット構造推論のための統一的汎用フレームワークとしてCausal Discovery Foundation Model (CDFM) を定式化する。
CDFMは従来のアルゴリズムを一貫して上回り、汎用因果発見基盤モデルへのパラダイムシフトを推進している。
論文 参考訳(メタデータ) (2026-07-13T12:58:28Z) - Improving Adversarial Robustness of Attribution via Implicit Regularization [9.78455276849371]
属性の敵対的堅牢性は、深層学習における信頼性説明可能性の基本的な要件である。
我々は、標準勾配降下の学習力学から頑健性が暗黙的に生じることを示した。
本研究は,ロバストな説明可能性のための原理的かつ実践的なメカニズムとして,学習力学を強調した。
論文 参考訳(メタデータ) (2026-05-28T14:19:39Z) - Large Vision-Language Models Get Lost in Attention [51.851592109135716]
本稿では,情報理論と幾何に基づく統合フレームワークを提案し,残差更新の幾何的およびエントロピー的性質を定量化する。
注意は再設定に焦点を当てたサブスペース言語演算子として機能し、FFNはセマンティックイノベーションを駆動するサブスペース言語演算子として機能します。
論文 参考訳(メタデータ) (2026-05-07T04:45:52Z) - Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning [20.73438231053258]
本稿では,マルチモーダルなコンセプトドリフトに適応した包括的フレームワークを提案する。
反ファクト推論とドメイン知識を統合し、思考と知覚をまたいだ制御された摂動を実行する。
これは、コヒーレンス、意思決定精度、および極端な干渉に対する固有の堅牢性を推論する上で、優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-17T05:24:04Z) - OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning [51.33849811496781]
大規模言語モデル (LLM) は例外的な論理的推論能力を示しているが、部分微分方程式 (PDE) による連続力学としばしば競合する。
OMNIFLOWは, 領域固有のパラメータ更新を必要とせず, 基本物理法則で凍結LDMを基底として設計したマルチモーダルシンボリックアーキテクチャである。
我々は, 微視的乱流, 理論的ナビエ・ストークス, マクロ的世界天気予報のベンチマークでこれを評価した。
論文 参考訳(メタデータ) (2026-03-16T18:29:01Z) - Is Softmax Loss All You Need? A Principled Analysis of Softmax-family Loss [91.61796429377041]
ソフトマックスの損失は、分類とランキングのタスクにおいて最も広く使用されるサロゲートの目標の1つである。
本研究では,異なるサロゲートが分類とランキングの指標との整合性を達成するかどうかを考察し,それらの勾配ダイナミクスを分析して,異なる収束挙動を明らかにする。
本研究は,大規模機械学習アプリケーションにおける損失選択の実践的ガイダンスとして,原則的基礎を確立した。
論文 参考訳(メタデータ) (2026-01-30T09:24:52Z) - A Generalized Adaptive Joint Learning Framework for High-Dimensional Time-Varying Models [0.8594140167290097]
本稿では,機能的変数選択と構造的変化点検出を同時に行うための正規化フレームワークであるAdaptive Joint Learning (AJL)を紹介する。
この分析は、疾患進行の同期相転移を明らかにし、時間変化の予測マーカーの相同的なセットを同定する。
論文 参考訳(メタデータ) (2026-01-08T02:07:49Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - ERIS: An Energy-Guided Feature Disentanglement Framework for Out-of-Distribution Time Series Classification [51.07970070817353]
理想的な時系列分類(TSC)は不変表現をキャプチャできるべきである。
現在の手法は、真に普遍的な特徴を分離するために必要な意味的な方向性を欠いている。
本稿では,シフト・ロバストネス・フレームワークのためのエンドツーエンドのエネルギー規則化情報を提案する。
論文 参考訳(メタデータ) (2025-08-19T12:13:41Z) - Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework [12.361554676966552]
大規模言語モデル(LLM)の最近の進歩は、人工知能への進歩を加速させている。
逐次的および並列的推論パラダイムの相補的な長所を生かしたフレキシブルなテスト時協調推論フレームワークを設計することを目指している。
論文 参考訳(メタデータ) (2025-07-09T13:28:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。