論文の概要: Opinion Leader Dynamics: How Sparse Attention Shapes Token Clustering
- arxiv url: http://arxiv.org/abs/2609.24202v1
- Date: Mon, 21 Sep 2026 07:17:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.140395
- Title: Opinion Leader Dynamics: How Sparse Attention Shapes Token Clustering
- Title(参考訳): Opinion Leader Dynamics: スパースアテンションがクラスタリングにどう影響するか
- Abstract要約: トークン群が内部に収束する2つのメカニズムを同定する枠組みを導入する。
Kimi-K3、MiniMax-M3、DeepSeek-V4-Flashの4つのベンチマークは、高密度アテンションモデルよりも明確なクラスタ分離と高いクラスタリングスコアを示している。
本研究は,制限されたトークン相互作用をグループレベルのアトラクタに関連付け,グループ内のアライメントを疎注意がどのように支援できるかを動的に説明する。
- 参考スコア(独自算出の注目度): 22.551705309887634
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Sparse attention reduces the quadratic cost of global self-attention while retaining strong empirical performance, but how its restricted interactions shape the evolution of token representations remains theoretically underexplored. Modeling tokens as particles on the unit sphere, we introduce opinion leader dynamics, a framework that identifies two mechanisms through which token groups converge internally while maintaining distinct limiting directions. In the explicit model, fixed representatives induce a potential that attracts tokens toward distinct local maxima. In the implicit model, disconnected interaction groups evolve toward separate consensus directions. We formulate both models as reverse Wasserstein gradient flows and establish exponential convergence under suitable conditions. We further connect these theoretical predictions to token evolution in frontier sparse-attention LLMs that motivate our framework. Across four benchmarks, Kimi-K3, MiniMax-M3, and DeepSeek-V4-Flash consistently exhibit clearer cluster separation and higher clustering scores than the dense-attention model GLM-4.7-Flash in projected token representations. These observations support the relevance of the predicted multiple-group structure to trained frontier LLMs, while finite-particle simulations illustrate the theoretical convergence behavior. Together, our results connect restricted token interactions to distinct group-level attractors, providing a dynamical account of how sparse attention can support alignment within groups while preserving separation between them.
- Abstract(参考訳): スパース・アテンションは、強い経験的性能を維持しながらグローバルな自己注意の二次的コストを低減させるが、その制限された相互作用がトークン表現の進化をいかに形作るかは理論的には過小評価されている。
トークンを単位球面上の粒子としてモデル化し、異なる制限方向を維持しながらトークン群が内部に収束する2つのメカニズムを識別するフレームワークである、意見リーダーダイナミクスを導入する。
明示的なモデルでは、固定代表は異なる局所極大に対してトークンを引き付けるポテンシャルを誘導する。
暗黙のモデルでは、非連結な相互作用群は別々のコンセンサス方向に向かって進化する。
両モデルを逆ワッサーシュタイン勾配流として定式化し、適切な条件下で指数収束を確立する。
さらに、これらの理論予測を、我々のフレームワークを動機づけるフロンティアスパースアテンションLDMにおけるトークン進化に結び付ける。
Kimi-K3、MiniMax-M3、DeepSeek-V4-Flashの4つのベンチマークでは、投射されたトークン表現におけるGLM-4.7-Flashよりも明確なクラスタ分離とクラスタリングスコアが一貫して示されている。
これらの観測は、予測された多重群構造が訓練されたフロンティア LLM との関係を支持する一方、有限粒子シミュレーションは理論収束挙動を示す。
その結果,異なるグループレベルのアトラクタに制限されたトークンの相互作用を関連付けるとともに,グループ間のアライメントを保ちながら,スパースアテンションがグループ内のアライメントをどのように支援できるかを動的に説明できることがわかった。
関連論文リスト
- Clustered Attractor Manifolds and Dynamical Condensation in Self-Attention [2.4792581096761404]
トランスフォーマー層は状態依存の相互作用ネットワークを生成する。
トークン表現はアテンション行列を決定し、それが表現を更新する。
我々は、このフィードバックを最小限の正規化された自己注意力学で研究する。
論文 参考訳(メタデータ) (2026-08-09T21:28:01Z) - Neural Networks Provably Learn Spectral Representations for Group Composition [51.637084292404616]
ニューラルネットワークトレーニング中に内部構造がどのように現れるかを検討する。
トレーニング力学は表現理論エネルギー汎関数上の勾配上昇によって支配されていることを証明する。
このフレームワークは特徴学習の表現論的記述を提供し、新しい低ランク圧縮現象を特徴付ける。
論文 参考訳(メタデータ) (2026-06-02T01:04:21Z) - Gradient Flow Structure and Quantitative Dynamics of Multi-Head Self-Attention [0.0]
変圧器の自己アテンションは単位球上の勾配流と解釈できる。
我々は,マルチヘッド自己注意力学の理論的枠組みを開発する。
論文 参考訳(メタデータ) (2026-05-05T20:31:11Z) - Phase-Consistent Magnetic Spectral Learning for Multi-View Clustering [18.462238432927915]
教師なしのマルチビュークラスタリングは、ラベルなしで複数のビューから補完的な情報を活用することで、データを有意義なグループに分割することを目的としている。
既存のアプローチは、しばしばマグニチュードのみの親和性や初期の擬似的ターゲットに依存しており、異なる視点が同等の強度を持つが矛盾する方向傾向を持つ関係を誘導すると不安定になる可能性がある。
本稿では,MVC における EmphPhase-Consistent Magnetic Spectral Learning を提案する。
論文 参考訳(メタデータ) (2026-02-21T06:04:57Z) - Deep Incomplete Multi-View Clustering via Hierarchical Imputation and Alignment [15.396375506151102]
本稿では,階層的な命令処理と4つのキーコンポーネントのアライメントを統合する,新しいディープIMVCフレームワークを提案する。
ベンチマーク実験により、我々のフレームワークは、様々なレベルの欠落下で優れたパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-01-14T00:46:00Z) - Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization [56.083511902353365]
強化学習(Reinforcement Learning, RL)は、一般的に、大規模言語モデルの全世代にわたって一様クレジットを適用する。
この研究は、LSMの内部論理を推論自体の機械的青写真として描画する特権基板として注意を向けている。
クリティカルノードに対するターゲットクレジット割り当てを動的に行う3つの新しいRL戦略を導入する。
論文 参考訳(メタデータ) (2025-10-15T13:49:51Z) - Explaining multimodal LLMs via intra-modal token interactions [55.27436637894534]
MLLM(Multimodal Large Language Models)は、様々な視覚言語タスクにおいて顕著な成功を収めているが、その内部決定機構は十分に理解されていない。
モーダル内相互作用を利用した解釈可能性の向上を提案する。
論文 参考訳(メタデータ) (2025-09-26T14:39:13Z) - Revisiting Self-Supervised Heterogeneous Graph Learning from Spectral Clustering Perspective [52.662463893268225]
自己教師付きヘテロジニアスグラフ学習(SHGL)は様々なシナリオにおいて有望な可能性を示している。
既存のSHGLメソッドには2つの大きな制限がある。
ランクと二重整合性制約によって強化された新しいフレームワークを導入する。
論文 参考訳(メタデータ) (2024-12-01T09:33:20Z) - Active-Dormant Attention Heads: Mechanistically Demystifying Extreme-Token Phenomena in LLMs [77.66717051042032]
実践者は変圧器に基づく大言語モデルにおいて、3つのパズリング現象を一貫して観察してきた。
これらの現象は、ある種のいわゆる「シンクトークン」が不当に高い注意重みを負っているのが特徴である。
極端トーケン現象のメカニズムを解明する。
論文 参考訳(メタデータ) (2024-10-17T17:54:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。