論文の概要: Why Any-Order Autoregressive Models Need Two-Stream Attention: A Structural-Semantic Tradeoff
- arxiv url: http://arxiv.org/abs/2602.16092v1
- Date: Tue, 17 Feb 2026 23:39:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-19 15:58:30.470157
- Title: Why Any-Order Autoregressive Models Need Two-Stream Attention: A Structural-Semantic Tradeoff
- Title(参考訳): 任意の順序の自己回帰モデルに2ストリームの注意が必要な理由:構造的セマンティックなトレードオフ
- Abstract要約: 我々は、2ストリームの注意が、任意の順序生成においてより微妙な役割を果たすかもしれないと論じている。
本稿では,目標位置情報を提供する回転位置埋め込みの修正であるデカップリングRoPEを提案する。
- 参考スコア(独自算出の注目度): 25.408128955753313
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Any-order autoregressive models (AO-ARMs) offer a promising path toward efficient masked diffusion by enabling native key-value caching, but competitive performance has so far required two-stream attention, typically motivated as a means of decoupling token content from position. In this work, we argue that two-stream attention may be serving a more subtle role. We identify a structural-semantic tradeoff in any-order generation: the hidden representation at each step must simultaneously attend to semantically informative tokens for prediction and structurally recent tokens for summarization, objectives that compete for attention capacity in a single stream but can specialize across two streams. To isolate this tradeoff from position-content separation, we propose Decoupled RoPE, a modification to rotary position embeddings that provides target position information without revealing target content. Decoupled RoPE performs competitively at short sequence lengths--where semantic and structural proximity coincide--but degrades as sequence length increases and the two orderings diverge. These results suggest that the success of two-stream attention stems not merely from separating position from content, but from circumventing the deeper structural-semantic tradeoff inherent to any-order generation.
- Abstract(参考訳): 任意の順序自己回帰モデル(AO-ARM)は、ネイティブなキーバリューキャッシングを有効にすることで、効率的なマスク付き拡散への有望な道を提供するが、競争性能には2ストリームの注意が必要であり、通常はトークンコンテンツを位置から切り離す手段として動機付けられている。
この研究では、二流の注意がより微妙な役割を担っているかもしれないと論じる。
それぞれのステップで隠された表現は、予測のための意味的情報的トークンと、要約のための構造的最新のトークンと、単一のストリームで注意力に競合するが、2つのストリームをまたいで専門化できる目的とを同時に対応させなければならない。
位置コンテンツ分離からこのトレードオフを分離するために,ターゲット内容を明らかにすることなく目標位置情報を提供する回転位置埋め込みを改良したDecoupled RoPEを提案する。
デカップリングされたRoPEは、セマンティックと構造的近接が一致した短いシーケンス長で競合的に実行されるが、シーケンス長が増加し、2つの順序が分岐するにつれて劣化する。
これらの結果から,二流注意の成功は,内容物からの位置を分離することだけでなく,任意の順序生成に固有の深い構造・意味的トレードオフを回避することに起因することが示唆された。
関連論文リスト
- The Attention Triangle in Audio-Video Models [67.46972888113658]
音声・ビデオ拡散モデルは、テキスト、音声、視覚内容の調整にモーダルな注意を頼っているが、この機構は微妙で体系的な意味的漏洩をもたらす可能性がある。
テキスト,音声,ビデオストリームを接続する3つの横断的エッジからなる「注意三角形」を探索し,解析することにより,これらのモデルについて検討する。
音声は映像生成に影響を及ぼし、ビデオは音声生成に影響を及ぼす。
論文 参考訳(メタデータ) (2026-09-03T09:33:27Z) - RoleMix: Unifying Sequential and Non-Sequential Features via Semantic Tokenization for Post-Click Conversion Rate Prediction [1.6050320174037502]
RoleMixは、共有されたロール保存トークンインターフェースを通じて、シーケンシャルかつ非シーケンシャルなエビデンスを表す。
大規模なKDDカップ2026 Tencent UniRec Challengeでは、RoleMixは83.648%のオンラインAUCを達成し、公式産業ベースラインを1.953%上回っている。
論文 参考訳(メタデータ) (2026-07-18T15:44:48Z) - When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics [14.506581918176478]
本稿では,新しい2段階の視覚トークン解析フレームワークであるStructure-to-Semantics(STS)を紹介する。
第1段階では、空間的および構造的多様性を最大化するために、反発に基づくサンプリング機構を採用している。
第2段階は命令対応のクロスアテンションを利用して、プロンプト非関連トークンを正確にフィルタリングする。
論文 参考訳(メタデータ) (2026-06-02T12:36:24Z) - Bottleneck Tokens for Unified Multimodal Retrieval [16.707536543758344]
マルチモーダル検索のためのデコーダのみのマルチモーダル大言語モデル(MLLM)の適用には、2つの構造的ギャップがある。
まず、既存のメソッドは暗黙のプーリングに依存しており、シーケンスレベルの表現として標準語彙トークンの隠れた状態をオーバーロードする。
第二に、コントラスト的な微調整は、埋め込みが一致すべきものを特定するが、どのように情報を圧縮すべきかについてのトークンレベルのガイダンスは提供しない。
本稿では,Bottleneck Tokens(BToks)を紹介した。これは,固定容量明示的なプール機構として機能する,学習可能なトークンの小さなセットである。
論文 参考訳(メタデータ) (2026-04-13T07:12:12Z) - Making Training-Free Diffusion Segmentors Scale with the Generative Power [118.72472901404814]
一連の研究は、事前学習された拡散モデルを、それ以上の訓練をせずに意味的セグメンテーションに適応することに焦点を当てている。
本稿では,自動アグリゲーションと画素単位の再スケーリングという2つの手法を提案する。
論文 参考訳(メタデータ) (2026-03-06T11:35:37Z) - Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion [31.189038928192648]
Co2Sは半教師付きRSセグメンテーションフレームワークで、ビジョン言語モデルと自己教師型モデルとを融合する。
テキスト埋め込みと学習可能なクエリを利用した,明示的でシンプルなセマンティックコガイダンス機構が導入された。
6つの一般的なデータセットに対する実験は,提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2025-12-28T18:24:19Z) - Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization [56.083511902353365]
強化学習(Reinforcement Learning, RL)は、一般的に、大規模言語モデルの全世代にわたって一様クレジットを適用する。
この研究は、LSMの内部論理を推論自体の機械的青写真として描画する特権基板として注意を向けている。
クリティカルノードに対するターゲットクレジット割り当てを動的に行う3つの新しいRL戦略を導入する。
論文 参考訳(メタデータ) (2025-10-15T13:49:51Z) - Cross-Attention is Half Explanation in Speech-to-Text Models [31.16674879591289]
クロスアテンションはエンコーダ・デコーダアーキテクチャのコアメカニズムであり、音声テキスト処理(S2T)を含む多くの分野に普及している。
本分析では,単言語,多言語,単一タスク,マルチタスクのモデルを複数スケールで分析し,注意点が塩分濃度に基づく説明と強く一致していることを示す。
また、クロスアテンションは入力関係の約50%しか捕捉せず、最良の場合、デコーダがエンコーダの表現にどのように出席するかを部分的に反映している。
論文 参考訳(メタデータ) (2025-09-22T16:49:26Z) - CTR-Sink: Attention Sink for Language Models in Click-Through Rate Prediction [42.92011330807996]
$textitCTR-Sink$は、レコメンデーションシナリオに適した振る舞いレベルの注意シンクを導入した、新しいフレームワークである。
注意シンク理論にヒントを得て、注意集中シンクを構築し、外部情報を介して注意集約を動的に制御する。
論文 参考訳(メタデータ) (2025-08-05T17:30:34Z) - SeqPE: Transformer with Sequential Position Encoding [76.22159277300891]
SeqPEは、各$n$次元位置指数をシンボルシーケンスとして表現し、軽量なシーケンシャル位置エンコーダを用いて埋め込みを学習する。
言語モデリング、長文質問応答、および2次元画像分類による実験により、SeqPEはパープレキシティ、正確なマッチング(EM)、精度の強いベースラインを超えるだけでなく、手作業によるアーキテクチャ再設計を必要とせず、多次元入力へのシームレスな一般化を可能にする。
論文 参考訳(メタデータ) (2025-06-16T09:16:40Z) - EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration [63.112790050749695]
本稿では,行動情報と意味情報の両方をシームレスに統合する新しい生成推薦フレームワークであるEAGERを紹介する。
EAGERの有効性を4つの公開ベンチマークで検証し,既存手法と比較して優れた性能を示した。
論文 参考訳(メタデータ) (2024-06-20T06:21:56Z) - Spatial Semantic Recurrent Mining for Referring Image Segmentation [63.34997546393106]
高品質なクロスモーダリティ融合を実現するために,Stextsuperscript2RMを提案する。
これは、言語特徴の分散、空間的意味的再帰的分離、パーセマンティック・セマンティック・バランシングという三部作の作業戦略に従う。
提案手法は他の最先端アルゴリズムに対して好適に機能する。
論文 参考訳(メタデータ) (2024-05-15T00:17:48Z) - Semantics Meets Temporal Correspondence: Self-supervised Object-centric Learning in Videos [63.94040814459116]
自己教師付き手法は、高レベルの意味論と低レベルの時間対応の学習において顕著な進歩を見せている。
融合した意味特徴と対応地図の上に,意味認識型マスキングスロットアテンションを提案する。
我々は、時間的コヒーレントなオブジェクト中心表現を促進するために、セマンティックおよびインスタンスレベルの時間的一貫性を自己スーパービジョンとして採用する。
論文 参考訳(メタデータ) (2023-08-19T09:12:13Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。