論文の概要: Chiaroscuro Attention: Spending Compute in the Dark
- arxiv url: http://arxiv.org/abs/2606.08327v1
- Date: Sat, 06 Jun 2026 20:38:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.044596
- Title: Chiaroscuro Attention: Spending Compute in the Dark
- Title(参考訳): Chiaroscuroの注意: 暗黒で計算を行う
- Authors: Prateek Kumar Sikdar,
- Abstract要約: CHIAR-Formerは、各トークンを3つの演算子のいずれかにルーティングする4層ハイブリッドトランスである。
目的に設計されたDCT+Attention専用変種はWikiText-103上でVal PPL 36.54を達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard transformers apply self-attention uniformly at every layer and token, regardless of whether the input requires dynamic cross-token interaction. We propose CHIAR-Former (Chiaroscuro Attention), a 4-layer hybrid transformer that routes each token to one of three operators - DCT spectral mixing, RBF kernel mixing, or full self-attention - based on per-token spectral entropy, a theoretically justified complexity signal. Through systematic ablation on WikiText-103, we discover routing collapse: the router consistently rejects RBF in favour of DCT and attention, revealing that spectral mixing and dynamic attention are complementary and sufficient. A purpose-designed DCT+Attention-only variant achieves Val PPL 36.54 on WikiText-103 - a 45% improvement over a full-attention baseline (PPL 66.62) at 62.5% fewer attention FLOPs. We extend evaluation to WikiText-2, IMDB sentiment classification, and synthetic ListOps operations, establishing a clear operating regime: CHIAR-Former excels on large-scale naturalistic text where token diversity supports spectral specialisation, while full attention retains an edge on small datasets and synthetic pattern-matching tasks. These findings - both the wins and the losses - together define when and why spectral routing earns its keep.
- Abstract(参考訳): 標準変換器は、入力が動的交叉相互作用を必要とするかどうかにかかわらず、各層とトークンに均一に自己アテンションを適用する。
本研究では,各トークンをDCTスペクトル混合,RBFカーネル混合,全自己アテンションの3つの演算子のいずれかにルーティングする4層ハイブリッドトランスフォーマーであるCHIAR-Former(Chiaroscuro Attention)を提案する。
ルータは、DCTと注意を優先してRBFを一貫して拒否し、スペクトル混合と動的注意が相補的で十分であることを明らかにした。
DCT+Attentionのみの派生型がWikiText-103でVal PPL 36.54を達成し、フルアテンションベースライン(PPL 66.62)を62.5%減らした。
CHIAR-Formerは、トークンの多様性がスペクトルの特殊化をサポートする大規模博物論的なテキストに優れており、完全な注意は小さなデータセットや合成パターンマッチングタスクのエッジを保持します。
これらの発見 - 勝利と損失の両方 - は、いつ、なぜスペクトルルーティングがその利益を得るのかを一緒に定義する。
関連論文リスト
- Dynamic Spectral Denoising with Global-Context Attention for Multi-Behavior Recommendation [58.33732779555114]
重要なボトルネックは、2つの結合した不均一性によって引き起こされる表現レベルの失敗である、と我々は主張する。
マルチビヘイビアレコメンデーション(SpectraMB)のためのグローバルコンテキストを考慮した動的スペクトルデノベーションを提案する。
SpectraMBは、ほとんどの評価設定で最高の結果を達成し、ノイズのある相互作用下での堅牢性の向上を示す。
論文 参考訳(メタデータ) (2026-06-01T15:58:13Z) - Energy-Gated Attention and Wavelet Positional Encoding: Complementary Inductive Biases for Transformer Attention [0.0]
標準的な注意力に欠ける2つの相補的帰納バイアスを同定する。
正当性と局所性は相補的帰納バイアスであり、それぞれが単独では満たせないギャップに対処する。
この超添加性は、2つの独立したトレーニングランで観察され、中心的な経験的発見である。
論文 参考訳(メタデータ) (2026-05-25T22:04:31Z) - Energy-Gated Attention: Spectral Salience as an Inductive Bias for Transformer Attention [0.0]
乱流流体力学では、コヒーレント構造は全エネルギーの不均等な部分を持ち、全ての輸送を支配している。
我々は,トークンが変圧器の注意に類似する役割を担っていることを提案する。
本稿では,EGA(Energy-Gated Attention)がキートークン埋め込みのスペクトルエネルギーによる値集約を実現することを示す。
論文 参考訳(メタデータ) (2026-05-21T00:21:14Z) - Triple Spectral Fusion for Sensor-based Human Activity Recognition [86.21994396715074]
本稿では,センサを用いたヒューマンアクティビティ認識(HAR)に適した新しい三重スペクトル融合フレームワークを提案する。
雑音抑制のための適応的な補間フィルタリング手法を開発し,各IMUセンサを姿勢・運動モードノードに整理する。
適応ウェーブレット周波数選択手法により、コンテキストの冗長性を抑え、特徴の長さを短縮する。
論文 参考訳(メタデータ) (2026-05-04T15:42:58Z) - When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models [0.0]
ハイブリッドリカレントアテンションアーキテクチャにおけるルーティングパラドックスを同定する。
コンテンツベースのルーティングは、ルーティングが避けるように設計されたペアワイズな計算を必要とすることを示す。
論文 参考訳(メタデータ) (2026-03-22T01:04:57Z) - Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition [60.20529806857076]
マルチモーダル感情認識は、テキスト、ビデオ、音声などの手がかりを融合させ、個人の感情状態を理解する。
従来の手法では、機械的に独立な単調なパフォーマンスに依存することと、感情タスクで要求されるきめ細かい表現と相反する粗粒の融合という2つの主な制限に直面していた。
我々は,マルチスケールバンド分解とエキスパートコラボレーションを通じて,微細な相補的特徴をモデル化するために,Atsukoという名前のComplementarity-Supervised Multi-Band Expert Networkを提案する。
論文 参考訳(メタデータ) (2026-03-07T03:58:48Z) - Routing Absorption in Sparse Attention: Why Random Gates Are Hard to Beat [0.0]
疎い注意がエンドツーエンドにトレーニングされると、モデルのQ/K/V投影は、どんなマスクにも適応する。
微分可能なソフトゲーティングは、ゲートが学習されているかランダムであるかに関わらず、ほぼ同じ難易度に収束する。
専門家はどのルーターにも適応するが、注意は構造的により厳しい形を示すことを示している。
論文 参考訳(メタデータ) (2026-02-11T15:06:44Z) - SEER: Spectral Entropy Encoding of Roles for Context-Aware Attention-Based Design Pattern Detection [0.0]
本稿では,ソースコードからGang of Four(GoF)デザインパターンを検出するために,従来のContext Is All You Needのアップグレード版を提案する。
SEERはこれらの制限に、(i)各クラスの相互作用グラフのラプラシアンスペクトルからメンバーごとのロール埋め込みを導出するスペクトルエントロピーロールエンコーダ、(ii)メソッドカテゴリに経験的校正期間を割り当てる時間重呼出コンテキストの2つの原則で対処する。
PyDesignNet上のSEER(1,832ファイル、35,000のシーケンス、23のGoFパターン)を評価し、以前のシステムよりも一貫した利得を観察する。
論文 参考訳(メタデータ) (2026-01-19T19:13:40Z) - Hadamard Attention Recurrent Transformer: A Strong Baseline for Stereo Matching Transformer [53.62241289871256]
Adamard Attention Recurrent Stereo Transformer(HART)について紹介する。
HARTには、以下のコンポーネントを組み込んだ新しいアテンションメカニズムが含まれている。
反映的な領域では、HARTはKITTI 2012ベンチマークで1位にランクインした。
論文 参考訳(メタデータ) (2025-01-02T02:51:16Z) - Sharing Key Semantics in Transformer Makes Efficient Image Restoration [148.22790334216117]
視覚変換器(ViT)の基盤となる自己注意機構は、すべてのグローバルな手がかりを包含する傾向がある。
劣化した画像の小さな部分、特にセマンティックに密に整合した部分では、回復プロセスを支援するために特に関連する情報を提供する。
本稿では, IR(e, SemanIR) 用の Transformer を通じて鍵セマンティクスを共有することで, IR の性能向上を提案する。
論文 参考訳(メタデータ) (2024-05-30T12:45:34Z) - G-DetKD: Towards General Distillation Framework for Object Detectors via
Contrastive and Semantic-guided Feature Imitation [49.421099172544196]
そこで本研究では,すべてのピラミッドレベルにまたがる特徴ペア間のソフトマッチングを自動的に行う,意味誘導型特徴模倣手法を提案する。
また,異なる特徴領域間の関係で符号化された情報を効果的に捉えるために,コントラスト蒸留を導入する。
本手法は,(1)フレームワークのコンポーネントを別々に使用した場合に,既存の検出KD技術よりも優れた性能を発揮する。
論文 参考訳(メタデータ) (2021-08-17T07:44:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。