論文の概要: What Softmax Throws Away: Mass-Aware Attention for Evidence Accumulation
- arxiv url: http://arxiv.org/abs/2607.22781v1
- Date: Fri, 24 Jul 2026 10:11:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.876965
- Title: What Softmax Throws Away: Mass-Aware Attention for Evidence Accumulation
- Title(参考訳): ソフトマックスのスロース:証拠の蓄積に大量の注意を払う
- Authors: Minwoo Yu, Young-guk Ha,
- Abstract要約: そこで,MAAはモデルデータセット12細胞のうち11細胞において将来リンクAUCを改善している。
また、有意な時間点過程における一貫した証拠も観察する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High task performance does not show whether a model retains prediction-relevant structural information in its internal representation. Temporal graph models, for example, can achieve high future-link AUC while basic graph statistics remain difficult to recover from the same representation. We identify one source of this gap in the weighted averaging used by standard attention: when an evidence pattern is repeated, the numerator and denominator grow at the same rate, so inputs with different amounts of accumulated evidence can produce the same aggregate. We propose Mass-Aware Attention (MAA), which generalizes standard L1 normalization to an Lp family. Under repetition, MAA makes the numerator and denominator scale at different rates, retaining the effective number of contributing inputs in the representation magnitude. It adds no supervision, parameters, hidden dimensions, or explicit count features, and recovers standard attention at p=1. Across four continuous-time dynamic graph models and three datasets, MAA improves future-link AUC in 11 of 12 model-dataset cells. Linear recovery from the same hidden representation increases by 4.49% on average, and preferential-attachment recovery improves in all 12 cells after family-wise correction. We also observe consistent evidence in marked temporal point processes, temporal knowledge graphs, retrieval-augmented generation, and spatio-temporal point processes. Information accessibility and task utility remain distinct: NLL improves in MTPP, ranking is largely preserved in TKG, additional information in RAG does not improve the diagnostic head, and downstream LayerNorm can erase the signal in STPP. These results position MAA as a general normalization principle for improving predictor-facing representation informativeness by controlling repetition invariance in standard attention.
- Abstract(参考訳): 高いタスク性能は、モデルが内部表現に予測関連構造情報を保持するかどうかを示すものではない。
例えば、時間グラフモデルは高次リンクAUCを達成することができるが、基本的なグラフ統計は、同じ表現から回復することが困難である。
証拠パターンを繰り返すと、数値と分母が同じ速度で成長するので、蓄積された証拠の量が異なる入力は、同じ集合を生成することができる。
標準L1正規化をLpファミリーに一般化するMass-Aware Attention (MAA)を提案する。
繰り返して、MAAは数値と分母を異なる速度でスケールさせ、表現の規模において有効な入力数を保持する。
監督、パラメータ、隠された次元、明示的なカウント機能を追加せず、p=1で標準的な注意を回復する。
4つの連続時間動的グラフモデルと3つのデータセットにまたがって、MAAは12のモデルデータセットセルのうち11の将来のリンクAUCを改善している。
同じ隠蔽表現からの線形リカバリは平均4.49%増加し、家族的修正後の全12細胞において優先的アタッチメントリカバリが向上する。
また、有意な時間的点過程、時間的知識グラフ、検索強化生成、時空間的点過程における一貫した証拠も観察する。
NLLはMTPPで改善され、ランキングはTKGでほとんど保存され、RAGでの追加情報は診断ヘッドで改善されず、下流のLayerNormはSTPPで信号を削除することができる。
これらの結果から、MAAは、標準注意における反復不変性を制御することにより、予測対象の表現情報を改善するための一般的な正規化原理として位置づけられる。
関連論文リスト
- Self-Gating Attention for Efficient Time Series Forecasting [32.21325858238185]
時系列予測における自己注意マップは、しばしば異なるタイムスタンプにまたがる冗長なパターンを含む。
本稿では,共有学習行列と入力依存残差成分で注目スコアを表すプラグイン・アンド・プレイアテンション機構であるセルフゲーティング・アテンション(SGA)を提案する。
論文 参考訳(メタデータ) (2026-07-02T15:49:14Z) - A Statistical Approach for Modeling Irregular Multivariate Time Series with Missing Observations [21.49782595218257]
不十分な値を持つ不規則な時系列は、医療などの領域における予測モデリングに重大な課題をもたらす。
本手法は,観測値の標準偏差と,連続観測における変化の平均と変動率の4つの重要な特徴を計算した。
AUROC/AUPRCは0.5-1.7%、F1スコアは1.1-1.7%である。
論文 参考訳(メタデータ) (2026-02-23T05:48:17Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - Spatial Reasoning with Denoising Models [49.83744014336816]
本稿では,連続変数の集合に対する推論を行うためのフレームワークを提案する。
初めて、その生成順序をデノナイジングネットワーク自体によって予測できる。
これらの結果から,特定の推論タスクの精度を1%から50%に向上させることができる。
論文 参考訳(メタデータ) (2025-02-28T14:08:30Z) - DyG-Mamba: Continuous State Space Modeling on Dynamic Graphs [59.434893231950205]
動的グラフ学習は、現実世界のシステムにおける進化の法則を明らかにすることを目的としている。
動的グラフ学習のための新しい連続状態空間モデルDyG-Mambaを提案する。
我々はDyG-Mambaがほとんどのデータセットで最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2024-08-13T15:21:46Z) - Detecting Anomalies in Dynamic Graphs via Memory enhanced Normality [39.476378833827184]
動的グラフにおける異常検出は、グラフ構造と属性の時間的進化によって大きな課題となる。
時空間記憶強調グラフオートエンコーダ(STRIPE)について紹介する。
STRIPEは、AUCスコアが5.8%改善し、トレーニング時間が4.62倍速く、既存の手法よりも大幅に優れている。
論文 参考訳(メタデータ) (2024-03-14T02:26:10Z) - Disentanglement via Latent Quantization [60.37109712033694]
本研究では,組織化された潜在空間からの符号化と復号化に向けた帰納的バイアスを構築する。
本稿では,基本データレコーダ (vanilla autoencoder) と潜時再構成 (InfoGAN) 生成モデルの両方に追加することで,このアプローチの広範な適用性を実証する。
論文 参考訳(メタデータ) (2023-05-28T06:30:29Z) - Imputing Missing Observations with Time Sliced Synthetic Minority
Oversampling Technique [0.3973560285628012]
本稿では,データセット内の各サンプルに対して均一な不規則な時系列を構成することを目的とした,単純かつ斬新な時系列計算手法を提案する。
我々は、観測時間の重複しないビン(「スライス」と呼ばれる)の中間点で定義される格子を固定し、各サンプルが所定の時間にすべての特徴に対して値を持つことを保証する。
これにより、完全に欠落した観察をインプットし、データ全体の時系列の均一な分類を可能にし、特別な場合には個々の欠落した特徴をインプットすることができる。
論文 参考訳(メタデータ) (2022-01-14T19:23:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。