論文の概要: Multi-Gate Residuals
- arxiv url: http://arxiv.org/abs/2605.23259v1
- Date: Fri, 22 May 2026 06:00:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.217729
- Title: Multi-Gate Residuals
- Title(参考訳): マルチゲート残像
- Authors: Zhizhan Zheng, Feiyun Zhang, Shuchun Liu, Tian Xia, Xi Liu, Dasheng Hu, Hongquan Zhou,
- Abstract要約: 本稿では,MGR(Multi-Gate Residuals)を提案する。
MGRは大規模なトレーニングとデプロイメントに実用的であり、既存のアーキテクチャよりも明確なパフォーマンス向上を提供する。
- 参考スコア(独自算出の注目度): 4.946825241542971
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Attention Residuals has shown some effectiveness in addressing the widespread issue of unbounded activation growth across deep residual layers, it inevitably incurs significant communication overhead. To circumvent this bottleneck, we propose Multi-Gate Residuals (MGR), which stabilizes activation scales without additional communication burden. It utilizes a straightforward scoring and gating mechanism to maintain multi-stream context, coupled with Attention Pooling to extract hidden states from the stream states. Empirical experiments demonstrate that MGR is practical for large-scale training and deployment, offering tangible performance improvements over existing architectures.
- Abstract(参考訳): Attention Residualsは、深い残層にまたがる非バウンドなアクティベーション成長の広範な問題に対処する上で、いくつかの効果を示してきたが、必然的にかなりの通信オーバーヘッドを引き起こす。
このボトルネックを回避するために,通信負荷を伴わずにアクティベーションスケールを安定化するMGR(Multi-Gate Residuals)を提案する。
ストレートなスコアリングとゲーティング機構を使用してマルチストリームコンテキストを維持し、アテンションプールと組み合わせてストリーム状態から隠れた状態を抽出する。
経験的な実験では、MGRは大規模なトレーニングとデプロイメントに実用的であり、既存のアーキテクチャよりも明確なパフォーマンス向上を提供する。
関連論文リスト
- PLUME: Latent Reasoning Based Universal Multimodal Embedding [52.35354073629127]
ユニバーサルマルチモーダル埋め込み(UME)は、異種入力を単一のモデルで共有検索空間にマッピングする。
最近のアプローチでは、埋め込みを抽出する前に明確なチェーン・オブ・シント(CoT)論理を生成することにより、UMEを改善している。
PLUMEは,言語化されたCoTを連続的潜伏状態の短時間の自己回帰ロールアウトに置き換えることで,UMEを進化させる潜在的推論フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T14:04:53Z) - ARES: Scalable and Practical Gradient Inversion Attack in Federated Learning through Activation Recovery [73.8181449261685]
Federated Learning(FL)は、モデルの更新を生データではなく共有することで、ユーザのプライバシ保護を目的としたコラボレーションモデルトレーニングを可能にする。
最近の研究によると、これらの共有更新は、勾配反転攻撃(GIA)を通じて、不注意にセンシティブなトレーニングデータを漏洩する可能性がある。
論文 参考訳(メタデータ) (2026-03-18T11:40:44Z) - MORE: Multi-Objective Adversarial Attacks on Speech Recognition [39.77140497042348]
Whisperのような大規模自動音声認識(ASR)モデルは、様々な現実世界のアプリケーションで採用を広げている。
したがって、小さな入力の摂動に対する堅牢性は、リアルタイム環境における信頼性の高い性能を維持するために重要である。
認識精度と推論効率を両立させる多目的反復倍増促進攻撃MOREを導入する。
論文 参考訳(メタデータ) (2026-01-05T07:27:57Z) - Explaining multimodal LLMs via intra-modal token interactions [55.27436637894534]
MLLM(Multimodal Large Language Models)は、様々な視覚言語タスクにおいて顕著な成功を収めているが、その内部決定機構は十分に理解されていない。
モーダル内相互作用を利用した解釈可能性の向上を提案する。
論文 参考訳(メタデータ) (2025-09-26T14:39:13Z) - MAT: Multi-Range Attention Transformer for Efficient Image Super-Resolution [14.265237560766268]
画像超解像(SR)タスクのためのマルチランジアテンショントランス (MAT) を提案する。
MATはマルチレンジ・アテンション(MA)とスパース・マルチレンジ・アテンション(SMA)の両方を促進する。
また、MSConvStarモジュールを導入し、マルチレンジ表現学習におけるモデルの能力を高める。
論文 参考訳(メタデータ) (2024-11-26T08:30:31Z) - Synergistic Multiscale Detail Refinement via Intrinsic Supervision for
Underwater Image Enhancement [39.208417033777415]
マルチステージを含む水中シーンの細部を高度化するための内在監視(SMDR-IS)を提案する。
ASISFモジュールは、多段劣化段階における特徴伝達を正確に制御し、ガイドすることができる。
Bifocal Intrinsic-Context Attention Module (BICA) は画像中のマルチスケールシーン情報を効率的に活用する。
論文 参考訳(メタデータ) (2023-08-23T05:40:55Z) - Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation [51.14107156747967]
弱教師付きセマンティックセマンティックセマンティクス(WSSS)は、完全な教師付きアプローチよりもアノテーションが少ないため、かなりの注目を集めている。
本研究では,非学際的な過密化に対する深い注意を抑えるための適応的再活性化機構 (AReAM) を提案する。
AReAMは既存のWSSS手法と比較してセグメンテーション性能を大幅に改善し、ノイズを低減し、関連するセマンティック領域に焦点を絞る。
論文 参考訳(メタデータ) (2023-05-04T19:11:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。