論文の概要: Multilinguality in Hybrid Attention LLMs
- arxiv url: http://arxiv.org/abs/2609.35378v1
- Date: Mon, 28 Sep 2026 15:14:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 06:00:07.878857
- Title: Multilinguality in Hybrid Attention LLMs
- Title(参考訳): ハイブリッドアテンションLDMにおける多言語性
- Abstract要約: 本研究は,LLMの多言語性に対するハイブリットアテンションの影響に関する最初の研究である。
本研究の動機は,再発状態の帰納バイアスが言語処理を変化させる可能性にある。
代替レイヤのオーダはトレーニングを通じて標準よりも優れており、最大2.5倍高速に学習することができる。
- 参考スコア(独自算出の注目度): 45.90403983668531
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In response to the growing demand for long sequences in agentic and reasoning use cases, many state-of-the-art LLMs combine multiple variants of attention to mitigate the quadratic complexity of traditional softmax attention. These hybrid attention LLMs aim to balance the strengths and limitations of full attention and alternatives based on recurrence. This work presents a first study of how hybrid attention impacts the multilinguality of LLMs. Beyond the impact on long sequences in poorly tokenized languages, our study is motivated by the possibility that the inductive biases of the recurrent state alter linguistic processing. Our interpretability analysis confirms this, showing that cross-lingual representations in hybrid models develop in patterns tied to the ordering of recurrent and full-attention layers. Across diverse models, we notably observe a pronounced spike in cross-lingual alignment around the first full-attention layer. These findings lead us to question the conventional ordering of attention layers. In distillation experiments on multilingual data, all alternative layer orderings outperform the standard throughout training, learning up to 2.5X faster. These stark, replicable results prompt our theory that multilingual models would benefit from starting with a full-attention layer rather than recurrent layers.
- Abstract(参考訳): エージェントや推論のユースケースにおける長いシーケンスの需要の増加に対応して、多くの最先端のLCMは、従来のソフトマックスの注意の二次的複雑さを軽減するために、複数の種類の注意を組み合わせる。
これらのハイブリッドアテンションLLMは、注意力と代替手段の強さと限界を、再発に基づいてバランスさせることを目的としている。
本研究は,LLMの多言語性に対するハイブリットアテンションの影響に関する最初の研究である。
トークン化の不十分な言語における長いシーケンスへの影響以外にも、再発状態の帰納的バイアスが言語処理を変化させる可能性によって、我々の研究は動機づけられている。
我々の解釈可能性分析は、ハイブリッドモデルにおける言語間表現が、繰り返しおよび全アテンション層の順序に結びついたパターンで発達することを示す。
多様なモデル全体で、我々は第1のフルアテンション層周辺の言語間アライメントの顕著なスパイクを観察している。
これらの結果から,従来の注意層配置に疑問が持たれた。
多言語データの蒸留実験では、全ての代替層注文はトレーニングを通して標準よりも優れ、最大2.5倍高速に学習する。
これらの輝かしいレプリカブルな結果は、多重言語モデルが再帰的な層ではなく、フルアテンション層から始めることの恩恵をもたらすという我々の理論を示唆する。
関連論文リスト
- MultiHaluDet: Multilingual Hallucination Detection via LLM Hidden State Probing [1.3700362496838856]
大規模言語モデル(LLM)における幻覚は、信頼性の高いデプロイメントにとって重要な障壁である。
多言語幻覚を検出する新しい3段階積み重ねフレームワークであるMultiHaluDetを紹介する。
本フレームワークは,HluEvalおよびTriviaQAベンチマークで98.55%のAUROCに到達し,最先端検出性能を実現する。
論文 参考訳(メタデータ) (2026-05-24T07:50:03Z) - LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language Models [12.710857972236303]
言語間トピックモデリングは、言語間の共有意味構造を発見することを目的としている。
近年のLCMによる改良は解釈性を改善しているが, コストが高く, 文書レベルが高く, 幻覚の傾向が強い。
LLM-XTM は,自己整合性不確実性定量化と LLM-Guided topic refinement を統合したフレームワークである。
論文 参考訳(メタデータ) (2026-05-05T02:40:39Z) - Multilingual Routing in Mixture-of-Experts [45.90403983668531]
並列多言語データセットを用いて、専門家のルーティングパターンを分析する。
MoEモデルは、初期および後期のデコーダ層において、言語固有の方法でトークンをルーティングする。
本稿では,英語で頻繁に活性化される中層タスクエキスパートの促進により,ルータを操る手法を提案する。
論文 参考訳(メタデータ) (2025-10-06T11:09:20Z) - Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models [60.39744129890118]
大規模視覚言語モデル(LVLM)は、人間の言語で視覚情報を理解する能力を示す。
本研究では,LVLMの多言語理解能力と浅い層における言語特異的ニューロン活性化の関連性を明らかにする。
精密LAnguage-Specific 層ファインチューニングによるLVLMの多言語化を実現する学習レシピ PLAST を紹介する。
論文 参考訳(メタデータ) (2025-08-25T18:15:25Z) - The Emergence of Abstract Thought in Large Language Models Beyond Any Language [95.50197866832772]
大規模言語モデル(LLM)は様々な言語で効果的に機能する。
予備的研究では、LLMの隠れた活性化は、英語以外のプロンプトに反応してもしばしば英語に類似している。
近年の結果は多言語のパフォーマンスが強く、他の言語での特定のタスクにおける英語のパフォーマンスを超えている。
論文 参考訳(メタデータ) (2025-06-11T16:00:54Z) - CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention Intervention [56.08815340137881]
LVLM(Large Vision-Language Models)は、印象的なマルチモーダル能力を示したが、多言語オブジェクト幻覚の傾向は残っていない。
LVLMにおける多言語オブジェクト幻覚(CLAIM)の緩和のための言語横断的注意介入を提案する。
論文 参考訳(メタデータ) (2025-06-03T11:17:16Z) - Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models [56.61984030508691]
言語混乱に関する最初の機械論的解釈可能性研究について述べる。
混乱点(CP)がこの現象の中心であることを示す。
比較分析によって同定された少数の臨界ニューロンを多言語で調整したニューロンで編集すると、混乱が著しく軽減されることがわかった。
論文 参考訳(メタデータ) (2025-05-22T11:29:17Z) - Probing the Emergence of Cross-lingual Alignment during LLM Training [10.053333786023089]
多言語大言語モデル(LLM)は、ゼロショットの多言語間転送性能を著しく向上させる。
本研究では,LLMの事前学習において,このような言語間アライメントがどのように出現するかを検討する。
ニューロンの重なり合いと下流性能の相関関係を観察する。
論文 参考訳(メタデータ) (2024-06-19T05:31:59Z) - Analyzing the Mono- and Cross-Lingual Pretraining Dynamics of
Multilingual Language Models [73.11488464916668]
本研究では,多言語事前学習プロセスのダイナミクスについて検討する。
我々は,XLM-Rプレトレーニング全体から抽出したチェックポイントを,一連の言語的タスクを用いて探索する。
分析の結果,より複雑なものよりも低レベルな言語スキルが得られ,早期に高い言語性能が得られることがわかった。
論文 参考訳(メタデータ) (2022-05-24T03:35:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。