論文の概要: How Language Models Differ in Redistributing Attention-Head Activity Under Serial Demand
- arxiv url: http://arxiv.org/abs/2609.36221v1
- Date: Mon, 28 Sep 2026 20:19:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.999637
- Title: How Language Models Differ in Redistributing Attention-Head Activity Under Serial Demand
- Title(参考訳): 言語モデルが心的欲求下での注意行動の再分配にどう影響するか
- Abstract要約: モデルが各レイヤのアテンションヘッド上でアクティビティを分散する方法は、ディープを通して情報をルーティングする方法の粗いビューを提供する。
ほとんどのモデルでは、奥行きの直前のレイヤがアクティビティに集中し、後のレイヤがそれを拡散します。
上位の頭に集中しているモデルも、その答えの頭に依存している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The way a model distributes activity over each layer's attention heads offers a coarse view of how it routes information through depth; how this changes with the task is part of what a mechanistic account must explain. Holding prompt length fixed, we vary how many serial steps a task demands and measure, in every layer of 17 open-weight models, whether activity concentrates on a few heads or spreads across many as demand rises. Both occur: in most models, layers just before mid-depth concentrate activity and later layers spread it. Models differ in where and how strongly this happens. The Qwen2.5 base models from 0.5B to 7B, for example, spread less than the average model in every task and concentrate activity in parts of their second half, where Llama models from 1B to 8B and OLMo-2 spread; the contrast largely holds between Llama-3.1-70B and Qwen2.5-72B, which have the same number of layers and heads. These differences are reproducible, and post-trained models keep much of their base model's pattern. An ablation study suggests that, within a task, models whose activity is more concentrated on their top heads also depend more on those heads for the answer. Concentration and spreading across layers thus offer a new way to compare models, by how they route information through depth. Code is available at https://github.com/johnnyjli/serial-demand-heads.
- Abstract(参考訳): モデルが各レイヤのアテンションヘッド上でアクティビティを分散する方法は、それがディープを通して情報をルーティングする方法の粗いビューを提供する。
迅速な長さの固定は、要求されるタスクのシリアルステップの数や17のオープンウェイトモデルのすべてのレイヤにおいて、アクティビティが数頭に集中するか、要求が上昇するにつれて多くの層に広がるかによって異なります。
ほとんどのモデルでは、深度が集中する直前の層が活動に集中し、後の層がそれを拡散します。
モデルは、どこで、どのくらい強く起こるかによって異なる。
例えば、0.5Bから7BまでのQwen2.5ベースモデルは、全てのタスクにおいて平均モデルよりも小さく、後半ではLlamaモデルから1Bから8BとOLMo-2が広がり、Llama-3.1-70BとQwen2.5-72Bのコントラストは同じレイヤーとヘッドを持つ。
これらの違いは再現可能であり、訓練後のモデルはベースモデルのパターンの多くを保持します。
アブレーション研究は、あるタスクの中で、トップヘッドに活動が集中しているモデルもまた、答えの頭に依存していることを示唆している。
これにより、層にまたがる濃度と拡散は、深度を通して情報をルーティングする方法によって、モデルを比較する新しい方法を提供する。
コードはhttps://github.com/johnnyjli/serial-demand-heads.comで入手できる。
関連論文リスト
- Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention [42.127946936876235]
より大規模なモデルでは、無限のトレーニングデータであっても、小さなモデルでは学習できないタスクが学習されることが示される。
特に、より小さなモデルでは、ニューロンを高頻度または低複雑性のタスクに割り当て、希少で複雑なタスクでは不十分なソリューションを学ぶ。
次に、より大きなモデルがこのデータ中心のボトルネックを回避し、干渉機構の低下に辿り着くかを評価する。
論文 参考訳(メタデータ) (2026-05-28T08:02:11Z) - Nudging: Inference-time Alignment of LLMs via Guided Decoding [18.530367090350605]
大規模言語モデル(LLM)は、ユーザ命令を効果的かつ安全に追従するためにアライメントを必要とする。
このプロセスでは、すべてのベースモデルの整列バージョンをトレーニングする必要があります。
NUDGingは、任意のベースモデルを小さなアライメントモデルを用いて推論時に整列する、トレーニング不要なアルゴリズムである。
論文 参考訳(メタデータ) (2024-10-11T23:24:38Z) - What Matters for Model Merging at Scale? [94.26607564817786]
モデルマージは、複数の専門家モデルとより有能な単一モデルを組み合わせることを目的としている。
これまでの研究は主に、いくつかの小さなモデルをマージすることに焦点を当ててきた。
本研究は,大規模モデルマージの有用性を体系的に評価する。
論文 参考訳(メタデータ) (2024-10-04T17:17:19Z) - MOWA: Multiple-in-One Image Warping Model [65.73060159073644]
本研究で提案するマルチ・イン・ワン・イメージ・ワープ・モデル(MOWA)について述べる。
領域レベルと画素レベルでの動作推定を両立させることにより,マルチタスク学習の難しさを軽減する。
私たちの知る限り、これは1つのモデルで複数の実用的なワープタスクを解決する最初の作業です。
論文 参考訳(メタデータ) (2024-04-16T16:50:35Z) - UnIVAL: Unified Model for Image, Video, Audio and Language Tasks [105.77733287326308]
UnIVALモデルは2つのモードを超えて、テキスト、画像、ビデオ、オーディオを1つのモデルに統合する。
本モデルは,タスクバランスとマルチモーダルカリキュラム学習に基づいて,多くのタスクに対して効率的に事前学習を行う。
統一モデルにより、重み一般化によるマルチモーダルモデルの融合に関する新しい研究を提案する。
論文 参考訳(メタデータ) (2023-07-30T09:48:36Z) - ZipIt! Merging Models from Different Tasks without Training [20.2479633507354]
ZipIt!」は、同じアーキテクチャの2つの任意のモデルをマージする一般的な方法である。
これら2つの変更が組み合わさって、以前の作業よりも20~60%改善されていることが分かりました。
論文 参考訳(メタデータ) (2023-05-04T17:59:58Z) - Mimicking the Oracle: An Initial Phase Decorrelation Approach for Class Incremental Learning [141.35105358670316]
本研究では,Na"訓練初期相モデルとオラクルモデルとの相違について検討する。
より均一に散らばるように,各クラスの表現を効果的に正規化するクラスワイド・デコレーション(CwD)を提案する。
私たちのCwDは実装が簡単で、既存のメソッドに簡単にプラグインできます。
論文 参考訳(メタデータ) (2021-12-09T07:20:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。