論文の概要: Distributed Sparse Interventions in Language Models
- arxiv url: http://arxiv.org/abs/2607.07128v1
- Date: Wed, 08 Jul 2026 08:19:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.321002
- Title: Distributed Sparse Interventions in Language Models
- Title(参考訳): 言語モデルにおける分散スパース介入
- Authors: Maximilian S. Ernst, Lorenz Linhardt, Aaron Peikert, Oliver Eberle,
- Abstract要約: タスク動作におけるモデルコンポーネントの役割を研究するために,分散スパース介入(DSI)を導入する。
DSIは、タスク関連計算を必要とするニューロンのスパース集合を特定するために、層間のニューロン間の非線形性と相互作用を考察している。
我々は,DSIが学習言語モデルにおけるタスク動作を,0.01%のニューロンの局所化と介入によって活性化できることを実証した。
- 参考スコア(独自算出の注目度): 5.980111878930065
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models perform a wide range of tasks at varying levels of abstraction with the capacity to flexibly infer tasks from context, execute multiple tasks simultaneously, and select among competing tasks. To study the role of model components in task behaviour, their causal influence can be investigated through interventions. Prior work on model steering has largely focused on interventions along global directions in activation space, modeling task representations as approximately linear and additive. By studying interventions at the neuron level, we find substantial, neuron-specific nonlinear effects on model outputs that are not captured by current steering approaches. We introduce Distributed Sparse Interventions (DSI), an intervention approach that considers nonlinearities and interactions between neurons across layers to identify sparse sets of neurons that elicit task-relevant computations. Across a range of tasks, we demonstrate that DSI can activate task behaviour in instruction-tuned language models by localising and intervening on as few as 0.01% of neurons, highlighting the effectiveness of sparse, distributed interventions in the neuron basis. Additionally, adopting a set-based perspective enables computations over the identified neuron sets, offering insights into the roles of individual neurons by analysing their effects across tasks. Through sparse interventions, DSI enables fine-grained control over model behaviour, localisation of task-relevant neuron sets, and furthers our understanding of task composition.
- Abstract(参考訳): 言語モデルは、コンテキストから柔軟にタスクを推測し、複数のタスクを同時に実行し、競合するタスクの中から選択することができる。
課題行動におけるモデルコンポーネントの役割を研究するために,その因果的影響を介入を通して調査することができる。
モデルステアリングの以前の研究は、アクティベーション空間におけるグローバルな方向に沿った介入に主に焦点を合わせ、タスク表現を概して線形で付加的なものとしてモデル化してきた。
ニューロンレベルでの介入を研究することで、現在のステアリングアプローチでは捉えられないモデル出力に対して、かなり、ニューロン特異的な非線形効果が見つかる。
本稿では, タスク関連計算を行うニューロンのスパース集合を識別するために, 階層間の非線形性や相互作用を考慮した介入手法であるDistributed Sparse Interventions (DSI)を導入する。
様々なタスクにおいて、DSIは、神経細胞の0.01%を局所化し介入することにより、訓練言語モデルにおけるタスクの動作を活性化できることを示し、ニューロンベースでのスパース分散介入の有効性を強調した。
さらに、セットベースの観点を採用することで、特定されたニューロンセットに対する計算が可能になり、タスク間での効果を分析することで、個々のニューロンの役割に関する洞察を提供する。
スパース介入により、DSIはモデル行動のきめ細かい制御、タスク関連ニューロン集合の局所化を可能にし、タスク構成の理解を深める。
関連論文リスト
- Tiny Brains, Giant Impact: Uncovering the Keystone Neurons of LLM with Just a Few Prompts [57.98275914877019]
広い範囲のオープンウェイトトランスフォーマーにおいて、ニューロンのサブセットは、複数の能力次元のタスクをまたいだ推論において、常に高度に活性化されることが示される。
クロスタスク活性化強度に沿って探索することにより、非常にスパースなサブセットが分離され、その除去はモデル挙動の崩壊を引き起こす。
解析の結果,キーストーンニューロンは,前訓練中にほぼ確立されたモデルの安定で内在的なニューロンサブセットであることが明らかとなった。
論文 参考訳(メタデータ) (2026-05-24T03:31:07Z) - From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models [10.052877942432783]
HONESは、視覚言語モデルにおけるタスク認識ニューロンの属性とステアリングのための勾配のないフレームワークである。
HONESは,タスククリティカルニューロンの同定において既存の手法よりも優れており,ステアリング後のモデル性能が向上していることを示す。
論文 参考訳(メタデータ) (2026-04-20T08:21:06Z) - To See a World in a Spark of Neuron: Disentangling Multi-task Interference for Training-free Model Merging [16.81093103067372]
本研究は, モデルマージにおける神経機構を利用した最初の研究である。
神経サブスペース内のタスク干渉を軽減するために開発された新しい統合フレームワークであるNeuroMergingを紹介する。
本研究は, モデルマージにおける神経機構の整合の重要性を強調した。
論文 参考訳(メタデータ) (2025-03-07T11:00:24Z) - Neural Models of Task Adaptation: A Tutorial on Spiking Networks for Executive Control [0.0]
このチュートリアルでは、タスクスイッチングのダイナミクスをシミュレートするスパイキングニューラルネットワーク(SNN)を構築するためのステップバイステップのアプローチを示す。
このモデルには、横方向の抑制、適応的なシナプス重み、生理的関連範囲における正確なパラメータ化など、生物学的に現実的な特徴が組み込まれている。
このチュートリアルに従うことで、認知過程や神経適応を研究するための生物学的にインスパイアされたSNNモデルを開発、拡張することができる。
論文 参考訳(メタデータ) (2025-03-05T00:44:34Z) - STNDT: Modeling Neural Population Activity with a Spatiotemporal
Transformer [19.329190789275565]
我々は、個々のニューロンの応答を明示的にモデル化するNDTベースのアーキテクチャであるSpatioTemporal Neural Data Transformer (STNDT)を紹介する。
本モデルは,4つのニューラルデータセット間での神経活動の推定において,アンサンブルレベルでの最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2022-06-09T18:54:23Z) - Overcoming the Domain Gap in Contrastive Learning of Neural Action
Representations [60.47807856873544]
神経科学の基本的な目標は、神経活動と行動の関係を理解することである。
我々は,ハエが自然に生み出す行動からなる新しいマルチモーダルデータセットを作成した。
このデータセットと新しい拡張セットは、神経科学における自己教師あり学習手法の適用を加速することを約束します。
論文 参考訳(メタデータ) (2021-11-29T15:27:51Z) - Multi-Task Neural Processes [105.22406384964144]
我々はマルチタスク学習のためのニューラル・プロセスの新たな変種であるマルチタスク・ニューラル・プロセスを開発する。
特に,各タスク改善のための帰納的バイアスを提供するために,関数空間内の関連するタスクから伝達可能な知識を探索することを提案する。
その結果、マルチタスク学習におけるタスク間の有用な知識の伝達におけるマルチタスクニューラルプロセスの有効性が示された。
論文 参考訳(メタデータ) (2021-11-10T17:27:46Z) - Learning Neural Causal Models with Active Interventions [83.44636110899742]
本稿では,データ生成プロセスの根底にある因果構造を素早く識別する能動的介入ターゲット機構を提案する。
本手法は,ランダムな介入ターゲティングと比較して,要求される対話回数を大幅に削減する。
シミュレーションデータから実世界のデータまで,複数のベンチマークにおいて優れた性能を示す。
論文 参考訳(メタデータ) (2021-09-06T13:10:37Z) - And/or trade-off in artificial neurons: impact on adversarial robustness [91.3755431537592]
ネットワークに十分な数のOR様ニューロンが存在すると、分類の脆さと敵の攻撃に対する脆弱性が増加する。
そこで我々は,AND様ニューロンを定義し,ネットワーク内での割合を増大させる対策を提案する。
MNISTデータセットによる実験結果から,本手法はさらなる探索の方向として有望であることが示唆された。
論文 参考訳(メタデータ) (2021-02-15T08:19:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。