論文の概要: Discovering Decoupled Functional Modules in Large Language Models
- arxiv url: http://arxiv.org/abs/2603.17823v1
- Date: Wed, 18 Mar 2026 15:13:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-19 18:32:57.778741
- Title: Discovering Decoupled Functional Modules in Large Language Models
- Title(参考訳): 大規模言語モデルにおける非結合機能モジュールの発見
- Abstract要約: 大規模言語モデルは、どのように異なる関数をモジュールにまとめるかは、まだ明らかにされていない。
本研究では,LLM全体の大きなニューロン群を同時にモジュールに分解する,教師なしLLMクロスレイヤー分子発見(ULCMOD)フレームワークを提案する。
本稿では,新しい目的関数と効率的なイテレーティブ・デカップリング(IterD)アルゴリズムを提案する。
- 参考スコア(独自算出の注目度): 21.534639190745978
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding the internal functional organization of Large Language Models (LLMs) is crucial for improving their trustworthiness and performance. However, how LLMs organize different functions into modules remains highly unexplored. To bridge this gap, we formulate a functional module discovery problem and propose an Unsupervised LLM Cross-layer MOdule Discovery (ULCMOD) framework that simultaneously disentangles the large set of neurons in the entire LLM into modules while discovering the topics of input samples related to these modules. Our framework introduces a novel objective function and an efficient Iterative Decoupling (IterD) algorithm. Extensive experiments show that our method discovers high-quality, disentangled modules that capture more meaningful semantic information and achieve superior performance in various downstream tasks. Moreover, our qualitative analysis reveals that the discovered modules show semantic coherence, correspond to interpretable specializations, and a clear spatial and hierarchical organization within the LLM. Our work provides a novel tool for interpreting the functional modules of LLMs, filling a critical blank in LLM's interpretability research.
- Abstract(参考訳): 言語モデル(LLM)の内部機能組織を理解することは、信頼性とパフォーマンスを改善する上で非常に重要です。
しかし、LLMがいかに異なる関数をモジュールに整理するかは、まだ明らかになっていない。
このギャップを埋めるために,機能モジュール発見問題を定式化し,LLM全体の大きなニューロン集合をモジュールに同時にアンタングルし,これらのモジュールに関連する入力サンプルのトピックを発見できるunsupervised LLM Cross-layer Module Discovery (ULCMOD) フレームワークを提案する。
本稿では,新しい目的関数と効率的なイテレーティブ・デカップリング(IterD)アルゴリズムを提案する。
実験により,より意味のあるセマンティックな情報を収集し,様々な下流タスクにおいて優れた性能を実現する,高品質で不整合なモジュールが発見された。
さらに,これらのモジュールは意味的コヒーレンスを示し,解釈可能な特殊化に対応し,LLM内の空間的・階層的構造が明確であることを明らかにする。
我々の研究はLLMの機能的モジュールを解釈するための新しいツールを提供し、LLMの解釈可能性研究において重要な空白を埋める。
関連論文リスト
- EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants [7.295547133368925]
本稿では,Large Language Model (LLM) を用いた質問応答システムの総合評価を行う。
我々のフレームワークは、各コンポーネントを分離し、評価することで、きめ細かい分析を可能にします。
このモジュラーアプローチは、特定の障害モードとパフォーマンスパターンを明らかにし、解釈可能で効果的な教育用QAシステムの開発をサポートする。
論文 参考訳(メタデータ) (2025-11-21T23:05:46Z) - Who Reasons in the Large Language Models? [18.521142439429635]
十分に訓練された大言語モデルにおける推論能力は、Transformerのマルチヘッド自己認識機構における出力投影モジュール(oproj)に起因していることを示す。
我々は、オプロイが推論を可能にする上で中心的な役割を果たすことを示す状況証拠と経験的証拠の両方を提供し、他のモジュールはより流動的な対話に寄与する。
論文 参考訳(メタデータ) (2025-05-27T10:26:47Z) - Modular Machine Learning: An Indispensable Path towards New-Generation Large Language Models [33.822930522694406]
我々は,次世代大規模言語モデル(LLM)に不可欠なアプローチとして,有望な学習パラダイム,すなわちモジュール機械学習(MML)を概説する。
我々は,LLMの複雑な構造を,モジュール表現,モジュールモデル,モジュール推論の3つの相互依存成分に分解する,LLMのための統一MMLフレームワークを提案する。
最終的に、MLとLLMの統合は、統計的(深層)学習と形式的(論理的)推論のギャップを埋める可能性があると信じています。
論文 参考訳(メタデータ) (2025-04-28T17:42:02Z) - Configurable Foundation Models: Building LLMs from a Modular Perspective [115.63847606634268]
LLMを多数の機能モジュールに分解する傾向が高まり、複雑なタスクに取り組むためにモジュールの一部とモジュールの動的アセンブリを推論することができる。
各機能モジュールを表すブロックという用語を造語し、モジュール化された構造をカスタマイズ可能な基礎モデルとして定義する。
検索とルーティング,マージ,更新,成長という,レンガ指向の4つの操作を提示する。
FFN層はニューロンの機能的特殊化と機能的ニューロン分割を伴うモジュラーパターンに従うことが判明した。
論文 参考訳(メタデータ) (2024-09-04T17:01:02Z) - LLM Inference Unveiled: Survey and Roofline Model Insights [62.92811060490876]
大規模言語モデル(LLM)推論は急速に進化しており、機会と課題のユニークなブレンドを提示している。
本調査は, 研究状況を要約するだけでなく, 屋上モデルに基づく枠組みを導入することによって, 従来の文献レビューから際立っている。
このフレームワークは、ハードウェアデバイスにLSMをデプロイする際のボトルネックを特定し、実用上の問題を明確に理解する。
論文 参考訳(メタデータ) (2024-02-26T07:33:05Z) - Small LLMs Are Weak Tool Learners: A Multi-LLM Agent [73.54562551341454]
大規模言語モデル(LLM)エージェントはスタンドアロンのLLMの機能を大幅に拡張する。
本稿では、上記の機能をプランナー、呼び出し元、要約器に分解する新しい手法を提案する。
このモジュール化されたフレームワークは、個々の更新と、それぞれの機能を構築するための小さなLLMの潜在的な使用を容易にする。
論文 参考訳(メタデータ) (2024-01-14T16:17:07Z) - If LLM Is the Wizard, Then Code Is the Wand: A Survey on How Code
Empowers Large Language Models to Serve as Intelligent Agents [81.60906807941188]
大型言語モデル(LLM)は、自然言語と形式言語(コード)の組み合わせに基づいて訓練される
コードは、標準構文、論理一貫性、抽象化、モジュール性を備えた高レベルの目標を実行可能なステップに変換する。
論文 参考訳(メタデータ) (2024-01-01T16:51:20Z) - Corex: Pushing the Boundaries of Complex Reasoning through Multi-Model Collaboration [83.4031923134958]
Corexは,大規模言語モデルを自律エージェントに変換する,新たな汎用戦略スイートだ。
人間の振る舞いにインスパイアされたCorexは、Debate、Review、Retrieveモードといった多様なコラボレーションパラダイムによって構成されている。
我々は,複数のLDMを協調的に演奏することで,既存の手法に比べて性能が著しく向上することが実証された。
論文 参考訳(メタデータ) (2023-09-30T07:11:39Z) - mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality [95.76661165594884]
mPLUG-Owlは、大規模言語モデル(LLM)にマルチモーダル能力を持たせる訓練パラダイムである。
トレーニングパラダイムは、LLMの助けを借りて視覚知識を学ぶ、画像とテキストの整列のための2段階の手法を含む。
実験の結果,本モデルは既存のマルチモーダルモデルよりも優れていた。
論文 参考訳(メタデータ) (2023-04-27T13:27:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。