NeuroCogMap Reveals Cognitive Organization of Large Language Models
Abstractの概要
NeuroCogMapは、認知神経科学に触発されたフレームワークであり、大規模言語モデルの内部の疎な特徴量を機能的なパーセル(区画)に編成し、解釈可能な機能や認知能力と関連付け、知覚から応用に至る4段階の階層構造に配置する。GemmaやLlamaなどのモデルからSAE(Sparse Autoencoder)で抽出した特徴量を使用し、生成されたパーセルが意味的に一貫性があり、中間的な粒度で安定しており、モデル間で部分的に保存されていることを報告している。さらに、この構造を用いてハルシネーションや拒絶失敗などの病的行動を分析し、異なる失敗が表現システムと行動制御システムにおける別々の崩壊に対応することを示している。モデルの病理分析にとどまらず、自然な言語理解中のヒトの皮質応答の予測を向上させたり、意思決定の古典的な認知モデルを改善するのに役立つ潜在的な戦略シグナルを導出するためにも使用されている。
新規性
本論文の主な新規性は、解釈可能な内部単位や高次の認知構造を定義するために、認知神経科学の概念、特に機能的パーセレーションを借用したLLM向けのシステムレベルのマッピングフレームワークである点である。また、失敗の診断と介入、ヒトの皮質機能との比較、および認知に導かれたモデルの発見といった複数の下流タスクの分析において、同じ内部マップを使用している点も特徴的である。
成果
著者らは、270のパーセルからなるアトラスが、パーセル内で一貫した意味論、予測可能な機能的記述、選択的なパーセルと能力のリンク、およびモデル間の部分的な対応関係をもたらすことを報告している。NeuroCogMapから導出されたシグネチャは、複数のベースライン(不確実性、プロービング、摂動ベース)よりもハルシネーションや拒絶失敗を適切に検出し、パーセルレベルの介入によってテスト環境における事実の正確性や拒絶のパフォーマンスが向上する。さらに本フレームワークは、LeBel物語聴取データセットにおいて比較対象の表現の中で最も高い皮質応答の予測精度を達成し、改良された2段階意思決定モデルのホールドアウト適合度の向上も示している。
論文の注目点
- NeuroCogMapは、疎な特徴量を機能的パーセルにクラスタリングし、認知機能のアノテーションを付与して能力に関連付け、階層化することで、LLM認知の多層の内部アトラスを構築する。
- マッピングされた構造は異なる失敗メカニズムの区別に用いられ、ハルシネーションは表現の崩壊に、拒絶失敗は安全性に関連する制御から手続き的実行への移行に結び付けられており、これらのシグネチャは検出と標的を絞った介入をも支援する。
- NeuroCogMapは、言語理解中の皮質応答の予測精度を向上させ、古典的な認知モデルの改善に役立つ潜在的な意思決定戦略を明らかにすることによって、ヒトの認知システムと結び付けられている。