論文の概要: When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs
- arxiv url: http://arxiv.org/abs/2608.08159v1
- Date: Sat, 08 Aug 2026 14:37:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.70484
- Title: When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs
- Title(参考訳): ステアブルな概念表現はいつ現実になるか? : LLMにおける神経科学パラレルのクロスファミリ・オーディションにおける計測の問題点
- Abstract要約: 大型言語モデル(LLM)は、人間のような神経と認知のサインを示すことがますます報告されている。
本研究は,概念方向の因果性について検討する。
生の活性化単位と固定層と係数により, モデルスケールで操舵性は増大した。
残留ノルム比較可能な介入とホールドアウト操作点選択により、概念ステアリングはあらゆる規模において重要なままである。
- 参考スコア(独自算出の注目度): 8.657685524975246
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly reported to exhibit human-like neural and cognitive signatures, including concept cells, mental number lines, and cognitive maps. These claims often rely on linear probing and activation steering applied to a single model, yet both methods are highly sensitive to measurement choices. A reported parallel may therefore reflect the model, the measurement procedure, or both. We audit four representative neuroscience-inspired paradigms across 17 models from five families, spanning $0.6$B to $72$B parameters. Our main experiment examines the causal steerability of concept directions. With raw activation units and a fixed layer and coefficient, steerability appears to increase with model scale, resembling an emergent capability. However, this pattern is produced by an uncalibrated pipeline rather than by a claim established in the steering literature. The trend depends jointly on raw units, the readout metric, and the operating point; correcting any one of these removes it. With residual-norm-comparable interventions and held-out operating-point selection, concept steering remains significant at every scale, but shows no significant trend across the Qwen3 series, although the confidence interval does not rule out a moderate positive slope. The remaining results are mixed. A linear geographic world map is consistently decodable in every tested checkpoint up to $72$B. Number magnitude is strongly encoded, but whether individual neurons appear bell-shaped or monotonic depends on the selection criterion. Language-specific structure is localizable, but the direction of the cross-lingual asymmetry reverses under a different attribution method. These results suggest that the main constraint on AI neuroscience is not a lack of phenomena, but a lack of comparable measurements and adequate controls. We release the protocol, stimuli, and code.
- Abstract(参考訳): 大型言語モデル(LLM)は、概念細胞、メンタルナンバーライン、認知マップなど、人間のような神経的および認知的なサインを示すことがますます報告されている。
これらの主張は1つのモデルに適用される線形探索とアクティベーションステアリングにしばしば依存するが、どちらの手法も測定選択に非常に敏感である。
したがって、報告された並列性はモデル、測定手順、またはその両方を反映することができる。
我々は、5つのファミリーから17のモデルにまたがる4つの代表的な神経科学にインスパイアされたパラダイムを監査し、0.6ドルBから72ドルBのパラメータにまたがる。
本研究は,概念方向の因果性について検討する。
生の活性化単位と固定層と係数により、ステアビリティはモデルスケールで増加し、創発的能力に類似している。
しかし、このパターンはステアリング文献で確立されたクレームではなく、非校正パイプラインによって生成される。
この傾向は、原単位、読み出しメートル法、および操作点に共同して依存する。
残留ノルム比較可能な介入とホールドアウト操作点選択により、概念ステアリングはあらゆるスケールで重要なままであるが、Qwen3級数で有意な傾向は示さないが、信頼区間は適度な正の傾きを排除していない。
残りの結果はまちまちだ。
線形地理世界地図は、テストされた全てのチェックポイントにおいて、一貫して72ドルBまでデオード可能である。
数等級は強く符号化されるが、個々のニューロンがベル型であるか単調かは選択基準に依存する。
言語固有の構造は局所化可能であるが、言語間非対称性の方向は異なる属性法の下で逆転する。
これらの結果は、AI神経科学の主な制約は現象の欠如ではなく、同等の測定と適切な制御の欠如であることを示している。
プロトコル、刺激、コードをリリースします。
関連論文リスト
- Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability [51.56484100374058]
機械論的解釈可能性プリミティブに対する最初の識別可能性定理を証明した。
スペクトルは、正当性分解ではなく、記述されたエラーバーを持つ識別可能なモデル固有の指紋である。
論文 参考訳(メタデータ) (2026-08-10T19:42:01Z) - Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models [0.0]
評価コンテキストを認識するモデルは、その振る舞いを戦略的に変化させ、下流のベンチマークを解釈しにくくする。
Qwen 2.5, Gemma 2, およびLlama 3.2にまたがる11のモデルを用いて、表現深さの体系的な大きさ依存的なシフトを求める。
このことは,評価意識の強さだけでなく,ネットワーク上で最も線形に回復可能な場所でのスケール変化を示唆している。
論文 参考訳(メタデータ) (2026-06-28T04:48:17Z) - Leverage Is Not Reach: A Control-Window Law for Single-Neuron Steering in Language Models [1.7259824817932294]
我々は単一ニューロンステアリングのための予算正規化制御ウィンドウフレームワークを開発した。
1つの書き込み方向に沿った線量も1つの制御座標に減少する。
コヒーレント制御は、行動トリガーが崩壊天井の下にあるときに存在する。
論文 参考訳(メタデータ) (2026-06-18T06:25:18Z) - Before the First Token: Scale-Dependent Emergence of Hallucination Signals in Autoregressive Language Models [6.5607014897534865]
7個の自己回帰変換器の幻覚表現の時間的ダイナミクスについて検討した。
4M以下のモデルでは、生成位置毎に確率レベルプローブの精度を示す。
7Bスケールでは、Pythia-6.9Bは平坦な時間プロファイルを、Qwen2.5-7Bは支配的な前世代効果を示す。
論文 参考訳(メタデータ) (2026-03-20T02:30:01Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - Language Model Circuits Are Sparse in the Neuron Basis [50.460651620833055]
その結果, textbfMLP ニューロンは SAE と同様の機能的基盤であることがわかった。
この作業は、追加のトレーニングコストなしで言語モデルの自動解釈可能性を向上させる。
論文 参考訳(メタデータ) (2026-01-30T05:41:19Z) - Superposition disentanglement of neural representations reveals hidden alignment [6.015414975356222]
神経科学とAIにおいて、表現アライメントメトリクスは、異なるディープニューラルネットワーク(DNN)または脳が類似した情報を表現する範囲を測定する。
我々は、厳密な置換度が重ね合わせに依存するかの理論を開発する。
この結果から,ニューラルネットワーク間の真の表現的アライメントを明らかにするためには,重畳不整合(superposition disentanglement)が必要であることが示唆された。
論文 参考訳(メタデータ) (2025-10-03T17:12:40Z) - An Orthogonal Learner for Individualized Outcomes in Markov Decision Processes [55.93922317950527]
DRQ-learnerと呼ばれる新しいメタラーナーを開発した。
DRQ-learnerは離散状態空間と連続状態空間の両方の設定に適用できます。
論文 参考訳(メタデータ) (2025-09-30T15:49:29Z) - The Causal Neural Connection: Expressiveness, Learnability, and
Inference [125.57815987218756]
構造因果モデル (Structuor causal model, SCM) と呼ばれるオブジェクトは、調査中のシステムのランダムな変動のメカニズムと源の集合を表す。
本稿では, 因果的階層定理 (Thm. 1, Bareinboim et al., 2020) がまだニューラルモデルに対して成り立っていることを示す。
我々はニューラル因果モデル(NCM)と呼ばれる特殊なタイプのSCMを導入し、因果推論に必要な構造的制約をエンコードする新しいタイプの帰納バイアスを定式化する。
論文 参考訳(メタデータ) (2021-07-02T01:55:18Z) - Neural Unsupervised Semantic Role Labeling [48.69930912510414]
セマンティックロールラベリングのための最初の神経教師なしモデルを提案する。
タスクを2つの引数関連サブタスク、識別とクラスタリングとして分解する。
CoNLL-2009英語データセットの実験では、我々のモデルは過去の最先端のベースラインよりも優れていた。
論文 参考訳(メタデータ) (2021-04-19T04:50:16Z) - And/or trade-off in artificial neurons: impact on adversarial robustness [91.3755431537592]
ネットワークに十分な数のOR様ニューロンが存在すると、分類の脆さと敵の攻撃に対する脆弱性が増加する。
そこで我々は,AND様ニューロンを定義し,ネットワーク内での割合を増大させる対策を提案する。
MNISTデータセットによる実験結果から,本手法はさらなる探索の方向として有望であることが示唆された。
論文 参考訳(メタデータ) (2021-02-15T08:19:05Z) - Manifold GPLVMs for discovering non-Euclidean latent structure in neural
data [5.949779668853555]
神経科学における一般的な問題は、行動的に重要な変数の集合的神経表現を解明することである。
本稿では,新しい確率潜在変数モデルを提案し,各ニューロンがその表現に寄与する潜在状態を同時に同定する。
論文 参考訳(メタデータ) (2020-06-12T19:08:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。