論文の概要: In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privileged Access?
- arxiv url: http://arxiv.org/abs/2609.00904v1
- Date: Tue, 01 Sep 2026 08:36:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.481253
- Title: In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privileged Access?
- Title(参考訳): In-Context Neurofeedback: LLMはプライヴィグドアクセスを通して内部表現を制御できるか?
- Authors: Koshiro Aoki, Ryota Takatsuki, Gouki Minegishi, Yusuke Haruki, Daisuke Kawahara,
- Abstract要約: 最近の研究では、ニューロフィードバックを大言語モデル(LLM)に適用し、内部表現を制御できると主張している。
我々はLLMのニューロフィードバックパラダイムを再設計し、制御対象が特権アクセス要件を満たすようにした。
以上の結果から, LLMにおけるメタ認知の厳密な評価には, 特権アクセスを要求される評価方法が必要であることが示唆された。
- 参考スコア(独自算出の注目度): 10.427887176556245
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Whether large language models (LLMs) can control their own internal representations matters for both machine metacognition and AI safety. A recent study applied neurofeedback to LLMs and claimed that they can control their internal representations. However, the reported control may rely on superficial mechanisms rather than genuine internal access because the control targets in that study are not privileged, meaning that a third party can infer them from the prompt. We redesign the neurofeedback paradigm for LLMs so that the control target satisfies the privileged access requirement, which is closer to neurofeedback experiments in human cognitive neuroscience. Under this stricter setting, the models do not demonstrate reliable control over privileged internal representations, suggesting that previously reported control cannot exclude the possibility that it relies on superficial mechanisms. Our results indicate that rigorous assessments of metacognition in LLMs require evaluation methods that demand privileged access.
- Abstract(参考訳): 大きな言語モデル(LLM)が自身の内部表現を制御できるかどうかは、機械のメタ認知とAIの安全性の両方において重要である。
最近の研究は、神経フィードバックをLSMに適用し、内部表現を制御できると主張した。
しかし、報告されたコントロールは、真の内部アクセスではなく、表面的なメカニズムに依存しているかもしれない。
我々は,人間の認知神経科学における神経フィードバック実験に近い特権的アクセス要件を満たすために,LSMの神経フィードバックパラダイムを再設計する。
この厳密な設定の下では、モデルは特権付き内部表現に対する信頼性の高い制御を示さず、事前報告された制御は表面的な機構に依存している可能性を排除することができないことを示唆している。
以上の結果から, LLMにおけるメタ認知の厳密な評価には, 特権アクセスを要求される評価方法が必要であることが示唆された。
関連論文リスト
- Verbalizing LLMs' assumptions to explain and control sycophancy [62.927670321859495]
LLMは、真のアセスメントを提供するのではなく、"am I in the wrong?
LLMからこれらの仮定を抽出するフレームワークであるVerbalized Assumptionsを提案する。
我々の研究は、梅毒のメカニズムとしての仮定の新たな理解に貢献している。
論文 参考訳(メタデータ) (2026-04-03T14:15:43Z) - H-Neurons: On the Existence, Impact, and Origin of Hallucination-Associated Neurons in LLMs [56.31565301428888]
大型言語モデル(LLM)における幻覚関連ニューロン(H-Neurons)の同定
同定の面では、驚くほどスパースなニューロンのサブセットが幻覚の発生を確実に予測できることが示される。
行動への影響に関して、制御された介入は、これらのニューロンが過度に順応する行動と因果関係があることを明らかにする。
論文 参考訳(メタデータ) (2025-12-01T15:32:14Z) - Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations [2.759846687681801]
大規模言語モデル(LLM)は、タスクの解決に実際に使用している戦略を報告することができるが、その振る舞いを管理する戦略を認識できない場合もある。
これはメタ認知(メタ認知)の程度が限定されていることを示唆している。
我々は,LLMのメタ認知能力の定量化と,その活性化パターンの報告と制御に,文脈内学習を用いた神経科学に着想を得た神経フィードバックパラダイムを導入する。
論文 参考訳(メタデータ) (2025-05-19T22:32:25Z) - NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models [14.630626774362606]
大型言語モデル(LLM)の安全性アライメントは、有害な内容を抑えるためにニューロンの活性化を調節する微調整機構によって達成される。
本稿では,安全性の制約を負うニューロンを同定し,修正することにより,不整合を誘導する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-04-29T05:49:35Z) - LLM Internal States Reveal Hallucination Risk Faced With a Query [62.29558761326031]
人間は、クエリに直面したとき、私たちが知らないことを認識できる自己認識プロセスを持っています。
本稿では,大規模言語モデルが応答生成に先立って,自身の幻覚リスクを推定できるかどうかを検討する。
確率推定器により, LLM自己評価を利用して, 平均幻覚推定精度84.32%を達成する。
論文 参考訳(メタデータ) (2024-07-03T17:08:52Z) - Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons [57.07507194465299]
大規模言語モデル(LLM)は様々な能力に優れるが、有害なコンテンツや誤報を発生させるなどの安全性リスクが生じる。
安全行動の責任を負うLLM内の安全ニューロンの同定と解析に焦点をあてる。
モデル安全性に対する因果的影響を評価するために,これらのニューロンの特定と動的アクティベーションパッチを対比した推論時アクティベーションを提案する。
論文 参考訳(メタデータ) (2024-06-20T09:35:22Z) - SelfIE: Self-Interpretation of Large Language Model Embeddings [36.801959204164504]
SelfIEは、大きな言語モデルが自身の組み込みを自然言語で解釈できるフレームワークである。
SelfIEは倫理的判断、インジェクションの内在化、有害な知識のリコールなどのケースにおける内部的推論を明らかにする。
そこで我々は,個々のレイヤの勾配だけを必要としながら,オープンな概念を編集できるSupervised Controlを提案する。
論文 参考訳(メタデータ) (2024-03-16T15:30:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。