論文の概要: Same Outcome, Different Readout: What Does a Steerable Valence Direction in LLMs Represent?
- arxiv url: http://arxiv.org/abs/2609.22850v2
- Date: Tue, 22 Sep 2026 18:34:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.660906
- Title: Same Outcome, Different Readout: What Does a Steerable Valence Direction in LLMs Represent?
- Title(参考訳): LLMにおけるステアブル・バレンス・ディレクジョンとは何か?
- Abstract要約: 宣言可能性とアクティベーションステアリングの成功は、それ自体、内部の方向が何を表現しているかを定めていない。
本研究では,この課題を迷路作業における良い結果の方向性として,現実的な結果とそれが認識される情報的履歴とを分離する制御的介入を用いて検討する。
- 参考スコア(独自算出の注目度): 31.07275852348647
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decodability and successful activation steering do not, by themselves, establish what an internal direction represents. This gap is especially consequential for welfare-relevant interpretations, where a proposed functional state must be distinguished from correlated features of the extraction contrast. We study this question for a good-bad outcome direction in a maze task, using controlled interventions that separate the realised outcome from the informational history through which it became known. Across multiple LLM checkpoints, directions fitted on one explicit outcome encoding transfer well to another, indicating that the readout is not tied to surface form. In contrast, when the same realised outcome is reached through announced and unannounced histories, transfer degrades substantially: even after both histories receive the same explicit outcome, the post-event readout remains strongly conditioned on the earlier announcement. In a matched maze-RL run, the post-RL direction becomes substantially more predictive of reference-MDP remaining return and the policy becomes more dependent on it at the tested sites, while this history dependence persists. These results support a functional, value-related interpretation of the direction, but not its identification with a history-invariant scalar valence state.
- Abstract(参考訳): 宣言可能性とアクティベーションステアリングの成功は、それ自体、内部の方向が何を表現しているかを定めていない。
このギャップは、特に福祉関連解釈において重要であり、そこでは、提案された機能状態が抽出コントラストの相関した特徴と区別されなければならない。
本研究では,この課題を迷路作業における良い結果の方向性として,現実的な結果とそれが認識される情報的履歴とを分離する制御的介入を用いて検討する。
複数のLSMチェックポイントにまたがって、1つの明示的な結果の符号化に適合する方向は、他のものとよく一致し、読み出しが表面形に結び付けられていないことを示す。
対照的に、発表と未発表のヒストリーを通じて同じ実現結果に達すると、転送は大幅に低下する:両方のヒストリーが同じ明示的な結果を得た後も、更新後の読み出しは以前の発表に強く条件付けられている。
一致した迷路-RLの実行では、ポストRL方向は参照-MDPの残差をかなり予測し、試験された場所でポリシーはそれに依存するが、この履歴依存は持続する。
これらの結果は、その方向の関数的、価値に関する解釈を支持するが、歴史不変なスカラー価状態との識別はサポートしていない。
関連論文リスト
- How Do Language Models Choose Between Context and Memory? [0.0]
方向に沿った操舵が因果関係を確立できないことを示す。
また、オーソリティ計算はタスク間で再利用可能なものではなく、タスクに依存している可能性があることを示す。
論文 参考訳(メタデータ) (2026-09-01T05:35:36Z) - Doubly Robust Functional Representation Learning for Longitudinal Causal Inference with Irregular Histories [0.8870188183999853]
本研究では,不規則な歴史を観測・歴史体制のための推定対象状態に変換するために,Douubly Robust Functional Representation Learning (DR-FRL)を提案する。
DR-FRLは、不規則な歴史を観測された歴史体制のための推定可能な状態に変える、クロスフィットなワークフローである。
VitalDBの監査によると、DR-FRLは不規則な実験室の点雲を使用でき、有用な負の発見を提供する。
論文 参考訳(メタデータ) (2026-07-30T17:33:42Z) - Where Steering Signals Come From: Activation Source Selection in Activation Steering [71.96112659293725]
有効なステアリングは、ソーステキストに望ましい振る舞いが現れるかどうかだけでは説明できない。
強いシグナルは、モデルがターゲットの振る舞いを生成または継続しようとしている実行境界状態から来る。
この観点から、我々は、境界状態から共有のプロンプトと継続のセマンティクスを取り除くテールサブトラクションを導入する。
論文 参考訳(メタデータ) (2026-07-28T04:18:24Z) - Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing [5.457386921498268]
我々は、意味に敏感なケーススタディとして政治的スタンス判断を使用し、イギリスの政治的ステートメントデータセットを拡張します。
4つのオープンウェイトモデルの実験は、スタンス不安定が意味保存と意味反転の両方に影響を及ぼすことを示している。
その結果, 中間から後期までのデコーダ層, 特に最終プロンプト位置のブロック出力は, 最強の復元信号を与えることがわかった。
論文 参考訳(メタデータ) (2026-07-22T13:19:58Z) - Beyond Behavioural Trade-Offs: Mechanistic Tracing of Pain-Pleasure Decisions in an LLM [0.0]
以前の研究は、一部のLCMは、選択肢が痛みや快楽を引き起こすものとしてフレーム化されているときに選択を変更でき、そのような偏差は、記述された強度でスケール可能であることを示唆している。
本研究では, 変圧器内における原子価関連情報がどのように表現され, どこで因果的に使用されるかを検討する。
Gemma-2-9B-itと、前処理をモデルとした最小限の決定タスクを用いて、(i)ストリームを横断する層ワイドな線形プローブを用いて、表現の可用性をマップする。
我々は,活性化介入(ステアリング,パッチ,アブレーション)による因果的寄与を検証し,(iii)エプシロングリッド上での線量応答効果を定量化する。
論文 参考訳(メタデータ) (2026-02-22T12:42:38Z) - Partial Action Replacement: Tackling Distribution Shift in Offline MARL [11.861550409939818]
オフラインマルチエージェント強化学習(MARL)は、アウト・オブ・ディストリビューション・ジョイント・アクションを評価することの難しさによって著しく妨げられている。
我々は、OOD問題を緩和し、異なるPAR戦略を動的に重み付けするために、SPaCQL(Soft-Partial conservative Q-Learning)を開発した。
また,SPaCQLは不確実性インフォームドウェイトを用いた分散シフトに適応的に対応していることを示す。
論文 参考訳(メタデータ) (2025-11-10T20:56:58Z) - Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection [49.26064449816502]
本研究では,テキスト・視覚バイアスと共起バイアスに対処するために,グラディエントベースのインフルエンス・アウェア制約付きデコーディング(GACD)手法を提案する。
GACDは幻覚を効果的に低減し、MLLM出力の視覚的接地を改善する。
論文 参考訳(メタデータ) (2025-09-03T08:13:52Z) - Positional Biases Shift as Inputs Approach Context Window Limits [57.00239097102958]
入力がモデルのコンテキストウィンドウの最大50%を占める場合、LiM効果は最強となる。
関係情報が入力の終端に近づくと,モデルの性能が向上する,距離に基づくバイアスが観測される。
論文 参考訳(メタデータ) (2025-08-10T20:40:24Z) - A Sample Efficient Conditional Independence Test in the Presence of Discretization [54.047334792855345]
離散化されたデータに直接条件付き独立テスト(CI)は、誤った結論につながる可能性がある。
最近の進歩は、観測データをバイナライズすることで、潜伏変数間の適切なCI関係を推測することを目指している。
そこで本研究では,バイナライゼーションプロセスに依存しないサンプル効率のCIテストを提案する。
論文 参考訳(メタデータ) (2025-06-10T12:41:26Z) - Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning [55.36978389831446]
我々はベイズ適応RLフレームワークにおける反射探査を再放送する。
我々のアルゴリズムであるBARLは、観測結果に基づいて戦略を縫い替えるようにLLMに指示する。
論文 参考訳(メタデータ) (2025-05-26T22:51:00Z) - Trajectory Forecasting from Detection with Uncertainty-Aware Motion
Encoding [121.66374635092097]
物体検出と追跡から得られる軌道は、必然的にうるさい。
本稿では, 明示的に形成された軌道に依存することなく, 直接検出結果に基づく軌道予測器を提案する。
論文 参考訳(メタデータ) (2022-02-03T09:09:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。