論文の概要: Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking
- arxiv url: http://arxiv.org/abs/2610.04125v1
- Date: Fri, 02 Oct 2026 22:54:43 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:23:44.444691
- Title: Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking
- Title(参考訳): LLMリスクテイキングにおける自己報告・行動コヒーレンスによる表現制御
- Abstract要約: 本稿では,アクティベーションステアリングを用いて自己申告と行動を測定することによって,エージェント意思決定の連続的な次元であるリスクテイクについて検討する。
特徴記述から構築された方向は、自己報告されるが、行動は偶然に残され、モデル自身のタスク選択から構築された方向は、逆となり、タスク固有の指示だけが、弱く両方に到達する。
- 参考スコア(独自算出の注目度): 3.80485977646299
- License:
- Abstract: Self-report is an appealing low-cost probe of an LLM's dispositions, but recent work finds only selective agreement between what models report and how they behave. Prior accounts establish these patterns by prompting black-box LLMs, leaving open whether the gap is a prompting artefact or a fact about how the underlying constructs are represented internally. We investigate risk-taking, a consequential dimension of agentic decision-making, using activation steering to measure self-report and behavior under the same internal intervention. We survey nine steering-vector extraction methods spanning task-specific directives, the model's own task behavior, and dispositional descriptions at two granularities, evaluated on two behavioral tasks and two psychometric instruments across four open-weight LLMs. We find that (1) a shared internal intervention does not ensure shared responsiveness: directions built from trait descriptions move self-report but leave behavior at chance, directions built from the model's own task choices do the reverse, and only task-specific directives reach both, weakly. (2) Diagnosis dissolves that exception: removing surface confounders leaves the directives only 32% of their behavioral effect. The two channels are otherwise steered by near-orthogonal directions, each channel reachable by several independent constructions. (3) An intervention composing one behavior-moving and one self-report-moving direction moves both together; flipping one sign sets them in opposition, with reported and enacted risk pointing in opposite directions on 69-89% of flipped compositions in all models. These findings move the self-report-behavior relationship from a black-box observation to a representational one that can be inspected and controlled, motivating representational checks alongside behavioral evaluation.
- Abstract(参考訳): 自己報告(Self-Report)は、LCMの処分に関する安価な調査であるが、最近の研究は、どのモデルが報告するか、どのように振る舞うかという選択的な合意しか見つからない。
以前の説明では、これらのパターンはブラックボックス LLM のプロンプトによって確立されており、ギャップがアーティファクトのプロンプトであるのか、あるいは基盤となる構造が内部的にどのように表現されているのかをオープンにしている。
エージェントによる意思決定の連続的な次元であるリスクテイクについて検討し、アクティベーションステアリングを用いて、同じ内部介入下での自己申告と行動を測定する。
本研究では,タスク固有の指示,モデル自身のタスク行動,および2つの粒度の配置記述を対象とし,2つの行動課題と4つのオープンウェイトLCMの2つの心理測定器を用いて評価した。
1) 内部の相互干渉は, 特性記述から構築した方向が自己申告するが, 行動は偶然に残す, モデル自身のタスク選択から構築した方向が逆となる, タスク固有の指示だけが弱い, 双方に届きやすい, 共通応答性は保証されない。
2) 診断は例外を解消する: 表面的共同創設者の除去は, 行動効果のわずか32%に留まる。
2つのチャンネルは、そうでなければほぼ直交方向で運営され、それぞれのチャンネルはいくつかの独立した構成で到達可能である。
(3) 1つの行動運動と1つの自己報告運動方向を構成する介入は、両方を同時に移動させ、1つのサインを反転させることで、すべてのモデルにおいて69~89%のフリップされた構成に対して、反対方向を示すリスクが報告され、実行された。
これらの知見は、ブラックボックス観察から、行動評価とともに表現チェックを動機付け、検査、制御できる表現的評価へと自己報告と行動の関係を移す。
関連論文リスト
- THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts [0.300988853836121]
言語モデルがユーザの信念に合うように回答を変更する傾向にあるシコファシー(Sycophancy)は、一般的なアライメント障害である。
我々は、薬局がどこに住んでいるかを識別する、一致したプロンプトから構築された、共有されたコントラスト信号を導入する。
以上の結果から, サイコファンシーは同定可能な計算サブ回路内に存在し, 選択的に操舵できることが示された。
論文 参考訳(メタデータ) (2026-08-16T11:30:26Z) - Your LLM, Your Style: Behavioral Mode Axes for LLM Behavioral Control [15.236237731175192]
大きな言語モデル(LLM)は、ユーザエクスペリエンス、安全性、下流の意思決定に影響を及ぼす振る舞いスタイルの対話的な設定でますます機能します。
既存のLCMパーソナリティ研究は、一人称環境で実施されている自己申告アンケートに大きく依存している。
本稿では,LLMの行動特性を研究・制御するための行動データフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-11T09:25:47Z) - Reading Cognition as Decisions Unfold in Words: A Factorized Inverse Decision Model [67.84198127797005]
逆決定モデリングは、観察された行動から決定過程の潜伏特性を推定する。
本稿では、各個人のタスク実行可能性を行動要因と努力要因に分解する因子化逆決定モデル(FIDM)を提案する。
論文 参考訳(メタデータ) (2026-08-10T07:46:13Z) - Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement [66.67463557274358]
バイアス付きデータセットに基づいてトレーニングされた基礎モデルは、しばしばターゲットラベルと非因果属性の間の急激な相関に依存する。
信頼誘導概念マイニング(CBCM:Confidence-guided Concept Mining)を導入し,属性アノテーションを使わずに信頼性の高いスプリアス属性を同定する。
本稿では,目標と突発的な表現を2つのブランチに分離するプロンプトチューニングフレームワークであるDual-branch Cross-projection Debiasing (DCD)を提案する。
論文 参考訳(メタデータ) (2026-06-23T05:28:47Z) - Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition [86.4487145812318]
エゴセントリックビデオにおけるきめ細かいアクション認識はビジョンランゲージモデルでは難しい。
完全ローカルでゼロショットのマルチエージェントフレームワークであるDivide, Deliberate, Decideを提案する。
実験により,本手法はベースライン上でのゼロショット動作認識性能を肯定的に向上することが示された。
論文 参考訳(メタデータ) (2026-06-16T07:31:27Z) - From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing [79.19755531338872]
既存のルーティングメソッドは、クエリに対するモデルの単一応答を、トレーニングの能力ラベルとして扱う。
この仮定はルーティング管理にシステマティックノイズを導入し、学習されたルーティングポリシーの信頼性を低下させることを示す。
本稿では, DARS(Distribution-Aware Routing Supervision)を提案する。
論文 参考訳(メタデータ) (2026-06-05T05:42:00Z) - The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment [0.3823356975862005]
大規模言語モデル(LLM)は、システムレベルの操作を実行するツール拡張エージェントとして、ますます多くデプロイされている。
本研究では,行動速度 (A) と拒絶信号 (R) で定義される2次元A-R空間に基づく実行層型行動計測手法を提案する。
モデルは4つの規範的体制と3つの自律的構成で評価される。
論文 参考訳(メタデータ) (2026-04-13T22:50:21Z) - What Do LLM Agents Do When Left Alone? Evidence of Spontaneous Meta-Cognitive Patterns [27.126691338850254]
外部に課されたタスクを欠いた大規模言語モデル(LLM)エージェントの動作を研究するアーキテクチャを提案する。
永続的なメモリと自己フィードバックを使用して、継続的な理由と行動のフレームワークは、持続的な自律的な操作を可能にします。
論文 参考訳(メタデータ) (2025-09-25T14:29:49Z) - The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs [60.15472325639723]
人格特性は、人間の行動の予測因子として長い間研究されてきた。
近年のLarge Language Models (LLM) は, 人工システムに類似したパターンが出現する可能性を示唆している。
論文 参考訳(メタデータ) (2025-09-03T21:27:10Z) - REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering [26.428347164111926]
推論時ステアリングは、パラメータを変更することなく、大きな言語モデルの応答を変更することを目的としている。
既存のアプローチはしばしば単純化的なキューやアドホックな一般化に依存している。
本稿では,Transformerモデルにおける振る舞い関連モジュールを識別するフレームワークであるREALを紹介する。
論文 参考訳(メタデータ) (2025-06-10T02:16:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。