論文の概要: Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas
- arxiv url: http://arxiv.org/abs/2605.09159v1
- Date: Sat, 09 May 2026 20:42:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 02:24:05.5261
- Title: Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas
- Title(参考訳): LLMは内部ポリローグを経験しているか? : ペルソナのレンズを通して推論する
- Abstract要約: ポリログ(polylogue)という用語は、ペルソナベクトルと生成過程における隠れアクティベーションの間のアライメントの時系列を表す。
実験により,MMLU-Pro上でのポリログ特性は,低次元アクティベーションベースラインと競合して正当性を予測することが示された。
彼らはまた、具体的な操舵目標、すなわち反応の異なる段階で調節する潜在方向を提案する。
- 参考スコア(独自算出の注目度): 42.142576194290065
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work shows that large language models (LLMs) encode behavioural traits ("personas") as linear directions in activation space, often called "persona vectors". Prior work has used such directions as static handles for behavioural steering. Building on this, we treat them as dynamic signals instead: probes we can monitor and intervene on as reasoning unfolds. We use the term polylogue to denote the time series of alignments between persona vectors and hidden activations over the course of generation. Experiments across four open-weight models show that polylogue features predict correctness on MMLU-Pro competitively with low-dimensional activation baselines, while remaining interpretable through their associated persona directions. They also suggest concrete steering targets, namely which latent directions to modulate at different stages of a response. We instantiate this as a simple paragraph-conditioned intervention that improves accuracy on three of four models, pointing to stage-aware latent steering as a promising direction for reasoning-time control. Together, this positions the polylogue as an interpretable tool for reasoning-time monitoring and intervention.
- Abstract(参考訳): 最近の研究は、大きな言語モデル(LLM)が、行動特性(ペルソナ)を活性化空間における線形方向としてエンコードしていることを示している(しばしば「ペルソナベクトル」と呼ばれる)。
以前の作業では、動作のステアリングに静的ハンドルのような方向を使用していた。
これに基づいて、私たちはそれらを動的信号として扱います。
ポリログ(polylogue)という用語は、ペルソナベクトルと生成過程における隠れアクティベーションの間のアライメントの時系列を表す。
4つのオープンウェイトモデルに対する実験により、ポリログの特徴は低次元のアクティベーションベースラインと競合するMMLU-Pro上での正当性を予測し、関連するペルソナ方向で解釈可能であることが示された。
彼らはまた、具体的な操舵目標、すなわち反応の異なる段階で調節する潜在方向を提案する。
我々はこれを,4つのモデルのうち3つのモデルの精度を向上する,単純な条件付き介入としてインスタンス化し,ステージアウェアの潜在ステアリングを推論時間制御の有望な方向として挙げる。
これにより、ポリログは推論時間監視と介入のための解釈可能なツールとして位置づけられる。
関連論文リスト
- PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra [84.59328460968872]
大規模言語モデルにおけるパーソナリティ制御の現在の手法は、静的なプロンプトや高価な微調整に依存している。
ペルソナ(PERSONA)は、人格ベクトルを直接操作することで、微調整レベルのパフォーマンスを実現する訓練不要のフレームワークである。
PersonalityBenchでは、この手法は平均スコア9.60を達成し、教師付き微調整上界9.61とほぼ一致している。
論文 参考訳(メタデータ) (2026-02-17T15:47:58Z) - Controllable and explainable personality sliders for LLMs at inference time [1.3688381983244782]
連続多次元パーソナリティ制御のためのモジュラーフレームワークを提案する。
我々の重要な革新は、逐次適応ステアリング(SAS)である。これは、先行介入によってシフトした残流上のその後のプローブをトレーニングすることで、ステアリングベクトルを変換する手法である。
我々は,ビッグファイブの性格特性に関する枠組みを検証し,ゴール順守とコヒーレンスの両方において,ナイーブ・ベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-02-10T08:16:59Z) - Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - Linear Personality Probing and Steering in LLMs: A Big Five Study [0.7933052462113936]
本研究では,ビッグファイブの性格特性に整合した線形方向が,モデル行動の探索と操舵に有効かどうかを検討する。
その結果,特徴スコアに整合した直線方向は人格検出に有効なプローブであることが示唆された。
論文 参考訳(メタデータ) (2025-12-19T14:41:09Z) - Prototype-Based Dynamic Steering for Large Language Models [3.90727941420584]
Prototype-Based Dynamic Steering (PDS) は、命令の追加や変更なしに大きな言語モデル(LLM)推論を増幅するテスト時メソッドである。
本稿では,CoT (Chain-of-Thought) と中性プロンプトのクラスタリングアクティベーション差による「推論プロトタイプ」を提案する。
PDSは微調整やプロンプトエンジニアリングなしで精度を継続的に改善する。
論文 参考訳(メタデータ) (2025-10-07T01:34:28Z) - Learning to Steer: Input-dependent Steering for Multimodal LLMs [54.41165851011022]
本稿では,入力固有線形シフトを用いたきめ細かいステアリングについて検討する。
我々は、入力固有のステアリングベクトルを予測するために、小さな補助モジュールを訓練する。
我々のアプローチはL2S(Learn-to-Steer)と呼ばれ、幻覚を減らし、MLLMの安全性を向上し、他の静的ベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-18T10:53:20Z) - ExpertSteer: Intervening in LLMs through Expert Knowledge [86.98098988779809]
アクティベーションステアリングは、大規模言語モデルの生成プロセスを制御するための有望な方法を提供する。
本稿では、任意の専門的モデルを用いてステアリングベクトルを生成する新しいアプローチであるExpertSteerを提案する。
3つのLSMを4つの異なる領域にわたる15の人気のあるベンチマークで包括的な実験を行う。
論文 参考訳(メタデータ) (2025-05-18T08:55:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。