論文の概要: PCA-guided Activation Scaling for Monotonic Bidirectional Control over LLM Sycophancy
- arxiv url: http://arxiv.org/abs/2608.16650v1
- Date: Mon, 17 Aug 2026 14:48:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.75235
- Title: PCA-guided Activation Scaling for Monotonic Bidirectional Control over LLM Sycophancy
- Title(参考訳): LLM同期による単調双方向制御のためのPCA誘導活性化スケーリング
- Abstract要約: 大規模言語モデル (LLM) は, 事実の正確性に関わらず, ユーザの信念に合致する傾向にある。
そこで我々は,PCA-guided Activation Scaling (PAS)を紹介した。
3つのLCMと3つのデータセットにわたって、PASは強い単調性を達成する(Spearman $$ = +0.92)。
- 参考スコア(独自算出の注目度): 15.914340276284085
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) exhibit sycophancy, a tendency to agree with user beliefs regardless of factual accuracy. This can reinforce misconceptions, but eliminating it entirely risks over-correction against valid opinions. Effective control must therefore both reduce and increase sycophancy with predictable and gradual effect. Yet, existing methods fail to ensure a bidirectional and monotonic relationship between steering strength and behavioral outcome across models and datasets. We introduce PCA-guided Activation Scaling (PAS), an activation steering framework that decomposes residual stream activations into a PCA-identified sycophancy-honesty subspace and an orthogonal residual, then applies distinct scaling exponents to achieve monotonic, bidirectional control. Across three LLMs and three datasets, PAS achieves strong monotonicity (Spearman $ρ$ = +0.92) and an average shift of 15.4% per direction, compared with 8.7% for the baselines. Ablation studies confirm that the decomposition, asymmetric exponents, and layer selection are each essential for maintaining monotonic control. The data and code are available at https://github.com/Bellafc/PCS.
- Abstract(参考訳): 大規模言語モデル (LLM) は, 事実の正確性に関わらず, ユーザの信念に合致する傾向にある。
これは誤解を補強するが、有効な意見に対して過度に訂正されるリスクを完全に排除する。
したがって、効果的な制御は、予測可能かつ段階的な効果で、梅毒を減らし、増加させなければならない。
しかし、既存の手法では、ステアリング強度とモデルとデータセット間の行動結果の間の双方向およびモノトニックな関係を保証できない。
そこで我々は, PCA-guided Activation Scaling (PAS) を導入し, PCA-identified sycophancy-honesty subspace と直交残差に残余ストリームの活性化を分解するアクティベーション・ステアリング・フレームワークを紹介した。
3つのLCMと3つのデータセットにわたって、PASは強い単調性(Spearman $ρ$ = +0.92)と平均15.4%のシフトを達成する。
アブレーション研究は、分解、非対称指数、層選択がそれぞれ単調な制御を維持するのに不可欠であることを確認した。
データとコードはhttps://github.com/Bellafc/PCSで入手できる。
関連論文リスト
- CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning [4.663685189987781]
自己蒸留剤強化学習は、トークンレベルの蒸留損失で軌跡レベルの報酬を増大させる。
一般的なレシピでは、この損失を1つのスカラー、すなわち教師と学生の対数確率のギャップで埋める。
CRAFTは2つの制限に対処する3ピラー・クレジット・アサインメント方式である。
論文 参考訳(メタデータ) (2026-06-28T16:11:47Z) - GEMS: Geometric Constraints Enable Multi-Semantic Superposition in LLMs [5.018957704056544]
アクティベーションステアリング(Activation steering)は、推論時に中間隠れ状態を変更することで、リトレーニングなしでモデル動作を制御する。
制約なしに複数の意味的方向が重畳されると、モデルは崩壊する。
GEMSは,各ソースを対応する幾何学的制約にマッピングする訓練不要な手法である。
論文 参考訳(メタデータ) (2026-06-18T08:43:33Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence [16.403654360036498]
ミスアライメントは、敵対的なプロンプト、良心的な微調整、創発的なミスアライメント、目標のミスジェネレーションによって引き起こされる。
最近の証拠は、いくつかの不整合挙動が活性化空間の線形構造としてコード化され、操舵によって牽引可能であることを示唆している。
これらの知見は, 世代ごとのアクティベーションの不一致を継続的に補正する軽量なランタイムディフェンスとして, アクティベーションステアリングを動機付けている。
論文 参考訳(メタデータ) (2026-04-09T12:28:22Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - ROAST: Rollout-based On-distribution Activation Steering Technique [16.632201561391366]
アクティベーションステアリングは、推論時に大きな言語モデルをパラメータ効率よく制御する。
本稿では,ROAST(Rollout-based On-distriion Activation Steering Technique)を提案する。
我々の経験的分析によると、活性化度は方向整合性と適度に相関するが、大きさのばらつきは重要であり、しばしば意味的品質に不均衡である。
論文 参考訳(メタデータ) (2026-02-15T13:30:26Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - TD3 with Reverse KL Regularizer for Offline Reinforcement Learning from
Mixed Datasets [118.22975463000928]
エージェントが複数の行動ポリシーをロールアウトすることで収集したデータセットから学習する必要があるオフライン強化学習(RL)について考察する。
1) RL信号の最適化と行動クローニング(BC)信号の最適なトレードオフは、異なる行動ポリシーによって引き起こされる行動カバレッジの変化によって異なる状態に変化する。
本稿では,TD3アルゴリズムに基づくBC正規化器として,適応重み付き逆KL(Kulback-Leibler)分散を用いることにより,両課題に対処する。
論文 参考訳(メタデータ) (2022-12-05T09:36:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。