論文の概要: Usage-Modulated Sentiment Representations in Large Language Models
- arxiv url: http://arxiv.org/abs/2610.05069v1
- Date: Sun, 04 Oct 2026 09:11:21 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:56:42.788869
- Title: Usage-Modulated Sentiment Representations in Large Language Models
- Title(参考訳): 大規模言語モデルにおける使用感表現
- Abstract要約: 自然なコミュニケーションでは、感情は極性だけでなく、トーンやオーディエンス適応といった利用要因によっても形作られます。
我々は、共有感情方向を特定し、それを除去し、消去および生成時トーンステアリングを通じて残像を検査する。
- 参考スコア(独自算出の注目度): 16.188080446373544
- License:
- Abstract: Prior work suggests that sentiment can often be captured by approximately linear directions in LLM activation spaces, but a single direction may not fully capture sentiment representations. In natural communication, sentiment is shaped not only by polarity but also by usage factors, such as tone and audience adaptation. We test whether these factors systematically modulate sentiment representations beyond a shared sentiment direction. We construct a controlled paired dataset that holds event content fixed while varying sentiment polarity and usage factors, and analyze Llama, Mistral, and Gemma. We identify a shared sentiment direction, remove it, and test the residual structure through erasure and generation-time tone steering. Across models, the shared direction is robust (median cosine 0.953-0.975), yet removing it leaves 0.833-0.909 of the original positive-negative representation-difference norm. The residuals contain compact, reproducible usage-conditioned structure. Targeted erasure weakens held-out usage metrics more than random and label-shuffled controls. On Llama, outputs steered along residualized tone components are preferred in 92.8% of blind target-tone comparisons while preserving the requested sentiment polarity in 98.7% of evaluated outputs.
- Abstract(参考訳): 以前の研究は、感情は LLM の活性化空間においてほぼ直線的な方向で捉えることができるが、単一の方向が感情表現を完全に捉えることはできないことを示唆している。
自然なコミュニケーションでは、感情は極性だけでなく、トーンやオーディエンス適応といった利用要因によっても形作られます。
これらの要因が共有感情方向を超えて感情表現を体系的に調節するかどうかを検証する。
Llama, Mistral, Gemmaを解析し, 感情の極性と使用率の異なるイベントコンテンツを固定したペアデータセットを構築した。
我々は、共有感情方向を特定し、それを除去し、消去および生成時トーンステアリングを通じて残像を検査する。
モデル全体では、共有方向は堅牢(中間コサイン0.953-0.975)であるが、元の正負表現差分ノルムの0.833-0.909を残している。
残基はコンパクトで再現可能な使用条件構造を含む。
ターゲットの消去は、ランダムなコントロールやラベルシャッフルコントロールよりも、ホールドアウトされた使用基準を弱める。
ラマでは、残留音成分に沿って操る出力が92.8%のブラインドターゲット-トーン比較で好まれる一方で、評価された出力の98.7%で要求された感情極性を保存する。
関連論文リスト
- Distributional sentiment modeling and anomaly detection for consumer complaint assessment [4.755321790822027]
消費者の不満に対する否定的な感情を,境界付き連続変数として扱う。
我々は,有益な苦情と非有益な苦情の適合分布を比較した。
適合した分布は、異常診断を構築するためにドルと企業の反応結果と関連付けられている。
論文 参考訳(メタデータ) (2026-09-14T15:34:23Z) - SHIFT-M3: Pre-fusion Alignment-based Consistency Screening for Multimodal ECG Record Integrity [0.0]
マルチモーダルな臨床AIは通常、波形、レポート、メタデータ、下流の予測が同一患者のものであると仮定する。
我々は、この問題をマルチモーダルレコード整合性トリアージとして研究している。
本稿では、2つの別々のECGテキストビュー間のアライメントベースの一貫性を測定する軽量テキストベースのプリフュージョンスクリーンShift-M3を紹介する。
論文 参考訳(メタデータ) (2026-09-12T10:58:02Z) - K/V-Cache Interventions Dissociate Representation Alignment from Persona Expression in Decoder-Only Language Models [32.7114174898989]
我々は,デコーダのみの言語モデルにおけるペルソナ制御のための構造化曲面として,K/V-cacheの介入について検討する。
表現レベルのアライメントと行動表現の間には2つの一貫した普遍性があり,また位置摂動下での共通の失敗も報告する。
論文 参考訳(メタデータ) (2026-09-10T02:56:50Z) - Orientation, not magnitude: the causal structure of task-vector interference in merged language models [0.0]
タスク算術はそうでなければ機能し、フィールドはマグニチュードで原因を診断する。
層状フラックスの正確な分解は、既存の断続輸送の増幅によって支配されていることを示している。
ナイーブのbfloat16生成の「ユニバーサリティ」は、量子化粗さであることが判明した。
論文 参考訳(メタデータ) (2026-08-12T08:40:24Z) - Compared to What? Baselines and Metrics for Counterfactual Prompting [39.56472929066589]
患者の性別を外科的に変化させると,MedQAの14.9%のフリップ率を予測する。
本稿では,目標介入下で観察される相違点と,パラフレーズ入力によって引き起こされる相違点を比較検討する枠組みを提案する。
一般モデル感度を考慮すると,これらの効果は大きく消散することがわかった。
論文 参考訳(メタデータ) (2026-05-01T19:23:33Z) - DQE-CIR: Distinctive Query Embeddings through Learnable Attribute Weights and Target Relative Negative Sampling in Composed Image Retrieval [53.482391830683014]
合成画像検索(CIR)は、参照画像と、意図した変更を特定する修正テキストとを共同で解釈することにより、対象画像を検索するタスクに対処する。
既存のほとんどの手法は、基底の真理像を唯一の正の例として扱い、残りの全ての画像を負の例として扱う対照的な学習フレームワークの上に構築されている。
学習可能な属性重みとターゲットの相対的負サンプリングによるクエリ埋め込みを提案する。
論文 参考訳(メタデータ) (2026-03-04T13:17:44Z) - Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection [49.26064449816502]
本研究では,テキスト・視覚バイアスと共起バイアスに対処するために,グラディエントベースのインフルエンス・アウェア制約付きデコーディング(GACD)手法を提案する。
GACDは幻覚を効果的に低減し、MLLM出力の視覚的接地を改善する。
論文 参考訳(メタデータ) (2025-09-03T08:13:52Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z) - Unlearning-based Neural Interpretations [51.99182464831169]
静的関数を用いて定義される現在のベースラインは、バイアスがあり、脆弱であり、操作可能であることを示す。
UNIは、学習不可能で、偏りがなく、適応的なベースラインを計算し、入力を最も急な上昇の未学習方向に向けて摂動させることを提案する。
論文 参考訳(メタデータ) (2024-10-10T16:02:39Z) - Deconfounding Scores: Feature Representations for Causal Effect
Estimation with Weak Overlap [140.98628848491146]
推定対象の偏りを伴わずに高い重なりを生じさせる,デコンファウンディングスコアを導入する。
分離スコアは観測データで識別可能なゼロ共分散条件を満たすことを示す。
特に,この手法が標準正規化の魅力的な代替となることを示す。
論文 参考訳(メタデータ) (2021-04-12T18:50:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。