論文の概要: Sampling Reveals Style: Unsupervised, Training-Free Discovery of Prompt-Conditional Stylistic Axes in LLM Activations
- arxiv url: http://arxiv.org/abs/2609.19150v2
- Date: Fri, 18 Sep 2026 12:42:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.614601
- Title: Sampling Reveals Style: Unsupervised, Training-Free Discovery of Prompt-Conditional Stylistic Axes in LLM Activations
- Title(参考訳): サンプリングRevealsスタイル:LDM活性化におけるプロンプト-導電性スティリスティック軸の教師なし・無訓練発見
- Abstract要約: 大言語モデル(LLM)は、隠れたアクティベーションにおいてリッチなスタイリスティック構造を符号化する。
トレーニング不要で、迅速な条件付き代替案を提示します。
結果の軸をポール世代から自動的にラベル付けします。
- 参考スコア(独自算出の注目度): 3.5808917363708734
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) encode rich stylistic structure in their hidden activations, but discovering which stylistic dimensions are salient for a given prompt typically requires supervised contrastive data. We present a training-free, prompt-conditional alternative: we repeatedly sample completions of a single prompt at elevated temperature, apply Principal Component Analysis (PCA) to the pooled hidden activations, and label the resulting axes automatically from the pole generations. We validate the discovered axes against 245 human-elicited stylistic annotations in a two-phase study. On our strongest model (Qwen-3.5-4B-Instruct), the top two axes match spontaneously requested human dimensions with 72.8% precision and 43.6% macro-recall, and 75.6% of validity ratings judge the axes' polar generations accurate to their labels, with 90.9% adjacent inter-annotator agreement. Discoverability is strongly model-dependent: both Qwen models and Llama-3.2-3B expose human-salient axes, while DeepSeek-7B-Chat drops to 35.3% precision, its leading components dominated by structural rather than stylistic variance. Simple PCA over a model's own decoding variance is thus an effective, low-cost probe of stylistic structure in LLM representations, one that also exposes sharp cross-model differences in how that structure is organized.
- Abstract(参考訳): 大きな言語モデル(LLM)は、隠れたアクティベーションにおいてリッチなスタイリスティックな構造をエンコードするが、与えられたプロンプトに対してどのスタイリスティックな寸法が正当であるかを発見するには、典型的には教師付きコントラスト的なデータを必要とする。
そこで本研究では,1つのプロンプトを高温で繰り返しサンプリングし,プールに隠されたアクティベーションに主成分分析(PCA)を適用し,その結果の軸を自動的にポール世代からラベル付けする。
本研究は,2相研究において,245個の人文文的アノテーションに対して検出された軸を検証した。
我々の最強モデル(Qwen-3.5-4B-Instruct)では、上位2軸は72.8%の精度と43.6%のマクロリコールで自然に要求された人間の次元と一致し、75.6%の妥当性評価では、アノテータ間の合意が90.9%と評価された。
Qwen モデルと Llama-3.2-3B はどちらも人間の正弦軸を露出し、DeepSeek-7B-Chat は35.3%の精度に低下する。
したがって、モデル自身の復号分散に対する単純なPCAは、LLM表現におけるスタイリスティックな構造を効果的かつ低コストに探索するものであり、その構造がどのように構成されているかにおいて、鋭いクロスモデル差を露呈する。
関連論文リスト
- AlignDiff: Exploiting Model-Intrinsic Information for Better Preference Data Selection [53.61691036434302]
固有モデル信号によって駆動される嗜好データフィルタリングフレームワークであるAlignDiffを提案する。
AlpacaEval 2.0、Arena-Hard、MT-Benchベンチマークを評価した。
AlignDiffの有効性を検証するために包括的アブレーション研究を行っている。
論文 参考訳(メタデータ) (2026-09-05T05:51:23Z) - Mapping and Measuring the Behavioral Evolution of Large Language Models [28.603443859513153]
ベンチマークのリーダーボードは、言語モデルのパフォーマンスを概説するが、その振る舞いが他のモデルとどのように関係しているか、世代によって異なる。
1万のプロンプトの共有バンクに対する応答を用いて、6つのファミリーから32モデルの出力挙動を特徴付ける。
論文 参考訳(メタデータ) (2026-08-11T15:07:28Z) - DNA: Dual-stage Native Attribution for Generated Image Source Tracing [75.65470221927096]
既存のプロアクティブな方法は、透かしの埋め込みやモデル修正に依存している。
DNAは、ニューラルネットワークのトレーニングを追加せずに、この階層に従う粗大なフレームワークである。
実験の結果、DNAは89.11%のエンドツーエンドの属性精度を達成している。
論文 参考訳(メタデータ) (2026-07-15T10:27:52Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions [11.509375725817195]
既存のデータから高価値サンプルをマイニングする2段階の知識蒸留フレームワークを提案する。
フィルタされたサンプルのわずか10.30%で強化トレーニングを行うことで、MAP-Chartingデータセットで0.9585 (+17.8%)のMAP@3を達成する。
4Bパラメータモデルのみを用いて、中学代数学の誤概念ベンチマークのクロストピックテストにおいて84.38%の精度が得られる。
論文 参考訳(メタデータ) (2026-05-14T12:17:38Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation [14.249938992666202]
大きな言語モデル(LLM)は、人間の好みに合わせて高品質な嗜好データセットを必要とする。
本研究では,LLMの表現空間に固有の規則を取り入れたパラダイムシフトを,効率的でカスタマイズされた選好データセット構築のために検討する。
論文 参考訳(メタデータ) (2025-09-06T05:38:47Z) - Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future [38.1810626252963]
自己回帰言語モデル(Self-Rewarding Language Models)は、LLM-as-a-Judgeプロンプトを通じて、大きな言語モデル(LLM)が応答を生成し、独自の出力を評価するアーキテクチャを提案する。
本研究では,過去,現在,将来のモデル世代を戦略的に調整し,学習信号を持続するテキストbf自己回帰言語モデルを提案する。
論文 参考訳(メタデータ) (2025-08-08T05:25:54Z) - Crucial-Diff: A Unified Diffusion Model for Crucial Image and Annotation Synthesis in Data-scarce Scenarios [65.97836905826145]
医療、産業、自動運転といったさまざまなシナリオにおけるデータの不足は、モデルの過度な適合とデータセットの不均衡につながる。
重要なサンプルを合成するドメインに依存しないフレームワークであるCrucial-Diffを提案する。
我々のフレームワークは多様な高品質なトレーニングデータを生成し、ピクセルレベルのAPは83.63%、F1-MAXは78.12%である。
論文 参考訳(メタデータ) (2025-07-14T04:41:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。