論文の概要: Low-Resource Preference Adaptation of LLMs via Activation-Based Label Propagation
- arxiv url: http://arxiv.org/abs/2608.30902v1
- Date: Mon, 31 Aug 2026 14:52:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.457013
- Title: Low-Resource Preference Adaptation of LLMs via Activation-Based Label Propagation
- Title(参考訳): アクティベーションベースラベル伝搬によるLDMの低リソース優先度適応
- Authors: Alessio Galatolo, Meriem Beloucif,
- Abstract要約: 言語モデルが、その中間表現における嗜好情報をエンコードする方法について検討する。
選択された応答と拒否された応答からのアクティベーションは、事前訓練されたモデルであっても、層をまたいだ異なるクラスタを形成する。
この構造を実行し、ラベル付き選好ペアの軽量線形プローブをトレーニングし、それを用いて大きな未ラベルデータセットを注釈付けする。
- 参考スコア(独自算出の注目度): 6.262888209373497
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting large language models to user-specific preferences is often constrained by the cost of human annotation, making preference optimisation impractical in low-resource settings where preferences cannot be reliably labelled by LLMs themselves, e.g., due to cultural, subjective, or personalised contexts. In this paper, we investigate how language models encode preference information in their intermediate representations, finding that activations from chosen and rejected responses form distinct clusters across layers, even in pretrained models. Strikingly, this structure is strengthened by alignment on canonical datasets but erased when the target preferences differ from those the model was aligned on, suggesting aligned LLMs are poor judges for non-mainstream populations. Exploiting this structure, we propose training a lightweight linear probe on a few labelled preference pairs ($\leq$500) and using it to annotate large unlabelled datasets (50K+) for downstream preference optimisation. We systematically evaluate this approach across different datasets, preference optimisation methods and model scales and find that our method consistently outperforms direct training given the same annotation budget, and remains competitive against baselines trained on $50-100\times$ more labelled data in the majority of our settings. Code is available at https://github.com/alessioGalatolo/activ-pref-probe.
- Abstract(参考訳): 例えば、文化的、主観的、あるいはパーソナライズされた文脈のために、LLM自体によって、好みを確実にラベル付けできない低リソース環境において、好みを最適化するのは現実的ではない。
本稿では,言語モデルが中間表現の嗜好情報をエンコードする方法について検討し,選択された応答と拒否された応答のアクティベーションが,事前訓練されたモデルにおいても,層間において異なるクラスタを形成することを明らかにする。
厳密には、この構造は標準的データセットのアライメントによって強化されるが、モデルがアライメントされたものとターゲットの嗜好が異なる場合、削除される。
この構造を実行し、ラベル付き選好ペア数組($500)の軽量線形プローブをトレーニングし、ダウンストリーム選好最適化のために大きな未ラベルデータセット(50K+)を注釈付けする。
我々は、異なるデータセット、好みの最適化方法、モデルスケールでこのアプローチを体系的に評価し、同じアノテーション予算でダイレクトトレーニングを一貫して上回り、50-100\times$以上のラベル付きデータでトレーニングされたベースラインに対して競争力を維持することを発見した。
コードはhttps://github.com/alessioGalatolo/activ-pref-probe.comで公開されている。
関連論文リスト
- Intuitionistic Fuzzy Sets for Large Language Model Data Annotation: A Novel Approach to Side-by-Side Preference Labeling [0.0]
本稿では,多言語モデル(LLM)における人間の嗜好をモデル化・集約するための直観的ファジィ集合(IFS)に基づく新しい枠組みを提案する。
我々のアプローチは、選好の度合いだけでなく、メンバーシップ、非メンバーシップ、およびヒューイテーションの度合いを通じて、人間の判断に固有の不確実性や偏見も捉えている。
複数のデータセットに対する実験的検証は、我々のIFSベースのアプローチがアノテーションの一貫性を大幅に改善し、アノテータの疲労を低減し、高品質な嗜好データを生成することを示した。
論文 参考訳(メタデータ) (2025-05-30T04:20:00Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - Geometric-Averaged Preference Optimization for Soft Preference Labels [78.2746007085333]
LLMを人間の嗜好と整合させる多くのアルゴリズムは、人間の嗜好は二進的かつ決定論的であると仮定する。
本研究では,分散ソフトな選好ラベルを導入し,損失関数におけるLLM出力確率の重み付き幾何平均を用いて直接選好最適化(DPO)を改善する。
論文 参考訳(メタデータ) (2024-09-10T17:54:28Z) - Orchestrating LLMs with Different Personalizations [28.344891363780576]
本稿では,大規模言語モデル(LLM)と個人の嗜好を一致させる新しいアプローチを提案する。
有用性、簡潔性、ユーモアなど、複数の次元に沿って記述された嗜好を踏まえると、ゴールは、この仕様に最もよく準拠する再訓練をせずにLLMを作成することである。
1つの特定の選好次元で訓練された専門的なLSMから始め、各トーケンレベルで出力をマージするブラックボックス法を提案する。
論文 参考訳(メタデータ) (2024-07-04T22:55:02Z) - Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment [72.99676237703099]
大規模言語モデルと人間の嗜好の整合性を高める新しいフレームワークを提案する。
私たちのキーとなるアイデアは、小さな(種)データの中で人間の事前知識を活用することです。
本稿では,ノイズ認識型選好学習アルゴリズムを導入し,生成した選好データにおける品質低下のリスクを軽減する。
論文 参考訳(メタデータ) (2024-06-06T18:01:02Z) - Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment [104.18002641195442]
既存のペアデータを必要としない、効果的でスケーラブルなトレーニングパラダイムである自己拡張型優先度最適化(SAPO)を導入する。
負の反応を自律的に生成するセルフプレイの概念に基づいて、我々はさらに、データ探索とエクスプロイトを強化するために、非政治的な学習パイプラインを組み込む。
論文 参考訳(メタデータ) (2024-05-31T14:21:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。