論文の概要: Multiple latent orderings better predict language model preferences
- arxiv url: http://arxiv.org/abs/2609.22170v1
- Date: Wed, 26 Aug 2026 21:50:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.755111
- Title: Multiple latent orderings better predict language model preferences
- Title(参考訳): 複数の潜在順序が言語モデルの嗜好を予測する
- Abstract要約: 既存の作業は、そのような不整合を、1つの遅延順序の周囲のサンプリングノイズとして扱う。
我々は、不透過性は複数の潜在的、内部的に一貫した順序の集合を反映していると提案する。
- 参考スコア(独自算出の注目度): 0.26763498831034044
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are frequently employed in settings where they are asked to make value judgments and choices. These observed choices often exhibit intransitivity: A model may prefer item $A$ to $B$ and $B$ to $C$, while also preferring $C$ to $A$. Existing work that models LLM preferences treats such inconsistencies as sampling noise around a single latent ordering. We instead propose that intransitivity reflects the aggregation of multiple latent, internally consistent orderings. We first show that observed inconsistencies cannot be explained by a single ordering under any monotone link function. We then introduce a noise-augmented mixture Bradley-Terry (MBT) model that infers latent preference components from repeated pairwise comparisons. Across seven models and four tasks, a mixture of orderings often explains structural inconsistencies better than single-utility models. We find that aggregate preferences often hide underlying preference heterogeneity. A case study on Moral Machine dilemmas shows that models which disagree on aggregate orderings can still share latent components. Together, these results suggest that LLMs reflect plural preferences. Alignment and evaluation pipelines that treat LLM preferences as a single function, therefore, risk averaging over coherent orderings that different users may endorse differently.
- Abstract(参考訳): 言語モデルは、価値の判断と選択を求められる設定で頻繁に使用される。
モデルは$A$ to $B$と$B$ to $C$を好むが、同時に$C$ to $A$を好む。
LLMの選好をモデル化する既存の作業は、そのような矛盾を1つの遅延順序の周りのノイズをサンプリングするものとして扱う。
代わりに、不透過性は複数の潜在的、内部的に一貫した順序の集合を反映していると提案する。
まず、観測された不整合は、任意の単調リンク関数の下で単一順序で説明できないことを示す。
次に、繰り返しのペアワイズ比較から遅延選好成分を推定するノイズ強化混合Bradley-Terry(MBT)モデルを提案する。
7つのモデルと4つのタスクで、注文の混合は単一ユーティリティモデルよりも構造上の不整合をよく説明します。
集合的嗜好は、しばしば根底にある嗜好の不均一性を隠す。
Moral Machine Dilemmas のケーススタディでは、集約順序に反するモデルがまだ潜在成分を共有可能であることが示されている。
これらの結果はLLMが複数の嗜好を反映していることを示唆している。
LLMの選好を単一の機能として扱うアライメントと評価パイプラインは、異なるユーザが異なる方法で支持できるコヒーレントな順序よりも、平均的にリスクを評価できる。
関連論文リスト
- Selective Ensemble Based on Preference-Directed Multi-Objective Bandits [90.75513823660775]
我々は、部分的に指定された線形選好の下で逐次決定問題を定式化する。
次に、嗜好指向の高信頼度境界(PrefUCB)アルゴリズムを提案する。
大規模な事前学習型モデル選択アンサンブルタスクと,機関委任下でのオンラインアセットアロケーションの実験により,本手法が検証された。
論文 参考訳(メタデータ) (2026-06-20T07:52:46Z) - Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models [61.21623682203952]
両単語の置換は文法的に有効であるが、従来と異なる言語間変異を示す。
コーパス由来の嗜好と、6つのオープンウェイト言語モデルのモデル誘発順序付け確率を測り比較する。
論文 参考訳(メタデータ) (2026-06-19T17:56:44Z) - Set-LLM: A Permutation-Invariant LLM [2.9665130256021]
本論文は,大規模言語モデル(LLM)の順序感度という,特定の脆弱性によって動機付けられている。
本研究では,事前学習型LLMに対する新しいアーキテクチャ適応であるSet-LLMを導入し,置換不変性を保証する混合集合文入力の処理を可能にする。
論文 参考訳(メタデータ) (2025-05-21T12:14:26Z) - Order Independence With Finetuning [0.0]
大規模言語モデル(LLM)は多くのNLPタスクにおいて顕著な性能を示すが、しばしば順序依存を示す。
最近の研究は、指定されたトークンサブセットから注文情報を除去する手段として、SBP(Set-Based Prompting)を提案する。
我々は,SBPをトレーニングプロセスに統合し,これらの設定されたプロンプトをモデルのトレーニング多様体に"推進する"微調整戦略を導入する。
論文 参考訳(メタデータ) (2025-03-30T15:38:43Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - From Distributional to Overton Pluralism: Investigating Large Language Model Alignment [82.99849359892112]
適応後の応答多様性の低下を以前報告した再検査を行った。
分析の結果,応答の多様性の明らかな低下は,品質管理と情報集約によって大きく説明できることがわかった。
発見は、現在のアライメント技術はキャプチャーされるが、アシスタントライクなベースLLM動作の有用なサブセットを拡張するものではないことを示している。
論文 参考訳(メタデータ) (2024-06-25T16:32:33Z) - LoRA ensembles for large language model fine-tuning [35.78186948630364]
Low-Rank Adapters (LoRA) はパラメータ効率の良い微調整技術である。
LoRAは非常に少数のパラメータを表しており、基礎となる事前訓練モデルよりも桁違いに少ない。
LoRAアンサンブルは,既存の正則化技術上にのみ適用され,予測精度と不確実性の定量化に一貫した改善をもたらすことが判明した。
論文 参考訳(メタデータ) (2023-09-29T16:38:38Z) - Large Language Models Are Not Robust Multiple Choice Selectors [117.72712117510953]
複数選択質問(MCQ)は、大規模言語モデル(LLM)の評価において、一般的なが重要なタスク形式として機能する。
この研究は、現代のLLMが、その固有の「選択バイアス」によるオプション位置変化に対して脆弱であることを示している。
そこで本研究では,オプションIDに対する事前バイアスを全体予測分布から分離するPriDeという,ラベルのない推論時間脱バイアス手法を提案する。
論文 参考訳(メタデータ) (2023-09-07T17:44:56Z) - Inconsistencies in Masked Language Models [20.320583166619528]
Masked Language Model (MLM) は、マスキングされた位置におけるトークンの分布をシーケンスで提供することができる。
異なるマスキングパターンに対応する分布は、かなりの矛盾を示す可能性がある。
本稿では,条件文の集合(Ensemble of Conditionals)と呼ばれる fors の推論時間戦略を提案する。
論文 参考訳(メタデータ) (2022-12-30T22:53:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。