論文の概要: Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
- arxiv url: http://arxiv.org/abs/2604.05756v1
- Date: Tue, 07 Apr 2026 11:58:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.798003
- Title: Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
- Title(参考訳): KL最適化微細調整による多方向LDM生成における分布バイアスの制御
- Authors: Yanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto,
- Abstract要約: 我々は,Large Language Models (LLM) が所望の目標分布に従属する出力を生成できるかどうかを評価する。
職業文脈における性別・人種・感情の属性を用いて分布アライメントを定式化する。
本稿では,ステアリングトークンとセマンティックアライメントを結合したファインチューニングフレームワークを提案する。
- 参考スコア(独自算出の注目度): 37.39836347901149
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: While the real world is inherently stochastic, Large Language Models (LLMs) are predominantly evaluated on single-round inference against fixed ground truths. In this work, we shift the lens to distribution alignment: assessing whether LLMs, when prompted repeatedly, can generate outputs that adhere to a desired target distribution, e.g. reflecting real-world statistics or a uniform distribution. We formulate distribution alignment using the attributes of gender, race, and sentiment within occupational contexts. Our empirical analysis reveals that off-the-shelf LLMs and standard alignment techniques, including prompt engineering and Direct Preference Optimization, fail to reliably control output distributions. To bridge this gap, we propose a novel fine-tuning framework that couples Steering Token Calibration with Semantic Alignment. We introduce a hybrid objective function combining Kullback-Leibler divergence to anchor the probability mass of latent steering tokens and Kahneman-Tversky Optimization to bind these tokens to semantically consistent responses. Experiments across six diverse datasets demonstrate that our approach significantly outperforms baselines, achieving precise distributional control in attribute generation tasks.
- Abstract(参考訳): 現実の世界は本質的に確率的であるが、Large Language Models (LLM) は固定基底真理に対する単一ラウンドの推論に基づいて主に評価される。
本研究では,レンズを分布アライメントにシフトする: LLMが繰り返し刺激されると,所望の目標分布に従属する出力を生成することができるか,例えば実世界の統計や一様分布を反映する。
職業文脈における性別・人種・感情の属性を用いて分布アライメントを定式化する。
実験により,既製のLCMと標準アライメント技術(即時工学や直接選好最適化など)は,出力分布を確実に制御できないことがわかった。
このギャップを埋めるために,ステアリングトークン校正とセマンティックアライメントを結合したファインチューニングフレームワークを提案する。
本稿では,Kulback-Leiblerの発散と潜在ステアリングトークンの確率質量の固定と,これらのトークンを意味的に一貫した応答に結合するKahneman-Tversky最適化を組み合わせたハイブリッド目的関数を提案する。
6つの多様なデータセットを対象とした実験により,本手法は属性生成タスクにおける正確な分布制御を達成し,ベースラインを著しく上回ることを示した。
関連論文リスト
- Evidence-based Distributional Alignment for Large Language Models [58.65469623911573]
LLM分布推定の忠実度とロバスト性を改善する証拠に基づくアライメント手法であるEvi-DAを提案する。
対象国が与えられた場合、Evi-DAは関連するWorld Values Survey項目とその回答分布を検索し、オプション毎に粗いヴェルツェル値シグネチャを予測し、国条件の回答分布を構造化形式で推測する。
論文 参考訳(メタデータ) (2026-03-03T03:34:06Z) - SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning [50.93295951454092]
本稿では,カーネル化類似性を用いたサンプル軌道上で定義された設定レベル多様性の目的について紹介する。
提案手法は,各サンプル軌跡に対する余剰余剰貢献を導出し,この目的を政策最適化のためのプラグイン・アドバンテージ・シェーピング用語として統合する。
様々なモデルスケールで実験を行い、提案アルゴリズムの有効性を示し、様々なベンチマークでPass@1とPass@Kの双方において、強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-01T07:13:20Z) - Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective [60.45433515408158]
長いチェーン・オブ・ソート(CoT)がトップオプションの決定的決定要因となるが、あいまいなタスクの粒度分布キャリブレータとして機能しないことを示す。
CoTは分布アライメントを改善するが、CoTの内容によって最終的な精度が決定される。
論文 参考訳(メタデータ) (2026-01-06T16:26:40Z) - Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity [13.211627219720796]
強化学習(Reinforcement Learning, RL)は、推論に関わる課題を解決するためにLLMをチューニングするためのデファクトスタンダードとなっている。
我々は、RLが暗黙的に「モード探索」あるいは「ゼロ強制」逆KLを目標分布に最適化し、モデルがターゲットの特定の高確率領域に質量を集中させることを論じる。
そこで本研究では,まず,正解の相対確率を無視しながら,不正確な解をフィルタリングして得られる明示的対象分布から始める。
論文 参考訳(メタデータ) (2025-12-05T18:56:40Z) - Judging with Confidence: Calibrating Autoraters to Preference Distributions [56.17041629492863]
信頼性の高いオートラッターは、対象の個体群によって定義される嗜好の完全な分布をモデル化することを学ぶ必要がある、と我々は主張する。
異なるデータ条件に合わせた2つの学習方法を提案する。
この結果から, 分布マッチング目的の微調整オートレーダは, 目的の好み分布に整合した有言確率予測を導出することがわかった。
論文 参考訳(メタデータ) (2025-09-30T20:36:41Z) - Probabilistic Token Alignment for Large Language Model Fusion [100.30692772017238]
大規模言語モデル(LLM)をスクラッチからトレーニングすると、ユニークな機能と強みを持つモデルが得られるが、コストがかかり、しばしば冗長な機能をもたらす。
既存のモデル融合における重要な課題は、手動で定義された語彙のアライメントに依存することである。
PTA-LLM と呼ばれるアライメントのための一般およびソフトマッピングとして確率的トークンアライメント法を提案する。
論文 参考訳(メタデータ) (2025-09-21T23:18:24Z) - On Optimal Steering to Achieve Exact Fairness [29.589891801235083]
経験的に、我々の合成と実世界の両方のデータセットにおける最適なステアリング技術は、実用性を低下させることなく公正性を向上する。
マルチクラス分類におけるバイアスを低減するために, LLM表現のアフィンステアリングを示す。
論文 参考訳(メタデータ) (2025-09-19T08:37:51Z) - Distribution-Dependent Rates for Multi-Distribution Learning [26.38831409926518]
最近のマルチディストリビューション学習フレームワークは、環境との動的相互作用において、この目的に対処する。
我々は, MDL体制における分布依存性の保証を行い, 最適値以下の差でスケールし, その結果, 試料サイズへの依存度が向上することを示した。
適応型楽観的アルゴリズム LCB-DR を考案し,マルチアームバンディット文学における均一性と楽観的アロケーションのコントラストを反映した。
論文 参考訳(メタデータ) (2023-12-20T15:50:16Z) - A Distributional Approach to Controlled Text Generation [3.279201607581627]
予め訓練された言語モデル(LM)から制御されたテキスト生成に対処するための分布的アプローチを提案する。
このビューでは、単一の形式的なフレームワークで、ターゲット lm 上で "pointwise" と "distributional" の制約を定義することができる。
次に,我々のアプローチのユニークな特徴である分布制約に関する実験を行い,言語モデルにおけるバイアス問題に対する対策としての可能性を示す。
論文 参考訳(メタデータ) (2020-12-21T19:02:41Z) - Learning Invariant Representations and Risks for Semi-supervised Domain
Adaptation [109.73983088432364]
半教師付きドメイン適応(Semi-DA)の設定の下で不変表現とリスクを同時に学習することを目的とした最初の手法を提案する。
共同で textbfLearning textbfInvariant textbfRepresentations と textbfRisks の LIRR アルゴリズムを導入する。
論文 参考訳(メタデータ) (2020-10-09T15:42:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。