論文の概要: What Is Lost in Post-Training? Default Collapse and the Loss of In-Context Steerability Across Diverse Perspectives
- arxiv url: http://arxiv.org/abs/2610.02614v1
- Date: Fri, 02 Oct 2026 00:14:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.132914
- Title: What Is Lost in Post-Training? Default Collapse and the Loss of In-Context Steerability Across Diverse Perspectives
- Title(参考訳): トレーニング後に失うものは何か? デフォルトの崩壊とさまざまな観点からのコンテキスト内ステアビリティの喪失
- Abstract要約: ポストトレーニングでは、モデルが好ましくない視点に向けてコンテキスト内で操作できる能力が低下することを示す。
これらの調査結果は、単一の値セットの優先順位付けと、さまざまな利害関係者に役立てるために必要な技術的能力の維持との間にある緊張関係を示している。
- 参考スコア(独自算出の注目度): 14.584015580140395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI models serving a heterogeneous population must act on the principles appropriate to each user and context. While post-training has been shown to narrow the views large language models express, prior work has focused on default behavior rather than the ability to adapt to in-context information. We show that post-training also degrades a model's ability to be steered in-context toward perspectives it was not trained to favor. In controlled experiments, we fine-tune models toward one side of cultural-value disagreements and evaluate checkpoints throughout training. The trained side becomes increasingly dominant in ordinary use, while the ability to recognize and faithfully enact the opposing view declines. These findings point to a tension between prioritizing a single set of values and preserving the technical capacity needed to serve diverse stakeholders. Finally, we propose and analyze an alternative objective that maximizes reward subject to a prescribed distribution over expressed perspectives, and present stance-distribution matching as a practical implementation.
- Abstract(参考訳): 不均一な人口に奉仕するAIモデルは、各ユーザとコンテキストに適した原則に従って行動しなければならない。
ポストトレーニングでは、大きな言語モデルが表現するビューを狭めることが示されているが、以前の作業では、コンテキスト内の情報に適応する機能ではなく、デフォルトの動作に重点を置いていた。
ポストトレーニングでは、モデルが好ましくない視点に向けてコンテキスト内で操作できる能力も低下することを示す。
制御実験では,文化価値の不一致の一側面に向けて微調整モデルを作成し,トレーニングを通じてチェックポイントを評価する。
訓練された側は日常的な使用においてますます支配的になり、反対の見解を認識し、忠実に実践する能力は低下する。
これらの調査結果は、単一の値セットの優先順位付けと、さまざまな利害関係者に役立てるために必要な技術的能力の維持との間にある緊張関係を示している。
最後に,表現された視点に対する報酬分布の最大化を目的とする代替目的の提案と分析を行い,実用的な実装としてスタンス・ディストリビューション・マッチングを提示する。
関連論文リスト
- Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes [0.0]
現在のトレーニング後の方法の鍵となる制限は、人間のアノテータと自動報酬関数が、私たちが提供したいフィードバックを忠実に捉えることができないことである。
我々は、自然言語を用いて、フィードバックの忠実度を各トレーニングサンプルに条件付けする後トレーニングフレームワークであるAudiment-Conditioned Training (ECT)を紹介した。
ECTは不完全なフィードバック下でのパフォーマンス向上を目的としており、SFTやPPOといった既存のアルゴリズムのアドオンとして機能する。
論文 参考訳(メタデータ) (2026-08-10T20:22:13Z) - Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning [17.56588495990139]
Embodied Chain-of-Thoughtは、ロボットによる意思決定を強化するための、有望なメカニズムとして登場した。
我々は、SoTAアライメント戦略は必要だが忠実性の不十分な概念を提供すると論じる。
我々は、学習評論家ピノッキオ(Pinocchio)を通じて、信仰を具体化するための行動サロゲートを運用する。
論文 参考訳(メタデータ) (2026-07-06T05:10:27Z) - AI Alignment From Social Choice Perspectives [37.88586337953354]
社会的選択理論がフィードバックアグリゲーション層における障害モードの同定にどのように役立つかを示す。
社会的選択の観点が、明示的で原則的な方法で不一致を扱うための、より広いデザイン空間の特定にどのように役立つかを示す。
論文 参考訳(メタデータ) (2026-06-19T15:47:01Z) - Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy [59.44168425139687]
BayesVLA(ベイズVLA)は、前もってポリシーを視覚的アクションに分解し、ルック・トゥ・アクティベーションと言語条件付き可能性をサポートし、即時特定を可能にするベイズ因子化である。
実験は、既存の方法と比較して、目に見えない命令、オブジェクト、環境に対して優れた一般化を示す。
論文 参考訳(メタデータ) (2025-12-12T01:59:23Z) - Pre-trained Recommender Systems: A Causal Debiasing Perspective [19.712997823535066]
本研究では,異なるドメインから抽出した汎用ユーザ・イテムインタラクションデータをトレーニングすることで,ユニバーサルインタラクションパターンをキャプチャする汎用レコメンデータを開発する。
実験により,提案モデルにより,ゼロショットと少数ショットの学習環境での推薦性能が大幅に向上する可能性が示唆された。
論文 参考訳(メタデータ) (2023-10-30T03:37:32Z) - Optimising Equal Opportunity Fairness in Model Training [60.0947291284978]
既存のデバイアス法、例えば、敵の訓練や、表現から保護された情報を取り除くことは、バイアスを減らすことが示されている。
2つの新たな学習目標を提案し,2つの分類課題における高い性能を維持しつつ,バイアスの低減に有効であることを示す。
論文 参考訳(メタデータ) (2022-05-05T01:57:58Z) - Improving In-Context Few-Shot Learning via Self-Supervised Training [48.801037246764935]
本稿では,事前学習と下流での撮影の中間訓練段階において,自己監督を併用することを提案する。
中間的な自己超越段階は、強いベースラインよりも優れたモデルを生成する。
論文 参考訳(メタデータ) (2022-05-03T18:01:07Z) - Tradeoffs Between Contrastive and Supervised Learning: An Empirical
Study [9.520526500374842]
コントラスト学習はコンピュータビジョンにおいてかなりの進歩を遂げており、下流のデータセットの教師付き事前トレーニングよりも優れています。
まず、十分に少ない事前訓練予算の下で、ImageNetの教師付き事前トレーニングは、8つの多様な画像分類データセットにおいて、同等のコントラストモデルより一貫して優れています。
第2に,事前学習の予算が大きくなると,教師付き学習が普及するタスクが特定される。
論文 参考訳(メタデータ) (2021-12-10T05:19:32Z) - Contrastive Learning for Fair Representations [50.95604482330149]
訓練された分類モデルは、意図せずバイアスのある表現や予測につながる可能性がある。
対戦訓練のような既存の分類モデルのデバイアス化手法は、訓練に高価であり、最適化が困難であることが多い。
比較学習を取り入れたバイアス軽減手法を提案し、同じクラスラベルを共有するインスタンスに類似した表現を推奨する。
論文 参考訳(メタデータ) (2021-09-22T10:47:51Z) - The Lottery Tickets Hypothesis for Supervised and Self-supervised
Pre-training in Computer Vision Models [115.49214555402567]
事前訓練された重量は、しばしば分類、検出、セグメンテーションを含む幅広い下流タスクを増加させる。
最近の研究は、巨大モデル能力による事前学習の利点を示唆している。
本稿では,抽選券仮説(LTH)のレンズを用いて,教師付きおよび自己指導型事前学習モデルについて検討する。
論文 参考訳(メタデータ) (2020-12-12T21:53:55Z) - Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with
Latent Confounders [62.54431888432302]
無限水平エルゴードマルコフ決定過程におけるOPE問題について考察する。
我々は、状態と行動の潜在変数モデルのみを考慮すれば、政策値が政治外のデータから特定できることを示す。
論文 参考訳(メタデータ) (2020-07-27T22:19:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。