論文の概要: REAR: Test-time Preference Realignment through Reward Decomposition
- arxiv url: http://arxiv.org/abs/2606.30339v1
- Date: Mon, 29 Jun 2026 14:17:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.262551
- Title: REAR: Test-time Preference Realignment through Reward Decomposition
- Title(参考訳): REAR: Reward Decomposition によるテストタイムの優先度設定
- Authors: Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An,
- Abstract要約: 本稿では,タスクを階層化問題としてモデル化する新しいフレームワークを提案する。
これら2つの報酬項の比率を選択的に再スケールするREAR(Realignment Reward)を導出する。
我々は,REARをトークンレベルのポリシログ確率の線形結合として定式化することができ,様々なTSアルゴリズムと容易に統合できることを示す。
- 参考スコア(独自算出の注目度): 68.09214603569744
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aligning large language models (LLMs) with diverse user preferences is a critical yet challenging task. While post-training methods can adapt models to specific needs, they often require costly data curation and additional training. Test-time scaling (TTS) presents an efficient, training-free alternative, but its application has been largely limited to verifiable domains like mathematics and coding, where response correctness is easily judged. To extend TTS to preference alignment, we introduce a novel framework that models the task as a realignment problem, since the base model often fails to sufficiently align with the stated preference. Our key insight is to decompose the underlying reward function into two components: one related to the question and the other to preference information. This allows us to derive a REAlignment Reward (REAR) that selectively rescales the proportions of these two reward terms. We then show that REAR can be formulated as a linear combination of token-level policy log-probabilities, making it computationally efficient and easy to integrate with various TTS algorithms such as best-of-$N$ sampling and tree search. Experiments show that compared to other test-time baselines, REAR not only enables scalable test-time realignment for preference alignment tasks under diverse user requirements, but also generalizes to mathematical and visual tasks under appropriate preference settings.
- Abstract(参考訳): 大きな言語モデル(LLM)を多様なユーザの好みで調整することは、重要な課題ですが、難しい作業です。
ポストトレーニングメソッドは特定のニーズにモデルを適用することができるが、コストのかかるデータキュレーションと追加のトレーニングが必要になることが多い。
テストタイムスケーリング(TTS)は効率的でトレーニング不要な代替手段であるが、その応用は数学やコーディングといった検証可能な領域に限られており、応答の正しさは容易に判断できる。
TTSを優先順に拡張するために、ベースモデルが記述された優先順に十分に整合しない場合が多いため、タスクを調整問題としてモデル化する新しいフレームワークを導入する。
我々の重要な洞察は、基礎となる報酬関数を2つのコンポーネントに分解することである。
これにより、これらの2つの報酬項の比率を選択的に再スケールするREAR(Realignment Reward)を導出することができる。
次に,REARをトークンレベルのポリシログ確率の線形結合として定式化することにより,ベスト・オブ・N$サンプリングやツリー探索など,様々なTSアルゴリズムとの統合が容易になることを示す。
実験の結果,REARは他のテストタイムベースラインと比較して,多様なユーザ要件下での優先度調整タスクのスケーラブルなテストタイム再配置を可能にするだけでなく,適切な優先度設定下での数学的および視覚的タスクにも一般化できることがわかった。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Does This Look Familiar to You? Knowledge Analysis via Model Internal Representations [0.0]
効果的なトレーニングデータ選択のための明確な方法論は存在しない。
モデル内部表現(KAMIR)は、これらの制限を克服する新しいアプローチである。
機械読解や要約など、幅広いタスクに適用することができる。
論文 参考訳(メタデータ) (2025-09-09T01:08:15Z) - Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models [20.292872255460534]
RATTPOは,様々な報酬シナリオに適用可能なフレキシブルなテスト時間最適化手法である。
RATTPOは、報酬固有のタスク記述を必要とせずに、大きな言語モデル(LLM)のテキストをクエリすることで、最適化されたプロンプトを検索する。
経験的結果はRATTPOの汎用性を示し、多様な報酬設定のユーザプロンプトを効果的に強化する。
論文 参考訳(メタデータ) (2025-06-20T09:02:05Z) - A Systematic Examination of Preference Learning through the Lens of Instruction-Following [83.71180850955679]
新たな合成データ生成パイプラインを用いて48,000の命令追従プロンプトを生成する。
合成プロンプトでは、リジェクションサンプリング(RS)とモンテカルロ木探索(MCTS)の2つの選好データセットキュレーション手法を用いる。
実験により、MCTSが生成した選好ペアにおける共有プレフィックスは、限界はあるが一貫した改善をもたらすことが明らかになった。
高コントラストの選好ペアは一般的に低コントラストのペアよりも優れているが、両者を組み合わせることで最高のパフォーマンスが得られることが多い。
論文 参考訳(メタデータ) (2024-12-18T15:38:39Z) - Test-Time Alignment via Hypothesis Reweighting [56.71167047381817]
大規模な事前訓練されたモデルは、しばしば未指定のタスクで苦労する。
テストタイムのユーザ意図にモデルを整合させるという課題に対処する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-11T23:02:26Z) - Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts [95.09994361995389]
Relative Preference Optimization (RPO) は、同一のプロンプトと関連するプロンプトの両方から、より多く、あまり好まれない応答を識別するように設計されている。
RPOは、大きな言語モデルをユーザの好みに合わせて調整し、トレーニングプロセスにおける適応性を改善する優れた能力を示している。
論文 参考訳(メタデータ) (2024-02-12T22:47:57Z) - CAFA: Class-Aware Feature Alignment for Test-Time Adaptation [50.26963784271912]
テスト時間適応(TTA)は、テスト時にラベルのないデータにモデルを適応させることによって、この問題に対処することを目的としている。
本稿では,クラス認識特徴アライメント(CAFA, Class-Aware Feature Alignment)と呼ばれる単純な機能アライメント損失を提案する。
論文 参考訳(メタデータ) (2022-06-01T03:02:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。