論文の概要: Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search
- arxiv url: http://arxiv.org/abs/2606.27291v1
- Date: Thu, 25 Jun 2026 17:09:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.373769
- Title: Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search
- Title(参考訳): 携帯型クエリ生成のためのリワード信号の設計:産業用セマンティックジョブサーチを事例として
- Authors: Ping Liu, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Rajat Arora, Yunxiang Ren, Chunnan Yao, Dan Xu, Baofen Zheng, Wanjun Jiang, Andrii Soviak, Kevin Kao, Jingwei Wu, Wenjing Zhang,
- Abstract要約: 本稿では,Emphportable Search クエリを生成するために,エンドツーエンドの RLAIF フレームワークを提案する。
このタスクは、ポリシー最適化がルーリックの欠陥を活用し、冗長なコピー動作をもたらす、非常に敵対的な報酬曲面を導入する。
提案手法では,提案手法の誤りを再現する報酬を補正するルールベースの報酬フロアを導入することで,家族間評価審査員に+0.147ドルの品質改善をもたらすことを示す。
- 参考スコア(独自算出の注目度): 8.82040111147814
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Job-search platforms rely on low-bandwidth query interfaces that often fail to capture the high-dimensional complexity of candidate profiles. We present an end-to-end RLAIF (Reinforcement Learning from AI Feedback) framework to generate \emph{portable} job search queries, terms that abstract away seeker-specific identifiers while preserving generalizable qualifications. This task introduces a highly adversarial reward surface where policy optimization frequently exploits flaws in LLM-as-judge rubrics, resulting in degenerate verbatim-copying behaviors. We conducted comprehensive empirical experiments to isolate the impact of optimization mechanics against structured reward engineering. Our results demonstrate that for critic-free optimizers, performance is overwhelmingly dictated by robust reward shaping, rendering the specific choice of algorithm largely immaterial. While critic-free per-rollout baseline methods (RLOO and REINFORCE++) natively resist reward-hacking, the group-relative advantage normalization in GRPO appears uniquely sensitive to spurious reward signals, making it disproportionately susceptible to exploitation. We show that introducing a deterministic, rule-based reward floor to correct for rewards assigned to verbatim copying mitigates this failure mode, resulting in a substantial $+0.147$ quality improvement on a cross-family evaluation judge. Ultimately, we show that the training-time reward model inflates performance gains by $2.4\times$, confirming that the training success is fundamentally dependent on enforcing reward-shaping disciplines rather than selecting alternative optimizers.
- Abstract(参考訳): ジョブ検索プラットフォームは、低い帯域幅のクエリインタフェースに依存しており、しばしば候補プロファイルの高次元の複雑さを捉えるのに失敗する。
本稿では, 探索者固有の識別子を抽象化し, 一般化可能な資格を維持しつつ, ジョブ検索クエリを生成するために, エンドツーエンドのRAIF(Reinforcement Learning from AI Feedback)フレームワークを提案する。
この課題は、ポリシー最適化がLLM-as-judgeルーブリックの欠陥を頻繁に活用し、動詞のコピー動作を退避させる、高度に敵対的な報酬曲面を導入する。
我々は、構造化報酬工学に対する最適化力学の影響を分離するための総合実験を行った。
この結果から,批判のないオプティマイザでは,ロバストな報酬形成によって性能が圧倒的に決定され,アルゴリズムの特定の選択がほとんど非物質的であることが示された。
RLOO や REINFORCE++(英語版) は報酬ハックにネイティブに抵抗するが、GRPO の集団相対的優位正規化は、刺激的な報酬信号に独特に敏感であり、不当に悪用されやすい。
提案手法では,本手法の失敗モードを緩和し,家族間評価審査員に対して+0.147ドルの品質向上を図った。
最終的に、トレーニングタイム報酬モデルがパフォーマンス向上を2.4\times$に膨らませることを示し、トレーニングの成功が代替オプティマイザを選択するのではなく、報酬形成の規律を強制することに根本的に依存していることを確認する。
関連論文リスト
- When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study [77.64957118012423]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデル推論において大きな進歩をもたらした。
最近の研究は、多数決や信頼に基づくスコアなど、モデル自身の信号から報酬を導き出すことによって、この問題に対処している。
本稿では,コード生成における本質的な報酬手法の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-06-18T19:15:50Z) - Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning [52.48243762705385]
Chain of Uncertain Rewards (CoUR)は、大きな言語モデル(LLM)を統合して報酬関数の設計と評価を効率化する新しいフレームワークである。
我々は、CoURがより良い性能を実現し、報酬評価のコストを大幅に削減できることを示します。
論文 参考訳(メタデータ) (2026-04-15T05:44:14Z) - PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning [29.373324685358753]
本稿では,自然言語記述から実行可能報酬関数コードを生成し,改善するためのフレームワークであるPROFと,単一専門家の軌跡を提案する。
また,環境相互作用やRLトレーニングを必要とせず,新たな報酬関数品質評価とランキング戦略であるReward Preference Ranking(RPR)を提案する。
論文 参考訳(メタデータ) (2025-11-14T14:38:02Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment [54.787826863212146]
推論時間計算は、言語モデルのパフォーマンスをスケールするための強力な軸を提供する。
我々は, (i) 応答品質, (ii) 計算量の観点から, 推論時アライメントアルゴリズムの性能を解析する。
我々は$textttInferenceTimePessimism$を紹介した。これは推論時間計算の故意使用を通じて報酬ハッキングを緩和する新しいアルゴリズムである。
論文 参考訳(メタデータ) (2025-03-27T18:00:08Z) - Behavior Alignment via Reward Function Optimization [23.92721220310242]
設計者のドメイン知識と環境のプライマリ報酬を反映した補助報酬を統合する新しいフレームワークを導入する。
提案手法の有効性を,小型実験から高次元制御課題に至るまで,様々な課題に対して評価する。
論文 参考訳(メタデータ) (2023-10-29T13:45:07Z) - Mind the Gap: Offline Policy Optimization for Imperfect Rewards [14.874900923808408]
多様な不完全な報酬を処理できる統合オフラインポリシー最適化手法である textitRGM (Reward Gap Minimization) を提案する。
下位層の双対性を生かして,オンラインインタラクションを伴わずにサンプルベースの学習を可能にする,抽出可能なアルゴリズムを導出する。
論文 参考訳(メタデータ) (2023-02-03T11:39:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。