論文の概要: HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks
- arxiv url: http://arxiv.org/abs/2607.28301v1
- Date: Thu, 30 Jul 2026 14:41:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.610661
- Title: HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks
- Title(参考訳): HARGO:HPCタスク上でのLCMのRL後評価のための不均一性を考慮した逆誘導最適化
- Abstract要約: 改良された微調整により、大規模言語モデルにドメイン知識を組み込むことで、高性能コンピューティングタスクを実現できる。
しかし、知識だけではタスクに適した行動は保証されない。
本稿では,HARGO, Heterogeneity-Aware Reward-Guided Optimizationを提案する。
- 参考スコア(独自算出の注目度): 0.8508198765617196
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Supervised fine-tuning (SFT) can equip large language models (LLMs) with domain knowledge for high-performance computing (HPC) tasks such as data race detection and benchmark question answering. However, knowledge alone does not guarantee task-appropriate behavior: the same SFT model that correctly classifies 88.65\% of C/C++ data race samples produces verbose, imprecise answers to factual queries, with 65.9\% of MLPerf responses exceeding 40 characters. Reinforcement learning (RL) post-training addresses this gap by optimizing for task-specific rewards rather than token-level imitation. Yet HPC tasks exhibit extreme heterogeneity, with binary classification, factual QA, and semantic generation differing by 58x in answer length, spanning three distinct reward distributions, and showing widely varying SFT accuracy. This makes uniform-weight RL methods such as GRPO suboptimal. We propose HARGO, Heterogeneity-Aware Reward-Guided Optimization, which introduces per-response importance weighting via confidence-modulated advantage: computing a discrimination signal from group-level reward contrast and a confidence signal from reference model log-probabilities, then modulating the advantage before computing per-response weights, without requiring task-type labels. Across four HPC tasks and nine methods, HARGO achieves the best performance on all three primary metrics: WinRate 54.62\%, Data Race F1 91.30\%, and PLP Similarity 0.8558. Ablation confirms complementary contributions from both signals. HARGO establishes the best overall alignment quality among compared methods for heterogeneous HPC tasks.
- Abstract(参考訳): Supervised Fine-tuning (SFT) は、大規模言語モデル(LLM)に、データ競合検出やベンチマーク質問応答といったハイパフォーマンスコンピューティング(HPC)タスクのドメイン知識を組み込むことができる。
C/C++データレースサンプルの88.65\%を正しく分類する同じSFTモデルは、事実クエリに対する冗長で不正確な回答を生成し、65.9\%のMLPerf応答は40文字を超えている。
強化学習(RL)は、トークンレベルの模倣よりもタスク固有の報酬を最適化することで、このギャップに対処する。
しかし、HPCタスクは、二項分類、実数QA、意味生成を58倍にし、3つの異なる報酬分布にまたがり、広範囲に異なるSFT精度を示す。
これによりGRPOサブ最適化のような一様ウェイトなRL法が作られる。
本稿では,HARGO, Heterogeneity-Aware Reward-Guided Optimizationを提案する。HARGO, Heterogeneity-Aware Reward-Guided Optimizationは,グループレベルの報酬コントラストからの識別信号と参照モデルのログ確率からの信頼信号の計算を行い,タスクタイプラベルを必要とせずに応答単位の重み付けを演算する。
4つのHPCタスクと9つのメソッドで、HARGOは、WinRate 54.62\%、Data Race F1 91.30\%、PLP similarity 0.8558の3つの主要なメトリクスで最高のパフォーマンスを達成する。
アブレーションは両方の信号から補完的な寄与を裏付ける。
HARGOは、異種HPCタスクの比較方法の中で、最高の全体的なアライメント品質を確立する。
関連論文リスト
- Unified Data Selection for LLM Reasoning [66.0118347918729]
複雑で長いCoT推論のための大規模言語モデル(LLM)のトレーニングは、しばしば大量の高品質な推論データの必要性によってボトルネックとなる。
本研究では,各推論サンプルの上位(例えば0.5%)のエントロピートークンのみを和らげることで,推論品質を定量化する学習自由度指標であるHigh-Entropy Sum(HES)を提案する。
論文 参考訳(メタデータ) (2026-05-21T12:21:41Z) - LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources [0.7734726150561088]
行方不明者や子どもの安全に関する調査は、構造化フォーム、掲示板スタイルのポスター、物語ウェブプロファイルなど、異種ケース文書に依存している。
レイアウト、用語、データ品質の変化は、急激なトリアージ、大規模分析、探索計画を妨げる。
本稿では、AIによる解析および正規化パイプラインであるGuardian Packを紹介し、マルチソース調査文書を統一されたスキーマ準拠の表現に変換する。
論文 参考訳(メタデータ) (2026-04-08T01:35:56Z) - OPERA: Online Data Pruning for Efficient Retrieval Model Adaptation [39.548179971747906]
ドメイン固有の微調整は、高密度レトリバーにとって不可欠であるが、すべてのトレーニングペアが学習プロセスに等しく貢献するわけではない。
我々は、この不均一性を利用して、検索モデル適応の有効性と効率を両立させるデータプルーニングフレームワークであるOPERAを紹介する。
論文 参考訳(メタデータ) (2026-03-17T23:11:45Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking [84.07076200941474]
ArenaRLは、ポイントワイドスカラースコアからグループ内相対ランクにシフトする強化学習パラダイムである。
我々は,グループ内対角アリーナを構築し,安定した有利な信号を得るためのトーナメントベースのランキングスキームを考案する。
実験により、ArenaRLは標準のRLベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-10T08:43:07Z) - SWE-RM: Execution-free Feedback For Software Engineering Agents [61.86380395896069]
実行ベースフィードバックは、テストタイムスケーリング(TTS)と強化学習(RL)を通じて、コーディングエージェントの開発に広く利用されている。
対照的に、報酬モデルによる実行不要なフィードバックは、単体テストケースに依存することなく、よりきめ細かい信号を提供することができる。
SWE-RMは,30Bの合計パラメータと3Bのアクティベートされた3Bの混合実験アーキテクチャを採用した,正確で堅牢な報酬モデルである。
論文 参考訳(メタデータ) (2025-12-26T08:26:18Z) - CoT-Saliency: Unified Chain-of-Thought Reasoning for Heterogeneous Saliency Tasks [96.64597365827046]
本稿では,3つの運用上不均一なサリエンシタスクを共同で処理する,最初の統合フレームワークを提案する。
タスクの不均一性を橋渡しする視覚言語モデル(VLM)において、チェーン・オブ・ソート(CoT)推論プロセスを導入する。
我々は,全タスクにまたがる特別なSOTA手法と強力なクローズドソースVLMの整合性を示す。
論文 参考訳(メタデータ) (2025-11-01T04:37:01Z) - Flow-GRPO: Training Flow Matching Models via Online RL [80.62659379624867]
本稿では,オンライン政策強化学習をフローマッチングモデルに統合する最初の方法であるFlow-GRPOを提案する。
提案手法では,(1)決定論的正規微分方程式を同値な微分方程式に変換するODE-to-SDE変換と,(2)推論ステップの数を維持しながらトレーニングの段階を短縮するDenoising Reduction戦略の2つの主要な戦略を用いる。
論文 参考訳(メタデータ) (2025-05-08T17:58:45Z) - Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize
Encoded Knowledge [85.17343729885003]
我々は,Hint-before-Solving Prompting (HSP)を導入し,その問題を解くためのヒントを生成する。
HSPは推論タスクの精度を効果的に向上させることができる。
我々はHSPと細調整されたLlemma-7Bに基づいてHSPMATHデータセットを構築し、64.3精度を達成した。
論文 参考訳(メタデータ) (2024-02-22T05:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。