論文の概要: TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
- arxiv url: http://arxiv.org/abs/2608.08491v1
- Date: Sun, 09 Aug 2026 05:25:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.843724
- Title: TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
- Title(参考訳): TrustRoboReward:マルチパラダイム・ロボット・リワードモデルのための予測順序付きイソトニックスコア編集
- Abstract要約: 優先順序等調スコア編集(POISE)を備えたマルチパラダイム報酬モデリングフレームワークであるTrustRoboRewardを提案する。
POISEはポイントワイズスコアを修正し、TrustJudgeが未解決のクロスパラダイム逆転競合を取り除く。
POISEでトレーニングされたQwen3-VL-4Bは、全体的な報酬スコアが77.96%に達し、GPT-5-mini(78.09%、ギャップ0.13%)とほぼ一致し、最強のRoboReward-4Bベースラインを10.13%上回った。
- 参考スコア(独自算出の注目度): 40.42873860258522
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward models are a bottleneck for reinforcement learning in embodied AI. Long-horizon robotic manipulation requires scalable vision feedback beyond handcrafted rewards or task-specific annotations. Existing open-source VLM reward judges like RoboReward adopt simple 1--5 trajectory progress scoring, lacking pairwise preferences for RLHF, DPO and Bradley-Terry frameworks, while failing to optimize video scene understanding. Augmenting RoboReward with pairwise comparison and video-QA supervision causes inconsistency between pairwise preferences and pointwise scores, introducing training noise and hurting downstream performance---an issue aggregation methods such as TrustJudge cannot resolve. To address this, we propose TrustRoboReward, a multi-paradigm reward modeling framework equipped with Preference-Ordered Isotonic Score Editing (POISE). We construct a unified four-paradigm dataset with trajectory progress scoring (Score-A), video-QA answer quality scoring (Score-B), and their pairwise counterparts (Pair-A, Pair-B). Pairwise labels align better with human judgment than pointwise scores, inspiring us to calibrate pointwise scores to avoid score-pair reversals against pairwise preferences. POISE rectifies pointwise scores and eliminates cross-paradigm reversal conflicts unresolved by TrustJudge. Theoretically, POISE reduces score-pair reversal conflicts from 20.15% to 0%, whereas TrustJudge retains 20.46% conflicts on the same corpus. Evaluated on our benchmark, Qwen3-VL-4B trained with POISE achieves an overall reward score of 77.96%, nearly matching GPT-5-mini (78.09%, gap 0.13%) and outperforming the strongest RoboReward-4B baseline by 10.13%. It also lifts test-time score-pair consistency to 71.90%, exceeding RoboReward-4B (57.26%) and GPT-5-mini (68.09%). Integrating TrustJudge aggregation during inference boosts the overall score to 78.57%, surpassing the GPT-5-mini teacher model.
- Abstract(参考訳): リワードモデルは、エンボディAIにおける強化学習のボトルネックである。
ロングホライゾンのロボット操作は、手作りの報酬やタスク固有のアノテーションを超えた、スケーラブルな視覚フィードバックを必要とする。
RoboRewardのような既存のオープンソースのVLM報酬審査員は、単純な1--5軌道進行スコアを採用し、RLHF、DPO、Bradley-Terryフレームワークをペアで選好するが、ビデオシーン理解の最適化には失敗した。
ペアワイズ比較によるRoboRewardの拡張とビデオQA監視は、ペアワイズ選好とポイントワイズスコアの矛盾を引き起こし、トレーニングノイズを導入し、下流のパフォーマンスを損なう。
提案するTrustRoboRewardは,Preference-Ordered Isotonic Score Editing (POISE) を備えたマルチパラダイム報酬モデリングフレームワークである。
トラジェクティブ・プログレス・スコア(Score-A)、ビデオQA応答品質スコア(Score-B)、ペアワイズ・スコア(Pair-A, Pair-B)を備えた4パラダイム・データセットを構築した。
ペアワイズラベルは、ポイントワイズスコアよりも人間の判断と整合し、ポイントワイズスコアを校正して、ペアワイズ選好に対するスコアペア逆転を避けるように促します。
POISEはポイントワイズスコアを修正し、TrustJudgeが未解決のクロスパラダイム逆転競合を取り除く。
理論的には、POISEは20.15%から0%に、TrustJudgeは20.46%の競合を同じコーパスに保持する。
POISEでトレーニングしたQwen3-VL-4Bは、全体的な報酬スコアが77.96%に達し、GPT-5-mini(78.09%、ギャップ0.13%)とほぼ一致し、最強のRoboReward-4Bベースラインを10.13%上回った。
また、テストタイムのスコアペア一貫性を71.90%まで引き上げ、RoboReward-4B (57.26%) と GPT-5-mini (68.09%) を上回った。
推論中にTrustJudgeアグリゲーションを統合することで、総合スコアは78.57%まで上昇し、GPT-5-miniの教師モデルを上回った。
関連論文リスト
- Target-Checked Reliability Score Refinement for Video Question Answering [3.8271803328378677]
モデルの再トレーニングや回答の変更を伴わずに、目標シフトの下で回答レベルの信頼性スコアを改善できるかどうかを検討する。
3つの固定されたビデオ言語モデルから、4つの決定論的ビデオサンプリングに基づいてオプション確率リストを収集する。
選択した回答に割り当てられた確率として定義される原点スコアと,開発データセットに基づいて学習したヒストグラムに基づく勾配ボスティング(HGB)スコアを比較した。
候補は、ビデオレベルの繰り返しチェックがポジティブで安定した改善を示す場合にのみ、元のスコアを置き換える。
論文 参考訳(メタデータ) (2026-09-09T08:29:00Z) - LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks [3.789882665982407]
マルチエージェント大規模言語モデル(LLM)システムは、より多くの計算に費やして推論を改善することができる。
この決定は、各設定内に固定されたソルバを保持しながら、すべての問題を4つのプロトコルで実行することで分離する。
論文 参考訳(メタデータ) (2026-08-14T22:35:37Z) - Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions [80.33276868889341]
Z-Rewardは効率的な報酬展開から推論と重大な判断を分離する。
Z-Reward はテキスト・画像の最適化のための識別可能な報酬信号として機能することを示す。
論文 参考訳(メタデータ) (2026-06-08T06:20:12Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - EdgeJury: Cross-Reviewed Small-Model Ensembles for Truthful Question Answering on Serverless Edge Inference [0.0]
EdgeJuryは、真実性と堅牢性を改善する軽量アンサンブルフレームワークです。
TruthfulQA (MC1)では、EdgeJuryの精度は76.2%である。
200-question adversarial EdgeCasesセットでは、EdgeJuryは+48.2%の利得を得る。
論文 参考訳(メタデータ) (2025-12-29T14:48:40Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Fortytwo: Swarm Inference with Peer-Ranked Consensus [36.94429692322632]
我々は、AI推論において優れたパフォーマンスを達成するために、Swarmの知能原則と分散ペアのランキングコンセンサスを活用する新しいプロトコルFortytwoを提案する。
独自のBradley-Terry-styleアグリゲーションモデルを用いて、Swarm推論が多数決をかなり上回ることを示す。
論文 参考訳(メタデータ) (2025-10-27T23:19:48Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment [57.03947082589616]
大規模言語モデル(LLM)は、しばしばコントラスト的なアライメント目標と選好ペアデータセットを使用してアライメントされる。
これについて検討し、基礎となる応答が対照的な場合、嗜好データがより良い学習信号を与えることを示した。
我々は、よりコントラスト的な選好ペアを生み出すデータ生成手法である、AI Revisions (CLAIR) からのコントラスト学習を紹介する。
我々の最良のモデルは、APOで32K CLAIRの選好に基づいて訓練され、Llama-3-8B-Instructを7.65%改善し、GPT4-turboとのギャップを45%短縮しました。
論文 参考訳(メタデータ) (2024-08-12T16:24:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。