論文の概要: Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- arxiv url: http://arxiv.org/abs/2607.01897v1
- Date: Thu, 02 Jul 2026 08:50:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.749879
- Title: Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- Title(参考訳): Rank-then-Act: フレーム順進行からの逆数自由制御
- Authors: Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov,
- Abstract要約: Rank-Then-Act (RTA) は、環境に配慮せず、専門家によるビデオデモからコントロールポリシーを学ぶためのフレームワークである。
VLM(Vision-Language Model)をオフラインで,プログレッシブベースのオーディショナルスコアラーとしてトレーニングする。
我々は,予測進行ランクと真の時間指標とのスピアマンランク相関を計算し,有界でスケール不変な学習信号を生成する。
- 参考スコア(独自算出の注目度): 5.357451930622806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Rank-Then-Act (RTA), a framework for learning control policies from expert video demonstrations without environment rewards. RTA trains a Vision-Language Model (VLM) offline as a progress-based ordinal scorer, using a Group Relative Policy Optimization (GRPO) objective over shuffled frame sequences, which forces the model to recover temporal ordering from visual semantics rather than trivial time cues. Importantly, instead of using the scorer directly as a scalar reward model, we propose a correlation-based reward function for reinforcement learning: at each interaction window, we compute the Spearman rank correlation between predicted progress rankings and true temporal indices, yielding a bounded, scale-invariant learning signal. This design decouples reward learning from absolute calibration and enables stable transfer across tasks and environments. We evaluate RTA on discrete control benchmarks (PyBoy: Catrap, Kirby) and continuous control tasks (PointMaze, MetaWorld). RTA consistently matches or outperforms prior video-based reward learning methods and rank-based baselines, while demonstrating strong cross-task reuse of a single pretrained progress scorer. Our results suggest that correlation-structured supervision over video-derived ordinal signals is sufficient for policy learning, offering a scalable alternative to explicit reward design.
- Abstract(参考訳): 環境報酬を伴わない専門家によるビデオデモから制御ポリシーを学習するためのフレームワークであるRan-Then-Act(RTA)を紹介する。
RTAは、グループ相対ポリシー最適化(GRPO)の目標をシャッフルフレームシーケンスよりも使用して、進捗ベースの順序スコアラとしてVLM(Vision-Language Model)をオフラインでトレーニングする。
重要なことは、スコアラーをスカラー報酬モデルとして直接使用する代わりに、強化学習のための相関に基づく報酬関数を提案することである: それぞれの相互作用ウィンドウでは、予測された進行ランクと真の時間指標とのスピアマンランク相関を計算し、境界付きスケール不変学習信号を生成する。
この設計は、絶対的な校正から報酬の学習を分離し、タスクや環境間の安定した移動を可能にする。
離散制御ベンチマーク(PyBoy: Catrap, Kirby)と連続制御タスク(PointMaze, MetaWorld)でRTAを評価する。
RTAは、事前訓練された1つのプログレッシブスコアラーの強力なクロスタスク再利用を示しながら、従来のビデオベースの報酬学習方法とランクベースのベースラインとを一貫して一致または上回る。
以上の結果から,映像からの順序信号に対する相関構造による監視はポリシー学習に十分であり,明示的な報酬設計に代わるスケーラブルな代替手段を提供することが示唆された。
関連論文リスト
- Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training [29.56905427210088]
Gragient-ARMは、好みのフィードバックから強化学習を使用するルーリックジェネレータとジャッジを共同で最適化するフレームワークである。
ベンチマークのベースライン間で、勾配-ARMは最先端のパフォーマンスを達成し、オフラインおよびオンラインの強化学習設定において、ダウンストリームポリシーアライメントを大幅に改善することを示す。
論文 参考訳(メタデータ) (2026-02-02T00:50:53Z) - REALIGN: Regularized Procedure Alignment with Matching Video Embeddings via Partial Gromov-Wasserstein Optimal Transport [7.952582509792969]
実世界の命令データには、しばしばバックグラウンドセグメント、繰り返しアクション、順番に示されるステップが含まれている。
正規化部分グロモフ・ワッサースタイン最適輸送(R-FPGWOT)に基づく手続き学習のための自己指導型フレームワークREALIGNを紹介する。
KOTとは対照的に、我々の定式化は部分的なアライメントスキームの下で視覚的対応と時間的関係を共同でモデル化する。
論文 参考訳(メタデータ) (2025-09-29T07:32:14Z) - ReLAM: Learning Anticipation Model for Rewarding Visual Robotic Manipulation [25.115056940401164]
リワードデザインは、ロボット操作のための視覚的強化学習において、依然として重要なボトルネックとなっている。
本研究では,画像から抽出したキーポイントを通して空間距離を暗黙的に推定する手法を提案する。
Reward Learning with Precipation Model (ReLAM) は、アクションフリーのビデオデモから高密度で構造化された報酬を自動的に生成する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-09-26T14:28:42Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Compile Scene Graphs with Reinforcement Learning [69.36723767339001]
次世代予測は大規模言語モデル(LLM)の訓練の基本原理である
本稿では,マルチモーダルLLM(M-LLM)であるR1-SGGを紹介する。
私たちは、Hard Recall、Hard Recall+Relax、Soft Recallの3つのリコールベースのバリエーションを含む、グラフ中心の報酬セットを設計します。
論文 参考訳(メタデータ) (2025-04-18T10:46:22Z) - Learning One Representation to Optimize All Rewards [19.636676744015197]
我々は,報酬のないマルコフ決定プロセスのダイナミクスのフォワードバックワード(fb)表現を紹介する。
後尾に指定された報酬に対して、明確な準最適ポリシーを提供する。
これは任意のブラックボックス環境で制御可能なエージェントを学ぶためのステップです。
論文 参考訳(メタデータ) (2021-03-14T15:00:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。