論文の概要: Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- arxiv url: http://arxiv.org/abs/2607.01897v1
- Date: Thu, 02 Jul 2026 08:50:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.749879
- Title: Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- Title(参考訳): Rank-then-Act: フレーム順進行からの逆数自由制御
- Abstract要約: Rank-Then-Act (RTA) は、環境に配慮せず、専門家によるビデオデモからコントロールポリシーを学ぶためのフレームワークである。
VLM(Vision-Language Model)をオフラインで,プログレッシブベースのオーディショナルスコアラーとしてトレーニングする。
我々は,予測進行ランクと真の時間指標とのスピアマンランク相関を計算し,有界でスケール不変な学習信号を生成する。
- 参考スコア(独自算出の注目度): 5.357451930622806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Rank-Then-Act (RTA), a framework for learning control policies from expert video demonstrations without environment rewards. RTA trains a Vision-Language Model (VLM) offline as a progress-based ordinal scorer, using a Group Relative Policy Optimization (GRPO) objective over shuffled frame sequences, which forces the model to recover temporal ordering from visual semantics rather than trivial time cues. Importantly, instead of using the scorer directly as a scalar reward model, we propose a correlation-based reward function for reinforcement learning: at each interaction window, we compute the Spearman rank correlation between predicted progress rankings and true temporal indices, yielding a bounded, scale-invariant learning signal. This design decouples reward learning from absolute calibration and enables stable transfer across tasks and environments. We evaluate RTA on discrete control benchmarks (PyBoy: Catrap, Kirby) and continuous control tasks (PointMaze, MetaWorld). RTA consistently matches or outperforms prior video-based reward learning methods and rank-based baselines, while demonstrating strong cross-task reuse of a single pretrained progress scorer. Our results suggest that correlation-structured supervision over video-derived ordinal signals is sufficient for policy learning, offering a scalable alternative to explicit reward design.
- Abstract(参考訳): 環境報酬を伴わない専門家によるビデオデモから制御ポリシーを学習するためのフレームワークであるRan-Then-Act(RTA)を紹介する。
RTAは、グループ相対ポリシー最適化(GRPO)の目標をシャッフルフレームシーケンスよりも使用して、進捗ベースの順序スコアラとしてVLM(Vision-Language Model)をオフラインでトレーニングする。
重要なことは、スコアラーをスカラー報酬モデルとして直接使用する代わりに、強化学習のための相関に基づく報酬関数を提案することである: それぞれの相互作用ウィンドウでは、予測された進行ランクと真の時間指標とのスピアマンランク相関を計算し、境界付きスケール不変学習信号を生成する。
この設計は、絶対的な校正から報酬の学習を分離し、タスクや環境間の安定した移動を可能にする。
離散制御ベンチマーク(PyBoy: Catrap, Kirby)と連続制御タスク(PointMaze, MetaWorld)でRTAを評価する。
RTAは、事前訓練された1つのプログレッシブスコアラーの強力なクロスタスク再利用を示しながら、従来のビデオベースの報酬学習方法とランクベースのベースラインとを一貫して一致または上回る。
以上の結果から,映像からの順序信号に対する相関構造による監視はポリシー学習に十分であり,明示的な報酬設計に代わるスケーラブルな代替手段を提供することが示唆された。
関連論文リスト
- Unsupervised Continual Learning with Growing Self-Organizing Maps and Synthetic Replay [47.020758735910306]
本研究では,クラス増分学習のための自己組織化マップ(GSOM)とエンコーダデコーダモデルに基づく生成連続学習フレームワークを提案する。
提案手法により,分布統計メモリを用いた非定型再生が可能となり,生データを格納する必要がなくなる。
複数のベンチマークの結果から,提案手法は教師付きメモリベース手法であっても性能の競争力を発揮することが示された。
論文 参考訳(メタデータ) (2026-08-27T19:48:44Z) - Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers [55.33468902405567]
本稿では、事前学習とデプロイの両方が好みのフィードバックにのみ依存する新しい学習パラダイム、In-Context Preference-based Reinforcement Learning (ICPRL)を提案する。
ICPRLは、厳密なコンテキスト内一般化を可能にし、完全な報酬管理で訓練されたICRLメソッドに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-09T03:42:16Z) - Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training [29.56905427210088]
Gragient-ARMは、好みのフィードバックから強化学習を使用するルーリックジェネレータとジャッジを共同で最適化するフレームワークである。
ベンチマークのベースライン間で、勾配-ARMは最先端のパフォーマンスを達成し、オフラインおよびオンラインの強化学習設定において、ダウンストリームポリシーアライメントを大幅に改善することを示す。
論文 参考訳(メタデータ) (2026-02-02T00:50:53Z) - REALIGN: Regularized Procedure Alignment with Matching Video Embeddings via Partial Gromov-Wasserstein Optimal Transport [7.952582509792969]
実世界の命令データには、しばしばバックグラウンドセグメント、繰り返しアクション、順番に示されるステップが含まれている。
正規化部分グロモフ・ワッサースタイン最適輸送(R-FPGWOT)に基づく手続き学習のための自己指導型フレームワークREALIGNを紹介する。
KOTとは対照的に、我々の定式化は部分的なアライメントスキームの下で視覚的対応と時間的関係を共同でモデル化する。
論文 参考訳(メタデータ) (2025-09-29T07:32:14Z) - ReLAM: Learning Anticipation Model for Rewarding Visual Robotic Manipulation [25.115056940401164]
リワードデザインは、ロボット操作のための視覚的強化学習において、依然として重要なボトルネックとなっている。
本研究では,画像から抽出したキーポイントを通して空間距離を暗黙的に推定する手法を提案する。
Reward Learning with Precipation Model (ReLAM) は、アクションフリーのビデオデモから高密度で構造化された報酬を自動的に生成する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-09-26T14:28:42Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency [56.475612147721264]
本稿では、離散的かつ連続的な報酬信号を通して意味的推論と時間的推論の両方を監督する二重回帰定式化を提案する。
我々は,ビデオQA,テンポラルビデオグラウンディング,グラウンドドビデオQAを含む8つの代表的なビデオ理解タスクに対するアプローチを評価した。
その結果、MLLMを用いた推論中心のビデオ理解の進展において、報酬設計とデータ選択の重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-06-02T17:28:26Z) - Compile Scene Graphs with Reinforcement Learning [69.36723767339001]
次世代予測は大規模言語モデル(LLM)の訓練の基本原理である
本稿では,マルチモーダルLLM(M-LLM)であるR1-SGGを紹介する。
私たちは、Hard Recall、Hard Recall+Relax、Soft Recallの3つのリコールベースのバリエーションを含む、グラフ中心の報酬セットを設計します。
論文 参考訳(メタデータ) (2025-04-18T10:46:22Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Self-Supervised Representation Learning from Temporal Ordering of
Automated Driving Sequences [49.91741677556553]
本研究では、認識タスクのための地域レベルの特徴表現を事前学習するための時間順述前文タスクであるTempOを提案する。
我々は各フレームを、オブジェクト検出やトラッキングシステムにとって自然な表現である、未順序な特徴ベクトルのセットで埋め込む。
BDD100K、nu Images、MOT17データセットの大規模な評価は、私たちのTempO事前学習アプローチがシングルフレームの自己教師型学習方法よりも優れていることを示している。
論文 参考訳(メタデータ) (2023-02-17T18:18:27Z) - Learning One Representation to Optimize All Rewards [19.636676744015197]
我々は,報酬のないマルコフ決定プロセスのダイナミクスのフォワードバックワード(fb)表現を紹介する。
後尾に指定された報酬に対して、明確な準最適ポリシーを提供する。
これは任意のブラックボックス環境で制御可能なエージェントを学ぶためのステップです。
論文 参考訳(メタデータ) (2021-03-14T15:00:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。