論文の概要: GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
- arxiv url: http://arxiv.org/abs/2606.00775v1
- Date: Sat, 30 May 2026 15:40:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.769618
- Title: GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
- Title(参考訳): GIRL-DETR:ビデオモーメント検索のための勾配独立強化学習
- Abstract要約: ビデオモーメント検索(VMR)タスクは、自然言語クエリに沿った時間境界を正確にローカライズする必要がある。
GIRL-DETRは、RLポストトレーニングを、初めて軽量な時間的ローカライゼーションフレームワークに導入する。
- 参考スコア(独自算出の注目度): 10.034595422596562
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video Moment Retrieval (VMR) task requires accurately localizing temporal boundaries aligned with natural language queries, but many models suffer from a misalignment between continuous surrogate losses and non-differentiable metrics, leading to optimization stagnation during the late stages of training and trapping boundary predictions in suboptimal solutions. Although Reinforcement Learning (RL) post-training successfully optimizes localization results for large models, applying it directly to lightweight networks easily disrupts the fragile feature representations established during the supervised phase. To overcome this optimization bottleneck, we propose Gradient-Isolated Reinforcement Learning for DETR (GIRL-DETR), introducing RL post-training into a lightweight temporal localization framework for the first time. The input video and text features first establish early alignment through Cross-Modal Interaction (CMI) before entering the transformer encoder. Subsequently, a Text-Guided Gating (TGG) mechanism dynamically injects semantic priors into the queries before the transformer decoder generates candidate proposals, providing high signal-to-noise ratio inputs for temporal prediction. After the supervised training reaches convergence, the backbone network is frozen to protect the feature manifold, while the detection head directly optimizes the non-differentiable evaluation metric tIoU to enhance localization accuracy through a Three-stage Progressive Reinforcement Learning (TPRL) strategy. This approach achieves an orthogonal decoupling of state representation and metric optimization. Experiments on Charades-STA, QVHighlights, and TACoS demonstrate that GIRL-DETR effectively resolves surrogate loss degradation and achieves substantial accuracy improvements with minimal parameter updates, providing a robust new pathway for RL applications in lightweight VMR models.
- Abstract(参考訳): ビデオモーメント検索(VMR)タスクは、自然言語クエリに沿った時間境界を正確にローカライズする必要があるが、多くのモデルは、連続的なサロゲート損失と非微分不可能なメトリクスの相違に悩まされ、トレーニングの後期における最適化の停滞と、最適でないソリューションにおける境界予測のトラップとなる。
強化学習(Reinforcement Learning, RL)は大規模モデルのローカライゼーション結果の最適化に成功しているが, 軽量ネットワークに直接適用することで, 教師付きフェーズで確立した脆弱な特徴表現が容易に破壊される。
この最適化ボトルネックを克服するため,DTR(GIRL-DETR)のためのグラディエント分離強化学習を提案し,RLポストトレーニングを軽量な時間的局所化フレームワークに初めて導入した。
入力ビデオとテキスト機能は、まず、トランスフォーマーエンコーダに入る前に、CMI(Cross-Modal Interaction)を介して早期アライメントを確立する。
その後、変換器デコーダが候補提案を生成する前に、テキストガイドゲーティング(TGG)機構がクエリに動的にセマンティック先行を注入し、時間的予測のために高い信号対雑音比入力を提供する。
教師付きトレーニングが収束した後、バックボーンネットワークを凍結して特徴多様体を保護するとともに、検出ヘッドは、非微分可能評価指標tIoUを直接最適化し、3段階進行強化学習(TPRL)戦略により、局所化精度を高める。
このアプローチは状態表現とメートル法最適化の直交分離を実現する。
Charades-STA、QVHighlights、TACoSの実験では、GIRL-DETRはサロゲート損失の低減を効果的に解決し、最小限のパラメータ更新で大幅な精度の向上を実現し、軽量VMRモデルにおけるRLアプリケーションのための堅牢な新しいパスを提供する。
関連論文リスト
- LCPNet: Latent Consistent Proximal Unfolding Network for Infrared Small Target Detection [50.3892176822492]
赤外線小目標検出(IRSTD)は、複雑な赤外背景から長距離小目標を特定することを目的としている。
深層学習法は、識別的画像-マスクマッピングを学習することでIRSTDを改善した。
深層展開法は、モデル駆動イテレーションをニューラルネットワークに埋め込むことによって、この問題に部分的に対処する。
これらの制約に対処するために,Latent Consistent Proximal Unfolding Network (LCPNet)を提案する。
論文 参考訳(メタデータ) (2026-07-06T02:15:09Z) - Explicit Critic Guidance for Aligning Diffusion Models [27.6704888666835]
拡散後学習のための状態整列型アクター批判フレームワークを提案する。
提案手法は, グループリレーショナルRLとアクタークリティックベースラインを, シングルリワード, マルチリワードベンチマークで連続的に上回っている。
論文 参考訳(メタデータ) (2026-05-26T22:20:51Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Efficient and Adaptive Human Activity Recognition via LLM Backbones [39.42078885809324]
本稿では,大規模事前学習言語モデル(LLM)をセンサベースHARの汎用時間バックボーンとして再利用するパラダイムシフトを提案する。
提案手法は, 高速収束, 強力なデータ効率, 堅牢なデータ転送を実現する。
論文 参考訳(メタデータ) (2026-05-12T12:06:39Z) - Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping [66.25536973294726]
テキスト・トゥ・イメージ(T2I)モデルのポストトレーニング手法はハッキングに報いる傾向がある。
SLAS(Super-Linear Advantage Shaping)は、地方政策の分野を再考する。
SLASは、DanceGRPOベースラインを複数のバックボーンとベンチマークで一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-11T17:59:25Z) - Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondence [30.38509036690193]
MOCHIは、登録したトレーニングデータを必要とせずにトレーニングされた多視点3D顔予測フレームワークである。
標準点間距離は、登録不要設定でトレーニングの不安定性と視覚的アーティファクトを誘導する。
代わりに、よりスムーズな勾配とより優れた再構成忠実度を提供する点マップと正規化に基づく損失を提案する。
論文 参考訳(メタデータ) (2026-05-02T13:59:29Z) - Warm-Started Reinforcement Learning for Iterative 3D/2D Liver Registration [13.711805805211247]
学習ベースの手法は、最近、最適化ベースのアプローチに匹敵する登録誤差を達成している。
逐次的意思決定プロセスとしてCT-to-video登録を定式化する離散アクション強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-11T14:58:45Z) - Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models [58.3184497327891]
蒸留自己回帰(AR)ビデオモデルは、効率的なストリーミング生成を可能にするが、しばしば人間の視覚的嗜好に反する。
蒸留ARモデルに適した効率的なオンライン強化学習フレームワークであるAstrolabeを提案する。
論文 参考訳(メタデータ) (2026-03-17T18:32:18Z) - Transformer-based Scalable Beamforming Optimization via Deep Residual Learning [12.79709425087431]
大規模MU-MISOチャネルにおけるダウンリンクビームフォーミングのための教師なしディープラーニングフレームワーク。
モデルはオフラインでトレーニングされ、動的通信環境における軽量フィードフォワード計算によるリアルタイム推論を可能にする。
論文 参考訳(メタデータ) (2025-10-15T01:43:51Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization [77.62516752323207]
そこで本研究では,事前訓練した重みを効率よく微調整する直交微調整法を導入し,頑健さと一般化の強化を実現した。
自己正規化戦略は、OrthSRと呼ばれるVLMのゼロショット一般化の観点から安定性を維持するためにさらに活用される。
筆者らはCLIPとCoOpを再検討し,少数の画像のクラスフィシエーションシナリオにおけるモデルの改善を効果的に行う。
論文 参考訳(メタデータ) (2024-07-11T10:35:53Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。