論文の概要: LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification
- arxiv url: http://arxiv.org/abs/2610.01800v1
- Date: Thu, 01 Oct 2026 14:43:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.198175
- Title: LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification
- Title(参考訳): LineupRL:キャプション・ツー・シリーズ識別による時系列キャプションのための検証可能な強化学習
- Abstract要約: 時系列キャプションは時系列理解の基本的なステップであり、信号と自然言語の橋渡しとしても機能する。
本稿では,LineupRLを提案する。LineupRL,LLVRパイプラインを用いた強化学習であり,その報酬はキャプション・ツー・シリーズの識別である。
2つのキャプションベンチマークで、LineupRLはSFTとRLの基準線を上回ります。
- 参考スコア(独自算出の注目度): 35.10357842026358
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Time series captioning is a fundamental step in time series understanding and can also serve as the bridge between signal and natural language. Supervised fine-tuning (SFT) relies on a larger model's captions and cannot exceed their quality. Reinforcement learning (RL) can, but its rewards were designed for other modalities and other tasks, and they transfer poorly to open-ended generation in the time series domain. We address this by proposing LineupRL, a reinforcement learning with verifiable rewards (RLVR) pipeline whose reward is caption-to-series identification. The reward model is a frozen large language model (LLM) verifier that reads the generated caption and the candidate time series as raw values, never the chart, and must pick the described time series from multiple distractors. Matching is a far lighter demand on the verifier than writing questions or judging a caption, so an off-the-shelf LLM can supply the reward. Across two captioning benchmarks, and on forecasting and reconstruction where the predictor sees only the caption, LineupRL outperforms SFT and RL baselines on every metric. The 3B vision language model (VLM) trained by LineupRL also outperforms, at 1/24 of the parameters, the 72B VLM whose captions the SFT baseline is distilled from. Our case study shows that LineupRL resists reward hacking, and that the captioner it trains both traces the trend and names the values at key points.
- Abstract(参考訳): 時系列キャプションは時系列理解の基本的なステップであり、信号と自然言語の橋渡しとしても機能する。
監督された微調整(SFT)はより大きなモデルのキャプションに依存しており、その品質を超えることはできない。
強化学習(RL)は可能であるが、その報酬は他のモダリティやタスクのために設計されており、時系列領域におけるオープン・エンド・ジェネレーションには不十分である。
この問題を解決するためにLineupRLを提案する。LineupRLは、評価された報酬(RLVR)パイプラインで、報酬はキャプション・ツー・シリーズの識別である。
報酬モデル(英: reward model)は、生成されたキャプションと候補時系列を生の値として読み取る冷凍大型言語モデル(LLM)検証器である。
マッチングは、質問を書いたり、キャプションを判断したりするよりも、検証者に対するはるかに軽い要求である。
2つのキャプションベンチマークと、予測器がキャプションのみを見る予測と再構築では、LineupRLは各メトリックでSFTとRLのベースラインを上回っている。
LineupRLによって訓練された3B視覚言語モデル(VLM)も、パラメータの1/24において、SFTベースラインを蒸留した72B VLMよりも優れている。
ケーススタディでは、LineupRLは報酬のハッキングに抵抗し、キャプタはトレンドを追跡してキーポイントの値を指定する。
関連論文リスト
- CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning [86.9494763617273]
本稿では,Captioning Reinforcement Learning++ (CapRL++)を紹介した。
本稿では,CapRL++が高密度キャプション品質を向上し,空間的・時間的理解などのタスクにおけるキャプションベースの事前訓練を強化していることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:09:20Z) - VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning [57.588999592609646]
本稿では,参照キャプション(証人)と視覚信号(代弁者)とをペアにする,証人-代弁者報酬であるVCapを提案する。
VCapは、キャプションの品質検証のための超幾何分布レベルの精度を持つ報酬信号を提供する。
実験では,VCapでトレーニングした8Bモデルは,複数の画像およびビデオキャプションベンチマーク上で,オープンソースおよびクローズドソースSOTAモデルより優れていた。
論文 参考訳(メタデータ) (2026-05-27T06:27:04Z) - BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning [4.441850776689605]
そこで本稿では, 実用意識の正しさ, 参照カバレッジ, 言語品質を協調的に最適化する, よりバランスのとれた強化学習フレームワークを提案する。
提案手法はキャプション品質を常に改善し, ピークゲインは+13.6 DCScore, +9.0 CaptionQA, +29.0 Cap である。
論文 参考訳(メタデータ) (2026-05-08T07:48:36Z) - More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models [74.10138874771852]
RLVR上で視覚知覚とテキスト推論を別々に改善する分離されたフレームワークであるPeRL-VL(Perception and Reasoning Learning for Vision-Language Models)を提案する。
知覚のために、PeRL-VLはVLMに基づく説明報酬を導入し、モデルの自己生成した画像記述を忠実さと満足度で評価する。
推論のために、PeRL-VLは論理に富んだチェーン・オブ・シントデータに関するテキストのみの推論SFTステージを追加し、コヒーレンスと論理的一貫性を視覚と独立に強化する。
論文 参考訳(メタデータ) (2025-12-13T23:06:18Z) - CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning [90.19455861166745]
本稿では,キャプションの品質を再定義するトレーニングフレームワークであるCaptioning Reinforcement Learning (CapRL)を紹介する。
主観的画像キャプションタスクにRLVRを適用した最初の研究として、CapRLは複数の設定を大幅に強化することを示した。
CapRLはQwen2.5-VL-72Bに匹敵する性能を達成し、ベースラインのマージンは平均8.4%を超えた。
論文 参考訳(メタデータ) (2025-09-26T17:59:55Z) - Compile Scene Graphs with Reinforcement Learning [69.36723767339001]
次世代予測は大規模言語モデル(LLM)の訓練の基本原理である
本稿では,マルチモーダルLLM(M-LLM)であるR1-SGGを紹介する。
私たちは、Hard Recall、Hard Recall+Relax、Soft Recallの3つのリコールベースのバリエーションを含む、グラフ中心の報酬セットを設計します。
論文 参考訳(メタデータ) (2025-04-18T10:46:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。