論文の概要: Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
- arxiv url: http://arxiv.org/abs/2608.28675v1
- Date: Tue, 25 Aug 2026 07:46:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.704504
- Title: Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
- Title(参考訳): ビデオ推論のためのマルチエージェント自己改善型強化学習
- Abstract要約: グラウンドドビデオ質問応答や時間的グラウンド化のようなビデオ推論タスクは、クエリをサポートする時間的エビデンスを選択する必要がある。
凍結検証器がトレーニングをガイドできるかどうかについて検討する。
我々のフレームワークは、トレーニング可能なEmphGrounderと凍結したEmphVerifierを結合する: Grounderは候補の軌跡とエビデンスセグメントをサンプリングする。
- 参考スコア(独自算出の注目度): 45.361080098317665
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video reasoning tasks such as grounded video question answering and temporal grounding require selecting temporal evidence that supports the query. In many current training setups, temporal supervision is applied through local objectives such as boundary regression or span generation, while verification is used mainly to rerank candidate segments at inference time. We study whether a frozen verifier can also guide training. Our multi-agent framework couples a trainable \emph{Grounder} with a frozen \emph{Verifier}: the Grounder samples candidate trajectories and evidence segments, the Verifier assigns query-conditioned segment scores, a group-relative policy-gradient objective favors trajectories that outperform their within-input peers, and a bootstrapped calibration loss steers temporal predictions toward verifier-preferred spans. Trained on source tasks and evaluated without target-dataset fine-tuning, a two-billion-parameter instantiation transfers zero-shot across grounded question answering, temporal grounding, and long-video question answering, reaching 28.7\% intersection-over-union and 25.4\% answer-grounding accuracy on a grounded-question-answering benchmark, 46.1\% intersection-over-union on a temporal-grounding benchmark, and 54.1\% on a long-video question-answering benchmark. Relative to a strong same-scale baseline, the gains are modest but consistent, with the clearest improvements on relevance-oriented metrics such as intersection-over-union and moderate-overlap recall. Within the tested benchmarks and transfer setting, the results support frozen verification as a training signal for evidence selection, while showing that strict boundary precision remains comparatively weaker. Code and models are available at https://anonymous.4open.science/r/MASIRL-E50C/
- Abstract(参考訳): グラウンドドビデオ質問応答や時間的グラウンド化のようなビデオ推論タスクは、クエリをサポートする時間的エビデンスを選択する必要がある。
現在の多くのトレーニングでは、時間的監督は境界回帰やスパン生成といった局所的な目的を通じて適用され、検証は主に推論時に候補セグメントをリランクするために使用される。
凍結検証器がトレーニングをガイドできるかどうかについて検討する。
我々のマルチエージェントフレームワークは、トレーニング可能な \emph{Grounder} と凍結した \emph{Verifier} とを結合する: Grounder は候補軌跡とエビデンスセグメントをサンプリングし、Verifier はクエリ条件付きセグメントスコアを割り当て、group-relative policy-gradient objective は、彼らのインプットピアよりも優れたトラジェクトリを優先し、ブートストラップされたキャリブレーション損失ステアは、検証対象スパンに対して時間予測を行う。
ソースタスクに基づいて訓練され、ターゲットデータセットの微調整なしで評価され、2ビリオンパラメータのインスタンス化は、接地された質問応答、時間的接地、長ビデオの質問応答でゼロショットを転送し、接地された質問応答ベンチマークで28.7\%と25.4\%の回答接地精度、時間的接地ベンチマークで46.1\%、長時間ビデオの質問応答ベンチマークで54.1\%に達する。
強い同スケールのベースラインとは対照的に、利得は控えめだが一貫性があり、相互接続や中程度のオーバーラップリコールといった関連性指向のメトリクスが明らかに改善されている。
試験されたベンチマークと転送設定では、証拠選択のトレーニング信号として凍結検証をサポートしながら、厳密な境界精度は比較的弱いままである。
コードとモデルはhttps://anonymous.4open.science/r/MASIRL-E50C/で入手できる。
関連論文リスト
- Concentrate After Imagination: Text-Conditioned Evidence Grounding for Partially Relevant Video Retrieval [27.64333612353748]
関連のあるビデオ検索は、クエリーが短い瞬間だけを記述すると、未トリミングされたビデオを検索する。
本稿では,PRVRのためのスコアレベルのエビデンス検証演算子TRACEを提案する。
ActivityNet Captions、Charades-STA、TVRでは、TRACEは3つのベンチマークで最高のSumRを達成する。
論文 参考訳(メタデータ) (2026-09-08T16:37:35Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training [30.22002300048916]
大規模言語モデルテストタイムトレーニング(TTT)は、しばしばローカルプロキシメトリクスによって評価される。
TTTメモリを校正する行動評価フレームワークを導入する。
論文 参考訳(メタデータ) (2026-07-01T03:07:17Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z) - Find, Fix, Reason: Context Repair for Video Reasoning [45.021693494492666]
強化学習は、大規模なマルチモーダルモデルにおいて高度なビデオ推論を持つ。
凍結したツール統合された教師は、時間的依存の欠如を認識し、最小限のエビデンスパッチを提供する。
本稿では,正解による結果の妥当性と依存性の整合性という2つの目標に最適化を整合させるロバスト改善リワード(RIR)を提案する。
論文 参考訳(メタデータ) (2026-04-17T17:04:19Z) - VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification [73.02304272829785]
VideoBenchは、証拠を厳格に検証する長ビデオ応答のための階層的なベンチマークだ。
これは、13のドメインに500の注釈付き質問を手動で記述し、時間間隔と空間境界ボックスを組み合わせて証拠とする。
GeminiPro-3-Proでさえ、標準のエンドツーエンドのQA設定で17%未満の質問に正しく答えている。
その結果,表面レベルでの回答の正しさと真正な証拠に基づく推論との間に大きなギャップが生じた。
論文 参考訳(メタデータ) (2026-04-02T03:29:43Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。