論文の概要: Beyond Single Videos: Benchmarking and Active Evidence Seeking for E-Commerce Cross-Video Reasoning
- arxiv url: http://arxiv.org/abs/2610.03099v1
- Date: Fri, 02 Oct 2026 10:19:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.32327
- Title: Beyond Single Videos: Benchmarking and Active Evidence Seeking for E-Commerce Cross-Video Reasoning
- Title(参考訳): シングルビデオを超えて:Eコマースのクロスビデオ推論のためのベンチマークとアクティブエビデンス
- Abstract要約: 私たちは、最初のEコマースのクロスビデオ推論ベンチマークであるAdsCVRを紹介します。
AdSeekは、マルチターン探索中にビジュアルおよびオーディオツールを選択するエージェントフレームワークである。
AdsCVRテストスプリットの精度は74.30%で、Qwen3-VL-8B-Instructのバックボーンを27.90ポイント上回っている。
- 参考スコア(独自算出の注目度): 12.42880221384249
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: E-commerce videos are information-dense and frequently compared by consumers evaluating products and merchants assessing marketing strategies. However, existing multimodal models mainly focus on single-video understanding and have limited ability to compare information across videos. We introduce AdsCVR, the first e-commerce cross-video reasoning benchmark, containing 2,483 videos and 6,110 question-answer pairs across six reasoning dimensions. Cross- video reasoning requires models to locate fine-grained evidence among many redundant frames and integrate visual details, speech, and on-screen text. We therefore propose AdSeek, an agentic framework that dynamically selects visual and audio tools during multi-turn exploration, replacing static uniform sampling with active evidence acquisition. To address the sparse credit assignment of reinforcement learning, we develop an offline trajectory rectification mechanism that identifies reasoning errors and missing multimodal evidence in RL-generated trajectories. The corrected trajectories provide supervised fine-tuning signals that reduce biases learned during RL. This mechanism supports a rectified bootstrapping pipeline in which initial RL exposes reasoning bottlenecks, supervised fine-tuning corrects them, and a final RL stage further improves the policy. AdSeek achieves 74.30 percent accuracy on the AdsCVR test split, outperforming its Qwen3-VL-8B-Instruct backbone by 27.90 percentage points. It also generalizes to the open- domain CrossVid benchmark, demonstrating effective active evidence gathering.
- Abstract(参考訳): 電子商取引ビデオは情報密度が高く、マーケティング戦略を評価する商品や商人を評価する消費者によって頻繁に比較される。
しかし、既存のマルチモーダルモデルは、主にシングルビデオ理解に焦点を当てており、ビデオ間で情報を比較する能力に制限がある。
2,483本の動画と6,110本の質問応答対を含む,最初のEコマースクロスビデオ推論ベンチマークであるAdsCVRを紹介した。
クロスビデオ推論では、多くの冗長なフレーム間のきめ細かい証拠を見つけ出し、視覚的詳細、音声、画面上のテキストを統合する必要がある。
そこで我々は,マルチターン探索において視覚・音声ツールを動的に選択するエージェントフレームワークであるAdSeekを提案し,静的な均一サンプリングをアクティブな証拠取得に置き換えた。
強化学習の疎度なクレジット割り当てに対処するため,RL生成トラジェクトリにおける推論誤差とマルチモーダルな証拠の欠如を識別するオフライントラジェクトリ補正機構を開発した。
補正された軌道は、制御された微調整信号を提供し、RLで学んだバイアスを減らす。
このメカニズムは修正されたブートストラップパイプラインをサポートし、初期RLは推論ボトルネックを露呈し、監督された微調整がそれらを修正し、最終RLステージはポリシーをさらに改善する。
AdSeekは、AdsCVRテストの分割で74.30%の精度を達成し、Qwen3-VL-8B-Instructバックボーンを27.90ポイント上回っている。
また、オープンドメインのCrossVidベンチマークにも一般化し、効果的なアクティブエビデンス収集を実証している。
関連論文リスト
- TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval [15.588457512574832]
データキュレーション、モデル開発、安全性分析には、実行ログから関連クリップを効率よく取り出すことが不可欠である。
汎用埋め込みモデルは静的シーンコンテキストからのショートカットに依存することが多い。
そこで我々は, ego-trajectory similarity を報酬として利用する動き認識ファインチューニングフレームワークであるTraVELを紹介した。
論文 参考訳(メタデータ) (2026-08-13T17:24:23Z) - VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning [55.2367119060441]
ビデオ理解は、クローズドコンテクストの知覚を超えて、オープンワールドのエビデンス探索へと移行している。
既存のマルチモーダル検索エージェントは主に静的画像をターゲットにしており、現在のVDRベンチマークはテキスト中心の検索に依存している。
本稿では,VDRのマルチツール推論による視覚言語モデルを実現するクローズドループエージェントフレームワークであるVideoSearcherを提案する。
論文 参考訳(メタデータ) (2026-07-03T03:50:09Z) - Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding [37.607009528052565]
この研究は、長いビデオ理解のための最初のEvidence-Driven Self-correctionフレームワークであるReflect-R1を提案する。
このフレームワークは直感、検証、調停からなる3段階のパイプラインを構成する。
本手法は真正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正
論文 参考訳(メタデータ) (2026-06-26T10:15:36Z) - InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning [61.87294123934038]
ビデオタスクにおけるマルチモーダル理解を強化するフレームワークであるInternVideo3を提案する。
MCRは理解を、共有、進化するコンテキスト上でのクローズドループプロセスとして扱う。
InternVideo3は、Video-MME、MLVU、Egoなどのベンチマークで強力なパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2026-06-10T15:17:08Z) - A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding [69.31609753061137]
マルチモーダルな大規模言語モデルはシングルビデオ理解において高いパフォーマンスを達成しているが、複数のビデオにまたがる推論能力は依然として限られている。
既存のアプローチでは、複数のビデオを1つの入力にまとめて直接推論を行い、トレーニングと推論のミスマッチを導入する。
現在のマルチビデオベンチマークでは、主にイベントレベルの比較を強調しており、アイデンティティレベルのマッチング、きめ細かい識別、構造化されたマルチステップ推論が過小評価されている。
視覚ツール,タスク固有のスキル,コンフリクト対応検証機構を統合した,多視点理解のためのスキル強化型エージェントフレームワークSAMAを提案する。
論文 参考訳(メタデータ) (2026-03-16T02:09:48Z) - VAR: Visual Attention Reasoning via Structured Search and Backtracking [49.427842994857635]
構造化された検索としてグラウンドド推論をリキャストするフレームワークであるVisual Attention Reasoningを紹介する。
VARは、推論プロセスを2つの重要な段階に分解する。
我々は、我々の7BモデルであるVAR-7Bが、幻覚と安全性のベンチマークの包括的なスイートに新しい最先端を設定していることを示します。
論文 参考訳(メタデータ) (2025-10-21T13:18:44Z) - ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding [71.654781631463]
ReAgent-Vは、新しいエージェントビデオ理解フレームワークである。
推論中に効率の良いフレーム選択とリアルタイムの報酬生成を統合する。
12のデータセットに対する大規模な実験は、一般化と推論において大きな成果を上げている。
論文 参考訳(メタデータ) (2025-06-02T04:23:21Z) - ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning [68.76048244253582]
ビデオ理解におけるフレーム選択の最適化にルールベース強化学習(RL)を利用する最初のフレームワークであるViaRLを紹介する。
ViaRLは、下流モデルの応答精度を報奨信号として利用し、試行錯誤によってフレームセレクタを訓練する。
ViaRLは、多様なビデオ理解タスクに対して、時間的基盤性能と堅牢な一般化を一貫して提供します。
論文 参考訳(メタデータ) (2025-05-21T12:29:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。