論文の概要: Grounding with Confidence: Controllable Generative Video Temporal Grounding
- arxiv url: http://arxiv.org/abs/2609.39883v2
- Date: Thu, 01 Oct 2026 12:13:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.563786
- Title: Grounding with Confidence: Controllable Generative Video Temporal Grounding
- Title(参考訳): 信頼できるグラウンド:制御可能な生成ビデオ時間グラウンド
- Abstract要約: 生成モデルは典型的には、明確な間隔レベルの信頼スコアのないタイムスタンプを出力し、候補の選択を導く。
我々は、元の復号パス内で個々のインターバルをスコアリングすることで、受理から候補生成を分離する。
軽量信頼ヘッドは、プール化されたデコーダ状態を読み出し、インターバルセレクションのためにトレーニングされた明示的なスコアを提供する。
- 参考スコア(独自算出の注目度): 23.186399560557803
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video temporal grounding supports applications such as video search, content review, and automated editing by localizing events described in natural language. Yet existing generative models typically output timestamps without explicit interval-level confidence scores to guide candidate selection. We separate candidate generation from acceptance by scoring individual intervals within the original decoding pass. A lightweight confidence head reads pooled decoder states, providing an explicit score trained for interval selection. Offline verifier scores supervise the head on fixed candidate sequences, and temporal-overlap labels adapt it to current rollouts during reinforcement learning. GT-anchored candidate-pool supervision and set-level optimization train the generator. The resulting scores support ranking, threshold-based selection, and rejection without invoking an external verifier at inference. On a fixed OMTG-Bench candidate pool, confidence raises query-macro Recall@0.5 from 9.95% to 14.42% over generation order at a 10% global return budget, and from 26.48% to 31.12% at a 25% budget. The continuous scores let downstream applications adjust return budgets or acceptance thresholds to match their precision-recall preferences, without regenerating candidate intervals.
- Abstract(参考訳): ビデオ時間グラウンドは、ビデオ検索、コンテンツレビュー、自然言語で記述されたイベントのローカライズによる自動編集などのアプリケーションをサポートする。
しかし、既存の生成モデルは、通常、明確なインターバルレベルの信頼スコアのないタイムスタンプを出力し、候補の選択を導く。
我々は、元の復号パス内で個々のインターバルをスコアリングすることで、受理から候補生成を分離する。
軽量信頼ヘッドは、プール化されたデコーダ状態を読み出し、インターバルセレクションのためにトレーニングされた明示的なスコアを提供する。
オフライン検証器は、固定された候補シーケンスで頭部を監督し、時間オーバーラップラベルは強化学習中に現在のロールアウトに適応する。
GTによる候補プールの監督と設定レベルの最適化はジェネレータを訓練する。
結果のスコアは、推論時に外部検証者を呼び出すことなく、ランキング、しきい値ベースの選択、拒絶をサポートする。
OMTG-Bench候補プールでは、信頼度が9.95%から14.42%に上昇し、全リターン予算が10%、26.48%から31.12%に上昇する。
ダウンストリームアプリケーションは、予測間隔を再生することなく、リターン予算やアクセプションしきい値を調整することで、その精度とリコールの好みを一致させる。
関連論文リスト
- When to Retrieve, When to Stay: Uncertainty-Aware Temporal Evidence Allocation for Streaming Video-LLMs [55.016033209274376]
WRWS(When to Retrieve, When to Stay)は、不確実性適応型エビデンスアロケーションのためのトレーニング不要のフレームワークである。
WRWSは、関連手段が信頼性が高い場合に意味検索を好んでおり、不確実性の下での精度を高める。
我々の効率評価において、WRWSは、平均視覚から回答までの時間を、最先端手法の47.93%に削減する。
論文 参考訳(メタデータ) (2026-09-29T12:13:56Z) - Sampling headroom is not selection gain: a compute-value audit of test-time scaling for video world models [34.20907662027954]
テストタイムスケーリングは、より多くの計算がより良い候補を生成する場合にのみ生成を改善することができ、システムはそれらを確実に識別できる。
我々は,余分なサンプリングが機会を生み出すかどうかを問う連続的なフレームワークであるCompute-Value Audit(CVA)を紹介する。
192の物理IQのシーンでは、プールを4から16の候補に拡張すると、オラクルの品質は+9.23 IQ向上する。
12のアダプティブ・ディープス・ポリシーは、均一な計算よりも優れておらず、測定されたエントリー料金の42-69%しか回復しない。
論文 参考訳(メタデータ) (2026-09-06T06:11:15Z) - Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning [45.361080098317665]
グラウンドドビデオ質問応答や時間的グラウンド化のようなビデオ推論タスクは、クエリをサポートする時間的エビデンスを選択する必要がある。
凍結検証器がトレーニングをガイドできるかどうかについて検討する。
我々のフレームワークは、トレーニング可能なEmphGrounderと凍結したEmphVerifierを結合する: Grounderは候補の軌跡とエビデンスセグメントをサンプリングする。
論文 参考訳(メタデータ) (2026-08-25T07:46:32Z) - RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding [1.1161075621843597]
既存のアプローチはトレードオフに直面している: 言語モデルは質問コンテキストを理解し、不正確な座標を生成する。
このギャップを候補ボックスレベルで埋めるRefineRankを紹介します。
コンパクトなトレーニング可能なモジュールであるRefineNetは、凍結された医療ビジョン言語モデルの言語と地域特性と、凍結されたオープンセット検出器の提案を組み合わせる。
論文 参考訳(メタデータ) (2026-08-25T00:20:29Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding [59.09971455857609]
Video Temporal Groundingは、長いビデオの中で自然言語の記述と一致するビデオセグメントを時間的に見つけることを目的としている。
本稿では,データ効率のよいクロスドメイン時間グラウンド法を提案する。
この方法では、ターゲットアノテーションの必要性を排除し、計算とストレージの両方のオーバーヘッドをリアルタイムで実行できるほど低く保つ。
論文 参考訳(メタデータ) (2025-08-08T13:47:00Z) - Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains [13.58151841630302]
本稿では,RAGにおける再ランク付けを合理的な選択手法で置き換える新しい方法であるMETEORAを提案する。
METEORAは、最先端の再評価手法よりも約50%少ないチャンクを使用しながら、生成精度を33.34%向上させる。
敵対的な設定では、METEORAはF1スコアを0.10から0.44に大幅に改善する。
論文 参考訳(メタデータ) (2025-05-21T20:57:16Z) - Iterative pseudo-forced alignment by acoustic CTC loss for
self-supervised ASR domain adaptation [80.12316877964558]
特定のドメインからの高品質なデータラベリングはコストと人的時間を要する。
本稿では,反復的擬力アライメントアルゴリズムに基づく自己教師付きドメイン適応手法を提案する。
論文 参考訳(メタデータ) (2022-10-27T07:23:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。