論文の概要: Does This Moment Justify the Recommendation? Counterfactual Behavior-Grounded Evidence Retrieval for Personalized Video Recommendation
- arxiv url: http://arxiv.org/abs/2609.00996v1
- Date: Tue, 01 Sep 2026 09:46:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.542628
- Title: Does This Moment Justify the Recommendation? Counterfactual Behavior-Grounded Evidence Retrieval for Personalized Video Recommendation
- Title(参考訳): このモーメントはレコメンデーションを正当化するのか?パーソナライズされたビデオレコメンデーションのための非現実的行動を取り巻くエビデンス検索
- Authors: Xin Liu,
- Abstract要約: 本研究では,このような証拠が存在するかどうかからパーソナライズされた証拠が生じる場所を分離した反事実的行動接地証拠検索について検討する。
ビデオレベルのエビデンス推定からセグメントレベルのローカライゼーションを分離する,コンパクトなフレームワークCBGERを提案する。
- 参考スコア(独自算出の注目度): 4.496057264602764
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Personalized video recommendation predicts user preference at the video level, while temporal video grounding localizes query-relevant moments. However, strong localization does not establish whether the retrieved moment constitutes valid evidence for recommending the video to a particular user. We study counterfactual behavior-grounded evidence retrieval, which separates where personalized evidence occurs from whether such evidence exists and evaluates whether model predictions respond consistently when that evidence is replaced. We introduce CBGER-10K, containing 5,000 controlled factual--counterfactual pairs for 3,026 users, where each pair replaces only the focal behavior-supported segment while preserving the user, temporal position, and hard distractors. We further propose CBGER, a compact framework that decouples segment-level localization from video-level evidence estimation and learns both through structured counterfactual supervision. CBGER achieves $0.4432$ MRR, $0.6977$ Pair Accuracy, and $0.6987$ Intervention Consistency across five adapted personalized-highlight and temporal-grounding baselines. Notably, compared with QD-DETR, its MRR improvement is not statistically significant, while Pair Accuracy improves by $11.03$ points. These results show that accurate temporal localization does not necessarily imply reliable personalized evidence existence, motivating explicit evaluation of Whether alongside Where.
- Abstract(参考訳): パーソナライズされたビデオレコメンデーションは、ユーザの好みをビデオレベルで予測し、時間的ビデオグラウンドはクエリ関連モーメントをローカライズする。
しかし、検索した瞬間が、特定のユーザーに動画を推薦する有効な証拠であるかどうかを確証しない。
本研究では,このような証拠が存在するかどうかからパーソナライズされた証拠が存在する場所を分離し,その証拠が置き換えられた場合にモデル予測が一貫して応答するかどうかを評価する。
CBGER-10Kは,3,026名のユーザに対して,5000対の制御された事実-事実-事実対を含み,各ペアがユーザ,時間的位置,ハードトラクタを保ちながら,焦点行動支援セグメントのみを置き換える。
さらに,ビデオレベルのエビデンス推定からセグメントレベルのローカライゼーションを分離し,構造化された対実的監視を通じて双方を学習する,コンパクトなフレームワークCBGERを提案する。
CBGERは、パーソナライズされたパーソナライズされたハイライトと時間的接地ベースラインで、MRR$0.4432$ MRR、$0.6977$ Pair Accuracy、$0.6987$ Intervention Consistencyを達成している。
特に、QD-DETRと比較して、MRRの改善は統計的に有意ではないが、Pair Accuracyは11.03$ポイント改善している。
これらの結果から,正確な時間的局所化は必ずしもパーソナライズされた証拠の存在を示唆するものではないことが示唆された。
関連論文リスト
- From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents [28.84798025130296]
VESTAは、ルート条件付き取得・検証・統合ループとして組織された、トレーニング不要の長ビデオエージェントである。
時間的エビデンス台帳は、観測結果を適応的で圧縮された時間的位置、証明、カバレッジ、コンフリクト、検証結果、仮説支持の視点に集約する。
論文 参考訳(メタデータ) (2026-08-31T15:55:48Z) - CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding [37.61837019441122]
大規模視覚言語モデル(LVLM)は、強化学習(RL)によるビデオ時間グラウンド(VTG)において、かなりの性能向上を達成した。
既存の手法では、最終的な予測間隔のみを評価する結果の正当性報酬に依存しており、境界関連の視覚的証拠は十分に制約されていない。
本稿では,時間的ミスアライメントに対して,境界固有の視覚的エビデンスによる局所化最適化を付加するコンピテンス・アウェア・ビジュアルバウンダリアライメント(CAVE)を提案する。
論文 参考訳(メタデータ) (2026-08-03T11:27:29Z) - Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition [0.9297355862757838]
PRISM-AHはA/Hを時間とともに展開するマルチモーダルコンフリクトとして扱うフレームワークである。
知識誘導型大規模言語モデルは、データセットの専門的な分類法を用いて、構造化された証拠を理由づける。
525ビデオのラベル付き公開テストパーティションでは、PRISM-AHは0.2827のゼロショットベースラインと比較して0.6133のマクロF1を達成する。
論文 参考訳(メタデータ) (2026-07-28T16:44:38Z) - RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation [74.86562505934961]
言語ベースのユーザプロファイルは、長い行動履歴をレコメンデーションのために明示的な意味表現に変換する。
そこでは,ストリームやプロファイルの更新を限定的に行うことで,ユーザの行動が継続的に到着する,実世界のショートビデオレコメンデーションにおいて,この問題について検討する。
本稿では,ストリーミング構造化されたセマンティックプロファイルを過去のレコメンデーションフィードバックで最適化するためのオフラインクローズドループフレームワークRECAPを提案する。
論文 参考訳(メタデータ) (2026-07-17T08:10:37Z) - Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding [86.37002814396674]
ビデオ時間グラウンドのためのフォアシー・ツー・グラウンド(F2G)を提案する。
F2Gは予測的時間知覚とエビデンス駆動推論を統合している。
さまざまなベンチマークでグラウンド化の精度を一貫して向上させる。
論文 参考訳(メタデータ) (2026-05-21T04:03:25Z) - PeReGrINE: Evaluating Personalized Review Fidelity with User Item Graph Context [11.110549053156625]
PeReGrINEは、グラフ構造化されたユーザーエビデンスに基づくパーソナライズされたレビュー生成のためのベンチマークおよび評価フレームワークである。
我々は,各ユーザの言語的・情緒的な傾向を事前のレビューよりも要約したユーザスタイルを計算する。
ディゾナンス分析は、期待されるユーザスタイルと製品レベルのコンセンサスからの逸脱を測定する。
論文 参考訳(メタデータ) (2026-04-09T04:36:28Z) - VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification [73.02304272829785]
VideoBenchは、証拠を厳格に検証する長ビデオ応答のための階層的なベンチマークだ。
これは、13のドメインに500の注釈付き質問を手動で記述し、時間間隔と空間境界ボックスを組み合わせて証拠とする。
GeminiPro-3-Proでさえ、標準のエンドツーエンドのQA設定で17%未満の質問に正しく答えている。
その結果,表面レベルでの回答の正しさと真正な証拠に基づく推論との間に大きなギャップが生じた。
論文 参考訳(メタデータ) (2026-04-02T03:29:43Z) - Counteracting Duration Bias in Video Recommendation via Counterfactual Watch Time [63.844468159126826]
視聴時間の予測は時間のバイアスに悩まされ、ユーザーの興味を正確に反映する能力を妨げる。
対実時計モデル (CWM) が提案され、CWTはユーザーがビデオレコメンデーションシステムから最大限の利益を得る時間に等しいことを示した。
論文 参考訳(メタデータ) (2024-06-12T06:55:35Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z) - Deconfounded Video Moment Retrieval with Causal Intervention [80.90604360072831]
本研究は,ビデオ中の特定のモーメントをテキストクエリに従ってローカライズすることを目的とした,ビデオモーメント検索(VMR)の課題に取り組む。
既存の手法は主に複雑な相互モーダル相互作用によるクエリとモーメントのマッチング関係をモデル化する。
本稿では,クエリとビデオコンテンツが予測に与える影響を捉えるために,構造因果モデルを構築する因果性に着想を得たVMRフレームワークを提案する。
論文 参考訳(メタデータ) (2021-06-03T01:33:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。