論文の概要: OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds
- arxiv url: http://arxiv.org/abs/2606.15330v1
- Date: Sat, 13 Jun 2026 14:48:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.363084
- Title: OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds
- Title(参考訳): OneBar:Eコマースビデオフィードのためのコンテンツを取り巻く生成クエリ推奨フレームワーク
- Authors: Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu,
- Abstract要約: OneBarは、Eコマースビデオフィードのリアルタイムクエリレコメンデーションのためのエンドツーエンドの生成フレームワークである。
OneBarは,(1)マルチモーダルなビデオ理解と行動に起因した協調的アンカーを融合した複数モーダルな意図的接地モジュール,(2)効率的なオンラインサービスを実現するための即時圧縮機構を備えた統一エンド・ツー・エンドアーキテクチャ,(3)効率的な嗜好内在化のためのプログレッシブな選好学習戦略,の3つの革新を特徴としている。
- 参考スコア(独自算出の注目度): 15.664358656780921
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Short-video platforms now expose clickable search entries beneath the video player, enabling users to easily express content-induced search intent. However, conventional query recommendation systems on short-video platforms suffer from latency constraints and objective misalignment, while recent generative approaches struggle with noisy content-side metadata and preference drift. To address these issues, we propose OneBar, an end-to-end generative framework for real-time query recommendation for E-Commerce video feeds. OneBar features three key innovations: (1) a collaborative-multimodal intent grounding module that fuses multimodal video understanding and behavior-derived collaborative anchors; (2) a Unified End-to-End architecture equipped with a prompt-compression mechanism for efficient online serving; and (3) a progressive preference learning strategy for efficient preference-internalization, which internalizes hierarchical behavior preferences into the generative policy, eliminating the need for a separately trained reward model. Compared with online base, OneBar increases Query Exposure by 16.91\% and Query Click by 18.68\%, while maintaining a slight Query CTR gain of 0.19\%. The additional search traffic further contributes to 20.36\% more guided orders and 21.67\% higher GMV.
- Abstract(参考訳): ショートビデオプラットフォームでは、ビデオプレーヤーの下にクリック可能な検索エントリが公開され、ユーザーはコンテンツによる検索インテントを簡単に表現できるようになった。
しかし,従来の短いビデオプラットフォーム上でのクエリ推薦システムは遅延制約や客観的なミスアライメントに悩まされ,最近の生成的アプローチではノイズの多いコンテンツ側メタデータや嗜好の漂流に悩まされている。
これらの問題に対処するために、Eコマースビデオフィードのリアルタイムクエリレコメンデーションのためのエンドツーエンド生成フレームワークであるOneBarを提案する。
OneBarは,(1)マルチモーダルなビデオ理解と行動由来の協調的アンカーを融合した協調的マルチモーダルな意図的接地モジュール,(2)効率的なオンラインサービスを実現するための即時圧縮機構を備えた統一エンドツーエンドアーキテクチャ,(3)階層的な行動嗜好を生成方針に内包し,個別に訓練された報酬モデルの必要性を排除した,効率的な嗜好内在化のためのプログレッシブな選好学習戦略,の3つの革新を特徴としている。
オンラインベースと比較して、OneBarはクエリエクスポージャーを16.91 %、クエリクリックを18.68 %増加させ、クエリCTRは0.19 %上昇を維持している。
さらに検索トラフィックが20.36\%増加し、21.67\%上昇した。
関連論文リスト
- Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language [60.91064560080974]
本稿では,クエリ関連クリップをトリムするスポットVMRを提案する。
提案するSpotVMRは,最新のVMR手法の効率性を実現するプラグイン・アンド・プレイモジュールとして機能する。
論文 参考訳(メタデータ) (2026-05-28T11:42:28Z) - ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance [56.15563109738998]
ForeSeaは3段階のプラグアンドプレイパイプラインを備えたAI法医学検索システムである。
ForeSeaは従来のビデオRAGモデルよりも精度を3.5%向上し、一時IoUは11.0向上した。
論文 参考訳(メタデータ) (2026-03-24T07:15:28Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search [43.94443394870866]
OneSearchは、eコマース検索のための最初の産業向けエンドツーエンド生成フレームワークである。
OneSearchは運用費を75.40%削減し、Model FLOPsの利用を3.26%から27.32%に改善した。
このシステムはKuaishouの複数の検索シナリオにまたがって展開され、数百万のユーザーにサービスを提供している。
論文 参考訳(メタデータ) (2025-09-03T11:50:04Z) - Beyond Simple Edits: Composed Video Retrieval with Dense Modifications [96.46069692338645]
多様なビデオセグメントにまたがる細粒度および構成されたアクションをキャプチャする新しいデータセットを提案する。
Dense-WebVid-CoVRは、1.6万のサンプルからできており、修正テキストは既存のものより約7倍多い。
我々は,Cross-Attention (CA) 融合により視覚情報とテキスト情報を統合した新しいモデルを開発した。
論文 参考訳(メタデータ) (2025-08-19T17:59:39Z) - A Flexible and Scalable Framework for Video Moment Search [51.47907684209207]
本稿では,テキストクエリにマッチする任意の長さの動画のコレクションからランク付けされたモーメントのリストを取得するためのフレキシブルなフレームワークを提案する。
SPR(Segment-Proposal-Ranking)と呼ばれる我々のフレームワークは,探索プロセスを,セグメント検索,提案生成,モーメント改善という3つの独立した段階に単純化する。
TVR-Rankingデータセットの評価から,我々のフレームワークは,計算コストと処理時間を大幅に削減して最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2025-01-09T08:54:19Z) - Sync from the Sea: Retrieving Alignable Videos from Large-Scale Datasets [62.280729345770936]
AVR(Alignable Video Retrieval)の課題について紹介する。
クェリビデオが与えられた場合、我々は大量のクリップから良質な映像を識別し、時間的にクェリに同期させることができる。
大規模なKineetics700を含む3つのデータセットに関する実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2024-09-02T20:00:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。