論文の概要: TasteRoute: Personalized Routing for Video Generation
- arxiv url: http://arxiv.org/abs/2610.05896v1
- Date: Mon, 05 Oct 2026 07:12:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 03:28:27.159513
- Title: TasteRoute: Personalized Routing for Video Generation
- Title(参考訳): TasteRoute:ビデオ生成のためのパーソナライズされたルーティング
- Abstract要約: 本稿では、入力要求、ユーザの好み、利用可能な生成予算に基づいて、共同でジェネレータを選択する、パーソナライズされたビデオ生成ルータであるTasteRouteを紹介する。
TasteRouteはテキスト・ツー・ビデオと画像・ツー・ビデオのセッティング全体を通じて、平均生成コストを削減しつつ、好みのルーティングに強力なシンプルなベースラインと競合する。
TasteRoute-3kは、マルチモデルビデオ比較、品質判断、選好ランク付け、ユーザ注目の信号を含む、人間による注釈付きデータセットである。
- 参考スコア(独自算出の注目度): 23.9008848329821
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rapid progress in video generation has led to a plethora of models that differ substantially in capability and generation cost. This raises a natural question: can each request be efficiently routed to an appropriate model? We find that even when the consensus of the other annotators is used as an oracle, it agrees with each annotator's own favorite only 34-55% of the time. Motivated by this observation, we introduce TasteRoute, a personalized video-generation router that selects a generator jointly based on the input request, user preferences, and available generation budget. Across text-to-video and image-to-video settings, TasteRoute is competitive with strong simple baselines on preference routing while reducing average generation cost. The cost saving increases under higher budget caps. Finally, we release TasteRoute-3k, a human-annotated dataset containing multi-model video comparisons, quality judgments, preference rankings, and user-profile signals to facilitate future research on personalized and cost-aware video routing.
- Abstract(参考訳): ビデオ生成の急速な進歩は、能力と生成コストに大きく異なる多くのモデルを生み出している。
それぞれのリクエストは、効率的に適切なモデルにルーティングできますか?
他のアノテータのコンセンサスを託宣として使用しても、それぞれのアノテータのお気に入りである34-55%の時間で一致していることがわかった。
そこで本研究では,入力要求,ユーザ嗜好,利用可能な生成予算に基づいて,共同でジェネレータを選択するビデオ生成ルータであるTasteRouteを紹介する。
TasteRouteはテキスト・ツー・ビデオと画像・ツー・ビデオのセッティング全体を通じて、平均生成コストを削減しつつ、好みのルーティングに強力なシンプルなベースラインと競合する。
コスト削減は、より高い予算上限の下で増加する。
最後に,マルチモデルビデオ比較,品質判断,選好ランク,ユーザ注目信号を含む人手による注釈付きデータセットであるTasteRoute-3kをリリースし,パーソナライズとコストを意識したビデオルーティングの今後の研究を促進する。
関連論文リスト
- Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing [41.81696128826457]
大規模言語モデル(LLM)は、応答品質を維持しながら、各クエリを適切なモデルに割り当てることで、サービスコストを削減する。
しかし、そのようなルータを学習するには、クエリーの品質フィードバックを集めるために、過去のクエリーで複数の候補モデルを実行する必要があることが多い。
情報的モデルフィードバックを選択的に取得し,関連するクエリ間で機能情報を共有する,スパーススーパービジョンルーティングフレームワークであるSaveを提案する。
論文 参考訳(メタデータ) (2026-09-29T12:42:02Z) - Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models [51.616920646492524]
本稿では,ベンチマーク設計,データ構築,報酬モデルトレーニングを対象とする統一フレームワークを提案する。
VURB(Video Understanding Reward Bench)は、2,100対の選好ペアと長い連鎖推論トレース(1,143トークン)と、一般的な、長い、推論指向のビデオタスクにおける多数投票評価を特徴とするベンチマークである。
我々は、VURBとVideoRewardBenchの最先端性能を達成するために、差別的かつ生成的な報酬モデルであるVideoDRMとVideoGRMを訓練する。
論文 参考訳(メタデータ) (2026-05-08T15:29:11Z) - VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding [21.436338677020178]
ビデオは、過度に長い視覚的トーケンシーケンスを生成し、推論中にメモリと遅延を急激に増加させる。
本稿では,InternVL上に構築されたクエリ適応型デュアルルータフレームワークであるVideoについて述べる。
我々は、ビデオがInternVLベースラインを同等または低い予算で継続的に改善し、67.9%のトークン削減を達成することを示した。
論文 参考訳(メタデータ) (2026-05-07T08:23:27Z) - Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization [10.831044672402177]
既存のルーティング攻撃は、ホワイトボックスアクセスまたはプロンプトに依存するため、現実のブラックボックスシナリオでは効果がない。
逆接接尾辞最適化による高価なモデルにブラックボックスLLMルータを誤誘導することを目的としたR$2$Aを提案する。
複数のオープンソースおよび商用ルーティングシステムの実験により、R$2$Aは、異なる分散のクエリにおける高価なモデルへのルーティング率を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-04-16T13:51:48Z) - EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation [80.13014959623452]
EVATokは、$textbfE$fficient $textbfV$ideo $textbfA$daptive $textbfTok$enizersを生成するフレームワークである。
EVATok は UCF-101 上でより優れた再構成と最先端のクラス・ビデオ生成を実現する。
論文 参考訳(メタデータ) (2026-03-12T17:59:59Z) - When Routing Collapses: On the Degenerate Convergence of LLM Routers [46.01380774114097]
ユーザのコスト予算が増加するにつれて、ルータは体系的に最も有能で最も高価なモデルにデフォルトとなる。
モデルランキングを直接学習する決定対応ルータであるEquiを提案する。
RouterBenchでは、最強の先行ルータと比較して、GPT-4レベルのパフォーマンスでコストを約17%削減する。
論文 参考訳(メタデータ) (2026-02-03T12:51:55Z) - Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback [87.37721254914476]
我々はHyPERを紹介した。HyPERは、人間または言語モデル(LM)にアノテーションを付与するハイブリッド推論ルータである。
その結果,HyPERを用いた人工選好と直接選好の混合は,RewardBenchでは7-13%しか使用せず,RM性能が向上していることがわかった。
また、HyPERの機能を分析した結果、安全上の懸念や複雑さが人間のフィードバックから最も恩恵を受けていることがわかりました。
論文 参考訳(メタデータ) (2024-10-24T20:04:15Z) - Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video
Synthesis [69.83405335645305]
映像生成領域に画像モデルの進化をもたらすことによって、動きの忠実度、視覚的品質、スケーラビリティを損なうことが議論されている。
この作業では、これらの課題に体系的に対処するビデオファーストモデルであるSnap Videoを構築します。
画像生成の背後にあるワークホースであるU-Netは、ビデオ生成時に低スケールであり、計算オーバーヘッドがかなり必要であることを示す。
これにより、初めて数十億のパラメータを持つテキスト・ビデオモデルを効率的にトレーニングし、多数のベンチマークで最先端の結果に到達し、はるかに高い品質、時間的一貫性、動きの複雑さの動画を生成することができる。
論文 参考訳(メタデータ) (2024-02-22T18:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。