論文の概要: OSEF: One-Step Evidence Fusion for Cross-Video Scene Procedure Planning
- arxiv url: http://arxiv.org/abs/2607.29401v1
- Date: Fri, 31 Jul 2026 13:21:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.753336
- Title: OSEF: One-Step Evidence Fusion for Cross-Video Scene Procedure Planning
- Title(参考訳): OSEF:ワンステップ・エビデンス・フュージョンによるクロスビデオ・シーン・プロシージャ・プランニング
- Authors: Zhentong Ye, Lei Zhang, Sijia Zhou, Yingda Yu, Yuehan Shi, Jiaqi Xuan, Shuaiwu Dong, Guanchao Tong, Meimei Zhang, Bin Li,
- Abstract要約: ビデオ・シーン・プロシージャ・プランニングは、事前に目標とする初期観測を提供する。
モデルはサポートビデオを取得し、関連するウィンドウをローカライズし、アクションシーケンスを予測する必要がある。
ワンステップエビデンス・フュージョンは、ベンチマークがメソッドランク可能と認定している6つのセルのうち、最初にランク付けする。
- 参考スコア(独自算出の注目度): 7.053645713585685
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video Scene Procedure Planning (VSPP) supplies the target start-goal observations in advance, leaving open how a planner should act when the evidence must itself be retrieved. We introduce Cross-Video Scene Procedure Planning (CVSPP): given an answer-redacted start-goal query and K candidate videos, a model must retrieve the supporting video, localize the relevant window, and predict the action sequence. Two obstacles couple here. Same-task demonstrations share stages and windows, and an early hard selection passes the wrong scene chain to the planner. We build an eleven-source benchmark with typed negative roles, a fail-closed answer-leakage gate, and separate Evidence- and Plan-axis metrics. On its 14 source-horizon cells we adapt nine planner families against a majority-sequence floor. We then present One-Step Evidence Fusion (OSEF), which scores a query-conditioned cell-and-span lattice over all candidates and feeds the full soft lattice to the planner through a token-global adapter, cropping no window beforehand. OSEF ranks first on all six cells the benchmark certifies as method-rankable. On four matched same-task COIN and CrossTask cells it improves exact-video-and-plan success by 2.9-10.7 points over an enhanced hard-selection SOTA, and a component study assigns the largest single increment to the token-global interface. Five converted-source cells sit at or near the majority-sequence floor, the benchmark's remaining headroom. The supplementary package includes model constructors and evaluation code.
- Abstract(参考訳): ビデオ・シーン・プロシージャ・プランニング(VSPP)は、事前に目標とする開始目標の観察を提供し、証拠そのものを回収しなければならないときにプランナーがどのように振る舞うべきかをオープンにしておく。
そこで我々は,CVSPP (Cross-Video Scene Procedure Planning) を導入し,質問応答とK候補ビデオが与えられた場合,支援ビデオの検索,関連するウィンドウのローカライズ,アクションシーケンスの予測を行う。
ここで2つの障害物が衝突します。
同じタスクのデモはステージとウィンドウを共有し、初期のハードセレクションは間違ったシーンチェーンをプランナーに渡します。
負の型付きロールと、フェールクロースされた応答リードゲートと、エビデンスとプラン軸のメトリクスを分離した11ソースのベンチマークを構築します。
14個のソース・ホライゾン細胞で、我々は9つのプランナーファミリーを多数配列のフロアに適応させる。
提案するOne-Step Evidence Fusion (OSEF) は,全ての候補に対して問合せ条件付きセル・アンド・スパン格子をスコアし,トークン・グロバルアダプタを通じて完全なソフト格子をプランナーに供給し,事前に窓を刈り取る。
OSEFは、ベンチマークがメソッドランク可能な6つのセルで最初にランク付けする。
一致する4つの同一タスクのCOINとCrossTaskセルでは、ハードセレクションのSOTAよりも2.9-10.7ポイント精度が向上し、コンポーネントスタディではトークン・グローバルインターフェースに最大のシングルインクリメントを割り当てている。
5つの変換されたソースセルが、ベンチマークの残りのヘッドルームである多数列フロアの近くに位置する。
補足パッケージは、モデルコンストラクタと評価コードを含む。
関連論文リスト
- RECIPE: Procedural Planning via Grounding in Instructional Video [30.96089823924218]
本稿では,RECIPEがノイズの多いビデオコーパスからクリーンなステップラベルを抽出する方法を示す。
RECIPEはGRPOの報酬としてグラウンド品質を使用し、ノイズの多いコーパスをラベルソースではなく検証器に変換する。
基準ベースLCM-as-judgeプロトコルを用いて,6つの手続き基準にまたがる計画を評価する。
論文 参考訳(メタデータ) (2026-05-19T15:20:39Z) - What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs [33.91859613266694]
VLM(Vision-Language Models)におけるGUIグラウンディング中に何が起こるかを調べ、これまで見過ごされていたボトルネックを特定する。
プリフィルステージは候補UI要素を決定するが、デコードステージは最終的な座標を洗練させる。
Re-Prefillは、注意誘導された第2のプリフィルステージを導入して、ターゲット選択を洗練させることによって推論を再考する、トレーニング不要な手法である。
論文 参考訳(メタデータ) (2026-05-10T07:04:07Z) - CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates [35.64639873984766]
本稿では,初期状態と目標状態の間の中間的推論ステップを導入したSGI(Scene Graph Incremental Update)を提案する。
シーケンシャルプランニングにおける信頼性の向上に加えて、SGIはPlan-BenchやVQAといった従来のプランニングタスクに一般化している。
論文 参考訳(メタデータ) (2025-12-11T06:46:51Z) - GTA1: GUI Test-time Scaling Agent [97.58177633084915]
グラフィカルユーザインタフェース(GUI)は、ユーザ命令をアクションプロポーザルに順次分解することで、プラットフォーム(例えばLinux)間で自律的にタスクを完了させる。
本稿では,前述の textbfGUI textbfTest-time Scaling textbfAgent,すなわち GTA1 の課題について検討する。
論文 参考訳(メタデータ) (2025-07-08T08:52:18Z) - Skip-Plan: Procedure Planning in Instructional Videos via Condensed
Action Space Learning [85.84504287685884]
Skip-Plan(スキップ・プラン)は、訓練ビデオにおけるプロシージャ計画のための凝縮された行動空間学習法である。
アクションチェーン内の不確実なノードやエッジをスキップすることで、長いシーケンス関数と複雑なシーケンス関数を短いが信頼できるものに転送する。
我々のモデルは、凝縮された作用空間内のアクションシーケンス内で、あらゆる種類の信頼できる部分関係を探索する。
論文 参考訳(メタデータ) (2023-10-01T08:02:33Z) - Non-Sequential Graph Script Induction via Multimedia Grounding [129.83134296316493]
我々は、学習タスクのための明示的なグラフスクリプトを生成することと、部分的なステップシーケンスが与えられた将来のステップを予測することの両方が可能なスクリプト知識モデルを訓練する。
人間による評価では、我々のモデルはWikiHowの線形ベースラインを48.76%上回り、シーケンシャルなステップ関係と非シーケンシャルなステップ関係を捉えた。
論文 参考訳(メタデータ) (2023-05-27T18:13:17Z) - Pretrained Language Models as Visual Planners for Human Assistance [12.8775186900555]
Visual Planning for Assistance (VPA)は、ユーザが複雑な多段階目標を達成するためのツールである。
VPAをビデオアクションセグメンテーションと予測に分解する。
この新しいアプローチは、Visual Language Model Based Planner (VLaMP)と呼ばれ、一連のメトリクスでベースラインを上回ります。
論文 参考訳(メタデータ) (2023-04-17T18:07:36Z) - Video Instance Segmentation with a Propose-Reduce Paradigm [68.59137660342326]
ビデオインスタンスセグメンテーション(VIS)は、ビデオ内の各フレームごとに定義されたクラスのすべてのインスタンスをセグメンテーションし、関連付けることを目的とする。
先行メソッドは通常、フレームまたはクリップのセグメンテーションを最初に取得し、追跡またはマッチングによって不完全な結果をマージします。
新しいパラダイムであるPropose-Reduceを提案し、入力ビデオの完全なシーケンスを1ステップで生成します。
論文 参考訳(メタデータ) (2021-03-25T10:58:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。