論文の概要: VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.24302v2
- Date: Thu, 03 Sep 2026 14:07:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.02363
- Title: VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- Title(参考訳): VideoHarness-RSI:凍結視覚言語モデルによる長時間ビデオ理解のための再帰的ハーネス自己改善
- Abstract要約: VideoHarness-RSIは、凍結したVLM周辺の実行可能なコンテキストコンストラクタを検索するフレームワークである。
我々はこの基準を相補的な弱化・強化体制下で研究する。
- 参考スコア(独自算出の注目度): 6.066300575103223
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-video understanding depends not only on the capability of a vision-language model (VLM), but also on how its limited context is constructed from a much longer video. Existing systems typically introduce hand-designed sampling, retrieval, memory, or agentic control strategies, making the context-construction program itself difficult to study as an independent optimization target. We introduce VideoHarness-RSI, a controlled framework that recursively searches executable context constructors around a frozen VLM while keeping the answering model and interface fixed. We study this baseline under complementary weak- and strong-initialization regimes. From a weak uniform constructor, recursive search progressively discovers more structured context-construction programs; from a stronger AKS harness, the same process further advances an already competitive hand-crafted frontier. The resulting harness retains its advantage under a matched cumulative visual-token control and transfers directly to additional long-video benchmarks without further search. Together, these results establish executable context construction as a distinct optimization layer and provide an auditable baseline for studying harness discovery, transfer, and efficiency around frozen VLMs.
- Abstract(参考訳): ロングビデオ理解は、視覚言語モデル(VLM)の能力だけでなく、より長いビデオからその限られたコンテキストがどのように構築されるかにも依存する。
既存のシステムは手書きのサンプリング、検索、メモリ、エージェント制御戦略を導入し、コンテキスト構築プログラム自体を独立した最適化ターゲットとして研究することを困難にしている。
我々は,凍結したVLMの周囲の実行可能なコンテキストコンストラクタを再帰的に検索し,応答モデルとインタフェースを固定した制御フレームワークであるVideoHarness-RSIを紹介する。
我々はこの基準を相補的な弱化・強化体制下で研究する。
弱い均一なコンストラクタから再帰探索により、より構造化されたコンテクスト構成プログラムが徐々に発見される。
結果として得られたハーネスは、一致した累積的な視覚的トーケン制御の下でその優位性を維持し、さらに検索することなく、追加の長ビデオベンチマークに直接転送する。
これらの結果は、異なる最適化層として実行可能なコンテキスト構築を確立し、凍結したVLMの周囲の発見、移動、効率を研究するための監査可能なベースラインを提供する。
関連論文リスト
- Harness-G: A Graph-Structured Harness for Search Agents [17.554676400013424]
強化学習(RL)検索エージェントは、検索を自由形式の自然言語クエリ生成としてモデル化する。
本稿では,このインタフェースを再設計するグラフ構造化検索フレームワークであるHarness-Gを提案する。
フリーフォームクエリ生成を有限アクション選択として再構成し、環境はメニューを構築し、検索状態を追跡し、それぞれの選択を検証、実行します。
両方の評価されたモデルスケールでF1の平均値が最も高く、最強のベースラインであるGraph-R1を1.5Bで10.74点、3Bで3.98点で上回っている。
論文 参考訳(メタデータ) (2026-07-30T04:05:05Z) - InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning [61.87294123934038]
ビデオタスクにおけるマルチモーダル理解を強化するフレームワークであるInternVideo3を提案する。
MCRは理解を、共有、進化するコンテキスト上でのクローズドループプロセスとして扱う。
InternVideo3は、Video-MME、MLVU、Egoなどのベンチマークで強力なパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2026-06-10T15:17:08Z) - STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models [81.32710031596591]
ビデオ推論タスクには、動きの追跡、時間順、フレーム全体の視覚状態の進化が必要である。
視覚言語モデル(LVLM)上に構築された既存の手法はしばしば、チェーン・オブ・ソート(CoT)を通じて推論を外部化することでこの問題に対処する。
STORMSは,LVLMに明示的なテキストCoTではなく,有界な連続的な潜在軌道を推論する2段階のフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T16:33:00Z) - STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering [28.670443420523796]
STRIVEは質問応答のための構造化強化学習フレームワークである。
報酬シグナルを豊かにし、より安定的で情報的なポリシー更新を促進する。
時間的カバレッジを維持しながら、入力問題に最も関連するフレームを優先順位付けする。
論文 参考訳(メタデータ) (2026-04-02T09:35:27Z) - Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding [21.306038832082553]
MLLM(Multimodal Large Language Models)は,ビデオ質問応答において高い性能を示した。
ロングフォームビデオへのそれらの応用は、コンテキスト長と計算コストの制限によって制限される。
本稿では,情報理論に基づくエビデンス駆動サンプリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-01T15:02:50Z) - Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining [66.89012795621349]
大規模言語モデル(LLM)は、複雑なソフトウェア工学に必要な、深く、長期にわたる推論に苦しむことが多い。
本稿では,再構築による理解という,新しいパラダイムを提案する。
マルチエージェントシミュレーションを用いて潜在エージェント軌道を合成するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T09:23:20Z) - VIPER: Process-aware Evaluation for Generative Video Reasoning [64.86465792516658]
我々は、時間的、構造的、象徴的、空間的、物理的、計画的推論にまたがる16のタスクにまたがる包括的なベンチマークVIPERを紹介する。
実験の結果,現状の映像モデルでは約20%のPOC@1.0しか達成できず,良好な結果が得られた。
論文 参考訳(メタデータ) (2025-12-31T16:31:59Z) - Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models [78.32948112203228]
ビデオ理解はコンピュータビジョンにおける最も困難なフロンティアである。
近年,映像理解タスクにおいて,映像多時間モデルが顕著に出現している。
Surveyは、ビデオ-LMM能力を向上するための統一的なフレームワークを研究者や実践者に提供することを目的としている。
論文 参考訳(メタデータ) (2025-10-06T17:10:44Z) - CAViAR: Critic-Augmented Video Agentic Reasoning [90.48729440775223]
より複雑なビデオ推論を行うために、知覚能力を利用することができますか?
我々は,ビデオモジュールをサブエージェントやツールとして利用できる大規模言語モデルエージェントを開発した。
我々は,我々のエージェントと批評家の組み合わせが,データセット上で高い性能を達成することを示す。
論文 参考訳(メタデータ) (2025-09-09T17:59:39Z) - Test-time Corpus Feedback: From Retrieval to RAG [21.517949407443453]
Retrieval-Augmented Generation (RAG) は知識集約型NLPタスクの標準フレームワークとして登場した。
ほとんどのRAGパイプラインは、検索と推論を独立したコンポーネントとして扱い、ドキュメントを一度取り出し、さらに相互作用することなく回答を生成する。
情報検索(IR)とNLPのコミュニティにおける最近の研究は、フィードバックを取り入れた適応的検索とランキング手法を導入して、このギャップを埋め始めている。
論文 参考訳(メタデータ) (2025-08-21T10:57:38Z) - AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding [73.60257070465377]
AdaVideoRAGは、軽量なインテント分類器を使用して、クエリ複雑性に基づいた検索に適応する新しいフレームワークである。
我々のフレームワークは、Omni-Knowledge Indexingモジュールを使用して、テキスト(キャプション、ASR、OCR)、視覚的特徴、セマンティックグラフから階層データベースを構築する。
実験では、既存のMLLMにシームレスに統合することで、長時間ビデオ理解のための効率と精度の向上が示されている。
論文 参考訳(メタデータ) (2025-06-16T15:18:15Z) - Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency [56.475612147721264]
本稿では、離散的かつ連続的な報酬信号を通して意味的推論と時間的推論の両方を監督する二重回帰定式化を提案する。
我々は,ビデオQA,テンポラルビデオグラウンディング,グラウンドドビデオQAを含む8つの代表的なビデオ理解タスクに対するアプローチを評価した。
その結果、MLLMを用いた推論中心のビデオ理解の進展において、報酬設計とデータ選択の重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-06-02T17:28:26Z) - ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning [68.76048244253582]
ビデオ理解におけるフレーム選択の最適化にルールベース強化学習(RL)を利用する最初のフレームワークであるViaRLを紹介する。
ViaRLは、下流モデルの応答精度を報奨信号として利用し、試行錯誤によってフレームセレクタを訓練する。
ViaRLは、多様なビデオ理解タスクに対して、時間的基盤性能と堅牢な一般化を一貫して提供します。
論文 参考訳(メタデータ) (2025-05-21T12:29:40Z) - ELITE: Embedding-Less retrieval with Iterative Text Exploration [5.8851517822935335]
大規模言語モデル(LLM)は自然言語処理において顕著な進歩を遂げた。
長期のコンテキスト制約を維持する能力は、ドキュメントレベルやマルチターンタスクのパフォーマンスを制限します。
論文 参考訳(メタデータ) (2025-05-17T08:48:43Z) - Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies [69.28082193942991]
本稿では、これまで見過ごされていた2つの重要なビデオ推論スキルを探索するためのテストベッドとして設計された、新しいデータセットであるTropes in Movies (TiM)を紹介する。
映画ストーリーテリングのトポロジを利用して、TiMは最先端のLCMベースのアプローチの推論能力を評価する。
これらの欠陥に対処するために、FEVoRI(Face-Enhanced Viper of Role Interactions)とConQueR(Context Query Reduction)を提案する。
論文 参考訳(メタデータ) (2024-06-16T12:58:31Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。