論文の概要: The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge
- arxiv url: http://arxiv.org/abs/2606.00829v1
- Date: Sat, 30 May 2026 17:55:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.871051
- Title: The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge
- Title(参考訳): 正しい推論戦略は、EgoCrossチャレンジのためのほとんど訓練なしのドメインウィズ推論
- Abstract要約: EgoCrossは、エゴセントリックなビデオ質問応答に基づくマルチモーダルな大規模言語モデルを評価する。
テストビデオは、通常の日常シーンではなく、手術、産業組み立て、エクストリームスポーツ、動物搭載カメラから来ている。
我々は4つの対象ドメインを別々に扱い、異なる入力、プロンプト、および応答マッピング手順を設計するドメインワイズ推論戦略を使用する。
- 参考スコア(独自算出の注目度): 45.78144290876062
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: EgoCross evaluates multimodal large language models on egocentric video question answering under substantial domain shift, where test videos come from surgery, industrial assembly, extreme sports, and animal-mounted cameras rather than ordinary daily-life scenes. In the source-limited track, the base model is fixed to Qwen3-VL-4B, while the official task-specific support set contains only 20 training samples. This setting makes the challenge less about model scaling and more about exposing the right visual, temporal, and answer-selection cues to a constrained model. Our key observation is that the frozen baseline model is not simply incapable of these rare scenarios; rather, it often fails to transfer its existing visual-language knowledge to the new task format without an appropriate interface. We therefore use a domain-wise inference strategy that treats the four target domains separately and designs different input, prompting, and answer-mapping procedures according to each domain's task characteristics. These strategies make the rare egocentric scenes more interpretable to the VLM by emphasizing the cues that matter for each domain. The resulting system is nearly training-free: surgery, and animal questions are answered with the base Qwen3-VL-4B model, while XSports and industry use only the official SFT checkpoint trained for two epochs on the provided 20 training samples. On the final evaluation, this simple strategy reaches 66.98\% overall accuracy, suggesting that careful domain-aware inference can compensate for limited base-model strength and recover much of the ability already present in the baseline model.
- Abstract(参考訳): EgoCrossは、エゴセントリックなビデオ質問に対するマルチモーダルな大きな言語モデルの評価を行い、テストビデオは日常のシーンではなく、手術、工業的組み立て、極端なスポーツ、動物を乗せたカメラから来ている。
ソース限定トラックでは、ベースモデルはQwen3-VL-4Bに固定され、公式のタスク固有のサポートセットには20のトレーニングサンプルしか含まれていない。
この設定は、モデルのスケーリングよりも、正しい視覚的、時間的、そして回答選択のキューを制約されたモデルに公開することの方が課題になります。
我々のキーとなる観察は、凍結されたベースラインモデルは、単にこれらの稀なシナリオでは不可能であるのではなく、しばしば、その既存の視覚言語知識を適切なインターフェースなしで新しいタスク形式に転送する。
そこで我々は、4つの対象ドメインを個別に扱うドメインワイズ推論戦略を用い、各ドメインのタスク特性に応じて異なる入力、プロンプト、および応答マッピング手順を設計する。
これらの戦略は、各領域にとって重要な手がかりを強調することで、希少な自我中心のシーンをよりVLMに解釈可能にする。
手術と動物に関する質問はQwen3-VL-4Bベースモデルで回答される一方、XSportsと業界は、提供された20のトレーニングサンプルで2つのエポックでトレーニングされた公式のSFTチェックポイントのみを使用する。
最終評価では、この単純な戦略は全体の精度66.98\%に達し、注意深いドメイン認識推論は、ベースラインモデルにすでに存在する能力の多くを補うことができることを示唆している。
関連論文リスト
- Restrict, Don't Retrain: Inference-Time VLM Guidance for Zero-Shot Aerial Segmentation [0.8921166277011344]
視覚言語モデル(VLM)を実行する1つのコンシューマグレードのGPUを使用して、不足するガイダンスを提供する。
本研究は,4つの航空データセットを対象とし,基本モデルが有能な各段階において一貫した利得を示す。
論文 参考訳(メタデータ) (2026-09-01T03:07:38Z) - SpatialBench: Is Your Spatial Foundation Model an All-Round Player? [92.031716744172]
空間ベンチ(SpatialBench)は、決定論的サンプリングを伴う空間基盤モデルのための、クロスパラダイムなドメインディバースベンチマークである。
6つのパラダイムにまたがる41のモデルを4つの異なる入力密度設定の下で5つのタスクスイートで包括的に評価する。
厳密なドメインアライメントと高いデータ品質が、単純なデータセットスケーリングよりもパフォーマンスに極めて重要であることを示す。
論文 参考訳(メタデータ) (2026-05-26T17:59:20Z) - Human-in-Context: Unified Cross-Domain 3D Human Motion Modeling via In-Context Learning [64.30639042094548]
単一プロセスを通じて統合ドメインモデルをトレーニングするための新しい設定を提案する。
最初にPose-in-Context(PiC)を紹介した。これはコンテキスト内学習を活用して、ポーズ中心のクロスドメインモデルを作成する。
そこで我々は、モーダル性、タスク、データセットの一般化を拡大するPiCの拡張であるHuman-in-Context(HiC)を提案する。
論文 参考訳(メタデータ) (2025-08-14T17:59:23Z) - EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering [59.94048858464922]
EgoCrossは、EgocentricQAにおけるMLLMのクロスドメイン一般化を評価するためのベンチマークである。
EgoCrossは、手術、産業、極端なスポーツ、動物の観点からの4つの分野をカバーしている。
798のビデオクリップにまたがる約1000のQAペアで構成され、予測、認識、ローカライゼーション、カウントという4つの重要なQAタスクにまたがる。
論文 参考訳(メタデータ) (2025-08-14T15:11:20Z) - Tuning Vision Foundation Model via Test-Time Prompt-Guided Training for VFSS Segmentations [1.8142185304787555]
本稿では,全アノテーションを必要とせず,下流データセット上での基礎モデルの性能を向上させる新しいテストタイムトレーニングパラダイムを提案する。
具体的には、テスト時間半自己指導型トレーニングタスクを誘導するために、簡単なポイントプロンプトを用いる。
このアプローチは、アノテーションの取得が時間集約的かつ高価である医療画像分野の課題に、直接取り組む。
論文 参考訳(メタデータ) (2025-01-30T16:48:02Z) - Test-Time Alignment via Hypothesis Reweighting [56.71167047381817]
大規模な事前訓練されたモデルは、しばしば未指定のタスクで苦労する。
テストタイムのユーザ意図にモデルを整合させるという課題に対処する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-11T23:02:26Z) - Technical Report for ICCV 2023 Visual Continual Learning Challenge:
Continuous Test-time Adaptation for Semantic Segmentation [18.299549256484887]
この課題の目標は、セマンティックセグメンテーションタスクのためのビデオシーケンスのドメインを徐々に変更するようにモデルを適応させるテスト時間適応(TTA)手法を開発することである。
TTA法は、各画像シーケンス(ビデオ)で別々に評価され、つまり、次のシーケンスの前に、モデルがソースモデル状態にリセットされる。
提案されたソリューションは、チャレンジで3位を獲得し、イノベーションアワードを受賞した。
論文 参考訳(メタデータ) (2023-10-20T14:20:21Z) - CharacterGAN: Few-Shot Keypoint Character Animation and Reposing [64.19520387536741]
本稿では,与えられた文字の少数のサンプルに対してのみトレーニング可能な生成モデルである characterGAN を紹介する。
我々のモデルはキーポイント位置に基づいて新しいポーズを生成し、インタラクティブなフィードバックを提供しながらリアルタイムで修正することができる。
提案手法は,近年のベースラインよりも優れており,多様なキャラクタに対してリアルなアニメーションを生成する。
論文 参考訳(メタデータ) (2021-02-05T12:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。