論文の概要: EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning
- arxiv url: http://arxiv.org/abs/2609.08938v2
- Date: Wed, 09 Sep 2026 04:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.688389
- Title: EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning
- Title(参考訳): EgoSIS:UAV推論における視覚的エゴ遷移の要因から運動カノニカルな空間的エビデンスへ
- Abstract要約: EgoSISは、RGB由来の双方向の流れをモーションカノニカルな視覚的証拠に変換する、ポーズのないアダプタである。
SIS-Benchでは、EgoSIS-8Bは89.9%の知覚、82.5%の知覚+メモリ、76.2%の全体的な精度を得る。
- 参考スコア(独自算出の注目度): 4.410395389325955
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: UAV video question answering requires separating camera motion from changes in the scene, but RGB-only multimodal models receive no explicit, stable reference for that separation. We present EgoSIS, a pose-free adapter that converts RGB-derived bidirectional flow into motion-canonical visual evidence in three stages. Factorized Visual Ego-Transitions (FVET) fits a robust image-plane transition and exposes motion, residual-support, and reliability factors. Reliability-Gated Ego-Transition Memory (ReTEM) uses reliability-weighted updates for a bounded history and re-anchors it at cuts or sustained uncertainty. Ego-Aligned Spatial Evidence (EASE) warps supported visual features into each segment's local anchor and injects four spatial evidence tokens per visual slice through zero-initialized residuals, without changing Qwen's visual-token count. On SIS-Bench, EgoSIS-8B obtains 89.9\% perception, 82.5\% perception-plus-memory, and 76.2\% overall accuracy, with the largest gains concentrated in self-awareness perception and memory. The adapter thus provides an interpretable interface between optical flow and spatial reasoning.
- Abstract(参考訳): UAVビデオ質問応答では、シーンの変化からカメラの動きを分離する必要があるが、RGBのみのマルチモーダルモデルは、その分離に対して明示的で安定した参照を受け取らない。
本稿では,RGB由来の双方向流れを3段階の運動カノニカルな視覚的エビデンスに変換する,ポーズフリーアダプターであるEgoSISを紹介する。
Factorized Visual Ego-Transitions (FVET) は、堅牢な画像プレーン遷移に適合し、動き、残留サポート、信頼性因子を露呈する。
Reliability-Gated Ego-Transition Memory (ReTEM)は、バウンド履歴に対する信頼性の高い更新を使用して、カットや持続的不確実性で再アンカリングする。
Ego-Aligned Space Evidence (EASE)ワープは、各セグメントの局所アンカーに視覚的特徴をサポートし、Qwenの視覚的トーケン数を変更することなく、ゼロ初期化残差を通して視覚的スライス毎に4つの空間的エビデンストークンを注入する。
SIS-Benchでは、EgoSIS-8Bは89.9\%の知覚、82.5\%の知覚+メモリ、76.2\%の全体的な精度を得る。
このアダプタは、光フローと空間推論の間の解釈可能なインターフェースを提供する。
関連論文リスト
- sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel Loader [0.0]
自動車輪ローダ制御のためのビジョン・ランゲージ・アクションアーキテクチャであるSensVLAを提案する。
Qwen3-2B Vision-Language Model (VLM)と、フローマッチング速度の回帰によって訓練された完全に訓練可能なトランスフォーマーアクションエキスパートを組み合わせる。
SensVLAはBird's-Eye-View(BEV)機能を、融解した前方と後方のライダーから抽出し、専用のクロスアテンションパスを通じてアクションエキスパートに直接ルーティングする。
論文 参考訳(メタデータ) (2026-09-15T11:29:50Z) - RASA: Disentangled Spatial-Motional Priors for Cross-Identity Character Animation [85.41886214825894]
クロスアイデンティティキャラクタアニメーションは、基準画像からターゲットアイデンティティを駆動し、駆動ビデオからソースキャラクタの動きに従うことを目的としている。
本稿では,移動制御から空間マッピングを分離するフレームワークであるReference-Aware Structure Alignment (RASA)を紹介する。
我々の研究は、不整合空間と動きの先行がロバストなキャラクターアニメーションの鍵となることを示す新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2026-08-28T11:36:44Z) - VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models [30.792102059830274]
Video-Adaptive Debiasing via Evidence Reweighting (VADER)は、2つの補完モジュールを持つトレーニング不要のフレームワークである。
Visual Focus Reallocation (VFR)は、ビデオ検索の各入力に対する介入ポリシーを自動的にインスタンス化する。
SEE(Selective Evidence Erasure)は、フレーム毎に高重要性の視覚トークンを隠蔽する。
論文 参考訳(メタデータ) (2026-08-09T10:09:11Z) - Difference-Based Relational Learning for Zero-Shot Object-Goal Visual Navigation With Direct Sim-to-Real Transfer [0.5371337604556311]
頑健なゼロショットsim-to-real転送のための時間差分関係ネットワーク(T-DRN)
AI2-THORの実験では、強いベースラインよりも成功率の観点からT-DRNがゼロショットの一般化を改善することが示されている。
T-DRNは、物理的な車輪付きロボット上で体系的に検証され、実感と動作の制約の下で頑健な性能を示す。
論文 参考訳(メタデータ) (2026-07-17T05:35:40Z) - REMIND: RE-Identification with Memory for INDoor Navigation [39.146761527401424]
モノクロRGB画像からの屋内ジェネリックオブジェクトの長期的多目的再識別のためのオンライントラッカー。
視覚的認知の証拠によって、人間は明示的な自己ローカライゼーションではなく、蓄積した外観の親しみと空間的コンテキストに依存している。
ScanNet++では、すべてのシーンで1つのエンドツーエンド検出を除いて、すべての設定で最高のIDF1を達成している。
論文 参考訳(メタデータ) (2026-07-10T10:30:50Z) - Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions [52.61846373082384]
ショットトランジション検出(STD)は本質的に複雑なトランジションに苦しむ。
本稿では,STDのためのビジョン言語モデル(VLM)フレームワークであるTransVLMを提案する。
広範囲な実験により、TransVLMは全体的な性能が優れていることが示された。
論文 参考訳(メタデータ) (2026-04-30T15:05:06Z) - Micro-Expression-Aware Avatar Fingerprinting via Inter-Frame Feature Differencing [12.334126578226318]
アバターの指紋認証は、それが本物かどうかではなく、誰が合成トーキングヘッドビデオを駆動しているかを検証する。
既存の方法は、固定された、微分不可能なランドマーク抽出段階に依存している。
生ビデオフレームで動作するマイクロ圧縮対応バックボーン上に構築したプリプロセッシングフリーシステムを提案する。
論文 参考訳(メタデータ) (2026-04-25T10:57:39Z) - Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention [58.05340906967343]
Egocentric Referring Video Object (Ego-RVOS)は、言語クエリで説明されているように、人間のアクションに積極的に関与する特定のオブジェクトを、一人称ビデオに分割することを目的としている。
既存の手法はしばしば苦労し、データセット内の歪んだオブジェクト-アクションのペアリングから急激な相関を学習する。
本稿では,強力なトレーニング済みRVOSをエゴセントリックドメインに適応させるプラグイン因果フレームワークであるCausal-Referring(CERES)を紹介する。
論文 参考訳(メタデータ) (2025-12-30T16:22:14Z) - Latent Diffusion Model without Variational Autoencoder [78.34722551463223]
SVGは視覚生成のための変分オートエンコーダを持たない新しい潜伏拡散モデルである。
凍結したDINO機能を利用して、明確な意味的識別性を持つ特徴空間を構築する。
迅速な拡散訓練を可能にし、数ステップのサンプリングをサポートし、生成品質を向上させる。
論文 参考訳(メタデータ) (2025-10-17T04:17:44Z) - EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent [41.11532785015233]
EgoPrune(エゴプルーン)は、エゴモーションビデオの推論に適した、トレーニング不要のトークンプルーニング手法である。
EgoPruneは、様々なプルーニング比率で、トレーニング不要のメソッドを一貫して上回っている。
我々はEgoPruneをJetson Orin NX 16GBエッジデバイスを備えたエンボディエージェント上に展開する。
論文 参考訳(メタデータ) (2025-07-21T09:27:45Z) - SD-ReID: View-aware Stable Diffusion for Aerial-Ground Person Re-Identification [74.36139886192495]
本稿では,AG-ReID のための SD-ReID という新しい生成フレームワークを提案する。
まず、ViTベースのモデルを用いて人物表現を抽出し、個人性や視認性を含む制御可能な条件を抽出する。
次に、安定拡散(SD)モデルを微調整し、これらの制御可能な条件によって導かれる人物表現を強化する。
論文 参考訳(メタデータ) (2025-04-13T12:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。