論文の概要: Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026
- arxiv url: http://arxiv.org/abs/2608.22337v1
- Date: Sun, 23 Aug 2026 10:11:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.723854
- Title: Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026
- Title(参考訳): 音声からマスクトラックへのモーションアウェア推論:2026年第8回LSVOSチャレンジのMeViS-Audioトラックのランナアップソリューション
- Abstract要約: 音声誘導型参照ビデオオブジェクトセグメンテーションは、音声動作記述によって特定されたオブジェクトのマスクトラックを復元することを目的としている。
我々は,第8回LSVOSチャレンジのMeViS-Audioトラックに対するアプローチであるSpeech2MaskTrackを紹介する。
- 参考スコア(独自算出の注目度): 18.40525632040563
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech-guided referring video object segmentation aims to recover the mask tracks of objects specified by a spoken motion description. Here, speech carries a linguistic instruction rather than acoustic evidence from a sounding object, so a solution must connect speech recognition, motion-centric temporal grounding, mask tracking, and explicit no-target handling. We introduce Speech2MaskTrack, our approach for the MeViS-Audio track of the 8th LSVOS Challenge. Speech2MaskTrack transcribes the spoken query and compiles it into structured constraints over category, count, direction, interaction role, and temporal phase. SAM3.1 enumerates multiple instance tracks, which TRACE ranks using complete-trajectory motion and relation evidence. A frozen lexical presence gate may suppress the ranked SAM3.1 base prediction. When the gate predicts that a target is present, an available full-expression-conditioned SaSaSa2VA track replaces the SAM3.1 mask. Only outputs that remain empty enter GPT-assisted recovery, which invokes SaSaSa2VA again under query- and mask-level verification. Speech2MaskTrack achieved second place in the official challenge ranking.
- Abstract(参考訳): 音声誘導型参照ビデオオブジェクトセグメンテーションは、音声動作記述によって特定されたオブジェクトのマスクトラックを復元することを目的としている。
ここでは、音声認識、動き中心の時間的接地、マスク追跡、明示的な非ターゲットハンドリングを接続する必要がある。
我々は,第8回LSVOSチャレンジのMeViS-Audioトラックに対するアプローチであるSpeech2MaskTrackを紹介する。
Speech2MaskTrackは、音声クエリを書き起こし、カテゴリ、カウント、方向、相互作用ロール、時間相に関する構造化された制約にコンパイルする。
SAM3.1は複数のインスタンストラックを列挙し、TRACEは完全な軌道運動と関係証拠を用いてランク付けする。
凍結した語彙的存在ゲートは、SAM3.1塩基予測のランクを抑えることができる。
ゲートがターゲットが存在すると予測すると、利用可能な完全圧縮条件のSaSaSa2VAトラックがSAM3.1マスクを置き換える。
空のままの出力のみがGPTアシストリカバリに入力され、クエリとマスクレベルの検証で再びSaSaSa2VAが呼び出される。
Speech2MaskTrackは公式のチャレンジランキングで2位を獲得した。
関連論文リスト
- Key-Frame Reasoning with SAM3: Third Place Solution for the MeViS-Text Track of the 8th LSVOS Challenge [15.751702557806595]
本報告では,第8回SVOSチャレンジのMeViS-Textトラックに対して,2段階のトレーニングフリーソリューションを提案する。
このタスクは、ビデオ全体を通して自然言語表現によって指定されたオブジェクトをローカライズし、セグメンテーションするモデルを必要とする。
J&F, J, F, N-acc, T-acc, and Final scores of 0.761, 0.7367, 0.7852, 0.8333, 0.9755, 0.856593。
論文 参考訳(メタデータ) (2026-08-18T02:11:03Z) - Multi-Agent Target-Existence Verification and Learned Mask Geometry Refinement: Winning Report of the MeViS-Text Track at the 8th LSVOS Challenge 2026 [0.6416429054645992]
本稿では,第8回LSVOSチャレンジ2026におけるMeViS-Textトラックへの第1位ソリューションを提案する。
偽りの非ターゲット表現を含む、手書きの動作表現でガイドされるビデオオブジェクトのセグメンテーションを参照すること。
我々のパイプラインであるSSUPERは、各表現を視覚概念に分解し、SAM3.1でフルビデオ候補マスクレットを生成し、ターゲットIDを選択する。
論文 参考訳(メタデータ) (2026-08-11T21:47:52Z) - Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge [46.49526425182438]
Qwen3-ASRはまず音声をテキストに変換する。
我々は、他の候補者と平均的なマスク契約を持つトラックを選択する。
ビデオレベルの分類器は、視覚的、音声的、およびビデオ内クエリスコアを組み合わせて、どのターゲットが存在するかを決定する。
論文 参考訳(メタデータ) (2026-08-10T11:43:31Z) - The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation [65.24213788883016]
本報告では,第5回PVUW MeViS-Text Challengeの優勝ソリューションについて述べる。
私たちは、強力なマルチモーダルな大規模言語モデルとSAM3を組み合わせた、完全にトレーニング不要なパイプラインを構築しています。
我々の手法はPVUW 2026 MeViS-Textテストセットで第1位であり、最終スコアは0.909064、J&Fスコアは0.7897026である。
論文 参考訳(メタデータ) (2026-04-01T02:42:30Z) - Perception Test 2025: Challenge Summary and a Unified VQA Extension [56.23039846339896]
第3の知覚テストは、IEEE/CVF International Conference on Computer Vision (ICCV) 2025と共に、フルデイワークショップとして組織された。
第一の目的は、最先端のビデオモデルをベンチマークし、マルチモーダル知覚の進捗を測定することである。
主要なパーセプションテストの課題の結果を要約し、既存のタスクとベンチマークへの新たな追加の両方を詳述する。
論文 参考訳(メタデータ) (2026-01-09T20:02:21Z) - EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving [64.58258341591929]
聴覚参照マルチオブジェクトトラッキング(AR-MOT)は、自律運転において難しい問題である。
私たちは、デュアルストリーム・ビジョン・トランスフォーマーを備えたエンドツーエンドのAR-MOTフレームワークであるEchoTrackを提案しました。
大規模AR-MOTベンチマークの最初のセットを確立する。
論文 参考訳(メタデータ) (2024-02-28T12:50:16Z) - Exploratory Evaluation of Speech Content Masking [7.012446339121189]
コンテントマスキング」と呼ばれる新しいタイプのプライバシを探求する玩具問題を導入する。
個別の音声表現(音声符号)の系列変更に基づくベースラインマスキング手法の評価を行う。
本稿では,3種類のマスキング場所と3種類のマスキング戦略について検討する。
論文 参考訳(メタデータ) (2024-01-08T14:56:03Z) - Tracking Anything in High Quality [63.63653185865726]
HQTrackは高品質なビデオ追跡のためのフレームワークだ。
ビデオマルチオブジェクトセグメンタ(VMOS)とマスクリファインダ(MR)で構成されている。
論文 参考訳(メタデータ) (2023-07-26T06:19:46Z) - CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for
Unsegmented Recordings [87.37967358673252]
第6回CiME音声分離認識チャレンジ(CHiME-6)の開催
この課題は、従来のCHiME-5課題を再考し、遠隔マルチマイクロホン音声のダイアリゼーションと認識の問題をさらに検討する。
本稿では, セグメント化多話者音声認識と非セグメント化多話者音声認識におけるCHiME-6チャレンジのベースライン記述について述べる。
論文 参考訳(メタデータ) (2020-04-20T12:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。