論文の概要: AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images
- arxiv url: http://arxiv.org/abs/2608.08874v2
- Date: Thu, 13 Aug 2026 12:00:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.485159
- Title: AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images
- Title(参考訳): AeroReformer2: 航空画像のスポーククエリ参照セグメンテーション
- Authors: Rui Li, Chenxi Duan, Haoyang Yang,
- Abstract要約: Spoken言語は、密集したリモートセンシング画像において任意のターゲットを指定するための自然なハンズフリーインターフェースを提供する。
我々は,アクセントと音声の異なる音声を付加し,元の画像,マスク,データを保存した音声クエリ・ベンチマークであるデータセットを紹介する。
また,境界保存型ビジュアルパスとトークン保存型音声符号化を組み合わせた,効率的な双方向ネットワークモデルを提案する。
- 参考スコア(独自算出の注目度): 5.79778334415852
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spoken language offers a natural, hands-free interface for specifying an arbitrary target in dense remote-sensing imagery, yet existing referring remote-sensing image segmentation benchmarks accept only written expressions. To bridge this gap, we introduce \dataset, a spoken-query benchmark derived from RISBench that adds accent- and voice-diverse speech while preserving the original image, mask, and data splits. Its hard evaluation sets combine rotor, wind, and mixed interference with three signal-to-noise levels. We also propose \model, an efficient bilateral network that combines a boundary-preserving visual path with token-preserving speech encoding, kernel linear cross-modal attention, and a resolution refinement head. The design conditions visual features at two scales without materializing a dense speech--visual affinity matrix, then restores fine boundaries using high-resolution visual features. On the clean test split, \model with Swin-Base achieves 62.09\% mean intersection over union (mIoU) and 68.22\% overall intersection over union (oIoU), outperforming the strongest audio-adapted remote-sensing baseline by 5.38 and 2.08 percentage points, respectively. It retains the best hard-set mIoU at 54.09\%. To the best of our knowledge, this is the first benchmark and model study of full-sentence spoken-query referring segmentation for remote-sensing imagery. The code will be made publicly available.
- Abstract(参考訳): Spoken言語は、密集したリモートセンシング画像において任意のターゲットを指定するための自然なハンズフリーインターフェースを提供するが、既存のリモートセンシングイメージセグメンテーションベンチマークは、記述された表現のみを受け入れる。
このギャップを埋めるために, RISBench から派生した音声クエリベンチマークである \dataset を導入する。
そのハード評価セットはローター、風、混合干渉を3つの信号対雑音レベルと組み合わせている。
また, 境界保存型ビジュアルパスとトークン保存型音声符号化, カーネル線形クロスモーダルアテンション, 解像度改善ヘッドを組み合わせた, 効率的な双方向ネットワークである \model を提案する。
設計条件は、高精細な音声親和性行列を具体化せずに、2つのスケールで視覚的特徴を表現し、高精細な視覚的特徴を用いて細かな境界を復元する。
クリーンなテスト分割では、Shamodel with Swin-Base は 62.09 % の平均和点 (mIoU) と 68.22 % 全体の和点 (oIoU) を達成し、オーディオ適応型リモートセンシングベースラインをそれぞれ5.38 と 2.08 ポイント上回っている。
最高のハードセットmIoUを54.09\%で保持する。
我々の知る限り、これはリモートセンシング画像のための全文音声クエリ参照セグメンテーションの最初のベンチマークおよびモデル研究である。
コードは公開されます。
関連論文リスト
- SENSE: Stereo OpEN Vocabulary SEmantic Segmentation [5.220640003552874]
Open-vocabulary セマンティックセマンティックセマンティクスにより、モデルは固定されたクラスセットを超えてオブジェクトまたはイメージ領域をセマンティクスできる。
SENSEはStereo OpENセマンティックセマンティックセマンティックセマンティックセマンティックセマンティックセマンティックセマンティックセマンティクスを強化するための最初の研究である。
ステレオ画像ペアを組み込むことにより,空間的推論とセグメンテーションの精度を向上させる幾何学的手法を導入する。
論文 参考訳(メタデータ) (2026-04-17T11:07:36Z) - Rethinking Referring Object Removal [9.906943507715779]
23,951枚の画像対において,34,615個のオブジェクトの表現を参照する136,495個のデータセットを構築した。
各ペアは、参照表現と削除後の基底真理を含む画像を含む。
符号化-復号構造を持つエンドツーエンドの構文認識型ハイブリッドマッピングネットワークを提案する。
論文 参考訳(メタデータ) (2024-03-14T06:26:34Z) - Synchronizing Vision and Language: Bidirectional Token-Masking
AutoEncoder for Referring Image Segmentation [26.262887028563163]
Referring Image (RIS)は、自然言語で表現されたターゲットオブジェクトをピクセルレベルのシーン内でセグメントすることを目的としている。
マスク付きオートエンコーダ(MAE)に触発された新しい双方向トークンマスキングオートエンコーダ(BTMAE)を提案する。
BTMAEは、画像と言語の両方に欠けている機能をトークンレベルで再構築することで、画像から言語、言語へのイメージのコンテキストを学習する。
論文 参考訳(メタデータ) (2023-11-29T07:33:38Z) - Towards Better Multi-modal Keyphrase Generation via Visual Entity
Enhancement and Multi-granularity Image Noise Filtering [79.44443231700201]
マルチモーダルなキーフレーズ生成は、入力されたテキストイメージペアのコアポイントを表すキーフレーズのセットを作成することを目的としている。
入力されたテキストと画像はしばしば完全に一致しないので、画像はモデルにノイズをもたらす可能性がある。
本稿では,モデル入力を外部知識で豊かにするだけでなく,画像ノイズを効果的にフィルタする,新しいマルチモーダル・キーフレーズ生成モデルを提案する。
論文 参考訳(メタデータ) (2023-09-09T09:41:36Z) - Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations [67.92679668612858]
我々は,集団が個人より優れているという心理的概念に触発されたコンセンサスネットワーク(Css-Net)を提案する。
Css-Netは,(1)コンセンサスモジュールと4つのコンセンサスモジュール,(2)コンセンサス間の相互作用の学習を促進するKulback-Leibler分散損失の2つのコアコンポーネントから構成される。
ベンチマークデータセット、特にFashionIQでは、Css-Netが大幅に改善されている。特に、R@10が2.77%、R@50が6.67%増加し、リコールが大幅に向上している。
論文 参考訳(メタデータ) (2023-06-03T11:50:44Z) - Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs
for Robust Speech Recognition [52.71604809100364]
音声の文脈化表現に雑音のロバスト性をエンコードするwav2vec-Switchを提案する。
具体的には、オリジナルノイズの多い音声ペアを同時にwav2vec 2.0ネットワークに供給する。
既存のコントラスト学習タスクに加えて、原音声と雑音音声の量子化表現を追加の予測対象に切り替える。
論文 参考訳(メタデータ) (2021-10-11T00:08:48Z) - Two-stage Visual Cues Enhancement Network for Referring Image
Segmentation [89.49412325699537]
Referring Image (RIS)は、ある自然言語表現によって参照される画像から対象のオブジェクトをセグメント化することを目的としている。
本稿では,2段階のビジュアルキュー拡張ネットワーク(TV-Net)を考案し,この問題に対処する。
この2段階の強化により,提案するTV-Netは,自然言語表現と画像間のきめ細かいマッチング動作の学習において,より優れた性能を享受できる。
論文 参考訳(メタデータ) (2021-10-09T02:53:39Z) - Locate then Segment: A Strong Pipeline for Referring Image Segmentation [73.19139431806853]
参照画像セグメンテーションは、自然言語表現によって参照されるオブジェクトをセグメンテーションすることを目的とする。
従来の方法は、視覚言語機能を融合させ、最終的なセグメンテーションマスクを直接生成するための暗黙的および反復的な相互作用メカニズムの設計に焦点を当てています。
これらの問題に取り組むための「Then-Then-Segment」スキームを紹介します。
私たちのフレームワークはシンプルですが驚くほど効果的です。
論文 参考訳(メタデータ) (2021-03-30T12:25:27Z) - Improving Semantic Segmentation via Decoupled Body and Edge Supervision [89.57847958016981]
既存のセグメンテーションアプローチは、グローバルコンテキストをモデル化することでオブジェクトの内部の一貫性を改善すること、あるいはマルチスケールの特徴融合によって境界に沿ったオブジェクトの詳細を洗練することを目的としている。
本稿では,セマンティックセグメンテーションのための新しいパラダイムを提案する。
我々の洞察は、セマンティックセグメンテーションの魅力ある性能には、画像の高頻度と低頻度に対応するオブジェクトのテキストボディとテキストエッジを具体的にモデル化する必要があるということである。
さまざまなベースラインやバックボーンネットワークを備えた提案したフレームワークが,オブジェクト内部の一貫性とオブジェクト境界を向上させることを示す。
論文 参考訳(メタデータ) (2020-07-20T12:11:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。