論文の概要: What Does the Encoder Actually Decide? A Controlled Comparison of Vision Backbones on Joint Tree Segmentation and Stereo Depth
- arxiv url: http://arxiv.org/abs/2609.13232v1
- Date: Wed, 02 Sep 2026 11:21:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 16:32:15.663259
- Title: What Does the Encoder Actually Decide? A Controlled Comparison of Vision Backbones on Joint Tree Segmentation and Stereo Depth
- Title(参考訳): エンコーダは実際に何を決定するのか? 複合木セグメントとステレオ深さにおける視覚バックボーンの制御された比較
- Abstract要約: 木を刈り取るロボットには、1ピクセルあたりの事実が2つ必要だ。
エンコーダの選択は、細い植生における関節のセマンティックセグメンテーションとステレオ深さをどの程度変えているのか?
両ブランチに1つのエンコーダを供給し、再調整せずにエンコーダのみを交換するハードパラメータ共有ネットワークを構築した。
- 参考スコア(独自算出の注目度): 5.266753902938501
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A robot pruning trees needs two facts per pixel: whether it belongs to a tree, and its distance. Both are usually obtained via task heads attached to a vision backbone chosen by reputation rather than measurement. Holding dataset, decoders, losses, schedule, and evaluation fixed, we ask: how much does the encoder choice change joint semantic segmentation and stereo depth on thin vegetation? We build a hard parameter-sharing network with one encoder feeding both branches, swapping only the encoder without downstream retuning. We evaluate [N] encoders across [M] architecture families (CNNs, transformers, hybrids, MLP-mixers, state-space models) near a ~25M budget, trained from scratch. Depth is evaluated on tree pixels only; segmentation uses boundary F1 and background IoU to prevent "label-everything-tree" shortcuts. Three findings stand out. First, the strongest encoders are convolutional and hybrid, not transformers: [BestEncoder] leads with [MIoU] segmentation mIoU and [Delta] depth $δ_1$, while [X] of [Y] plain vision transformers collapse when trained from scratch. Second, parameter count does not predict quality --- [SmallEncoder] at only [P]M parameters outranks models two orders of magnitude larger. Third, segmentation and depth rankings agree strongly (Spearman $ρ$ = [RhoValue]), showing no task conflict. Finally, [K] of [N] encoders collapse to degenerate all-tree segmentation --- exposed by boundary F1 but hidden by region IoU.
- Abstract(参考訳): 木を刈り取るロボットには、1ピクセルあたりの事実が2つ必要だ。
どちらも通常、測定ではなく評価によって選択された視覚バックボーンにアタッチされたタスクヘッドを介して取得される。
データセット、デコーダ、損失、スケジュール、評価を固定した上で、エンコーダの選択は、細い植生における共同セマンティックセグメンテーションとステレオディープをどの程度変えているのか?
両ブランチに1つのエンコーダを供給し、下流を調整せずにエンコーダのみを交換するハードパラメータ共有ネットワークを構築した。
我々は,[M]アーキテクチャファミリ (CNN, トランスフォーマー, ハイブリッド, MLP-mixer, ステートスペースモデル) を, 約25Mの予算でスクラッチからトレーニングした上で, [N] エンコーダの評価を行った。
セグメンテーションは境界F1と背景IoUを使って"ラベル全木"ショートカットを防ぐ。
3つの発見がある。
BestEncoder]は[MIoU]セグメンテーションmIoUと[Delta]の深さ$δ_1$でリードし、[Y]のプレーンビジョントランスフォーマーの[X]は、スクラッチからトレーニングすると崩壊する。
第二に、パラメータカウントは --- [SmallEncoder] のみ[P]Mパラメータで -- を予測しません。
第3に、セグメンテーションと深さランキングは強く同意する(Spearman $ρ$ = [RhoValue])。
最後に、[N]エンコーダの[K]は崩壊し、すべてのツリーセグメンテーションが縮退する -- 境界F1によって露出されるが、領域IoUによって隠される。
関連論文リスト
- SCOUT: Sim-to-Real Text-Based Person Retrieval by Embedding-Space Prediction over Frozen Video Features [0.0]
埋め込み空間の予測としてクロスモーダル検索を行うSCOUTを提案する。
トレーニング可能な予測器は、凍結ビデオエンコーダのパッチトークンを凍結テキストエンコーダの埋め込み空間にマッピングする。
AIシティチャレンジ2026トラック4では、フルフューズリロードシステムが最終リーダーボード上で84.25 mAP@10に到達し、フリーズモデルが単独で60.63に到達した。
論文 参考訳(メタデータ) (2026-09-16T22:51:56Z) - LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics [50.45297537821907]
我々はLeJEPAの崩壊のない目的の下で訓練された最初のビデオエンコーダLeVJEPAを紹介する。
単一のエンコーダは、クリップのグローバルおよびローカルビューよりも分散損失で訓練される。
LeVJEPAはV-JEPA 2とVT-S/B/Lの5.6から20.8倍の速さで一致または超える。
論文 参考訳(メタデータ) (2026-08-27T17:26:24Z) - Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs [50.3757247538081]
我々は、統一パイプラインの下で、5つの共通ビジョンエンコーダの空でないサブセット31を再訓練し、評価する。
各エンコーダのコントリビューションを,容量と必要量という2つの軸に分解する。
エンコーダごとのプロジェクタ有効ランクは、残留スコアの変動を説明する。
論文 参考訳(メタデータ) (2026-06-02T16:46:42Z) - BINO: Encoder Centric Self Supervised Stereo With Native Pair Input [0.0]
ビノは、コンパクトエンコーダの中で強い双眼鏡構造を学べるかを問う。
入力段階で修正ペアを融合させ、ステレオマイクロセルトークンを形成し、行認識パッチ位相位置符号化を使用する。
結果は、しばしば別々のリンクモジュールに割り当てられるクロスビュー推論の多くは、コンパクトで再利用可能なエンコーダ内で学習可能であることを示唆している。
論文 参考訳(メタデータ) (2026-03-29T23:26:09Z) - SegViTv2: Exploring Efficient and Continual Semantic Segmentation with
Plain Vision Transformers [76.13755422671822]
本稿では,エンコーダ・デコーダ・フレームワークを用いた意味的セグメンテーションのためのプレーンビジョン変換器(ViT)の能力について検討する。
Intention-to-Mask(atm)モジュールを導入し、平易なViTに有効な軽量デコーダを設計する。
我々のデコーダは、様々なViTバックボーンを使用して人気のあるデコーダUPerNetより優れ、計算コストの5%程度しか消費しない。
論文 参考訳(メタデータ) (2023-06-09T22:29:56Z) - Cats: Complementary CNN and Transformer Encoders for Segmentation [13.288195115791758]
生体医用画像分割のための二重エンコーダを用いたモデルを提案する。
畳み込みエンコーダと変換器の情報を融合してデコーダに渡して結果を得る。
提案手法は,各タスクにトランスフォーマーと非変換器を併用した最先端モデルと比較して,ボード全体のDiceスコアを高くする。
論文 参考訳(メタデータ) (2022-08-24T14:25:11Z) - Point-M2AE: Multi-scale Masked Autoencoders for Hierarchical Point Cloud
Pre-training [56.81809311892475]
Masked Autoencoders (MAE) は、言語と2次元画像変換器の自己教師付き事前学習において大きな可能性を示している。
我々は3次元点雲の階層的自己教師型学習のための強力なマルチスケールMAE事前学習フレームワークであるPoint-M2AEを提案する。
論文 参考訳(メタデータ) (2022-05-28T11:22:53Z) - P3Depth: Monocular Depth Estimation with a Piecewise Planarity Prior [133.76192155312182]
本研究では,コプラナー画素からの情報を選択的に活用して予測深度を改善する手法を提案する。
本手法の広範な評価により, 教師付き単分子深度推定法において, 新たな手法の確立が期待できる。
論文 参考訳(メタデータ) (2022-04-05T10:03:52Z) - Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective
with Transformers [149.78470371525754]
セマンティックセグメンテーションをシーケンスからシーケンスへの予測タスクとして扱う。
具体的には、イメージをパッチのシーケンスとしてエンコードするために純粋なトランスをデプロイします。
トランスのすべての層でモデル化されたグローバルコンテキストにより、このエンコーダは、SETR(SEgmentation TRansformer)と呼ばれる強力なセグメンテーションモデルを提供するための単純なデコーダと組み合わせることができる。
SETRはADE20K(50.28% mIoU)、Pascal Context(55.83% mIoU)、およびCityscapesの競争力のある結果に関する最新技術を達成している。
論文 参考訳(メタデータ) (2020-12-31T18:55:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。