論文の概要: Every View Counts: View-Consistent Panoptic Quality for Multi-view Panoptic Segmentation
- arxiv url: http://arxiv.org/abs/2610.05911v1
- Date: Mon, 05 Oct 2026 07:25:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 03:16:41.037204
- Title: Every View Counts: View-Consistent Panoptic Quality for Multi-view Panoptic Segmentation
- Title(参考訳): ビューカウント:多視点パノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノパノ
- Abstract要約: マルチビューパノプティックセグメンテーションは、セマンティッククラスとシーンレベルのインスタンスIDを、順序のない画像のすべてのピクセルに割り当てる。
最近のフィードフォワード3Dモデルは、入力ビューのラベルを単一のフォワードパスで予測する。
本稿では,PQを単一画像から一組の入力ビューに拡張するビュー一貫性パノプティクス(VC-PQ)を提案する。
- 参考スコア(独自算出の注目度): 14.10832602791375
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-view panoptic segmentation assigns a semantic class and a scene-level instance ID to every pixel of an unordered set of images, and recent feed-forward 3D models predict these labels for the input views in a single forward pass. Their predictions, however, have been evaluated with the scene-level PQ (PQ^scene) borrowed from per-scene optimization methods, typically on rendered held-out views. PQ^scene tiles all views of a scene into a single image, so that a missed appearance or a change of ID lowers the score of the matched pair only in proportion to its area. We propose View-Consistent Panoptic Quality (VC-PQ), which extends PQ from a single image to a set of input views, counts equally every view in which an instance is visible, and penalizes a prediction that is not visible in the same views as its ground truth. A decomposition of VC-PQ attributes the score a method loses to mask accuracy, view consistency, and the matching threshold. A single additional parameter recovers the area weighting of tiling for comparison. Under a fixed evaluation protocol on ScanNet++ and ScanNetv2, recent feed-forward methods are evaluated with VC-PQ and PQ^scene, and the decomposition shows where each of them loses its score. Controlled perturbations of the ground truth show that VC-PQ responds to the number of views in which an instance is missed or changes ID, whereas PQ^scene responds to their area. The aim of this work is to make view consistency part of the evaluation of multi-view panoptic segmentation, with VC-PQ reported alongside PQ^scene.
- Abstract(参考訳): マルチビュー・パノプティクス・セグメンテーションは、セマンティッククラスとシーンレベルのインスタンスIDを、順序のない画像集合の各ピクセルに割り当て、最近のフィードフォワード3Dモデルは、入力ビューのラベルを単一のフォワードパスで予測する。
しかし、それらの予測はシーンごとの最適化手法から借用されたシーンレベルのPQ(PQ^scene)を用いて評価されている。
PQ^sceneはシーンのすべてのビューを1つのイメージに分類するので、外観やIDの変更の欠如により、マッチしたペアのスコアはその領域に比例して低下する。
一つの画像から一連の入力ビューまでPQを拡張し、インスタンスが見えるすべてのビューをカウントし、基礎的な真実と同じビューでは見えない予測をペナライズするビュー一貫性パノプティクティクス(VC-PQ)を提案する。
VC-PQの分解は、メソッドが失うスコアをマスキング精度、ビュー一貫性、マッチングしきい値に属性付ける。
単一のパラメータが比較のためにタイリングの面積重み付けを復元する。
ScanNet++ と ScanNetv2 の固定評価プロトコルでは,VC-PQ と PQ^scene を用いて最近のフィードフォワード法の評価を行い,その分解結果から各アルゴリズムのスコアが失われることを示す。
基底真理の制御された摂動は、VC-PQがインスタンスが見逃されたりIDが変わったりするビューの数に応答し、PQ^sceneはその領域に応答することを示している。
本研究の目的は、PQ^sceneと共にVC-PQを報告し、多視点パノプティクスセグメンテーションの評価において、ビューの一貫性を一部にすることである。
関連論文リスト
- From Patching to Pruning Visual Computation in Vision Language Models [32.46243388053208]
Patch-to-Prune(P2P)は、診断ツールからのアクティベーションパッチを推論時バイパスに変換する、トレーニング不要のフレームワークである。
P2Pは、シーケンスの長さ、トークンの順序、位置情報、注意マスク、および残留経路を保存し、トークンを除去したり、事前訓練されたモデルの重みを変更することなくプルーニングする。
論文 参考訳(メタデータ) (2026-10-02T14:37:53Z) - Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation [9.296275675671636]
本稿では,ビューレベルとトークンレベルの両方において,入力コンテキスト収集のための階層的アプローチを提案する。
具体的には、画素特徴とカメラパラメータを組み合わせることで、意味的内容と幾何学的位置の両方に基づいて、ビューの重要性を評価する。
フレームワークを3つの広く使用されているベンチマークで評価し、既存のチューニング不要の手法とトレーニングベースのアプローチに匹敵するパフォーマンスを大幅に改善したことを示す。
論文 参考訳(メタデータ) (2026-06-02T03:38:51Z) - Active View Selection for Scene-level Multi-view Crowd Counting and Localization with Limited Labels [55.396639405563526]
複数ビューの観客数と位置決めは、入力された複数ビューを融合させ、地上の観客数や場所を推定する。
既存の方法は巨大なラベル付きビューとイメージを必要とし、クロスシーン設定ができない。
ビュー選択戦略において、ビューとシーンのジオメトリを考慮した独立ビュー選択法(IVS)を提案する。
また、ビュー選択、ラベル付け、下流タスクを協調的に最適化するアクティブビュー選択法(AVS)も提案した。
論文 参考訳(メタデータ) (2025-09-20T13:23:46Z) - No-Reference Point Cloud Quality Assessment via Graph Convolutional Network [89.12589881881082]
3次元(3D)ポイントクラウドは、新しいビジュアルメディアフォーマットとして、消費者にますます好まれている。
ポイントクラウドは、必然的に、マルチメディア通信システムによる品質劣化と情報損失に悩まされる。
マルチビュー2次元投影画像の相互依存関係を特徴付けるために,GCN(Graph Convolutional Network)を用いた新しい非参照PCQA手法を提案する。
論文 参考訳(メタデータ) (2024-11-12T11:39:05Z) - Position-guided Text Prompt for Vision-Language Pre-training [121.15494549650548]
本研究では,ビジョンランゲージ・プレトレーニングで訓練したクロスモーダルモデルの視覚的グラウンド化能力を高めるために,位置誘導型テキストプロンプト(PTP)パラダイムを提案する。
PTPは、与えられたブロック内のオブジェクトを予測したり、与えられたオブジェクトのブロックを後退させたりすることで、PTPが与えられた視覚的グラウンドタスクを補充するブランク問題に再構成する。
PTPはオブジェクト検出をベースとした手法で同等の結果を得るが、PTPがオブジェクト検出を破棄し、後続では不可能になるため、推論速度ははるかに速い。
論文 参考訳(メタデータ) (2022-12-19T18:55:43Z) - Hierarchical View Predictor: Unsupervised 3D Global Feature Learning
through Hierarchical Prediction among Unordered Views [69.83935019958334]
階層型ビュー予測器という,ビューに基づくディープラーニングモデルを提案する。
HVPは、教師なしの方法で、秩序のないビューから3D形状の特徴を学習する。
以上の結果から,HVPは大規模3次元形状ベンチマークにおいて最先端の手法より優れることが示された。
論文 参考訳(メタデータ) (2021-08-08T22:07:10Z) - Pose-guided Visible Part Matching for Occluded Person ReID [80.81748252960843]
本稿では、ポーズ誘導による特徴の識別を共同で学習し、その部分の可視性を自己判断する Pose-Guided Visible Part Matching (PVPM) 法を提案する。
実験結果から,提案手法は最先端手法と競合する性能を示した。
論文 参考訳(メタデータ) (2020-04-01T04:36:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。