論文の概要: PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet
- arxiv url: http://arxiv.org/abs/2607.06097v1
- Date: Tue, 07 Jul 2026 10:11:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.476621
- Title: PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet
- Title(参考訳): PVCap:PseudoCapとVoxelCapNetによる正確な3Dディエンスキャプションを目指して
- Abstract要約: PVCapはPseudoCapとVoxelCapNetで構成されている。
本手法は, CIDEr@0.5IoUでそれぞれ11.41%, 13.99%を超過する。
- 参考スコア(独自算出の注目度): 86.90893905012511
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D dense captioning, an emerging vision-language task, aims to generate descriptive sentences for each object in the 3D scene. Despite the impressive results achieved by previous methods, they suffer from two limitations. First, current research often employs global rigid transformations, such as rotation, to augment scenes without changing their spatial layouts. However, diverse spatial layouts are crucial for training a 3D dense captioning model to describe spatial relations between objects. Second, previous works mainly focus on the design of the caption generation pipeline while utilizing a simple network architecture for other components, i.e., backbone and detection head, which is crucial for extracting rich semantic information for captioning. In this paper, we propose PVCap to alleviate the aforementioned problems. Our PVCap consists of PseudoCap and VoxelCapNet. Specifically, PseudoCap employs a random mixing technique on instances within the dataset, generating numerous pseudo frames with diverse spatial layouts at the instance level. By utilizing a teacher-student framework, PseudoCap obtains pseudo caption labels for these pseudo frames. This data augmentation approach significantly increases the number of training samples and enhances the model's ability to describe the environment effectively. Regarding VoxelCapNet, we introduce a robust caption network that utilizes voxel features and adapts the caption head to the voxel-based network architecture. Our VoxelCapNet can serve as a competitive baseline for future research on 3D dense captioning. Extensive experiments are conducted on two prevalent benchmarks, i.e., ScanRefer and Nr3D. Notably, our method surpasses current state-of-the-art by 11.41% and 13.99% in CIDEr@0.5IoU, respectively. Codes will be made publicly available.
- Abstract(参考訳): 視覚言語タスクである3D高密度キャプションは、3Dシーンの各オブジェクトについて記述文を生成することを目的としている。
従来の手法によって達成された印象的な結果にもかかわらず、それらは2つの制限に悩まされている。
第一に、現在の研究では、空間配置を変更することなくシーンを拡大するために回転のようなグローバルな剛性変換を用いることが多い。
しかし, 物体間の空間的関係を記述するために, 3次元密度キャプションモデルの訓練には, 多様な空間的レイアウトが不可欠である。
第二に、従来の研究はキャプション生成パイプラインの設計に重点を置いており、バックボーンや検出ヘッドといった、キャプションのためのリッチなセマンティック情報を抽出するのに欠かせない、単純なネットワークアーキテクチャを他のコンポーネントに活用している。
本稿では,上記の問題を緩和するためにPVCapを提案する。
PVCapはPseudoCapとVoxelCapNetで構成されています。
具体的には、PseudoCapはデータセット内のインスタンスにランダムなミキシング技術を採用し、インスタンスレベルで多様な空間レイアウトを持つ多数の擬似フレームを生成する。
PseudoCapは、教師/学生のフレームワークを利用することで、これらの擬似フレームの擬似キャプションラベルを取得する。
このデータ拡張アプローチは、トレーニングサンプルの数を大幅に増加させ、モデルが環境を効果的に記述する能力を高める。
本稿では,VoxelCapNetについて,Voxel機能を利用したロバストなキャプションネットワークを導入し,そのキャプションヘッドをVoxelベースのネットワークアーキテクチャに適用する。
我々のVoxelCapNetは、将来の3D高密度キャプション研究の競争基盤となる。
大規模な実験はScanReferとNr3Dという2つの一般的なベンチマークで行われている。
特に,本手法はCIDEr@0.5IoUでそれぞれ11.41%,13.99%を達成している。
コードは公開されます。
関連論文リスト
- 3D CoCa: Contrastive Learners are 3D Captioners [10.132943642539828]
3Dキャプション(3Dキャプション)は、自然言語による3Dシーンの内容を記述することを目的としている。
対照的な視覚言語学習と3Dキャプション生成をシームレスに組み合わせた,新しい統合フレームワークである3D CoCaを提案する。
論文 参考訳(メタデータ) (2025-04-13T11:10:47Z) - View Selection for 3D Captioning via Diffusion Ranking [54.78058803763221]
Cap3D法は、3Dオブジェクトを2Dビューにレンダリングし、事前訓練されたモデルを用いてキャプションを行う。
3Dオブジェクトのレンダリングビューは、標準的な画像キャプションモデルのトレーニングデータから逸脱し、幻覚を引き起こす。
DiffuRankは、3Dオブジェクトとそれらの2Dレンダリングビューのアライメントを評価するために、事前訓練されたテキストから3Dモデルを利用する手法である。
論文 参考訳(メタデータ) (2024-04-11T17:58:11Z) - UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation [46.998093729036334]
我々は,UniM-OV3Dという,マルチモーダルなオープン・ボキャブラリ・シーン理解ネットワークを提案する。
ポイントクラウドのグローバル機能とローカル機能をよりよく統合するために、階層的なポイントクラウド機能抽出モジュールを設計する。
キャプションからの粗い点列表現の学習を容易にするために,階層型3Dキャプションペアの利用を提案する。
論文 参考訳(メタデータ) (2024-01-21T04:13:58Z) - Vote2Cap-DETR++: Decoupling Localization and Describing for End-to-End
3D Dense Captioning [37.44886367452029]
3Dシークエンスキャプションは、入力された3Dシーンの理解を、異なるオブジェクト領域に関連する複数のキャプションに変換するモデルを必要とする。
既存の手法では洗練された"detect-then-describe"パイプラインを採用しており、多数の手作り部品を持つ3D検出器上に明示的な関係モジュールを構築する。
まず,キャプション生成のデコード処理と並列デコードによるオブジェクトローカライゼーションを分離する,単純なyet効率のトランスフォーマフレームワークであるVote2Cap-DETRを提案する。
論文 参考訳(メタデータ) (2023-09-06T13:43:27Z) - Lowis3D: Language-Driven Open-World Instance-Level 3D Scene
Understanding [57.47315482494805]
オープンワールドのインスタンスレベルのシーン理解は、アノテーション付きデータセットに存在しない未知のオブジェクトカテゴリを特定し、認識することを目的としている。
モデルは新しい3Dオブジェクトをローカライズし、それらのセマンティックなカテゴリを推論する必要があるため、この課題は難しい。
本稿では,3Dシーンのキャプションを生成するために,画像テキストペアからの広範な知識を符号化する,事前学習型視覚言語基盤モデルを提案する。
論文 参考訳(メタデータ) (2023-08-01T07:50:14Z) - Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds [20.172702468478057]
3Dポイントクラウドでのディエンスキャプションは、オブジェクトレベルの3Dシーン理解を含む、視覚と言語に関する新たなタスクである。
本稿では,オブジェクトを記述に変換するトランスフォーマーベースのエンコーダデコーダアーキテクチャ,すなわちSpaCap3Dを提案する。
提案手法は, CIDEr@0.5IoUのベースライン法であるScan2Capを4.94%, CIDEr@0.5IoUで9.61%向上させる。
論文 参考訳(メタデータ) (2022-04-22T13:07:37Z) - X-Trans2Cap: Cross-Modal Knowledge Transfer using Transformer for 3D
Dense Captioning [71.36623596807122]
3D高密度キャプションは、通常3DシーンをRGB-Dスキャンまたはポイントクラウドとして表現する3Dシーンにおいて、自然言語で個々のオブジェクトを記述することを目的としている。
本研究では,トランスフォーマーを用いた3次元高密度キャプション用X-Trans2Capを用いたクロスモーダルな知識伝達について検討し,シングルモーダル3Dキャプションの性能を効果的に向上させる。
論文 参考訳(メタデータ) (2022-03-02T03:35:37Z) - Injecting Semantic Concepts into End-to-End Image Captioning [61.41154537334627]
本稿では、地域特徴を抽出することなくグリッド表現を使用する、純粋視覚変換器を用いた画像キャプションモデルViTCAPを提案する。
性能向上のために,意味論的概念を予測し,それをエンドツーエンドのキャプションに組み込む新しいコンセプトトークンネットワーク(CTN)を導入する。
特に、CTNは視覚変換器に基づいて構築され、分類タスクを通じて概念トークンを予測するように設計されている。
論文 参考訳(メタデータ) (2021-12-09T22:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。