論文の概要: Modeling Scientific Experiment Scenes: Dataset and Model
- arxiv url: http://arxiv.org/abs/2608.02892v3
- Date: Mon, 10 Aug 2026 20:32:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.348341
- Title: Modeling Scientific Experiment Scenes: Dataset and Model
- Title(参考訳): 科学実験シーンのモデリング:データセットとモデル
- Authors: Minghao Zou, Qingtian Zeng, Shangkun Liu, Cong Liu, Paul L. Rosin, Guanghui Yue, Jun Liu, Wei Zhou,
- Abstract要約: Cross-Modal Dual-Path Generator (CM-DPG) は、堅牢なオープンボキャブラリシーングラフ生成(SGG)のモデルである
モデルは、共同視覚テキストエンコーディングによるオブジェクトレベルのセマンティック表現を強化する。
PhysSceneとVG150の実験では、CM-DPGは複数の評価設定で競合性能を発揮する。
- 参考スコア(独自算出の注目度): 35.54149729801777
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Scene Graph Generation (SGG) is fundamental to structured visual understanding, yet existing benchmarks focus mainly on daily-life images and overlook scientific experiment scenes with specialized instruments, task-specific experimental semantics, and dense, fine-grained physical relations. Building upon PhysScene, our previously introduced SGG dataset for physics experiment scenes, we further identify two key challenges that such scientific environments pose to existing SGG models: a pronounced long-tail relational predicate distribution and a substantial visual-textual semantic gap. To address these challenges, we propose the Cross-Modal Dual-Path Generator (CM-DPG), a model for robust open-vocabulary SGG. The model enhances object-level semantic representations through joint visual-textual encoding and improves relational reasoning using complementary visual and geometric cues. We also incorporate relation-aware pre-training, caption-derived pseudo-supervision, and adaptive weighting to support balanced learning across head and tail predicates. Extensive experiments on PhysScene and VG150 show that CM-DPG achieves competitive performance across multiple evaluation settings, with ablation studies validating the contribution of each component. The dataset and code are publicly available at https://github.com/ZMH-SDUST/CM-DPG.
- Abstract(参考訳): シーングラフ生成(SGG)は、構造化された視覚的理解の基礎であるが、既存のベンチマークは、主に日常生活の画像に焦点を当て、専門的な機器、タスク固有の実験的意味論、密密できめ細かな物理的関係を持つ科学実験シーンを見渡す。
これまでに紹介した物理実験用SGGデータセットであるPhysSceneに基づいて、そのような科学的環境が既存のSGGモデルにもたらす2つの重要な課題、すなわち、長い尾関係述語分布と視覚的・テクスチュアルなセマンティックギャップを明らかにする。
これらの課題に対処するために、オープン語彙SGGの頑健なモデルであるCross-Modal Dual-Path Generator (CM-DPG)を提案する。
このモデルは、共同視覚テキスト符号化によるオブジェクトレベルの意味表現を強化し、相補的な視覚的および幾何学的手がかりを用いた関係推論を改善する。
また、頭と尾の述語間のバランス学習を支援するために、関係認識事前学習、キャプション由来の擬似スーパービジョン、適応重み付けも取り入れた。
PhysScene と VG150 の大規模な実験により,CM-DPG は複数の評価条件で競合性能を達成し,各成分の寄与を検証した。
データセットとコードはhttps://github.com/ZMH-SDUST/CM-DPGで公開されている。
関連論文リスト
- Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models [46.09809083890632]
シーングラフ思考(Scene Graph Thinking, SaGe)は、明示的なシーングラフ表現を通じて、きめ細かな、構造化された視覚的推論を可能にする新しいパラダイムである。
シーングラフからの推論トレースをサンプリングすることにより,120Kの高品質なトレーニングデータを構築する。
キュレートされたデータとグラフ整合トレーニングにより、我々のアプローチは8つのマルチモーダルベンチマークで大幅に改善される。
論文 参考訳(メタデータ) (2026-07-07T01:00:51Z) - PhysScene: A Scene Graph Dataset for Scientific Visual Reasoning in Physics Experiments [37.632499627458714]
SG(Scene Graphs)は、オブジェクトとそのペア関係をモデル化することで、視覚的なシーンの構造化された表現を提供する。
PhysSceneは物理実験に適した最初のSGデータセットである。
PhysSceneは、特殊な機器、構造化された実験装置、実験環境に固有の機能的関係を含んでいる。
論文 参考訳(メタデータ) (2026-06-08T11:40:48Z) - HGFormer: Topology-Aware Vision Transformer with HyperGraph Learning [14.344989900296968]
知覚探索のためのハイパーグラフの概念を紹介する。
具体的には,HyperGraph Transformer (HGFormer) と呼ばれるトポロジ対応の視覚変換器を提案する。
我々は効果的で統一的な表現を開発し、鮮明で詳細なシーンの描写を実現している。
論文 参考訳(メタデータ) (2025-04-03T09:58:01Z) - MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。
2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。
タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文 参考訳(メタデータ) (2024-07-06T00:40:53Z) - S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR [50.435592120607815]
外科手術のシーングラフ生成(SGG)は、手術室(OR)におけるホモロジー認知知能の増強に不可欠である
これまでの研究は主に多段階学習に依存しており、生成したセマンティックシーングラフはポーズ推定とオブジェクト検出を伴う中間プロセスに依存している。
本研究では,S2Former-OR(S2Former-OR)と呼ばれるORにおけるSGGのための新しいシングルステージバイモーダルトランスフォーマフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-22T11:40:49Z) - Towards a Unified Transformer-based Framework for Scene Graph Generation
and Human-object Interaction Detection [116.21529970404653]
本稿では,Transformerアーキテクチャに基づく一段階統一モデルであるSG2HOI+を紹介する。
本手法では,SGGとHOI検出のタスクをシームレスに統一する2つの対話型階層変換器を用いる。
提案手法は最先端のHOI法と比較して競争性能が向上する。
論文 参考訳(メタデータ) (2023-11-03T07:25:57Z) - Bilevel Fast Scene Adaptation for Low-Light Image Enhancement [50.639332885989255]
低照度シーンにおける画像の強調は、コンピュータビジョンにおいて難しいが、広く懸念されている課題である。
主な障害は、異なるシーンにまたがる分散の相違によるモデリングの混乱にある。
上述の潜在対応をモデル化するための双レベルパラダイムを導入する。
エンコーダのシーン非関連な一般化を多様なシーンにもたらすために、双方向学習フレームワークを構築した。
論文 参考訳(メタデータ) (2023-06-02T08:16:21Z) - Stacked Hybrid-Attention and Group Collaborative Learning for Unbiased
Scene Graph Generation [62.96628432641806]
Scene Graph Generationは、まず与えられた画像内の視覚的コンテンツをエンコードし、次にそれらをコンパクトな要約グラフに解析することを目的としている。
まず,モーダル内改良とモーダル間相互作用を容易にする新しいスタック型ハイブリッド・アテンションネットワークを提案する。
次に、デコーダを最適化するための革新的なグループ協調学習戦略を考案する。
論文 参考訳(メタデータ) (2022-03-18T09:14:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。