論文の概要: SiPhy: Single-Image Physical Property Reasoning
- arxiv url: http://arxiv.org/abs/2607.22355v1
- Date: Fri, 24 Jul 2026 14:36:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.15436
- Title: SiPhy: Single-Image Physical Property Reasoning
- Title(参考訳): SiPhy:シングルイメージの物理的特性推論
- Abstract要約: 単一イメージの物理特性推論のための統合フレームワークSiPhyを紹介する。
1つのRGBイメージから、SiPhyは擬似ボクセル点をサンプリングし、CLIP特徴を抽出し、VLMが提案する物質候補に基礎付ける。
部分ベースのコントラストアグリゲータは領域の一貫性を強制し、重みを意識した改善は厚さと体積推定を改善する。
- 参考スコア(独自算出の注目度): 10.6969737179559
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Inferring physical properties such as mass, stiffness, and elasticity from a single image is essential for simulation and embodied AI, yet most existing approaches rely on multi-view reconstruction or physics-based supervision. We introduce SiPhy, a unified framework for single-image physical property reasoning that aligns 3D-aware visual cues, depth with language-based material knowledge. From one RGB image, SiPhy samples pseudo-voxel points, extracts CLIP features, and grounds them to material candidates proposed by a VLM. A part-based contrastive aggregator enforces region consistency, while a heaviness-aware refinement improves thickness and volume estimation for dense objects. Across ABO-500, MVImgNet-100, and PhysXNet-100, SiPhy achieves state-of-the-art single-image performance, surpassing multi-view reconstruction methods by improving mass MnRE by up to 93% (vs. PUGS), reducing density MAE by 35.5% (vs. NeRF2Physics), and lowering Young's modulus error by 23.5%. We further validate SiPhy on real hand-object interaction datasets, demonstrating its potential as a data annotation engine for physical understanding from single-view imagery.
- Abstract(参考訳): 単一の画像から質量、剛性、弾力性などの物理的特性を推定することは、シミュレーションと具体的AIにとって不可欠であるが、既存のアプローチのほとんどは、多視点再構成や物理ベースの監督に依存している。
単一画像の物理特性推論のための統合フレームワークSiPhyを導入し,3次元視覚的手がかりと言語に基づく物質的知識の深度を一致させる。
1つのRGBイメージから、SiPhyは擬似ボクセル点をサンプリングし、CLIP特徴を抽出し、VLMが提案する物質候補に基礎付ける。
部分ベースのコントラストアグリゲータは領域の一貫性を強制する一方、重みを意識した改善は高密度物体の厚さと体積推定を改善する。
ABO-500、MVImgNet-100、PhysXNet-100全体で、SiPhyは最先端の単一画像のパフォーマンスを達成し、MnREを最大93%改善(PUGS)、密度MAEを35.5%削減(NeRF2Physics)、ヤングの弾性誤差を23.5%低減した。
さらに、実物間相互作用データセット上でSiPhyを検証し、シングルビュー画像からの物理的理解のためのデータアノテーションエンジンとしての可能性を示す。
関連論文リスト
- Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition [10.183626550724352]
Gen2Physicsは、自動的にそれらを構成材料コンポーネントに分解することで、物理においてメッシュを生成する。
我々のパイプラインは、高密度材料セグメンテーションのための微調整されたビジョントランス、ロバストな2次元から3次元の整合性プロジェクション、そしてビジョン・ランゲージ・モデル(VLM)の洗練を図っている。
論文 参考訳(メタデータ) (2026-08-24T22:18:44Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - PhysInOne: Visual Physics Learning and Reasoning in One Suite [41.08902311182402]
我々は、AIシステムのための物理地上トレーニングデータの致命的な不足に対処する大規模な合成データセットであるPhysInOneを提示する。
数百から数千のサンプルに制限された既存のデータセットとは異なり、PhysInOneは153,810のダイナミックな3Dシーンに200万のビデオを提供する。
我々はPhysInOneの有効性を、物理対応ビデオ生成、長期・短期のフレーム予測、物理的特性推定、モーション転送の4つの新しいアプリケーションで実証する。
論文 参考訳(メタデータ) (2026-04-10T15:27:27Z) - ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video [51.2815592637053]
ReconPhysは、単一の単眼ビデオから物理的属性推定と3次元ガウススプラッティング再構成を共同で学習するフィードフォワードフレームワークである。
提案手法では, 自己教師型戦略を用いて訓練したデュアルブランチアーキテクチャを用いて, 地上の物理ラベルの必要性を解消する。
大規模合成データセットの実験は優れた性能を示した。
論文 参考訳(メタデータ) (2026-04-09T06:51:14Z) - MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - Exploring Physical Intelligence Emergence via Omni-Modal Architecture and Physical Data Engine [50.62040226184694]
我々はOmniFysicsについて紹介する。OmniFysicsは、画像、音声、ビデオ、テキスト間の理解を統一するコンパクトなオムニモーダルモデルである。
明示的な物理知識を注入するために、2つのコンポーネントからなる物理データエンジンを構築します。
実験は、標準マルチモーダルベンチマークにおける競合性能を示し、物理指向評価の結果を改善した。
論文 参考訳(メタデータ) (2026-02-05T14:04:51Z) - PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image [67.76547268461411]
PhysX-Anythingは最初のシミュレーション可能な物理3D生成フレームワークである。
高品質なsim-ready 3Dアセットを明示的な幾何学、調音、物理的特性で生成する。
トークンの数を193倍に減らし、標準VLMトークン予算内で明示的な幾何学的学習を可能にする。
論文 参考訳(メタデータ) (2025-11-17T17:59:53Z) - PhysMotion: Physics-Grounded Dynamics From a Single Image [24.096925413047217]
本稿では、物理シミュレーションを利用した新しいフレームワークであるPhysMotionを紹介し、一つの画像と入力条件から生成された中間3次元表現をガイドする。
我々のアプローチは、従来のデータ駆動生成モデルの限界に対処し、より一貫した物理的に妥当な動きをもたらす。
論文 参考訳(メタデータ) (2024-11-26T07:59:11Z) - PhyRecon: Physically Plausible Neural Scene Reconstruction [81.73129450090684]
PHYRECONは、微分可能なレンダリングと微分可能な物理シミュレーションの両方を利用して暗黙的な表面表現を学習する最初のアプローチである。
この設計の中心は、SDFに基づく暗黙の表現と明示的な表面点の間の効率的な変換である。
また,物理シミュレータの安定性も向上し,全データセットに対して少なくとも40%の改善が得られた。
論文 参考訳(メタデータ) (2024-04-25T15:06:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。