論文の概要: Learning to Predict Contact Force Distributions from Vision Leveraging Object Geometry Priors
- arxiv url: http://arxiv.org/abs/2608.00464v1
- Date: Sat, 01 Aug 2026 06:11:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.681483
- Title: Learning to Predict Contact Force Distributions from Vision Leveraging Object Geometry Priors
- Title(参考訳): 物体形状を利用した視覚による接触力分布予測の学習
- Abstract要約: ロボット工学で一般的に採用されている剛体シミュレータを用いて、視覚と力のペアデータを収集する。
ノイズの多いポイントフォースを出力するシミュレータとは異なり、人間は馴染みのない状況でも一貫した予測を行うことができる。
毎日積み重ねられた1枚のRGB画像から3次元力分布を予測するモデルを構築した。
- 参考スコア(独自算出の注目度): 3.683654272386691
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Based on vision and prior experience, humans can make rough physical predictions and adjust their manipulation strategies. This paper aims to endow robots with a similar ability. To collect paired data of vision and forces, we use a rigid-body simulator commonly adopted in robotics. However, unlike simulators that output noisy point forces, humans are able to make consistent predictions even in unfamiliar situations. Based on this observation, we hypothesize that predicting smooth force distributions rather than raw point forces can improve both force prediction itself and downstream task performance. To validate this hypothesis, we construct a model that predicts three-dimensional force distributions from a single RGB image of piled daily objects. The target distribution is generated by applying statistical smoothing to point forces obtained from the simulator. Moreover, by incorporating object geometry into the smoothing process, we aim to account for variations in contact states and achieve more consistent vision-based predictions. We conduct extensive evaluations in both simulation and real environments. Results show that our approach improves prediction accuracy, enhances downstream task performance through smoothing, and further benefits from geometry-guided smoothing. Remarkably, the trained model generalizes effectively to real-world scenes despite being trained solely in simulation.
- Abstract(参考訳): 視覚と事前の経験に基づいて、人間は粗い物理的予測を行い、操作戦略を調整することができる。
本論文は,ロボットに同様の能力を持たせることを目的としている。
視覚と力のペアデータを収集するために,ロボット工学で一般的に用いられる剛体シミュレータを用いた。
しかし、ノイズの多い点力を出力するシミュレータとは異なり、人間は馴染みのない状況でも一貫した予測を行うことができる。
この観測から,原点力よりもスムーズな力分布の予測は,力予測自体と下流作業性能の両方を改善することができるという仮説を立てた。
この仮説を検証するため, 毎日積み重ねられた1枚のRGB画像から3次元力分布を予測するモデルを構築した。
シミュレータから得られる点力に統計的平滑化を適用して目標分布を生成する。
さらに,物体形状を平滑化プロセスに組み込むことで,接触状態の変動を考慮し,より一貫した視覚に基づく予測を実現することを目指す。
我々はシミュレーションと実環境の両方で広範囲な評価を行う。
その結果,提案手法は予測精度の向上,スムース化による下流タスク性能の向上,および幾何学誘導スムース化によるメリットが示された。
トレーニングされたモデルは、シミュレーションのみで訓練されているにもかかわらず、現実世界のシーンに効果的に一般化する。
関連論文リスト
- Learning Physics-Guided Residual Dynamics for Deformable Object Simulation [19.104444935269616]
物理誘導残留ダイナミクス(英: Physics-Guided Residual Dynamics、PGRD)は、物理に基づくアプローチと学習に基づくアプローチの利点を組み合わせたハイブリッドシミュレーションフレームワークである。
PGRDは,様々な実世界の変形可能なオブジェクトの集合上で,純粋に物理に基づく手法と学習に基づく手法の両方よりも正確な結果が得られることを示す。
論文 参考訳(メタデータ) (2026-07-15T05:15:43Z) - Bridging the sim2real gap in the table tennis robot with a transformer-based ball states predictor [42.252953556229066]
ロボットテーブルテニスは、動的環境における高速でクローズドループなロボット制御のための代表的なベンチマークである。
本稿では,テーブル球状態予測のための変圧器ベースのフレームワークを提案する。
様々なスキルレベルと多様なボールキャノン構成の選手から、大規模な実世界のデータセットを収集します。
論文 参考訳(メタデータ) (2026-06-09T21:35:59Z) - URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model [76.08429266631823]
3次元マルチモーダル大言語モデル(MLLM)に基づくエンドツーエンドの自動再構築フレームワークを提案する。
URDF-Anythingは、ポイントクラウドとテキストマルチモーダル入力に基づく自己回帰予測フレームワークを使用して、幾何学的セグメンテーションと運動論的パラメータ予測を協調的に最適化する。
シミュレーションと実世界の両方のデータセットの実験は、我々の手法が既存の手法よりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-11-02T13:45:51Z) - Video Prediction of Dynamic Physical Simulations With Pixel-Space Spatiotemporal Transformers [3.951575888190684]
本研究は,ビデオ予測のためのトランスフォーマー適応を簡易なエンド・ツー・エンド・アプローチで検討し,種々の自己時間的アテンションレイアウトを比較した。
本稿では,自動回帰映像予測のための簡易かつ効果的な変換器を提案し,連続した画素空間表現をビデオ予測水平線に適用する。
論文 参考訳(メタデータ) (2025-10-23T17:58:45Z) - Learning Contact Dynamics for Control with Action-conditioned Face Interaction Graph Networks [4.942750934906048]
本稿では,ロボットエンドエフェクタの高精度な動作と力トルク予測を,接触リッチな操作で実現する物理シミュレータを提案する。
提案モデルは,最新のGNNベースシミュレータを,新しいノードとエッジタイプで拡張する。
論文 参考訳(メタデータ) (2025-09-15T17:15:31Z) - Unified Human Localization and Trajectory Prediction with Monocular Vision [64.19384064365431]
MonoTransmotionはトランスフォーマーベースのフレームワークで、モノクロカメラのみを使用して、ローカライゼーションと予測タスクを共同で解決する。
両タスクを統合フレームワークで共同でトレーニングすることにより,ノイズの多い入力による実環境シナリオにおいて,我々の手法がより堅牢であることを示す。
論文 参考訳(メタデータ) (2025-03-05T14:18:39Z) - What Makes Pre-Trained Visual Representations Successful for Robust
Manipulation? [57.92924256181857]
照明やシーンテクスチャの微妙な変化の下では,操作や制御作業のために設計された視覚表現が必ずしも一般化されないことがわかった。
創発的セグメンテーション能力は,ViTモデルにおける分布外一般化の強い予測因子であることがわかった。
論文 参考訳(メタデータ) (2023-11-03T18:09:08Z) - DeepSimHO: Stable Pose Estimation for Hand-Object Interaction via
Physics Simulation [81.11585774044848]
我々は、前方物理シミュレーションと後方勾配近似とニューラルネットワークを組み合わせた新しいディープラーニングパイプラインであるDeepSimHOを紹介する。
提案手法は, 評価の安定性を著しく向上し, テスト時間最適化よりも優れた効率性を実現する。
論文 参考訳(メタデータ) (2023-10-11T05:34:36Z) - A Control-Centric Benchmark for Video Prediction [69.22614362800692]
本稿では,アクション条件付きビデオ予測のベンチマークを,制御ベンチマークの形式で提案する。
私たちのベンチマークには、11のタスクカテゴリと310のタスクインスタンス定義を備えたシミュレーション環境が含まれています。
次に、ベンチマークを活用して、スケールするモデルサイズ、トレーニングデータの量、モデルアンサンブルの影響を調査します。
論文 参考訳(メタデータ) (2023-04-26T17:59:45Z) - Object and Relation Centric Representations for Push Effect Prediction [18.990827725752496]
プッシュは、プレグレープ操作からシーンアレンジメントまでのタスクに使用される、非包括的操作スキルである。
本稿では,プッシュ動作の効果予測とパラメータ推定のためのグラフニューラルネットワークに基づくフレームワークを提案する。
本フレームワークは,異なる種類の接合体と異なる質量を有する物体を介して接続された異なる形状の多部オブジェクトを含む実環境と模擬環境の両方で検証される。
論文 参考訳(メタデータ) (2021-02-03T15:09:12Z) - Predicting the Physical Dynamics of Unseen 3D Objects [65.49291702488436]
インパルス力を受ける平面上での3次元物体の動的挙動の予測に焦点をあてる。
我々の手法は、訓練中に目に見えない物体の形状や初期条件に一般化することができる。
我々のモデルは物理エンジンと実世界の両方のデータによるトレーニングをサポートすることができる。
論文 参考訳(メタデータ) (2020-01-16T06:27:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。