論文の概要: PhysTacGen: Physics-Aware Visual-Tactile Sensor Image Generation
- arxiv url: http://arxiv.org/abs/2610.08068v1
- Date: Tue, 06 Oct 2026 10:00:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.925775
- Title: PhysTacGen: Physics-Aware Visual-Tactile Sensor Image Generation
- Title(参考訳): PhysTacGen:物理対応の視覚触覚センサ画像生成
- Abstract要約: PhysTacGenは、視覚と光学の触覚画像生成フレームワークである。
GTPOは、構造化材料記述を生成するために視覚言語モデルを洗練する強化学習戦略である。
得られたSSVTPデータに対する実験により, 比較ベースラインに対する構造的類似性が改善された。
- 参考スコア(独自算出の注目度): 13.766739830647404
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Realistic physical interaction is a cornerstone of embodied intelligence, yet collecting paired visual--tactile data remains costly. Visual-to-tactile synthesis offers a promising approach to augmenting such data, but learning this mapping is complicated by the gap between visual appearance and contact-related material properties, as well as spatial misalignment in paired observations. To address these challenges, we present \textbf{PhysTacGen}, a visual-to-optical-tactile image generation framework that integrates material-aware descriptions with geometric conditioning. First, we introduce Group Tactile Policy Optimization (GTPO), a reinforcement learning strategy that refines a vision--language model to generate structured material descriptions using task-specific rewards. Second, we combine DINOv2-based pair curation with monocular relative-depth estimation to select training pairs and provide geometric priors. Finally, an SDXL ControlNet synthesizes optical tactile images conditioned on RGB, relative depth, and GTPO-generated text. Experiments on curated SSVTP data demonstrate improved structural similarity over the compared baselines, while a blinded user study shows a preference for GTPO-generated descriptions. Generated tactile inputs also improve performance on an attribute-derived force-coefficient prediction proxy. Together, these results demonstrate the effectiveness of PhysTacGen for optical tactile image synthesis and its utility in the evaluated downstream task.The code will be available at https://github.com/VDIGPKU/PhysTacGen.
- Abstract(参考訳): 現実的な物理的相互作用は、インテリジェンスを具現化した基盤だが、ペア化された視覚触覚データの収集にはコストがかかる。
視覚と触覚の合成は、そのようなデータを増やすための有望なアプローチを提供するが、このマッピングの学習は、視覚的外観と接触関連物質特性のギャップと、ペア化された観測における空間的不整合によって複雑である。
これらの課題に対処するために、幾何学的条件付けと物質認識記述を統合した視覚的・光学的触覚画像生成フレームワークである \textbf{PhysTacGen} を提案する。
まず,グループ触覚政策最適化(Group Tactile Policy Optimization, GTPO)について述べる。
第二に、DINOv2ベースのペアキュレーションと単分子相対深度推定を組み合わせて、トレーニングペアを選択し、幾何学的事前情報を提供する。
最後に、SDXL ControlNetは、RGB、相対深度、GTPO生成テキストに条件付き光触覚画像を合成する。
得られたSSVTPデータを用いた実験では, 比較ベースラインよりも構造的類似性が向上し, ブラインドユーザスタディではGTPO生成記述が好まれている。
生成した触覚入力は属性由来の力係数予測プロキシの性能も向上する。
これらの結果は、光触覚画像合成におけるPhysTacGenの有効性と、評価ダウンストリームタスクにおけるその有用性を示し、https://github.com/VDIGPKU/PhysTacGenで利用可能となる。
関連論文リスト
- Modeling Scientific Experiment Scenes: Dataset and Model [35.54149729801777]
Cross-Modal Dual-Path Generator (CM-DPG) は、堅牢なオープンボキャブラリシーングラフ生成(SGG)のモデルである
モデルは、共同視覚テキストエンコーディングによるオブジェクトレベルのセマンティック表現を強化する。
PhysSceneとVG150の実験では、CM-DPGは複数の評価設定で競合性能を発揮する。
論文 参考訳(メタデータ) (2026-08-03T21:20:15Z) - OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation [63.27323042387232]
OmniPhysは、物理知識グラフに1,551個のサンプルの厳密なベンチマークである。
PhETシミュレーションを標準的なカリキュラムと整合させることで、OmniPhysは診断ストレステストを実行するナレッジ・トゥ・シナリオパイプラインを運用する。
我々は,物理フィードバックを離散最適化問題として扱う反復的フレームワークであるOmniPromptを提案する。
論文 参考訳(メタデータ) (2026-07-28T12:27:25Z) - PhysNeXt: Next-Generation Dual-Branch Structured Attention Fusion Network for Remote Photoplethysmography Measurement [50.524262997433546]
ハーモグラフィーは、心臓の脈動によって引き起こされる顔の皮膚の色変化を分析し、心拍数やその他の重要な兆候を測定することができる。
現在の手法は主に生のビデオからエンド・ツー・エンドのモデリング、または微妙な心拍マップ(ST)表現に基づいている。
本稿では,ビデオフレームとST表現を併用したデュアルインプットディープラーニングフレームワークであるPhysMapXtを提案する。
論文 参考訳(メタデータ) (2026-03-20T08:37:02Z) - Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation [82.63833405368159]
ツール操作の一般化には、セマンティックプランニングと正確な物理的制御の両方が必要である。
本研究では,密接な接触推定を伴う視覚的意味論を融合した3次元表現であるセマンティック・コンタクト・フィールド(SCFields)を提案する。
スクレイピング、クレヨン描画、剥離の実験は、堅牢なカテゴリレベルの一般化を示している。
論文 参考訳(メタデータ) (2026-02-14T16:05:08Z) - Exploring Physical Intelligence Emergence via Omni-Modal Architecture and Physical Data Engine [50.62040226184694]
我々はOmniFysicsについて紹介する。OmniFysicsは、画像、音声、ビデオ、テキスト間の理解を統一するコンパクトなオムニモーダルモデルである。
明示的な物理知識を注入するために、2つのコンポーネントからなる物理データエンジンを構築します。
実験は、標準マルチモーダルベンチマークにおける競合性能を示し、物理指向評価の結果を改善した。
論文 参考訳(メタデータ) (2026-02-05T14:04:51Z) - SPORTS: Simultaneous Panoptic Odometry, Rendering, Tracking and Segmentation for Urban Scenes Understanding [0.0]
本稿では,全体像理解のための新しいフレームワーク SPORTS を提案する。
Video Panoptic (VPS)、Visual Odometry (VO)、Scene Renderingタスクを反復的で統一された視点に統合する。
我々の注意に基づく特徴融合は、計測、追跡、セグメンテーション、新しいビュータスクにおいて、既存の最先端の合成方法よりも優れています。
論文 参考訳(メタデータ) (2025-10-14T17:28:19Z) - Interleaving Reasoning for Better Text-to-Image Generation [83.69082794730664]
テキストベース思考と画像合成を交互に行うIRG(Interleaving Reasoning Generation)を提案する。
IRGを効果的に訓練するために,2つのサブゴールをターゲットにしたIRGL(Interleaving Reasoning Generation Learning)を提案する。
実験の結果、SoTAの性能はGenEval, WISE, TIIF, GenAI-Bench, OneIG-ENで5~10ポイント向上した。
論文 参考訳(メタデータ) (2025-09-08T17:56:23Z) - Surformer v1: Transformer-Based Surface Classification Using Tactile and Vision Features [1.124958340749622]
Surformer v1は、構造化された触覚特徴とResNet-50を介して抽出されたPCAによる視覚的埋め込みを用いて、表面分類のために設計されたトランスフォーマーベースのアーキテクチャである。
このモデルは、触覚固有のエンコーダとモーダルなアテンション層を統合し、視覚とタッチの間のリッチな相互作用を可能にする。
我々はSurformer v1とMultimodal CNNの両方を訓練し、特徴ベースと画像ベースのマルチモーダル学習が分類精度と計算効率に与える影響について検討した。
論文 参考訳(メタデータ) (2025-08-07T00:59:33Z) - PhysFormer: Facial Video-based Physiological Measurement with Temporal
Difference Transformer [55.936527926778695]
近年のディープラーニングアプローチは、時間的受容の限られた畳み込みニューラルネットワークを用いた微妙なrの手がかりのマイニングに重点を置いている。
本稿では,エンドツーエンドのビデオトランスをベースとしたアーキテクチャであるPhysFormerを提案する。
論文 参考訳(メタデータ) (2021-11-23T18:57:11Z) - Teaching Cameras to Feel: Estimating Tactile Physical Properties of
Surfaces From Images [4.666400601228301]
本稿では,視覚情報から触覚特性の集合を推定する課題を紹介する。
我々は400以上のマルチビュー画像列とそれに対応する触覚特性を持つ画像触覚データセットの1つを構築した。
対向目的と新規なビジュオ触覚関節分類損失からなるクロスモーダルフレームワークを開発した。
論文 参考訳(メタデータ) (2020-04-29T21:27:26Z) - Learning the sense of touch in simulation: a sim-to-real strategy for
vision-based tactile sensing [1.9981375888949469]
本稿では,3次元接触力分布の再構成を目的とした,視覚に基づく触覚センサについて述べる。
シミュレーションデータから完全に調整されたディープニューラルネットワークをトレーニングするための戦略が提案されている。
結果として得られる学習アーキテクチャは、さらなるトレーニングをすることなく、複数の触覚センサ間で直接転送可能であり、実際のデータに対して正確な予測が得られます。
論文 参考訳(メタデータ) (2020-03-05T14:17:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。