論文の概要: Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion
- arxiv url: http://arxiv.org/abs/2607.11004v1
- Date: Mon, 13 Jul 2026 02:04:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.300277
- Title: Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion
- Title(参考訳): テキストゴールとSim-to-Real Generalizationを用いたリアルタイム画像変換によるアフォーマンスベースマニピュレーション計画
- Authors: Solvi Arnold, Rin Karashima, Tadashi Adachi, Takafumi Mochizuki, Kimitoshi Yamazaki,
- Abstract要約: 本稿では,アベイランス認識と行動効果予測に基づく操作計画システムを提案する。
このシステムでは、視覚的形態で将来を予測し、予測された結果と実行時に設定されたテキストベースの目標とを一致させて、候補計画を評価する。
さらに、様々な形状や視覚的外観のオブジェクトを一貫した視覚的外観で現実世界の状態を翻訳するための画像変換モジュールにより、システムをさらに拡張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a manipulation planning system based on affordance recognition and action effect prediction. The system reasons through possible futures in visual form, and evaluates candidate plans by agreement of predicted outcomes with text-based goals set at run-time, using a multi-modal goal-matching module. Positions of objects named in the goal text are tracked through predictions even when occluded, making it possible to generate action plans even when objects become occluded, or when their initial descriptors cease to identify them in future states. We further expand the system with an image conversion module for translating real-world state images with objects of varied shapes and visual appearances into a consistent visual appearance, to facilitate manipulation planning in a physical robot setup. We evaluate performance of the system's modules in isolation and demonstrate the integrated system's manipulation planning capabilities on a set of challenging tasks in both simulation and on hardware.
- Abstract(参考訳): 本稿では,アベイランス認識と行動効果予測に基づく操作計画システムを提案する。
このシステムでは,視覚的形態の将来の可能性を考慮し,マルチモーダルな目標マッチングモジュールを用いて,実行時に設定したテキストベースの目標と予測された結果とを一致させて,候補計画を評価する。
目標テキストに名前付けられたオブジェクトの位置は、オブジェクトが隠されたときや、初期記述者が将来の状態においてそれらを特定するのをやめたときでもアクションプランを生成することができるように、予測によって追跡される。
さらに、実際の状態画像に様々な形状や外観のオブジェクトを一貫した視覚的外観に変換するための画像変換モジュールを用いてシステムを拡張し、物理的なロボット設定での操作計画を容易にする。
本研究では,システムモジュールの性能を独立に評価し,シミュレーションおよびハードウェア上での課題に対して,統合システムの操作計画能力を実証する。
関連論文リスト
- Joint Discovery of Object and Action Symbols through Effect Prediction for Robotic Manipulation Planning [1.4701783773624093]
本稿では,ハイレベルな操作プリミティブとオブジェクトカテゴリを共同で発見するモデルを提案する。
我々は、予測効果軌道の中間ステップを用いて、部分的な動作実行を可能にする離散的な計画手法を利用する。
我々はテーブルトップ再配置および積み重ね作業の実験を行い、我々の効果駆動型計画手法が最先端の手法と視覚に基づく代替案の両方より優れていることを確認した。
論文 参考訳(メタデータ) (2026-06-22T11:58:11Z) - Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance [108.46436073194546]
効果的なプランニングは、ローカルで、視覚的に基礎があり、内部で生成され、アクションと直接整合するべきである、と私たちは主張する。
本稿では,タスク条件付きアベイランスをVLAモデル内で明示的な視覚的計画インターフェースとして内包する統合フレームワークであるAfford-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-22T20:43:47Z) - SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution [61.612676324369595]
画像編集モデルがロボット操作のための疎視世界モデルとして機能するかどうかを考察する。
本稿では,一括予測型視覚計画フレームワークSWEETを提案する。
DROIDとRoboMimicの実験では、SWEETは見知らぬシーンの予測を改善している。
論文 参考訳(メタデータ) (2026-05-19T03:54:46Z) - Do-Undo: Generating and Reversing Physical Actions in Vision-Language Models [57.71440995598757]
我々は,視覚言語モデルにおける重要なギャップに対処するために,Do-Undoタスクとベンチマークを導入する。
Do-Undoは、物理的な行動の結果をシミュレートし、それを正確に反転させるモデルを必要とし、視覚の世界における真の原因と効果を反映している。
論文 参考訳(メタデータ) (2025-12-15T18:03:42Z) - Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features [59.892436892964376]
本稿では,視覚に基づく制御ポリシを用いて,ロバストな閉ループ性能を実現するために必要な最小限のデータ要件とアーキテクチャ適応について検討する。
この知見はFlex (Fly lexically) で合成され, 凍結パッチワイド特徴抽出器として, 事前学習された視覚言語モデル (VLM) を用いたフレームワークである。
本研究では,本手法の有効性を,行動クローンによる訓練を実世界のシーンに応用した,四重項フライ・トゥ・ターゲットタスクに適用した。
論文 参考訳(メタデータ) (2024-10-16T19:59:31Z) - Pixel State Value Network for Combined Prediction and Planning in
Interactive Environments [9.117828575880303]
本研究は,予測と計画を組み合わせた深層学習手法を提案する。
U-Netアーキテクチャを持つ条件付きGANは、2つの高解像度画像シーケンスを予測するために訓練される。
結果は、対立する目的の中で車線の変化のような複雑な状況において直感的な行動を示す。
論文 参考訳(メタデータ) (2023-10-11T17:57:13Z) - Long-Horizon Planning and Execution with Functional Object-Oriented
Networks [79.94575713911189]
タスク計画と実行のためのFOONとしてオブジェクトレベルの知識を活用するというアイデアを紹介します。
提案手法では,FOONをPDDLに自動変換し,市販のプランナ,アクションコンテキスト,ロボットスキルを活用する。
我々はCoppeliaSimの長期タスクに対するアプローチを実証し、学習されたアクションコンテキストを、これまで見たことのないシナリオにどのように拡張できるかを示す。
論文 参考訳(メタデータ) (2022-07-12T19:29:35Z) - Long-Horizon Manipulation of Unknown Objects via Task and Motion
Planning with Estimated Affordances [26.082034134908785]
操作可能なオブジェクトの集合に関する事前知識がなくても,タスク・アンド・モーション・プランナが知的行動の計画に利用できることを示す。
この戦略により、単一のシステムが様々な実世界のマルチステップ操作タスクを実行できることを実証する。
論文 参考訳(メタデータ) (2021-08-09T16:13:47Z) - Latent Space Roadmap for Visual Action Planning of Deformable and Rigid
Object Manipulation [74.88956115580388]
プランニングは、イメージを埋め込んだ低次元の潜在状態空間で行われる。
我々のフレームワークは2つの主要なコンポーネントで構成されており、画像のシーケンスとして視覚的な計画を生成するビジュアル・フォレスト・モジュール(VFM)と、それら間のアクションを予測するアクション・プロポーザル・ネットワーク(APN)である。
論文 参考訳(メタデータ) (2020-03-19T18:43:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。