論文の概要: Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning
- arxiv url: http://arxiv.org/abs/2603.18495v1
- Date: Thu, 19 Mar 2026 05:04:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:05.963756
- Title: Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning
- Title(参考訳): ニューロシンボリックカウンターファクト推論によるクロスドメインデモ・トゥ・コード
- Authors: Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo,
- Abstract要約: 我々は、クロスドメイン適応問題として、ビデオ命令型ロボットプログラミングを定式化する。
NeSyCRは、ニューロシンボリックな反ファクト推論フレームワークである。
NeSyCRは最強のベースラインであるStatlerよりも31.14%改善した。
- 参考スコア(独自算出の注目度): 19.850681559877977
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in Vision-Language Models (VLMs) have enabled video-instructed robotic programming, allowing agents to interpret video demonstrations and generate executable control code. We formulate video-instructed robotic programming as a cross-domain adaptation problem, where perceptual and physical differences between demonstration and deployment induce procedural mismatches. However, current VLMs lack the procedural understanding needed to reformulate causal dependencies and achieve task-compatible behavior under such domain shifts. We introduce NeSyCR, a neurosymbolic counterfactual reasoning framework that enables verifiable adaptation of task procedures, providing a reliable synthesis of code policies. NeSyCR abstracts video demonstrations into symbolic trajectories that capture the underlying task procedure. Given deployment observations, it derives counterfactual states that reveal cross-domain incompatibilities. By exploring the symbolic state space with verifiable checks, NeSyCR proposes procedural revisions that restore compatibility with the demonstrated procedure. NeSyCR achieves a 31.14% improvement in task success over the strongest baseline Statler, showing robust cross-domain adaptation across both simulated and real-world manipulation tasks.
- Abstract(参考訳): VLM(Vision-Language Models)の最近の進歩により、ビデオインストラクトされたロボットプログラミングが可能となり、エージェントはビデオのデモンストレーションを解釈し、実行可能な制御コードを生成することができる。
我々は,ビデオ指導型ロボットプログラミングをクロスドメイン適応問題として定式化し,実演と展開の知覚的および物理的差異が手続き的ミスマッチを誘発する。
しかしながら、現在のVLMは、因果依存性を再構築し、そのようなドメインシフトの下でタスク互換の動作を達成するために必要な手続き的理解を欠いている。
我々はNeSyCRを紹介した。NeSyCRはニューロシンボリックな反ファクト推論フレームワークで、タスクプロシージャの検証を可能とし、コードポリシーの信頼性の高い合成を提供する。
NeSyCRは、ビデオのデモを、下層のタスク手順をキャプチャするシンボリックな軌跡に抽象化する。
デプロイメントの観察から、ドメイン間の非互換性を明らかにする反ファクト状態が導かれる。
検証可能なチェックでシンボル状態空間を探索することにより、NeSyCRは、実証された手順との互換性を回復する手続き的修正を提案する。
NeSyCRは最強のベースラインであるStatlerよりも31.14%のタスク成功を達成し、シミュレーションと実世界の操作の両方で堅牢なクロスドメイン適応を示している。
関連論文リスト
- \textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - Towards Reliable Code-as-Policies: A Neuro-Symbolic Framework for Embodied Task Planning [25.860785629018356]
本稿では,コード生成時の明示的なシンボル検証と対話的検証処理を組み込んだ,ニューロシンボリックなタスク計画フレームワークを提案する。
我々はRLBenchと動的に部分的に観測可能なシナリオにわたる実環境設定のフレームワークを評価した。
論文 参考訳(メタデータ) (2025-10-24T10:01:08Z) - EgoVIS@CVPR: What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning [22.919192926764836]
状態変化記述を取り入れたプロシージャ対応ビデオ表現学習について検討する。
我々は、仮説化された失敗の結果をシミュレートする状態変化反事実を生成する。
本研究は,提案した状態変化記述の有効性と,その有効性を実証するものである。
論文 参考訳(メタデータ) (2025-05-30T13:39:29Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - R-AIF: Solving Sparse-Reward Robotic Tasks from Pixels with Active Inference and World Models [50.19174067263255]
我々は、エージェントがスパース・リワード、継続的なアクション、ゴールベースのロボット制御POMDP環境においてエクササイズするのを助けるために、事前の選好学習手法と自己修正スケジュールを導入する。
我々のエージェントは、累積報酬、相対安定性、成功率の観点から、最先端モデルよりも優れたパフォーマンスを提供する。
論文 参考訳(メタデータ) (2024-09-21T18:32:44Z) - Learning from Demonstrations using Signal Temporal Logic [1.2182193687133713]
効果的なロボット制御ポリシーを得るための新しいパラダイムである。
我々はSignal Temporal Logicを使ってデモの質を評価しランク付けする。
提案手法は,最先端の最大因果エントロピー逆強化学習よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-02-15T18:28:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。