論文の概要: SIR: Structured Image Representations for Explainable Robot Learning
- arxiv url: http://arxiv.org/abs/2606.30101v1
- Date: Mon, 29 Jun 2026 10:37:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.180411
- Title: SIR: Structured Image Representations for Explainable Robot Learning
- Title(参考訳): SIR:説明可能なロボット学習のための構造化画像表現
- Authors: Paul Mattes, Jan Schwab, Jens Bosch, Nils Blank, Maximilian Xiling Li, Minh-Trung Tang, Moritz Haberland, Rudolf Lioutikov,
- Abstract要約: 本研究では,ロボットポリシー学習の中間表現として,シーングラフ(SG)を利用した構造化画像表現(SIR)を導入する。
モジュールは、このグラフをエンドツーエンドに分割し、アクション生成モデルに渡されるタスク関連サブグラフを作成することを学習する。
RoboCasaの評価によると、スパースグラフのポリシーは画像ベースのベースラインを平均19.5%、成功率14.81%で上回っている。
- 参考スコア(独自算出の注目度): 5.015076806206676
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing robot policies based on learned visual embeddings lack explicit structure and are sensitive to visual distractions. Thus, the representations that drive their behaviour are often opaque, making their decision-making process difficult to interpret. To address this, we introduce Structured Image Representations (SIR), a method that leverages Scene Graphs (SGs) as an intermediate representation for robot policy learning. Our approach first constructs a fully connected graph, using image-derived features as initial node representations. Then, a module learns to sparsify this graph end-to-end, creating a task-relevant sub-graph that is passed to the action generation model. This process makes our model intrinsically explainable. Evaluations on RoboCasa show that our sparse graph policies outperform image-based baselines on average with 19.5% vs 14.81% success rate. Most importantly, we show that the learned sparse graphs are a powerful tool for model analysis. By analysing when the model's sub-graph deviates from human expectation, such as by including distractor nodes or omitting key objects, we successfully uncover dataset biases, including spurious correlations and positional biases. https://github.com/intuitive-robots/SIR_Model
- Abstract(参考訳): 学習された視覚埋め込みに基づく既存のロボットポリシーは、明示的な構造を欠き、視覚的邪魔に敏感である。
したがって、行動を促進する表現はしばしば不透明であり、意思決定プロセスの解釈が困難になる。
そこで本研究では,ロボットポリシー学習の中間表現として,シーングラフ(SG)を利用した構造化画像表現(SIR)を導入する。
提案手法はまず,画像から得られる特徴を初期ノード表現として利用して,完全に連結されたグラフを構築する。
そして、モジュールは、このグラフをエンドツーエンドに分割し、アクション生成モデルに渡されるタスク関連サブグラフを作成することを学習する。
このプロセスは、本質的な説明を可能にします。
RoboCasaの評価によると、スパースグラフのポリシーは画像ベースのベースラインを平均19.5%、成功率14.81%で上回っている。
最も重要なことは、学習されたスパースグラフがモデル解析の強力なツールであることである。
モデルのサブグラフが,障害ノードやキーオブジェクトの省略などの人間の期待から逸脱した場合には,素早い相関や位置バイアスを含むデータセットバイアスを明らかにすることに成功した。
https://github.com/intuitive-robots/SIR_Model
関連論文リスト
- Explainable Graph Representation Learning via Graph Pattern Analysis [33.539251667469294]
本稿では,グラフパターン解析によるグラフ表現の学習と説明のためのフレームワークを提案する。
パターン解析を用いて実世界のデータに対するグラフ表現の学習と説明方法を示す。
論文 参考訳(メタデータ) (2025-12-04T07:25:01Z) - An Automatic Graph Construction Framework based on Large Language Models for Recommendation [49.51799417575638]
本稿では,大規模言語モデルに基づく自動グラフ構築フレームワークであるAutoGraphを紹介する。
LLMはユーザ好みとアイテムの知識を推論し、セマンティックベクターとして符号化する。
潜在因子は、ユーザ/イテムノードをリンクする余分なノードとして組み込まれ、結果として、深いグローバルビューセマンティクスを持つグラフとなる。
論文 参考訳(メタデータ) (2024-12-24T07:51:29Z) - Towards Graph Foundation Models: Learning Generalities Across Graphs via Task-Trees [50.78679002846741]
タスクツリーを用いたグラフのクロスタスク一般化のための新しい手法を提案する。
本稿では,グラフニューラルネットワーク(GNN)を多種多様なタスクツリー上で事前学習することにより,伝達可能な知識を誘導することを示す。
これにより、最小限の微調整で下流タスクに効率的に適応できる。
論文 参考訳(メタデータ) (2024-12-21T02:07:43Z) - Self-Pro: A Self-Prompt and Tuning Framework for Graph Neural Networks [10.794305560114903]
Self-Promptは、モデルとデータ自体に基づいたグラフのプロンプトフレームワークである。
非対称なグラフコントラスト学習を導入し、不均質に対処し、プリテキストと下流タスクの目的を整合させる。
11のベンチマークデータセットに対する広範な実験を行い、その優位性を実証する。
論文 参考訳(メタデータ) (2023-10-16T12:58:04Z) - Probing Graph Representations [77.7361299039905]
グラフ表現でキャプチャされた意味のある情報の量を定量化するために、探索フレームワークを使用します。
本研究は, グラフモデルにおける帰納的バイアスを理解するための探索の可能性を示すものである。
グラフベースモデルを評価する上で有用な診断ツールとして,探索を提唱する。
論文 参考訳(メタデータ) (2023-03-07T14:58:18Z) - Detecting Objects with Context-Likelihood Graphs and Graph Refinement [45.70356990655389]
本研究の目的は,オブジェクトと関係を別々に学習する既存の手法とは対照的に,オブジェクトの関係分布を共同で学習することである。
本稿では,オブジェクト間関係と初期クラス予測から画像のグラフィカルな表現を生成する新しい手法を提案する。
次に,エネルギーに基づくモデリング手法を用いて接合部を学習し,与えられた画像に対して文脈類似グラフを反復的に改良する。
論文 参考訳(メタデータ) (2022-12-23T15:27:21Z) - Temporal Graph Network Embedding with Causal Anonymous Walks
Representations [54.05212871508062]
本稿では,時間グラフネットワークに基づく動的ネットワーク表現学習のための新しいアプローチを提案する。
評価のために、時間的ネットワーク埋め込みの評価のためのベンチマークパイプラインを提供する。
欧州の大手銀行が提供した実世界のダウンストリームグラフ機械学習タスクにおいて、我々のモデルの適用性と優れた性能を示す。
論文 参考訳(メタデータ) (2021-08-19T15:39:52Z) - Group-Wise Semantic Mining for Weakly Supervised Semantic Segmentation [49.90178055521207]
この研究は、画像レベルのアノテーションとピクセルレベルのセグメンテーションのギャップを埋めることを目標に、弱い監督されたセマンティックセグメンテーション(WSSS)に対処する。
画像群における意味的依存関係を明示的にモデル化し,より信頼性の高い擬似的基盤構造を推定する,新たなグループ学習タスクとしてWSSSを定式化する。
特に、入力画像がグラフノードとして表現されるグループ単位のセマンティックマイニングのためのグラフニューラルネットワーク(GNN)を考案する。
論文 参考訳(メタデータ) (2020-12-09T12:40:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。