論文の概要: KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis
- arxiv url: http://arxiv.org/abs/2604.07034v1
- Date: Wed, 08 Apr 2026 12:49:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.53335
- Title: KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis
- Title(参考訳): KITE:VLMに基づくロボット故障解析のためのキーフレーム付きトークン化エビデンス
- Authors: Mehdi Hosseinzadeh, King Hang Wong, Feras Dayoub,
- Abstract要約: KITEは、長いロボットの動画を視覚誘導モデル(VLM)のコンパクトで解釈可能なトークン化エビデンスに変換する、トレーニング不要のレイアウト付きフロントエンドである。
KITEは、各軌跡を、開語彙検出と、鳥眼ビュー(EVB)表現とのペアで、小さな動きスキーマの集合に蒸留する。
これらの視覚的手がかりは、ロボットの注目とシーンコンテキストトークンを統一されたプロンプトにシリアライズされ、同じフロントエンドが障害検出、識別、ローカライゼーション、説明、修正をサポートする。
- 参考スコア(独自算出の注目度): 5.437966695589128
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present KITE, a training-free, keyframe-anchored, layout-grounded front-end that converts long robot-execution videos into compact, interpretable tokenized evidence for vision-language models (VLMs). KITE distills each trajectory into a small set of motion-salient keyframes with open-vocabulary detections and pairs each keyframe with a schematic bird's-eye-view (BEV) representation that encodes relative object layout, axes, timestamps, and detection confidence. These visual cues are serialized with robot-profile and scene-context tokens into a unified prompt, allowing the same front-end to support failure detection, identification, localization, explanation, and correction with an off-the-shelf VLM. On the RoboFAC benchmark, KITE with Qwen2.5-VL substantially improves over vanilla Qwen2.5-VL in the training-free setting, with especially large gains on simulation failure detection, identification, and localization, while remaining competitive with a RoboFAC-tuned baseline. A small QLoRA fine-tune further improves explanation and correction quality. We also report qualitative results on real dual-arm robots, demonstrating the practical applicability of KITE as a structured and interpretable front-end for robot failure analysis. Code and models are released on our project page: https://m80hz.github.io/kite/
- Abstract(参考訳): KITEは、長いロボットの動画を視覚言語モデル(VLM)のコンパクトで解釈可能なトークン化エビデンスに変換する。
KITEは、各軌跡をオープンボキャブラリ検出(英語版)と組み合わせて、相対的なオブジェクトレイアウト、軸、タイムスタンプ、および検出信頼度を符号化するスキーマ付きバードアイビュー(英語版) (BEV) 表現と組み合わせて、小さなモーションサリアントなキーフレームに蒸留する。
これらの視覚的手がかりは、ロボットの注目とシーンコンテキストトークンを統一されたプロンプトにシリアライズされ、同じフロントエンドが、オフザシェルフVLMによる障害検出、識別、ローカライゼーション、説明、修正をサポートする。
RoboFACベンチマークでは、Qwen2.5-VLを使用したKITEは、トレーニングフリー環境でのバニラQwen2.5-VLよりも大幅に改善され、特にシミュレーション失敗の検出、識別、ローカライゼーションに大きく貢献する一方で、RoboFACで調整されたベースラインと競合する。
小さなQLoRAファインチューンは、説明と修正品質をさらに改善する。
また、実際のデュアルアームロボットについて定性的な結果を報告し、KITEをロボット故障解析のための構造的かつ解釈可能なフロントエンドとして実用的に適用可能であることを実証した。
コードとモデルは、プロジェクトのページでリリースされています。
関連論文リスト
- VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models [80.1055544841585]
ビジョン・ランゲージ・アクションモデルは通常、視覚観察と言語指示を直接ロボット制御信号にマッピングする。
本稿では,高レベルの推論と低レベルの実行を,構造化された視覚的プロンプトインタフェースを介して分離する,デュアルシステムフレームワークであるVP-VLAを提案する。
Robocasa-GR1-TabletopベンチマークとSimplerEnvシミュレーションの実験は、VP-VLAが成功率を5%と8.3%改善することを示した。
論文 参考訳(メタデータ) (2026-03-23T14:08:58Z) - Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models [53.20969621498248]
本稿では,多種多様な計画および実行障害を生成するために,軌道を手続き的に乱す自動ロボット故障合成手法を提案する。
RLBench-Fail, BridgeDataV2-Fail, UR5-Failの3つの新しい故障検出ベンチマークを構築した。
次に、詳細な障害推論と検出のためのマルチビューイメージを備えたVLMであるGuardianをトレーニングします。
論文 参考訳(メタデータ) (2025-12-01T17:57:27Z) - Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models [25.45513133247862]
VLA(Vision-Language-Action)モデルは、ロボット学習において革命的な進歩を遂げている。
この進歩にもかかわらず、その敵意の強固さは未解明のままである。
本稿では,VLAモデルに対する敵パッチ攻撃と対応する防御戦略の両方を提案する。
論文 参考訳(メタデータ) (2025-10-15T07:42:44Z) - ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations [33.74746234704817]
ビデオオブジェクトセグメンテーション(RVOS)は、テキスト記述に基づいて、ビデオ全体を通してターゲットオブジェクトをセグメンテーションすることを目的としている。
これは、深い視覚レベルの理解、ピクセルレベルの高密度な予測、時間的推論を含むため、難しい。
基礎的な視覚基盤モデルから領域レベルの視覚テキストアライメントを継承するbfReferDINO RVOSを提案する。
論文 参考訳(メタデータ) (2025-01-24T16:24:15Z) - Efficient Video Action Detection with Token Dropout and Context
Refinement [67.10895416008911]
効率的なビデオアクション検出(ViT)のためのエンドツーエンドフレームワークを提案する。
ビデオクリップでは、他のフレームからのアクターの動きに関連するトークンを保存しながら、その視点でトークンを維持する。
第二に、残ったトークンを利用してシーンコンテキストを洗練し、アクターのアイデンティティをよりよく認識する。
論文 参考訳(メタデータ) (2023-04-17T17:21:21Z) - An Empirical Study of Training End-to-End Vision-and-Language
Transformers [50.23532518166621]
我々はMETER(textbfMultimodal textbfEnd-to-end textbfTransformtextbfER)を提案する。
具体的には、視覚エンコーダ(例えば、CLIP-ViT、Swin変換器)、テキストエンコーダ(例えば、RoBERTa、DeBERTa)、マルチモーダルフュージョン(例えば、マージアテンション対共振器)である。
論文 参考訳(メタデータ) (2021-11-03T17:55:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。