論文の概要: Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2603.12717v1
- Date: Fri, 13 Mar 2026 07:02:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-16 17:38:11.955064
- Title: Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation
- Title(参考訳): 思考の変化,行動の変化:VLAロボットマニピュレーションにおけるチェーン・オブ・ソート・脆弱性の探索
- Abstract要約: 最近のVision-Language-Action(VLA)モデルは、モーターコマンドを復号する前に自然言語プランを生成するために、チェーン・オブ・ソート(CoT)推論を採用する傾向にある。
我々は、この中間計画のどの特性が実際にアクションデコーダに依存しているのかを問う。
我々は,3つの攻撃層(ブラインドノイズ,メカニカルセマンティック,LLM適応)に分類した7つのテキスト破損の分類を設計し,40のテーブルトップ操作タスクにわたる最先端の推論VLAに適用する。
- 参考スコア(独自算出の注目度): 27.2709460237741
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent Vision-Language-Action (VLA) models increasingly adopt chain-of-thought (CoT) reasoning, generating a natural-language plan before decoding motor commands. This internal text channel between the reasoning module and the action decoder has received no adversarial scrutiny. We ask: which properties of this intermediate plan does the action decoder actually rely on, and can targeted corruption of the reasoning trace alone -- with all inputs left intact -- degrade a robot's physical task performance? We design a taxonomy of seven text corruptions organized into three attacker tiers (blind noise, mechanical-semantic, and LLM-adaptive) and apply them to a state-of-the-art reasoning VLA across 40 LIBERO tabletop manipulation tasks. Our results reveal a striking asymmetry: substituting object names in the reasoning trace reduces overall success rate by 8.3~percentage points (pp) -- reaching $-$19.3~pp on goal-conditioned tasks and $-$45~pp on individual tasks -- whereas sentence reordering, spatial-direction reversal, token noise, and even a 70B-parameter LLM crafting plausible-but-wrong plans all have negligible impact (within $\pm$4~pp). This asymmetry indicates that the action decoder depends on entity-reference integrity rather than reasoning quality or sequential structure. Notably, a sophisticated LLM-based attacker underperforms simple mechanical object-name substitution, because preserving plausibility inadvertently retains the entity-grounding structure the decoder needs. A cross-architecture control using a non-reasoning VLA confirms the vulnerability is exclusive to reasoning-augmented models, while instruction-level attacks degrade both architectures -- establishing that the internal reasoning trace is a distinct and stealthy threat vector invisible to input-validation defenses.
- Abstract(参考訳): 最近のVision-Language-Action(VLA)モデルは、モーターコマンドを復号する前に自然言語プランを生成するために、チェーン・オブ・シンク(CoT)推論を採用する傾向にある。
推論モジュールとアクションデコーダとの間の内部テキストチャネルは、敵対的な精査を受けていない。
この中間計画の特徴は、アクションデコーダが実際に依存しているか、そして、すべての入力をそのままにして、推論トレースのみを標的にすることで、ロボットの物理的タスクパフォーマンスを低下させることができるのか?
我々は,3つの攻撃層(ブラインドノイズ,メカニカルセマンティック,LLM適応)に分類した7つのテキスト汚職の分類を設計し,40 LIBERO テーブルトップ操作タスクにおける最先端の推論 VLA に適用する。
目的条件付きタスクで19.3〜ppドル、個別タスクで45〜ppドルに達するのに対して、文の並べ替え、空間方向逆転、トークンノイズ、さらには70BパラメーターのLCMによるプラウチブルブロングプランは、すべて無視できる($\pm$4〜pp)。
この非対称性は、アクションデコーダが、品質やシーケンシャルな構造を推論するよりも、エンティティ参照整合性に依存することを示している。
特に、高度なLLMベースの攻撃者は、デコーダが必要とするエンティティグラウンド構造を不注意に保持するため、単純な機械的オブジェクト名置換を過小評価する。
非推論VLAを用いたクロスアーキテクチャ制御では、脆弱性は推論強化モデルに限られていることが確認され、命令レベルアタックは両方のアーキテクチャを分解する -- 内部の推論トレースが入力バリデーションディフェンスに見えない、独特でステルス的な脅威ベクターであることを確立している。
関連論文リスト
- Grounding SWE-Agent Decisions in Architecture-0 Design: Navigating Unknown Unknowns through Physical Mapping [4.754027236572029]
自律型ソフトウェアエンジニアリングエージェント(SWE-Agents)が未知の未知(UUs)をナビゲートする方法を検討する。
UUは、暗黙のエンジニアリング制約(Unknown Unknowns (UUs))に悩まされる、初期段階のシステム設計フェーズである。
物理層とバリデーション層を根絶するための物理マッピングガード(PMG)を提案する。
論文 参考訳(メタデータ) (2026-09-15T14:04:33Z) - TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes [65.10128145059127]
この研究は、Vision-Language-Action(VLA)モデルに対する新しいバックドア攻撃タスクであるConfigured Failure Trappingを導入している。
本稿では,高品質な目標軌道を合成するための効率的なデータエンジンと,構成欠陥の忠実度を測定するための自動スイートを提案する。
実験によると、TrapVLAは構成された障害モードをVLAモデルに効果的に注入し、クリーンなデータのパフォーマンスを保っている。
論文 参考訳(メタデータ) (2026-08-27T03:44:49Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair [44.80087038178069]
本稿では,デコーダのみのトランスフォーマーをネイティブに組み込んだトレーニングフレームワークであるTeleological Reasoning Infilling (TRI)を紹介する。
推測では、TRIは二重システムループ内の外科的修復モジュールとして動作する。
3つのベンチマークの実験では、TRIは全てのタスクで最先端のパフォーマンスを達成し、プロブレム当たりのトークン支出を31.2%削減した。
論文 参考訳(メタデータ) (2026-06-03T15:58:48Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches [16.543720979135397]
CoT(Chain-of-Thought)推論は、ロボット操作において強力な能力を示している。
我々は、CoT推論がターゲット制御ハイジャックのための新しい攻撃ベクトルを導入することを示す。
我々は, CoT-reasoning Vision-Language-Actionモデルに対する最初の対向攻撃フレームワークであるTRAPを提案する。
論文 参考訳(メタデータ) (2026-03-24T12:14:12Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing [16.419761149171215]
本稿では,大規模言語モデルを組み込んだ論理的基盤化フレームワークを提案する。
オブジェクト識別の時点では,対話状態は複数の並列世界へ複製される。
GPT-4o, Gemini-2.5-Flash, Qwen-3-235B を3つのインセンティブレベル(中性, 損失ベース, 存在)で評価した。
論文 参考訳(メタデータ) (2026-03-07T13:21:53Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension [51.76841625486355]
Referring Expression (REC) は、自然言語クエリに対応する画像領域をローカライズすることを目的としている。
最近のニューロシンボリックRECアプローチは、大規模言語モデル(LLM)と視覚言語モデル(VLM)を利用して構成推論を行う。
推論ステップ内に軽量な演算子レベルの検証器を組み込む,ニューロシンボリックなフレームワークであるVIROを紹介する。
論文 参考訳(メタデータ) (2026-01-19T07:21:19Z) - DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models [51.76664843721462]
DeepThinkVLAはVision-Language-Actionモデルのための新しいアーキテクチャである。
因果的注意を伴うシーケンシャルCoTを生成し、双方向の注意に切り替え、アクションベクトルを高速に復号する。
LIBEROベンチマークで97.0%の成功率を達成した。
論文 参考訳(メタデータ) (2025-10-31T05:26:16Z) - Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models [25.45513133247862]
VLA(Vision-Language-Action)モデルは、ロボット学習において革命的な進歩を遂げている。
この進歩にもかかわらず、その敵意の強固さは未解明のままである。
本稿では,VLAモデルに対する敵パッチ攻撃と対応する防御戦略の両方を提案する。
論文 参考訳(メタデータ) (2025-10-15T07:42:44Z) - Countermind: A Multi-Layered Security Architecture for Large Language Models [0.0]
本稿では,多層型セキュリティアーキテクチャであるCountermindを提案する。
アーキテクチャは、すべての入力を構造的に検証し変換するように設計された強化された周辺装置と、出力が発生する前にモデルのセマンティック処理経路を制約する内部ガバナンス機構を提案する。
論文 参考訳(メタデータ) (2025-10-13T18:41:18Z) - Chain-of-Code Collapse: Reasoning Failures in LLMs via Adversarial Prompting in Code Generation [0.3495246564946556]
大規模言語モデル(LLM)は複雑な推論を必要とするタスクにおいて顕著な成功を収めた。
これらのモデルは本当に理由があるのか、それとも浅い統計パターンを利用するだけなのか?
ここでは、意味論的に忠実だが逆向きに構造化された急激な摂動のスイートを導入することで、LCMの推論の堅牢性について検討する。
論文 参考訳(メタデータ) (2025-06-08T02:43:46Z) - ShadowCode: Towards (Automatic) External Prompt Injection Attack against Code LLMs [56.46702494338318]
本稿では,コード指向の大規模言語モデルに対する(自動)外部プロンプトインジェクションという,新たな攻撃パラダイムを紹介する。
コードシミュレーションに基づいて誘導摂動を自動生成する,シンプルで効果的な方法であるShadowCodeを提案する。
3つの人気のあるプログラミング言語にまたがる31の脅威ケースを発生させるため、13の異なる悪意のある目標に対して本手法を評価した。
論文 参考訳(メタデータ) (2024-07-12T10:59:32Z) - Advancing Generalized Transfer Attack with Initialization Derived Bilevel Optimization and Dynamic Sequence Truncation [49.480978190805125]
転送攻撃はブラックボックスアプリケーションに大きな関心を惹きつける。
既存の作業は、本質的に単一のレベルの目的 w.r.t. シュロゲートモデルを直接最適化する。
本稿では,上位レベル(UL)と下位レベル(LL)のサロゲート攻撃とのネスト関係を明示的に再構築する2レベル最適化手法を提案する。
論文 参考訳(メタデータ) (2024-06-04T07:45:27Z) - Alternating Objectives Generates Stronger PGD-Based Adversarial Attacks [78.2700757742992]
Projected Gradient Descent (PGD) は、そのような敵を生成するための最も効果的で概念的にシンプルなアルゴリズムの1つである。
この主張を合成データの例で実験的に検証し、提案手法を25の$ell_infty$-robustモデルと3つのデータセットで評価した。
私たちの最強の敵攻撃は、AutoAttackアンサンブルのすべてのホワイトボックスコンポーネントより優れています。
論文 参考訳(メタデータ) (2022-12-15T17:44:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。