論文の概要: CT-SAFR: Safe and Interpretable Chain-of-Thought Reasoning for Autonomous Robots: A Multi-Layered Verification Framework for Trustworthy AI-Driven Robotic Decision Making
- arxiv url: http://arxiv.org/abs/2609.09692v1
- Date: Wed, 09 Sep 2026 04:15:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.897079
- Title: CT-SAFR: Safe and Interpretable Chain-of-Thought Reasoning for Autonomous Robots: A Multi-Layered Verification Framework for Trustworthy AI-Driven Robotic Decision Making
- Title(参考訳): CT-SAFR:自律ロボットの安全かつ解釈可能な連鎖推論:信頼できるAI駆動型ロボット決定のための多層検証フレームワーク
- Abstract要約: CoT(Chain-of-Thought)により、LCMは明示的でステップバイステップの推論を実行し、高度な自律ロボットの機会を生み出すことができる。
最近の研究では、推論モデルが実際の決定過程を言葉化しているのはわずか25~39%であり、複雑なタスクでは44%が劣化している。
本稿では,500ms以下のレイテンシで94.2%の幻覚検出を実現する多層検証フレームワークであるCT-SAFRを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-Thought (CoT) prompting enables LLMs to perform explicit, step-by-step reasoning, creating opportunities for sophisticated autonomous robots. However, recent research reveals that reasoning models verbalize their actual decision processes only 25-39% of the time, with faithfulness degrading 44% on complex tasks. This paper presents CT-SAFR (Chain-of-Thought Safety and Faithfulness for Robotics), a multi-layered verification framework achieving 94.2% hallucination detection (n = 500, 95% CI: 91.8-95.9%) with sub-500ms latency. Through a warehouse robot case study, this work demonstrates 87% reduction in unsafe reasoning outputs (p < 0.001) and provides recommendations for responsible deployment of reasoning-capable autonomous robots.
- Abstract(参考訳): CoT(Chain-of-Thought)により、LCMは明示的でステップバイステップの推論を実行し、高度な自律ロボットの機会を生み出すことができる。
しかし、最近の研究では、推論モデルが実際の決定過程を言葉で表すのは25~39%に過ぎず、忠実度は複雑なタスクで44%低下していることが明らかになっている。
本稿では,500ms以下の遅延を伴う幻覚検出(n = 500, 95% CI: 91.8-95.9%)を実現する多層検証フレームワークであるCT-SAFR(Chain-of-Thought Safety and Faithfulness for Robotics)を提案する。
倉庫のロボットケーススタディを通じて、この研究は、安全でない推論出力(p < 0.001)の87%の削減を示し、推論可能な自律ロボットの責任ある展開を推奨している。
関連論文リスト
- Bridging Language and Physics: Automated Design of Continuum Robots with Large Language Models [44.55124556245543]
LLMデザイナのための構造化フィードバックにシミュレータオブザーバ物理状態を変換することで閉ループを確立する多層フレームワーク AID-SR を提案する。
我々は,手を伸ばし,つかみ,移動し,操作する14のタスクのベンチマークにおいて,腱駆動型連続ロボットに対するアプローチを評価した。
AID-SRの3つの設計されたロボットを製作し、実世界でそのタスクを完了させた。
論文 参考訳(メタデータ) (2026-09-08T04:02:59Z) - Regret Dominates Surprise: Design-Time Requirements Engineering for Agentic-AI Safety [4.5810763763063225]
安全自律運転のための新しいレグレト・ドミナンス機構(MS-RGR)
MS-RGRは、ほぼゼロのサイレント障害を検出し、センサーのみのベースラインよりも17.5倍早くリスクを検出する。
MS-RGRはモデルレベルの安全訓練の代用ではなく、増幅する。
論文 参考訳(メタデータ) (2026-09-04T20:01:33Z) - Towards Trustworthy Autonomous Robots: An Explainable AI-Based Decision Framework [0.0]
TRACE(Transparent Reasoning Architecture for Credible Execution)は、すべての自律的なアクションをセンサエビデンスに遡ることができるようにするための決定フレームワークである。
TRACEはモデルに依存しないが、決定レベルの監査性を維持しながら学習ベースの知覚モジュールを統合するように設計されている。
筆者らは,3つの客観的指標を用いて,エビデンストレーサビリティ(センサ間リンク),決定再構成性(ポストホック解析能力),時間連続性(聴覚路完全性)の評価を行った。
論文 参考訳(メタデータ) (2026-09-02T17:44:25Z) - Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy [0.0]
高度なAIシステムの開発は、実行可能なアクション計画モデルの提案を検証するのではなく、実行に重点を置いている。
本稿では,行動許容度を評価するために,計画と実行の間にLCMによる検証層を提案する。
対人攻撃の受け入れ/エスカレート/削除のカテゴリで約85%の精度を達成し、タスクの受け入れと拒否の間に無視可能な誤りと、エスカレート境界に主に現れるエラーを発生させる。
論文 参考訳(メタデータ) (2026-08-10T17:15:55Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration [175.74514061083195]
提案するAutoResearchClawは,5つのメカニズムに基づいて構築されたマルチエージェント自律型研究パイプラインである。
25トピックの実験ステージベンチマークであるARC-Benchでは、AutoResearchClawがAI Scientist v2を54.7%上回っている。
論文 参考訳(メタデータ) (2026-05-19T15:49:51Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics [55.05920313034645]
本稿では,ロボット制御に特化して具体的推論を強化するため,強化学習を活用した新しいフレームワークであるRobot-R1を紹介する。
DeepSeek-R1学習アプローチにインスパイアされたRobot-R1は、推論に基づく応答をサンプリングし、より正確な予測につながるものを強化する。
実験の結果,ロボットR1で訓練したモデルは,具体的推論タスクにおいて,SFT法よりも優れていた。
論文 参考訳(メタデータ) (2025-05-29T16:41:12Z) - ABNet: Attention BarrierNet for Safe and Scalable Robot Learning [58.4951884593569]
バリアベースの手法は、安全なロボット学習における主要なアプローチの1つである。
本稿では,より大規模な基本安全モデルを段階的に構築するスケーラブルなAttention BarrierNet(ABNet)を提案する。
2次元ロボット障害物回避、安全なロボット操作、視覚に基づくエンドツーエンド自動運転におけるABNetの強みを実証する。
論文 参考訳(メタデータ) (2024-06-18T19:37:44Z) - Work-in-Progress: Crash Course: Can (Under Attack) Autonomous Driving Beat Human Drivers? [60.51287814584477]
本稿では,現在のAVの状況を調べることによって,自律運転における本質的なリスクを評価する。
AVの利点と、現実のシナリオにおける潜在的なセキュリティ課題との微妙なバランスを強調した、特定のクレームを開発する。
論文 参考訳(メタデータ) (2024-05-14T09:42:21Z) - COBRA-PPM: A Causal Bayesian Reasoning Architecture Using Probabilistic Programming for Robot Manipulation Under Uncertainty [5.47019032771784]
我々は、因果ベイズネットワークと確率的プログラミングを組み合わせた新しい因果ベイズ推論アーキテクチャであるCOBRA-PPMを導入し、不確実性の下でロボット操作の介入推論を行う。
ブロック積み重ね作業における高忠実度実験により,高い精度で操作結果を予測する(Pred Acc: 88.6%)とともに,94.2%のタスク成功率でグリージーな次善動作選択を行う。
論文 参考訳(メタデータ) (2024-03-21T15:36:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。