論文の概要: SAGE: Safety-Aligned Gradient Enforcement for Human--Robot Collaboration
- arxiv url: http://arxiv.org/abs/2609.21130v1
- Date: Thu, 17 Sep 2026 22:30:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.790774
- Title: SAGE: Safety-Aligned Gradient Enforcement for Human--Robot Collaboration
- Title(参考訳): SAGE:人間-ロボット協調のための安全に配慮したグラディエント強化
- Abstract要約: ロボットの決定は解釈可能で監査可能であるべきであり、実行された行動は安全性の制約を満たす必要がある。
両ミスマッチに対処するため,安全対応型勾配法(SAGE)を提案する。
- 参考スコア(独自算出の注目度): 29.310843492767106
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-party human-robot collaboration poses a dual challenge: robot decisions should remain interpretable and auditable, while executed actions must satisfy safety constraints during physical interaction. Combining explainable decision-tree policies with control-barrier-function (CBF) filtering provides a promising architecture but creates two learning mismatches in multi-agent reinforcement learning. Safety projection changes the action applied to the environment, while the coupled proposal graph can misalign independently optimized actor updates with a team-level update. We present safety-aligned gradient enforcement (SAGE) to address both mismatches. Its shield-annealed internalization layer (SAIL) uses a differentiable finite-penalty proposal map while retaining the exact CBF quadratic program for execution, preserving constraint-normal sensitivity to internalize repeatedly active safety constraints. Team-averaged Lyapunov policy optimization (TALO) constructs a team-aware update reference and applies a Lyapunov half-space correction to regulate independent actor updates. Physical experiments with two humanoid robots and a human partner demonstrate deployment feasibility. Across nine simulation scenarios, SAGE achieves a 71.0% success rate with 0.5 collision steps per thousand environment steps. Ablations show that direct CBF filtering reduces collision frequency by 98.5% but decreases success from 67.3% to 59.3%. SAIL reduces proposal violation by 48.8% and proposal-execution correction by 85.2%, while TALO reduces the update-consistency gap by 50.8%.
- Abstract(参考訳): ロボットの決定は解釈可能で監査可能であるべきであり、一方、実行された行動は物理的相互作用の間、安全上の制約を満たす必要がある。
説明可能な決定木ポリシーと制御バリア機能(CBF)フィルタリングを組み合わせることで、有望なアーキテクチャを提供するが、マルチエージェント強化学習における2つの学習ミスマッチを生成する。
安全プロジェクションは、環境に適用されたアクションを変更し、結合された提案グラフは、チームレベルの更新で独立に最適化されたアクター更新を誤解させる可能性がある。
両ミスマッチに対処するため,安全対応型勾配法(SAGE)を提案する。
シールドアニール内部化層(SAIL)は、CBF二次プログラムを厳密に保持し、繰り返しアクティブな安全制約を内部化するための制約正規感度を保ちながら、微分可能な有限ペナルティ提案マップを使用する。
Team-averaged Lyapunov Policy Optimization (TALO)は、チーム対応の更新参照を構築し、独立したアクター更新を制御するためにLyapunov半空間補正を適用する。
2つのヒューマノイドロボットと1人のパートナーによる物理的実験は、配備の実現可能性を示す。
9つのシミュレーションシナリオで、SAGEは環境ステップあたり0.5の衝突ステップで71.0%の成功率を達成する。
アブレーションでは、直接CBFフィルタリングは衝突頻度を98.5%削減するが、67.3%から59.3%に低下する。
SAILは提案違反を48.8%減らし、提案実行修正を85.2%減らし、TALOは更新一貫性のギャップを50.8%減らした。
関連論文リスト
- Modality-Decoupled Federated Learning for Privacy-Preserving Embodied Intelligence in 6G [90.42669277637026]
第6世代(6G)無線ネットワークは、大規模なインボディードインテリジェンスのための重要な基盤を提供すると期待されている。
本稿では、6Gネットワークにおけるプライバシー保護型インテリジェンスのためのモダリティ分離FLフレームワークであるFedMVLAを提案する。
論文 参考訳(メタデータ) (2026-09-09T01:36:44Z) - EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - Robust and Personalized Federated Learning for Aircraft-Engine Prognostics under Benign and Adversarial Client Heterogeneity [0.4776836972093627]
FL(Federated Learning)は、航空機の運用者が生データを共有せずに、エンジンセンサーテレメトリから残留寿命(RUL)モデルを共同訓練することを可能にする。
本研究では, 正直な操作者が異なる操作条件や障害モードを観察する良性不均一性と, 妥協した操作者が有毒な更新を提出する敵対的不均一性という2つの相補的課題について検討した。
エンジンの劣化を隠蔽する物理的に動機付けられたセンサ値バックドアを含む,4つのアグリゲーション手法に対する5つの攻撃を評価した。
論文 参考訳(メタデータ) (2026-08-04T06:54:29Z) - HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging [5.264722105217776]
HetGPSは、学習したグラフリスクと物理アンコール補正を相乗化するためのグラフ制御フレームワークである。
電気自動車の充電では、パラメータ共有した異種グラフソフトアクター批判ポリシーでこのフィルタを結合する。
論文 参考訳(メタデータ) (2026-08-01T13:59:49Z) - Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats [76.98547580312116]
本稿では,分散モデル予測制御(MPC)と制御バリア関数(CBF)を組み合わせたハイブリッドフレームワークを提案する。
リアルタイムに安全を確保するため、分散CBFベースのフィルタを適用し、エージェント間回避を強制する。
論文 参考訳(メタデータ) (2026-07-22T16:37:05Z) - OptiLoop: Coordination-in-the-Loop Verification and Repair for LLM-Generated Optimization Agents [0.9543827270223156]
分散された決定問題は、複数の当事者が共有された決定を調整する必要がある。
大規模言語モデル(LLM)は、ローカル最適化エージェントを生成することで参加障壁を低くする有望な方法を提供する。
LLM生成最適化エージェントのコーディネーション・イン・ザ・ループ検証と修復を提案する。
論文 参考訳(メタデータ) (2026-05-26T19:49:41Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Adaptive Reinforcement and Model Predictive Control Switching for Safe Human-Robot Cooperative Navigation [10.614812216110673]
本稿では,近接制御と安全制約の同時実施による移動ロボットの人間誘導ナビゲーションの課題について論じる。
本稿では,ハイブリッド学習制御フレームワークであるAdaptive Reinforcement and Model Predictive Control Switching (ARMS)を紹介する。
乱雑な環境でARMSが82.5パーセントの成功率を達成することを示す。
論文 参考訳(メタデータ) (2026-01-23T12:02:18Z) - A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space [91.99501941169831]
GuardSpaceは、微調整全体を通して安全アライメントを維持するためのガードレールフレームワークである。
GSM8Kで微調整されたLlama-2-7B-Chatでは、ガードスペースは最先端のAsFTよりも優れている。
論文 参考訳(メタデータ) (2025-10-16T04:57:53Z) - Multimodal Safety Evaluation in Generative Agent Social Simulations [43.972551727499116]
エージェントを3次元で評価するための再現可能なシミュレーションフレームワークを提案する。
エージェントはしばしば、地域のリビジョンとグローバルな安全の整合に失敗し、安全でない計画の修正で55%の成功率にしか達していないことを示す。
特に、誤解を招く視覚と組み合わせると、安全でない行動の45%が受け入れられ、画像が過信される傾向が強かった。
論文 参考訳(メタデータ) (2025-10-09T02:42:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。