論文の概要: Bounded-Fidelity Sim-as-Demo-Stage: Mocap Handoff for Governance Benchmarks
- arxiv url: http://arxiv.org/abs/2610.00008v1
- Date: Thu, 09 Jul 2026 09:16:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.306274
- Title: Bounded-Fidelity Sim-as-Demo-Stage: Mocap Handoff for Governance Benchmarks
- Title(参考訳): 境界フィデリティ・シモン・アズ・デモステージ:モキャップ・ハンドオフによるガバナンスベンチマーク
- Abstract要約: 本研究では,明示的に括弧されたハンドオフエンベロープ内の接触物理を抑制するパターンを提案する。
このパターンにより、ベンチマークデザイナは、ほぼゼロのエンジニアリングコストで監査チェーン検証を行うことができる。
- 参考スコア(独自算出の注目度): 7.392721604463545
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sim-to-real research pursues physics fidelity as a primary objective: simulators are judged by how closely they reproduce real-world contact dynamics. For governance benchmarking of LLM-driven robots, where the simulator demonstrates that an admission/policy/contract/audit pipeline behaves correctly, contact fidelity at object handoffs (grasp, carry, place) becomes a liability: contact-force integration noise injects audit-chain divergence that is structurally unrelated to the governance property under test. We propose bounded-fidelity sim-as-demo-stage, a design pattern that suppresses contact physics within explicitly bracketed handoff envelopes while preserving full dynamics elsewhere. The construction uses MuJoCo's mocap-body primitive driven by a 220-line Python adapter that the governance bridge invokes via structured intents. We formalise audit-chain stability as byte-equality of the hashed event log across replays and identify two structural envelope properties that imply it. Across N=1000 replays per posture, the mocap variant produces one distinct audit-chain hash (1000/1000 byte-identical; Wilson 95% CI [0.997, 1.000]); the contact-force baseline produces 584 distinct hashes (993/1000 diverged; CI [0.987, 0.998]). A timestep sweep (1, 2, 5, 10 ms) shows the divergence is structural, not a tuning artefact: it stays at 0.985 at every timestep. Envelope-edge timing jitter (+/-10 simulation steps, 1,400 replays) produces 0 divergence, and audit chains remain byte-equal across K in {1, 2, 3} sequentially handed-off objects (1,500 replays) with sub-linear per-pick-and-place overhead. The pattern gives benchmark designers audit-chain reproducibility at near-zero engineering cost; we also map where it is harmful (sim-to-real validation, policy training, contact-rich tasks) so it is not mis-deployed.
- Abstract(参考訳): Sim-to-real Researchは物理学の忠実性を第一の目的として追求している。
LLM駆動型ロボットのガバナンスベンチマークでは、インプット/ポリティ/契約/監査パイプラインが正しく振る舞うことをシミュレータが示すため、オブジェクトハンドオフ(グラスプ、キャリー、場所)における接触の忠実さは責任となる: 接触力統合ノイズは、テスト中のガバナンス特性と構造的に無関係な監査チェーンの分散を注入する。
本研究では, 接触物理を非定常的に抑制する設計パターンである有界有限性sim-as-demo-stageを提案する。
この構成では、MuJoCoのモキャップボディプリミティブを220行のPythonアダプタで駆動し、ガバナンスブリッジが構造化インテントを介して起動する。
オーディチェーンの安定性をリプレイにおけるハッシュイベントログのバイト平等として定式化し,その意味する2つの構造エンベロープ特性を同定する。
N=1000リプレイでは、モキャップの変種は1つの異なる監査チェーンハッシュ(1000/1000 byte-identical; Wilson 95% CI [0.997, 1.000])を生成し、584個の異なるハッシュ(993/1000 diverged; CI [0.987, 0.998])を生成する。
タイムステップスイープ(1, 2, 5, 10 ms)では、発散は構造的であり、チューニングアーチファクトではない。
エンベロープエッジのタイミングジッタ(+/-10のシミュレーションステップ、1,400リプレイ)は0のばらつきを発生し、監査チェーンは1, 2, 3} で K 全体でバイト等しく残る。
このパターンは、ベンチマークデザイナに、ほぼゼロのエンジニアリングコストで監査チェーンの再現性を与えます。
関連論文リスト
- APEXA: Execution-Integrity Enforcement for Multi-Agent LLM Automation of Synchrotron Data Reduction [0.23332469289621782]
我々は、シンクロトロンデータリダクションのための61のツールをコーディネートするフレームワークAPEXAを提案する。
決定論的実行統合ガードは、実行されていないツール呼び出しの結果を返すのを防ぐ。
また,APEXA-Benchは科学的正当性と身体的影響によって構成された58の施設タスクである。
論文 参考訳(メタデータ) (2026-09-21T06:33:11Z) - TRACE: A Multi-Layer Benchmark for Human AI Controller Coordination Under Drift and Failure [0.0]
現代のサイバー物理およびAI支援システムは、人間のオペレータ、AI決定モジュール、自動コントローラを単一の制御ループで結合する。
標準ベンチマークでは、これらのレイヤ間でドリフトと障害がどのように伝播するかの、タイムアラインなマルチレイヤトレースをキャプチャしない。
ALFREDは,日常的な家庭内課題に対する基礎的な指導基準である。
論文 参考訳(メタデータ) (2026-08-07T00:03:55Z) - TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows [2.435006380732194]
ノイズの多いトレースをトラジェクトリにコンパイルする,スキルガイドシステムであるTraceCompilerを提案する。
あらゆるハードエッジは監査可能な証拠を持ち、あいまいな関係が疑われる。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
論文 参考訳(メタデータ) (2026-08-03T01:05:06Z) - DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting [49.70827726228219]
このツールキットは、人間の手による実演のシングルビューRGBステレオ記録を、物理で検証可能なロボットアーム軌道に変換する。
DemoBridgeの中核は、衝突を意識した単一のプランナーである。
物理シミュレーターはループ内で動作し、生成した各フェーズを検証し、障害時にバックトラックするので、与えられたように再生できないデモは破棄されるのではなく、再計画される。
論文 参考訳(メタデータ) (2026-07-10T15:31:04Z) - OdysSim: Building Foundation Models for Human Behavior Simulation [70.35265860287608]
大規模言語モデルは、対話的評価と社会シミュレーションのための人間のシミュレータとして、ますます多くデプロイされている。
しかし、有益性駆動のポストトレーニングは、それらを同質で過度に同意できるアシスタントレジスタへと引き寄せる。
OdysSimは行動基礎モデルに関する最大のオープン・システマティック・リサーチである。
論文 参考訳(メタデータ) (2026-06-12T07:31:55Z) - Do Transformers Actually Help Intrusion Detection? A Temporal Sequence Evaluation on CIC-IDS2017 [1.2934180951771597]
我々はCIC-IDS 2017を、ネットワーク会話から順序付きフローシーケンスを構築することで、時間的侵入検出タスクとして再構成する。
中心的な発見は、アーキテクチャではなくパディング規約がトランスフォーマーのパフォーマンスを決定することである。
我々は、将来のIDS研究において、漏洩のない分割、明示的なパディング開示、シーケンシャル・アウェア・ベンチマークを標準的実践として推奨する。
論文 参考訳(メタデータ) (2026-06-09T16:57:10Z) - The Kitchen Loop: User-Spec-Driven Development for a Self-Evolving Codebase [0.0]
統合信頼モデル上に構築された自律的自己進化型ソフトウェアのためのフレームワークであるKitchen Loopを紹介します。
285以上のイテレーションで2つのプロダクションシステムにまたがって検証を行い、レグレッションオラクルによって検出されたゼロレグレッションで1,094以上のマージプルリクエストを生成しました。
論文 参考訳(メタデータ) (2026-03-26T17:45:00Z) - Pseudo-Simulation for Autonomous Driving [66.1981253104508]
既存の自動運転車(AV)の評価パラダイムは、重大な制限に直面している。
現実世界の評価は、安全上の懸念と現実主義の欠如のためにしばしば困難である。
オープンループ評価は、一般的に複合的なエラーを見落としているメトリクスに依存する。
論文 参考訳(メタデータ) (2025-06-04T17:57:53Z) - NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking [65.24988062003096]
我々は,視覚に基づく運転ポリシーをベンチマークするフレームワークであるNAVSIMを提案する。
我々のシミュレーションは非反応性であり、評価された政策と環境は互いに影響を与えない。
NAVSIMはCVPR 2024で開催され、143チームが433のエントリーを提出し、いくつかの新たな洞察を得た。
論文 参考訳(メタデータ) (2024-06-21T17:59:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。