論文の概要: Conditional Trajectory Peaks: Single-Pass Multimodal Policies over Action Chunks
- arxiv url: http://arxiv.org/abs/2610.06104v1
- Date: Mon, 05 Oct 2026 10:36:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 18:41:01.716664
- Title: Conditional Trajectory Peaks: Single-Pass Multimodal Policies over Action Chunks
- Title(参考訳): 条件付き軌道ピーク:アクションチャンクに対する単一パスマルチモーダルポリシー
- Abstract要約: Conditional Trajectory Peaks (CTP) は、完全なアクションチャンク候補、確率質量、軌道スケールを共同で予測する。
DAPSは、軌跡レベルの後方責任と質量変調およびスケール変調制約を用いた軌道ピークを専門とする。
ETBTは交換可能な候補集合間の幾何学的対応を通して、クロスチャンクの整合性を維持する。
- 参考スコア(独自算出の注目度): 10.075776519042183
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal imitation learning requires diverse executable futures under the same observation and consistent behavior across replanning cycles. We present Conditional Trajectory Peaks (CTP), a single-pass policy framework that jointly predicts complete action-chunk candidates, probability masses, and trajectory scales. Distribution-Aware Peak Specialization (DAPS) specializes trajectory peaks using trajectory-level posterior responsibilities and mass- and scale-modulated overlap constraints. Evidence-Gated Trajectory Belief Transport (ETBT) maintains cross-chunk consistency through geometric correspondence between exchangeable candidate sets, while allowing current policy evidence to override historical constraints. CTP achieves a coverage score of 91.40% on Push-T; success rates of 100.0%, 79.72%, and 84.44% on D3IL Avoiding, Aligning, and Sorting-2, respectively. On LIBERO, CTP achieves an average success rate of 97.25%. In real-world dual-arm experiments, CTP preserves both placement modes in a two-plate task, succeeding in all 50 trials. On bottle uprighting and pen placement into a holder, it maintains success rates comparable to $π_{0.5}$ while reducing policy inference latency from 218.24 ms to 75.80 ms. These results demonstrate that single-pass trajectory modeling can combine multimodal behavior, closed-loop consistency, and efficient inference.
- Abstract(参考訳): マルチモーダルな模倣学習には、同じ観察と一貫した行動の下での様々な実行可能未来が必要である。
本稿では,完全なアクションチャンク候補,確率質量,軌道スケールを共同で予測する単一パスポリシーフレームワークであるConditional Trajectory Peaks(CTP)を提案する。
DAPS(Dis Distribution-Aware Peak Specialization)は、軌跡レベルの後方責任と質量・スケールの重なり制約を用いた軌道ピークを専門とする。
Evidence-Gated Trajectory Belief Transport (ETBT) は、交換可能な候補集合間の幾何学的対応を通じてクロスチャンクの整合性を維持しつつ、現在の政策証拠が歴史的制約をオーバーライドすることを許している。
CTPはPush-Tで91.40%、D3IL Avoiding、Aligning、Sorting-2で100.0%、79.72%、84.44%である。
LIBEROでは、CTPの平均成功率は97.25%である。
実世界のデュアルアーム実験では、CTPは両方の配置モードを2段階のタスクで保持し、50回の試験で成功している。
ボトルアップライトとペンのホルダーへの配置では、π_{0.5}$に匹敵する成功率を維持しながら、ポリシー推論のレイテンシを218.24msから75.80msに下げている。これらの結果は、シングルパス軌道モデリングがマルチモーダルな振る舞い、クローズドループの一貫性、効率的な推論を組み合わせることができることを示している。
関連論文リスト
- Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization [70.25625746203777]
Reward-maximizing reinforcement learning (RL) は、テキスト・トゥ・イメージ(T2I)生成のための後流拡散とフローポリシーに広く用いられている。
T2Iでは、報酬最大化RLは基準KLやエントロピー正規化の下でもポリシーモードの崩壊を引き起こす。
拡散・流路政策のためのRLポストトレーニングフレームワークであるUnified Trajectory Matching Policy Optimization (Uni-TMPO)を紹介する。
論文 参考訳(メタデータ) (2026-09-28T09:13:03Z) - Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost [2.9867974725783113]
Constrained Path Reasoning (CPR)は、ソース認識パス仮説とステージレベルの会計とをペアリングする。
CPRは、タスク互換のコミットメントは、移行を分解し、候補の質量を集中し、正規性を誘導し、そのゲインが宣伝されたエラーや実行コストを超えたときにフィードバックを公開することができると予測している。
論文 参考訳(メタデータ) (2026-07-19T13:11:18Z) - Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy [7.1976264551575895]
メートル法アグリゲーション分散(英: Metric aggregate divergence、MAD)は、エージェントベースのモデルにおいて、異なるパイプラインステージで発生するサイレント不整合である。
私たちは、ディスパッチ時に実施される単一の呼び出し可能なランタイムであるメトリックコントラクトを、対策として紹介します。
論文 参考訳(メタデータ) (2026-06-27T18:17:33Z) - Beyond Mode Collapse: Distribution Matching for Diverse Reasoning [69.88237286885065]
GRPOのようなオンライン強化学習手法はモード崩壊に悩まされる。
このことは、逆KL最小化のモード探索行動に由来することを示す。
KL最小化の原理的近似によりモード崩壊を防止するDMPOを提案する。
論文 参考訳(メタデータ) (2026-05-19T07:13:00Z) - PASC: Pipeline-Aware Conformal Prediction with Joint Coverage Guarantees for Multi-Stage NLP and LLM Pipelines [0.11280931253550518]
PASC(Pipeline-Aware Split Conformal)は多段関節カバレッジを1つのスカラー共形予測問題に還元する。
3段階のNER -> NED -> エンティティ・タイピングパイプライン上では、PASCは96.4%、ボンフェロニは93.4%、独立CPは86.5%を達成している。
論文 参考訳(メタデータ) (2026-05-12T08:23:12Z) - TEMPO: Scaling Test-time Training for Large Reasoning Models [87.61789183311856]
テストタイムトレーニング(TTT)は、推論時間中にラベルのないテストインスタンスにモデルパラメータを適用する。
TTTフレームワークであるTEMPOを提案する。これは、ラベル付きデータセット上で定期的な批評家の再検討を行い、ラベル付き質問に対するポリシー修正をインターリーブする。
論文 参考訳(メタデータ) (2026-04-21T10:01:04Z) - Physics-Informed Causal MDPs for Sequential Constraint Repair in Engineering Simulation Pipelines [0.0]
本稿では,制約依存が層状DAGを形成するCMDPのためのフレームワークであるPI-CMDPを紹介する。
工学シミュレーションパイプラインにおける制約修復におけるPI-CMDPのインスタンス化を行う。
論文 参考訳(メタデータ) (2026-04-20T07:40:15Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Critic-Free Deep Reinforcement Learning for Maritime Coverage Path Planning on Irregular Hexagonal Grids [1.2891210250935148]
海上監視任務は、広大で幾何学的に複雑な領域におけるセンシング資産の効率的な配分に依存している。
伝統的なカバー・パス・プランニングアプローチは不規則な海岸線、島々、および排他的地域と戦っている。
本研究では,不規則海域の六角形格子表現においてCPPを解くための深層強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-30T12:56:38Z) - SENTINEL: Stagewise Integrity Verification for Pipeline Parallel Decentralized Training [54.8494905524997]
分散トレーニングは、信頼できない、地理的に分散したノードで実行される場合、重大なセキュリティリスクをもたらす。
重複のないパイプライン並列性(PP)トレーニングの検証機構であるSENTINELを提案する。
実験では、モデル収束と性能を維持しながら、最大176人の労働者を持つ信頼できない分散環境における最大4BパラメータLSMのトレーニングを成功させた。
論文 参考訳(メタデータ) (2026-03-03T23:51:10Z) - PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning [62.55836470496192]
PaCoReは、現代の言語モデルの中心的な制限を克服するために設計されたトレーニングと推論のフレームワークである。
PaCoReは、複数のラウンドでメッセージパッシングアーキテクチャを介して調整された巨大な並列探索を通じてTTCを駆動することで、従来のシーケンシャルパラダイムから逸脱する。
大規模で結果に基づく強化学習を備えたエンドツーエンドで訓練されたモデルでは、PaCoReに必要な合成能力を習得し、コンテキスト制限を超えることなく、数百万の効果的なTTCにスケールする。
論文 参考訳(メタデータ) (2026-01-09T07:24:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。