論文の概要: CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation
- arxiv url: http://arxiv.org/abs/2606.26423v1
- Date: Wed, 24 Jun 2026 22:25:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.093073
- Title: CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation
- Title(参考訳): CoStream: 一般化可能な複合操作のためのシンプルな振る舞いを構成する
- Authors: Haonan Chen, Yuxiang Ma, Stephen Tian, Xiaoshen Han, Wenlong Huang, Feiyang Wu, Yunzhu Li, Jiajun Wu, Edward H. Adelson, Yilun Du,
- Abstract要約: 複雑な操作能力は、単純で独立した振る舞いの合成から自然に現れることを示す。
基礎モデルと多種多様な感覚的モダリティを複数の構成可能なコア動作に編成するフレームワークである ourshort を提案する。
我々は,日常的な操作と高精度な組み立てにまたがる8つの実世界のタスクについて,コンタクトリッチなアセンブリとオブジェクト転送において,最も大きな成果を上げていることを実証する。
- 参考スコア(独自算出の注目度): 61.25264898597319
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon, contact-rich complex manipulation tasks, such as seating a GPU into a PCIe slot, demand both millimeter high precision and out-of-the-box generalization to new tasks. Existing paradigms struggle to satisfy both: classical pipelines use brittle, task-specific interfaces to achieve high-precision control but require costly pipeline redesigns to adapt to new tasks, whereas monolithic end-to-end policies provide better generalization but lack high precision on complex, out-of-distribution tasks unless retrained with new data. Both paradigms share an implicit assumption: once a manipulation capability is acquired, it must be deployed as a rigid pipeline or monolithic whole, rather than being freely decomposed and recomposed. In this paper, we show that complex manipulation capabilities can emerge naturally from the composition of simple, independent behaviors. Rather than deploying a monolithic policy or a rigid pipeline, we propose \ourshort, a framework orchestrating foundation models and diverse sensing modalities into multiple composable core behaviors: a semantic behavior extracting spatial constraints via foundation models; a predictive behavior forecasting trajectories by tracking keypoints in imagined videos; and a reactive behavior providing high-frequency tactile and force corrections. On a shared $SE(3)$ interface, these outputs compose by right-multiplication into a single pose command at each control step, executed by a compliant controller. We demonstrate \ourshort on 8 real-world tasks spanning everyday manipulation and precision assembly, with the strongest gains in contact-rich assembly and object transfer, and show robust recovery from manual perturbations during execution. {Website:} https://costream-simple.github.io
- Abstract(参考訳): PCIeスロットにGPUを配置するなど、長い水平でコンタクトに富んだ複雑な操作タスクは、新しいタスクにミリ精度とアウト・オブ・ボックスの一般化の両方を要求する。
古典的なパイプラインは、高い精度の制御を実現するために脆弱なタスク固有のインターフェースを使用するが、新しいタスクに適応するためにはコストがかかるパイプラインの再設計が必要である。
どちらのパラダイムも暗黙の前提を共有している。操作能力を獲得したら、自由に分解され、再分解されるのではなく、堅固なパイプラインやモノリシックな全体としてデプロイされなければならない。
本稿では,単純で独立した動作の合成から,複雑な操作能力が自然に現れることを示す。
モノリシックなポリシーや固いパイプラインを配置するのではなく,基礎モデルと多種多様な感覚的モダリティを複数の構成可能なコア行動に編成するフレームワークである‘ourshort’を提案する。
共有の$SE(3)$インターフェイスでは、これらの出力は各コントロールステップで1つのポーズコマンドに右に乗じて構成され、準拠のコントローラによって実行される。
本研究では,日常的な操作と高精度な組み立てにまたがる8つの実世界のタスクについて,接触リッチな組立とオブジェクト転送において最強の成果を示し,実行中の手動摂動からの堅牢な回復を示す。
Website:} https://costream-simple.github.io
関連論文リスト
- Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners [34.02715256877424]
統一モデルは単一のフレームワークにマルチモーダル理解と生成を統合する。
モデルがユーザの意図をキャプチャできるが、しばしばこの意味的知識を正確なピクセルレベルの操作に変換することができない。
本稿では,命令複雑性とモデル能力に基づく生成戦略を自律的に切り替える統合モデルを実現する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-14T11:27:46Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - On Geometric Structures for Policy Parameterization in Continuous Control [7.056222499095849]
本稿では,単位多様体上での演算による構造的利点を保った,計算効率の良いアクション生成パラダイムを提案する。
本手法は,動作を決定論的方向ベクトルと学習可能な濃度に分解し,目標方向と一様雑音との効率性を実現する。
実証的に、我々の手法は標準的な連続制御ベンチマークで最先端の手法と一致するか超えている。
論文 参考訳(メタデータ) (2025-11-11T13:32:38Z) - Controllable-LPMoE: Adapting to Challenging Object Segmentation via Dynamic Local Priors from Mixture-of-Experts [16.21786310193235]
制御可能LPMoEと呼ばれる、トレーニング可能なパラメータが少ない新しい動的事前学習パラダイムを提案する。
入力画像から多種多様な局所前駆体を異種畳み込みによりキャプチャする軽量な動的混合局所前駆体抽出器を構築した。
また、コサインアラインな変形性アテンションとチャネル指向適応スケールエンハンスメントを利用した双方向インタラクションアダプタを設計する。
論文 参考訳(メタデータ) (2025-10-24T03:03:59Z) - Dynamic Perturbed Adaptive Method for Infinite Task-Conflicting Time Series [0.0]
時系列タスクを、異なる目的の入力出力マッピングとして定式化し、同じ入力が異なる出力を生成する。
そこで本研究では,頻繁なタスクシフトの下で適応性を評価するために,多数の相反するサブタスクを持つ合成データセットを構築した。
本研究では,トランク・ブランチアーキテクチャに基づく動的摂動適応手法を提案する。
論文 参考訳(メタデータ) (2025-05-17T08:33:57Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - Self-regulating Prompts: Foundational Model Adaptation without
Forgetting [112.66832145320434]
本稿では,PromptSRCと呼ばれる自己正規化フレームワークを提案する。
PromptSRCはタスク固有の汎用表現とタスクに依存しない汎用表現の両方に最適化するプロンプトを導く。
論文 参考訳(メタデータ) (2023-07-13T17:59:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。