論文の概要: CoFL-S: Spatially Queryable Sector Flow Fields for Local Language-Conditioned Navigation
- arxiv url: http://arxiv.org/abs/2607.02222v1
- Date: Thu, 02 Jul 2026 14:26:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.870503
- Title: CoFL-S: Spatially Queryable Sector Flow Fields for Local Language-Conditioned Navigation
- Title(参考訳): CoFL-S:局所言語記述ナビゲーションのための空間的に検索可能なセクタフロー場
- Abstract要約: CoFL-Sは、ロボットの局所可視領域上の言語条件のフロー場を予測する低レベル視覚言語アクションフレームワークである。
この低レベル表現をトレーニングするために、各VLN-CEエピソード(元々はアクションシーケンスと組み合わせた全エピソード命令)をフレームレベルのローカル監視に変換する。
評価のために,低レベル動作インタフェースを命令分解から分離した連続時間Habitatベンチマークを導入する。
- 参考スコア(独自算出の注目度): 13.76195083398865
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Navigation has increasingly emphasized high-level instruction reasoning, memory, global map construction, and instruction decomposition, while the low-level action representation remains comparatively underexplored. We propose CoFL-S, a low-level vision-language-action framework that predicts a language-conditioned flow field over the robot's local visible sector and generates continuous trajectories by rolling out the predicted field. To train this low-level representation, we convert each VLN-CE episode, originally a whole-episode instruction paired with an action sequence, into frame-level local supervision with aligned sub-instructions and matched action, trajectory, and dense flow-field targets. For evaluation, we introduce a continuous-time Habitat benchmark that isolates low-level action interfaces from instruction decomposition and executes all methods through a shared velocity-command controller, enabling decomposition-independent closed-loop comparison across different planner frequencies rather than fixed discrete forward-and-turn transitions in VLN-CE. Under matched encoders and training settings, CoFL-S consistently outperforms action-token and action-chunk baselines across planner frequencies in the continuous-time Habitat benchmark, and zero-shot real-world closed-loop deployment further shows its advantage over both baselines beyond simulation.
- Abstract(参考訳): Vision-Language Navigationは、高レベルの命令推論、メモリ、グローバルマップ構築、命令分解をますます強調しているが、低レベルのアクション表現は比較的過小評価されている。
ロボットの局所可視領域上の言語条件付き流れ場を予測し,予測された視野をロールアウトして連続的な軌跡を生成する低レベル視覚言語行動フレームワークであるCoFL-Sを提案する。
この低レベル表現をトレーニングするために、各VLN-CEエピソードは、もともとアクションシーケンスと組み合わせられた全エピソード命令であり、アライメントされたサブインストラクションと一致したアクション、軌道、および密度のフローフィールドターゲットを備えたフレームレベルのローカル監視に変換する。
評価のために、低レベル動作インタフェースを命令分解から分離し、共有速度コマンドコントローラを介して全てのメソッドを実行する連続時間Habitatベンチマークを導入し、VLN-CEにおける離散的な前後方向遷移ではなく、異なるプランナー周波数間での分解独立閉ループ比較を可能にする。
一致したエンコーダとトレーニング設定の下では、CoFL-Sは連続時間Habitatベンチマークにおいて、プランナー周波数間のアクショントーケンとアクションチャンクベースラインを一貫して上回る。
関連論文リスト
- Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving [37.533498955258544]
本稿では,インスタンスレベルの残差をクラスレベルの遅延シフトに置き換える単一パス誘導機構を提案する。
我々はLCSがより強力なコマンドアテンデンスを実現しつつ、推論遅延を約50%削減できることを実証した。
論文 参考訳(メタデータ) (2026-07-31T19:32:28Z) - DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation [53.011370226020695]
DINOdeは、CLIPテキストの埋め込みをDINO視覚多様体と整合させるODEベースのフレームワークである。
提案手法では, (i) Semantic Text Flow (STF) と (ii) Global Context Flow (GCF) の2つの相補的要素を用いて, DINO の CLS トークンが持つ全体像表現を洗練する。
連続軌道としてアライメントをモデル化することにより、ディノドは離散射影に固有の絡み合いを回避し、より堅牢なクロスモーダルアライメントをもたらす。
論文 参考訳(メタデータ) (2026-07-23T14:37:27Z) - AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning [13.949868529278504]
AnchorVLAは階層的な意思決定型VLA計画フレームワークである。
トラジェクトリ・パターン・アンカーを高レベルなVLA推論と連続的なトラジェクトリ実行の間の明示的なインターフェースとして使用する。
最先端の成功率77.28、競争力89.92を達成している。
論文 参考訳(メタデータ) (2026-07-03T10:38:30Z) - SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation [26.212246536363363]
Object-Goal Navigation (Nav)は、エゴセントリックな視覚的観察のみを使用して、特定のターゲットを自律的に特定するエンボディエージェントを必要とする。
SAGE-Navは,Large Language Models(LLM)の推論機能と動的シーングラフを統合した,新しい階層型フレームワークである。
SAGE-Navは,物理ロボット展開に必要な低制御遅延を維持しつつ,ナビゲーション効率とゼロショット一般化の大幅な向上を実現していることを示す。
論文 参考訳(メタデータ) (2026-06-24T07:24:39Z) - Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation [79.12557132788139]
VLN-CE(Vision-Language Navigation in Continuous Environments)では、エージェントが現実世界のような環境でナビゲートしながら自然言語の指示に従う必要がある。
ほとんどのVLN-CEアプローチでは、ウェイポイント予測器がウェイポイントを提案し、ナビゲータが最良のウェイポイントを選択する。
提案手法は,各候補の経路点を実行可能な軌道に配置する,トラジェクトリ・ウェイポイントという新しいパラダイムを導入する。
論文 参考訳(メタデータ) (2026-06-05T13:11:39Z) - Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation [22.062997228195815]
言語誘導型UAVエージェントは、スムーズで物理的に実行可能な連続飛行コマンドを生成しながら、長い水平意味指示を実行しなければならない。
textbfFine-fine textbfLong-horizon textbf Instruction-textbfGuided benchmark for textbfHybrid UAV navigation and reasoning textbfTasks。
UAVエージェントにタスク実行状況とミッション計画に対するリアルタイム飛行中の推論能力を与えるため、我々は、
論文 参考訳(メタデータ) (2026-06-05T02:23:05Z) - AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model [53.15040805435013]
視覚言語モデル(VLM)は、一様にサンプリングされたフレームを解析することで、強力なセマンティックグラウンドと一般的な知識を提供する。
本稿では,高密度フレーム・ダイナミックス・モデリングと長軸意味指導を組み合わせたVLM誘導型JEPA型潜在世界モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:42Z) - HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation [1.774434289475737]
VLN(Vision-and-Language Navigation)は、厳格なステップバイステップの指示から、オープンな語彙、ゴール指向の自律性へとシフトしている。
本稿では,OsmAGのロバストなグローバルプランニングと,VLNの局所探索と命令グラウンド機能を組み合わせた階層型ナビゲーションフレームワークHaltNavを提案する。
論文 参考訳(メタデータ) (2026-03-13T06:22:35Z) - CoFL: Continuous Flow Fields for Language-Conditioned Navigation [14.35468089349405]
CoFLは、鳥眼ビュー(BEV)観察と言語指導をナビゲーションのための連続フローフィールドにマッピングするエンドツーエンドのポリシーである。
混合分布の訓練により、CoFLはモジュラービジョン・ランゲージ・モデル(VLM)ベースのプランナーよりも大幅に優れている。
論文 参考訳(メタデータ) (2026-03-03T11:02:55Z) - Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization [129.43937834515688]
我々は,ビデオ言語アライメントを強化するために,新しいコラボラティブ・テンポラル・コンポジション・ラーニング(COTEL)フレームワークを提案する。
具体的には、まずフレームとセグメントレベルの時間一貫性学習(TCL)モジュールを設計し、フレームサリエンシと文-モーメントペア間のセマンティックアライメントをモデル化する。
論文 参考訳(メタデータ) (2025-03-22T05:04:12Z) - Stragglers-Aware Low-Latency Synchronous Federated Learning via Layer-Wise Model Updates [71.81037644563217]
同期フェデレーションラーニング(FL)は、協調エッジラーニングの一般的なパラダイムである。
一部のデバイスは計算資源が限られており、様々な可用性があるため、FLレイテンシはストラグラーに非常に敏感である。
本稿では,NNの最適化手法をバックプロパゲーションにより活用し,グローバルモデルを階層的に更新するストラグラー対応層対応学習(SALF)を提案する。
論文 参考訳(メタデータ) (2024-03-27T09:14:36Z) - Temporal Context Aggregation Network for Temporal Action Proposal
Refinement [93.03730692520999]
時間的行動提案生成はビデオ理解分野において難しいが重要な課題である。
現在の方法はまだ不正確な時間境界と検索に使用される劣った自信に苦しんでいます。
TCANet は、「ローカルおよびグローバル」な時間的コンテキストアグリゲーションを通じて、高品質のアクション提案を生成するために提案します。
論文 参考訳(メタデータ) (2021-03-24T12:34:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。