論文の概要: Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios
- arxiv url: http://arxiv.org/abs/2608.08281v1
- Date: Sat, 08 Aug 2026 18:23:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.75758
- Title: Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios
- Title(参考訳): 実世界の海上航行シナリオにおける状況把握とCOLREGコンプライアンスのためのLCM機能探索
- Abstract要約: 大規模言語モデル(LLM)は、状況理解、推論、意思決定にかなりの能力を示している。
我々は、AISデータから50の多様な実世界のナビゲーションシナリオ、適用可能なCOLREGルールのラベル付きシナリオ、推奨アクション、アクションの推論からなるデータセットを構築した。
その結果,大規模なオンラインモデルであっても,微調整なしでは海上航行作業の解決が困難であることが示唆された。
- 参考スコア(独自算出の注目度): 0.4199844472131921
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recently, Large Language Models (LLMs) have shown considerable capability for situational understanding, reasoning, and decision making in different domains, most notable in the automotive sector. Therefore, we explore current state-of-the-art LLMs as a tool for maritime navigation, which includes both codified rules in the Collision Regulations (COLREGs) and uncodified best practices summarized in the concept of ``Good Seamanship''. We construct a dataset consisting of 50 diverse, real-world navigation scenarios from AIS data, label scenarios with applicable COLREG rules, recommended actions, and the reasoning for the action. We explore a variety of different LLM architectures and sizes to determine their understanding of maritime navigation tasks as well as evaluate their reasoning capabilities in this domain. The results obtained indicate that the maritime navigation task remains difficult to solve without fine-tuning, even for larger online models.
- Abstract(参考訳): 近年,Large Language Models (LLM) は,自動車分野において特に顕著な,さまざまな領域における状況理解,推論,意思決定の能力を示した。
そこで我々は,コリジョン・レギュレーション(COLREG)におけるルールの定式化と,'Good Seamanship'という概念で要約された未定のベストプラクティスを含む,海上航行のツールとして,現在最先端のLLMを探求する。
我々は、AISデータから50の多様な実世界のナビゲーションシナリオ、適用可能なCOLREGルールのラベル付きシナリオ、推奨アクション、アクションの推論からなるデータセットを構築した。
我々は,海上航行タスクの理解と,その領域における推論能力を評価するため,様々なLLMアーキテクチャとサイズについて検討する。
その結果,大規模なオンラインモデルであっても,微調整なしでは海上航行作業の解決が困難であることが示唆された。
関連論文リスト
- SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments [57.79171900005793]
人間は、大規模屋内環境内の目的地に向かうために、手話によって提供される意味的ヒントを日常的に活用する。
本稿では,手話からの意味的ヒントを解釈し,現在の観察に基づくその後の行動の推論を行うための,新しい具体的ナビゲーションタスクSignNavを紹介する。
空間認識モジュールは物理的世界へのサインの意味的ヒントを基盤として,時間認識モジュールは歴史的状態と現在の観測との長距離依存性を捉えている。
論文 参考訳(メタデータ) (2026-03-17T06:36:26Z) - City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs [13.863236619171174]
Taskは、知識集約的な現実世界環境におけるMLLMのシーケンシャルな意思決定能力を評価するように設計されている。
このタスクを,4つの多様なグローバル都市を対象とするベンチマークであるCityNavで運用する。
エージェントは、50以上の意思決定ポイントを順次ナビゲートするために、視覚入力と内部マルチモーダル推論のみに依存する必要がある。
本稿では,明示的な認知地図を探索することにより,エージェントの内部的推論を明示的に根拠とするVerbalization of Path (VoP)を提案する。
論文 参考訳(メタデータ) (2025-12-17T19:59:31Z) - NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous Environments [67.18144414660681]
VLN-CE(Vision-and-Language Navigation in Continuous Environments)は、自然言語命令によって誘導される複雑な環境において、エージェントがシーケンシャルなナビゲーションアクションを実行する必要がある。
人間の認知にインスパイアされたNavMorphは、VLN-CEタスクにおける環境理解と意思決定を強化する自己進化型世界モデルフレームワークである。
論文 参考訳(メタデータ) (2025-06-30T02:20:00Z) - Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning [69.5875073447454]
本稿では,大規模言語モデル(LLM)によって強化された動作エージェントを,動的・乱雑な環境における自律的なナビゲーションに向けて前進させる。
トレーニング不要なフレームワークは、マルチエージェント調整、クローズドループ計画、動的障害物回避を、リトレーニングや微調整なしでサポートしています。
論文 参考訳(メタデータ) (2025-03-10T13:39:09Z) - Llamarine: Open-source Maritime Industry-specific Large Language Model [0.4215938932388722]
Llamarineは,海洋航法に特化して設計された,最初のオープンソースのLarge Language Model (LLM) である。
Llamarine 1.0は、海事教科書、研究出版物、ウィキペディアのウェブテキストを含む高品質なコーパスの訓練と微調整を継続して開発されている。
主な貢献は、(a)権威源からの総合的な海洋データセットのキュレーション、モデルの知識ベースにおける深度と信頼性を確保すること、(b)汎用LSMよりも高精度で複雑な航法課題を推論できる基礎モデルの開発、(c)ベンチマークの作成である。
論文 参考訳(メタデータ) (2025-02-28T21:39:22Z) - Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation [35.71602601385161]
本稿では,視覚言語モデル(VLM)に基づくナビゲーションフレームワークを提案する。
提案手法は,長期タスクにおける空間的推論と意思決定を促進する。
実験の結果,提案手法は従来のオブジェクトナビゲーションタスクの手法を超越していることがわかった。
論文 参考訳(メタデータ) (2025-02-20T04:41:40Z) - DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes [76.24687327731031]
まず,DivSceneを導入することにより,オープン語彙オブジェクトナビゲーションの課題について検討する。
私たちのデータセットは、既存のデータセットよりもターゲットオブジェクトやシーンタイプがはるかに多様です。
我々はLVLMを微調整し、CoTの説明で次の動作を予測する。
論文 参考訳(メタデータ) (2024-10-03T17:49:28Z) - MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains [4.941781282578696]
Vision-and-Language Navigation (VLN)タスクでは、エージェントは自然言語の指示に従って目的地に向かう必要がある。
学習ベースのアプローチはタスクに対する主要な解決策だが、高いトレーニングコストと解釈可能性の欠如に悩まされている。
近年、Large Language Models (LLMs) は強力な一般化能力のため、VLNにとって有望なツールとして登場した。
論文 参考訳(メタデータ) (2024-05-17T08:33:27Z) - NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning [97.88246428240872]
Embodied AIの重要な研究課題であるVision-and-Language Navigation (VLN)は、自然言語の指示に従って複雑な3D環境をナビゲートするために、エンボディエージェントを必要とする。
近年の研究では、ナビゲーションの推論精度と解釈可能性を改善することにより、VLNにおける大きな言語モデル(LLM)の有望な能力を強調している。
本稿では,自己誘導型ナビゲーション決定を実現するために,パラメータ効率の高いドメイン内トレーニングを実現する,Navigational Chain-of-Thought (NavCoT) という新しい戦略を提案する。
論文 参考訳(メタデータ) (2024-03-12T07:27:02Z) - NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large
Language Models [17.495162643127003]
我々は,複雑なエンボディシーンにおけるGPTモデルの推論能力を明らかにするために,NavGPTを導入した。
NavGPTは、視覚的な観察、ナビゲーション履歴、将来の探索可能な方向のテキスト記述を入力として、エージェントの現在の状態を推論する。
本研究では,NavGPTが経路に沿った観察や行動から高品質なナビゲーション命令を生成可能であることを示す。
論文 参考訳(メタデータ) (2023-05-26T14:41:06Z) - Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration
for Zero-Shot Object Navigation [58.3480730643517]
言語駆動型ゼロショットオブジェクトゴールナビゲーション(L-ZSON)のための新しいアルゴリズムLGXを提案する。
このアプローチでは、このタスクにLarge Language Models(LLM)を使用します。
現状のゼロショットオブジェクトナビゲーションをRoboTHOR上で実現し,現在のベースラインよりも27%以上の成功率(SR)向上を実現した。
論文 参考訳(メタデータ) (2023-03-06T20:19:19Z) - Unsupervised Domain Adaptation for Visual Navigation [115.85181329193092]
視覚ナビゲーションのための教師なし領域適応手法を提案する。
本手法では,対象領域の画像をソース領域に変換し,ナビゲーションポリシで学習した表現と一致するようにする。
論文 参考訳(メタデータ) (2020-10-27T18:22:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。