論文の概要: TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.28474v1
- Date: Thu, 30 Jul 2026 16:27:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.660827
- Title: TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation
- Title(参考訳): TEA-AgriVLN:農業ビジョン・ランゲージナビゲーションのためのトラバーサビリティ推定アルゴリズム
- Abstract要約: VLN-CE(Vision-and-Language Navigation in Continuous Environments)は、自然言語の指示に従うためのエージェントである。
本稿では,カメラ画像のトラバーシティを推定するTAAモジュールを提案する。
私たちはそれをAgriVLNバックボーンに統合し、TEA-AgriVLNメソッドを構築します。
- 参考スコア(独自算出の注目度): 7.270093282559589
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-and-Language Navigation in Continuous Environments (VLN-CE) requires an agent to follow a natural language instruction, predicting a sequence of low-level actions to navigate a robot from a starting point to a target location. The A2A benchmark and the AgriVLN method pioneeringly extended VLN-CE from indoor scenes to agricultural scenes, while we observed a challenging distinction: In indoor scenes, whether a zone is traversable tends to be clear to classify, such as wood floors are traversable but concrete walls are not. In agricultural scenes, however, this issue tends to be ambiguous, such as an unripe cornfield might be traversable for a robotic dog but might be non-traversable for a human. To address this issue, we propose the TEA module, which estimates the traversability of the camera image, then alarm the decision-maker for rethinking when the predicted action does not align with the traversability map. We integrate it into the AgriVLN backbone to build our TEA-AgriVLN method. When evaluated on A2A, it improves Success Rate (SR) from 0.47 to 0.54 and Navigation Error (NE) from 2.91 m to 2.70 m, showing the state-of-the-art performance in the agricultural VLN-CE domain. We further implement the ablation studies and the case study, discussing the effectiveness and limitations of TEA on different ground categories and scene classes. Code: https://github.com/AlexTraveling/TEA-AgriVLN.
- Abstract(参考訳): VLN-CE(Vision-and-Language Navigation in Continuous Environments)は、エージェントが自然言語の指示に従う必要がある。
A2AのベンチマークとAgriVLNの手法は、VLN-CEを屋内のシーンから農業のシーンへと先駆的に拡張した。
しかし、農業の場面では、この問題はあいまいである傾向があり、例えば、未熟なトウモロコシ畑はロボット犬には向くが、人間には向かないかもしれない。
この問題に対処するために,カメラ画像のトラバータビリティを推定するTAAモジュールを提案する。
私たちはそれをAgriVLNバックボーンに統合し、TEA-AgriVLNメソッドを構築します。
A2Aでの評価では、成功率(SR)を0.47から0.54に、ナビゲーションエラー(NE)を2.91mから2.70mに改善し、農業用VLN-CEドメインの最先端性能を示す。
我々はさらに、異なる分野やシーンクラスにおけるTAAの有効性と限界について議論し、アブレーション研究とケーススタディを実施している。
コード:https://github.com/AlexTraveling/TEA-AgriVLN。
関連論文リスト
- IMAC-AgriVLN: Can Agricultural Vision-and-Language Navigation Agents be Aware of Instruction Mistakes? [7.270093282559589]
そこで本研究では,各命令に3つの誤り分類を挿入する半自動データアノテータを提案する。
いくつかの最先端の農業用VLN剤を試験し,SRでは57%,NEでは-9%の低下を示した。
本稿では,命令の誤りの有無を判定し,必要に応じて修正しようとするIMACモジュールを提案する。
論文 参考訳(メタデータ) (2026-06-01T17:27:57Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation [78.80536515102305]
VLN(Vision-and-Language Navigation)は、エージェントが視覚環境内の自身の動きに言語命令を接地する必要がある。
本稿では,ナビゲーションモデルに自己認識推論機構を備えた新しいフレームワークであるAwareVLNを提案する。
提案手法は,(1)空間的およびタスク指向の自己認識を促進する構造的推論モジュール,(2)効果的な学習のための進歩分担付き自動データエンジンの2つの重要な革新を特徴とする。
論文 参考訳(メタデータ) (2026-05-21T17:58:26Z) - AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild [62.47761809929869]
視覚言語ナビゲーション(VLN)は、視覚的観察とともに言語指示を解釈することで、知的エージェントが環境をナビゲートする必要がある。
無人航空機(UAV)の現在のVLN研究は、所定のルートに沿ってUAVを誘導するための詳細な指示に依存している。
本稿では,自律型UAVナビゲーションのためのエンド・ツー・エンドのビジョン・ランゲージ・アクションモデルであるAutoFlyを提案する。
論文 参考訳(メタデータ) (2026-02-10T11:08:07Z) - IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments [21.821075450697027]
Vision-IndoorLanguage Navigation (VLN)は、視覚的な観察に基づく自然言語命令に従うことで、エージェントが複雑な環境でのナビゲーションを可能にする。
室内のUAVベースのVLNは、検査、配送、捜索・救助といった現実世界の応用に関係があるにもかかわらず、未調査のままである。
室内UAVを用いたVLNに適した新しいベンチマークと手法である textbfIndoorUAV を紹介する。
論文 参考訳(メタデータ) (2025-12-22T04:42:35Z) - SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation [3.9186557599917293]
AgriVLN法とA2Aベンチマークは先駆的にビジョン・アンド・ランゲージ・ナビゲーション(VLN)を農業領域に拡張した。
現実的な農業シナリオでは、ナビゲーション命令が繰り返されるが、AgriVLNはそれぞれの命令を独立したエピソードとして扱う。
農業用視覚・言語ナビゲーション(SUM-AgriVLN)のための空間的記憶法を提案する。
論文 参考訳(メタデータ) (2025-10-16T06:53:32Z) - AgriVLN: Vision-and-Language Navigation for Agricultural Robots [4.566850249315913]
VLN(Vision-and-Language Navigation)は、自然言語の指示に従って、ロボットが目標とする目的地への移動を可能にする。
既存のベンチマークや方法はいずれも、農業シーン用に特別に設計されていない。
我々は6つの多様な農業シーンにまたがる1,560エピソードを含む農業と農業のベンチマークを提案する。
論文 参考訳(メタデータ) (2025-08-10T16:07:23Z) - ULN: Towards Underspecified Vision-and-Language Navigation [77.81257404252132]
Underspecificified Vision-and-Language Navigation (ULN)は、視覚・言語ナビゲーション(VLN)のための新しい設定である
本稿では,分類モジュール,ナビゲーションエージェント,エクスプロイテーション・ツー・エクスプロレーション(E2E)モジュールで構成されるVLNフレームワークを提案する。
我々のフレームワークはより堅牢で、ULNのベースラインを全レベルの相対的な成功率で10%上回る。
論文 参考訳(メタデータ) (2022-10-18T17:45:06Z) - Think Global, Act Local: Dual-scale Graph Transformer for
Vision-and-Language Navigation [87.03299519917019]
本稿では,2次元グラフ変換器 (DUET) を提案する。
我々は,グローバルな行動空間における効率的な探索を可能にするために,トポロジカルマップをオンザフライで構築する。
提案手法であるDUETは、目標指向の視覚・言語ナビゲーションベンチマークにおいて最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2022-02-23T19:06:53Z) - Airbert: In-domain Pretraining for Vision-and-Language Navigation [91.03849833486974]
ビジョン・アンド・ランゲージナビゲーション(VLN)は、エンボディエージェントが自然言語命令を使って現実的な環境をナビゲートできるようにすることを目的としている。
近年の方法は、VLN剤の一般化を改善するための事前学習である。
大規模かつ多様なドメイン内VLNデータセットであるBnBを紹介する。
論文 参考訳(メタデータ) (2021-08-20T10:58:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。