論文の概要: Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance
- arxiv url: http://arxiv.org/abs/2608.18602v1
- Date: Wed, 19 Aug 2026 06:44:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.312101
- Title: Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance
- Title(参考訳): Molmo2Fishを教える: 自然言語による対話型魚の追跡
- Abstract要約: 本稿では,対話型予測補正ワークフローを通じて不完全追跡予測を扱うための新しい手法を提案する。
私たちは、最初の概念実証としてソナー魚追跡データセットを調整します。
Molmo2Fishは魚の追尾と追尾作業において高い性能を発揮する。
- 参考スコア(独自算出の注目度): 6.626960192028637
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer vision is increasingly used to automate recognition tasks in large ecological datasets, but more complex tasks such as multi-object tracking continue to pose challenges. As researchers seek to incorporate vision models in ecology workflows, various lines of research have explored how to make imperfect predictions useful through human-in-the-loop processes. We propose a new approach to working with imperfect tracking predictions through an interactive prediction correction workflow taking place as a conversation with a multimodal large language model, which we tailor to a sonar fish tracking dataset as an initial proof of concept. We investigate the performance of the tool, Molmo2Fish, across guided and unguided tasks, correcting its own predicted tracks and external tracks. We find that Molmo2Fish achieves high performance on fish tracking and track correction tasks, but there is still much room to improve on incorporating natural language guidance. The code and data are publicly available at https://github.com/tidalove/molmo2fish.
- Abstract(参考訳): コンピュータビジョンは、大規模な生態データセットにおける認識タスクの自動化にますます使用されているが、マルチオブジェクトトラッキングのようなより複雑なタスクは、課題を呈し続けている。
研究者が視覚モデルをエコロジーのワークフローに組み込もうとする中で、様々な研究の行は、人間のループ内でのプロセスを通じて不完全な予測を有用にする方法を探った。
本稿では,多モーダル大言語モデルとの対話として発生する対話的予測補正ワークフローを通じて,不完全追跡予測を扱うための新しいアプローチを提案する。
ツールであるMolmo2Fishの性能を,ガイド付き,ガイドなしのタスクで検証し,予測されたトラックと外部トラックを修正した。
Molmo2Fishは魚の追尾と追尾作業において高い性能を発揮するが、まだ自然言語指導を取り入れる余地は十分ある。
コードとデータはhttps://github.com/tidalove/molmo2fishで公開されている。
関連論文リスト
- Evolution of Concepts in Language Model Pre-Training [53.994470178155105]
クロスコーダと呼ばれるスパース辞書学習手法を用いて,事前学習スナップショットにおける線形解釈可能な特徴の進化を追跡する。
ほとんどの機能が特定のポイントの周りに形成され始め、さらに複雑なパターンが後のトレーニング段階に現れます。
論文 参考訳(メタデータ) (2025-09-21T18:53:12Z) - Benchmarking pig detection and tracking under diverse and challenging conditions [1.865175170209582]
オブジェクト検出のためのPigDetectと、マルチオブジェクト追跡のためのPigTrackの2つのデータセットをキュレートした。
対象物検出では,ランダムなサンプル画像のみを用いて達成可能なものよりも,困難なトレーニング画像により検出が向上することを示す。
マルチオブジェクト追跡において,SORTに基づく手法は,エンドツーエンドのトレーニング可能なモデルに比べて優れた検出性能が得られることを示した。
論文 参考訳(メタデータ) (2025-07-22T14:36:51Z) - A Framework for Multi-View Multiple Object Tracking using Single-View Multi-Object Trackers on Fish Data [0.559239450391449]
この論文は、生態学研究における水中魚の検出と追跡に最先端のシングルビューMOTモデルであるFairMOTとYOLOv8を適用している。
提案フレームワークは,魚の個体を相対的精度47%で検出し,立体マッチング技術を用いて新しい3D出力を生成する。
論文 参考訳(メタデータ) (2025-05-22T18:12:08Z) - AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPO [0.0]
大きな言語モデル(LLM)は、言語処理において印象的な能力を示してきたが、視覚的な空間的推論を必要とするタスクにしばしば苦労している。
迷路ナビゲーションのための視覚的推論能力を備えた標準LLMの2段階学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-20T16:05:18Z) - DiSciPLE: Learning Interpretable Programs for Scientific Visual Discovery [61.02102713094486]
優れた意思決定を可能にするため、科学的推論において優れた解釈が重要である。
本稿では,ニューラルネットワークをインターリーブする学習プログラムを用いて,そのような解釈可能な設計モデルを得るための自動手法を提案する。
本稿では,大言語モデル (LLM) の常識と事前知識を活用する進化的アルゴリズムであるDiSciPLEを提案し,視覚データを説明するPythonプログラムを作成する。
論文 参考訳(メタデータ) (2025-02-14T10:26:14Z) - Interactive Planning Using Large Language Models for Partially
Observable Robotics Tasks [54.60571399091711]
大きな言語モデル(LLM)は、オープン語彙タスクを実行するロボットエージェントを作成することで、驚くべき成果を上げている。
LLMを用いた部分的に観測可能なタスクのための対話型計画手法を提案する。
論文 参考訳(メタデータ) (2023-12-11T22:54:44Z) - Octopus: Embodied Vision-Language Programmer from Environmental Feedback [58.04529328728999]
身体視覚言語モデル(VLM)は多モード認識と推論において大きな進歩を遂げた。
このギャップを埋めるために、我々は、計画と操作を接続する媒体として実行可能なコード生成を使用する、具体化された視覚言語プログラマであるOctopusを紹介した。
Octopusは、1)エージェントの視覚的およびテキスト的タスクの目的を正確に理解し、2)複雑なアクションシーケンスを定式化し、3)実行可能なコードを生成するように設計されている。
論文 参考訳(メタデータ) (2023-10-12T17:59:58Z) - Policy Pre-training for End-to-end Autonomous Driving via
Self-supervised Geometric Modeling [96.31941517446859]
PPGeo (Policy Pre-training via Geometric Modeling) は,視覚運動運転における政策事前学習のための,直感的かつ直接的な完全自己教師型フレームワークである。
本研究では,大規模な未ラベル・未校正動画の3次元幾何学シーンをモデル化することにより,ポリシー表現を強力な抽象化として学習することを目的とする。
第1段階では、幾何モデリングフレームワークは、2つの連続したフレームを入力として、ポーズと深さの予測を同時に生成する。
第2段階では、視覚エンコーダは、将来のエゴモーションを予測し、現在の視覚観察のみに基づいて測光誤差を最適化することにより、運転方針表現を学習する。
論文 参考訳(メタデータ) (2023-01-03T08:52:49Z) - Palm up: Playing in the Latent Manifold for Unsupervised Pretraining [31.92145741769497]
本稿では,多種多様なデータセットを使用しながら探索行動を示すアルゴリズムを提案する。
私たちのキーとなるアイデアは、静的データセットに事前トレーニングされた深層生成モデルを活用し、潜在空間に動的モデルを導入することです。
次に、教師なし強化学習アルゴリズムを用いて、この環境を探索し、収集したデータに基づいて教師なし表現学習を行う。
論文 参考訳(メタデータ) (2022-10-19T22:26:12Z) - Task Compass: Scaling Multi-task Pre-training with Task Prefix [122.49242976184617]
既存の研究では、大規模教師付きタスクによるマルチタスク学習がタスク間の負の効果に悩まされていることが示されている。
タスク間の関係を探索するために,タスクプレフィックスガイド付きマルチタスク事前学習フレームワークを提案する。
我々のモデルは、幅広いタスクの強力な基盤バックボーンとして機能するだけでなく、タスク関係を分析するための探索ツールとしても実現可能である。
論文 参考訳(メタデータ) (2022-10-12T15:02:04Z) - Leveraging Pre-Trained Language Models to Streamline Natural Language
Interaction for Self-Tracking [25.28975864365579]
本研究では,自己追跡のための新たなNLPタスクを提案する。
このフレームワークは、合成サンプルを使用してタスクを10ショットの学習に変換するプロンプトを強化し、新しいトラッキングトピックをブートストラップする際のコールドスタート問題に対処する。
論文 参考訳(メタデータ) (2022-05-31T01:58:04Z) - A Survey of Fish Tracking Techniques Based on Computer Vision [11.994865945394139]
本稿では,過去7年間の魚類追跡技術の進歩を概観する。
基本的位置決めと追跡方法に重点を置き、多様な魚の追跡手法を探求する。
また、オープンソースのデータセット、評価指標、課題、魚の追跡研究への応用についても要約している。
論文 参考訳(メタデータ) (2021-10-06T07:46:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。