論文の概要: Clock-state olfactory search in turbulent flows using Q-learning: The geometry of plume recovery
- arxiv url: http://arxiv.org/abs/2605.15938v1
- Date: Fri, 15 May 2026 13:19:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-18 21:22:26.291222
- Title: Clock-state olfactory search in turbulent flows using Q-learning: The geometry of plume recovery
- Title(参考訳): Q-ラーニングによる乱流中のクロック状態嗅覚探索:配管回復の幾何学
- Authors: Marco Rando, Robin A. Heinonen, Yujia Qi, Agnese Seminara,
- Abstract要約: 過去の観測を最小限に抑えた嗅覚検索エージェントの学習にQラーニングを用いる。
この薬剤は、昆虫に見られるよく知られた行動を組み合わせた、羽根を回復するための解釈可能な戦略を学習する。
- 参考スコア(独自算出の注目度): 0.6393971049475565
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Finding an odor source in a turbulent flow requires effectively leveraging the history of olfactory observations into a robust navigation strategy. In this work, we use tabular Q-learning to train an olfactory search agent with a minimal memory of past observations: only a running clock since the last whiff. This agent learns an interpretable strategy to recover the plume which combines well-known behaviors observed in insects: surging, casting, and a return downwind. While achieving good performance on data from direct numerical simulations of turbulence, the agent is limited by an inability to adapt its strategy to the local intermittency level; we show that providing more flexibility improves robustness.
- Abstract(参考訳): 乱流中の臭源を見つけるには、嗅覚観測の歴史を効果的に活用して堅牢な航法戦略を構築する必要がある。
本研究では,過去の観測記録を最小限に抑えた嗅覚検索エージェントの学習に表型Q-ラーニングを用い,最後のホイッフ以来のランニングクロックのみを学習する。
この薬剤は、昆虫が観察するよく知られた行動、すなわち膨らみ、鋳型、そして逆風を組み合わす配管を回復するための解釈可能な戦略を学習する。
乱流の直接数値シミュレーションから得られるデータの性能は良好であるが,その戦略を局部断続レベルに適応できないため,柔軟性の向上により堅牢性の向上が期待できる。
関連論文リスト
- TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory [46.632646462295234]
提案するMemRLは,非パラメトリック強化学習をエピソードメモリ上で行うことで,エージェントの自己進化を可能にするフレームワークである。
MemRLは、セマンティックな関連性によって候補をフィルタリングし、学習したQ値に基づいて候補を選択する2相検索機構を採用している。
解析実験により,MemRLは安定性・塑性ジレンマを効果的に調整し,重み付けを伴わずに連続的なランタイム改善を可能にすることを確認した。
論文 参考訳(メタデータ) (2026-01-06T17:14:50Z) - FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories [82.90132015584359]
ReFlowはフローマッチングと理論的に整合性があるが、現実的なシナリオでは最適ではない。
本研究では,ReFlowをベースとした蒸留手法であるFlowSteerを提案する。
論文 参考訳(メタデータ) (2025-11-24T07:13:23Z) - Q-learning with temporal memory to navigate turbulence [47.28605705112213]
乱流環境における嗅覚探索の問題点を考察する。
そこで我々は,少数の解釈可能な嗅覚状態を用いた強化学習アルゴリズムを開発した。
そこで本研究では, 嗅覚の相違点が2つあり, 現実的な嗅覚プルームでナビゲーションを学ぶのに十分であることを示す。
論文 参考訳(メタデータ) (2024-04-26T15:51:20Z) - Solving Offline Reinforcement Learning with Decision Tree Regression [0.0]
本研究は, オフライン強化学習問題に対して, 回帰タスクとして再検討することで, 新たなアプローチを提案する。
我々は、リターン条件付きとリターン重み付き決定ツリーポリシーの2つの異なるフレームワークを紹介します。
オフラインRLに対するこの改定されたアプローチに固有の単純化にもかかわらず、我々のエージェントは、少なくとも確立された手法と同等の性能を示す。
論文 参考訳(メタデータ) (2024-01-21T23:50:46Z) - Diffusion Generative Flow Samplers: Improving learning signals through
partial trajectory optimization [87.21285093582446]
Diffusion Generative Flow Samplers (DGFS) はサンプルベースのフレームワークであり、学習プロセスを短い部分的軌道セグメントに分解することができる。
生成フローネットワーク(GFlowNets)のための理論から着想を得た。
論文 参考訳(メタデータ) (2023-10-04T09:39:05Z) - Emergent behavior and neural dynamics in artificial agents tracking
turbulent plumes [1.8065361710947974]
我々は、深層強化学習を用いて、リカレントニューラルネットワーク(RNN)エージェントを訓練し、シミュレートされた乱流プラムの源を見つける。
風向の変化を観測する実験的な仮説が提案されている。
論文 参考訳(メタデータ) (2021-09-25T20:57:02Z) - Automatic Recall Machines: Internal Replay, Continual Learning and the
Brain [104.38824285741248]
ニューラルネットワークのリプレイには、記憶されたサンプルを使ってシーケンシャルなデータのトレーニングが含まれる。
本研究では,これらの補助サンプルをフライ時に生成する手法を提案する。
代わりに、評価されたモデル自体内の学習したサンプルの暗黙の記憶が利用されます。
論文 参考訳(メタデータ) (2020-06-22T15:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。