論文の概要: Learning Action Models with Conditional and Quantified Effects via Uncertainty-Guided Exploration
- arxiv url: http://arxiv.org/abs/2608.30955v1
- Date: Mon, 31 Aug 2026 15:23:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.478414
- Title: Learning Action Models with Conditional and Quantified Effects via Uncertainty-Guided Exploration
- Title(参考訳): 不確実性誘導探索による条件付き定量的効果を用いた学習行動モデル
- Authors: Jeffrey Jewett, William Solow, Sandhya Saisubramanian,
- Abstract要約: 既存の行動モデル学習法は、単純な行動表現を仮定するか、条件付きおよび定量化された効果を学習する際に計算的に難解になる。
オンライン仮説駆動型行動モデル学習(OHCAM: Online hypothesis-Driven Action Model Learning)は、環境との限られた相互作用から条件付きおよび定量化された効果を持つ行動モデルを学ぶためのオンラインアプローチである。
- 参考スコア(独自算出の注目度): 3.825358340033492
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate action models are critical for effective planning. Existing action-model learning methods largely assume simple action representations or become computationally intractable when learning conditional and quantified effects. We present Online Hypothesis-Driven Conditional Action Model Learning (OHCAM), an online approach for learning action models with conditional and quantified effects from limited interactions with the environment. OHCAM maintains a belief over hypothesized action models and actively selects informative actions to reduce uncertainty by maximizing disagreement among competing hypotheses, while being robust to noisy observations. To enable scalability, OHCAM begins with a small set of simple action model hypotheses and expands to more complex conditions only when the current hypotheses become inconsistent with the data. Experiments on six benchmark planning domains demonstrate that OHCAM is sample efficient in learning action models that solve substantially more tasks than baselines, even with observation noise. We validate OHCAM on two tasks using a Kinova Gen3 robot, demonstrating the real-world applicability of our approach.
- Abstract(参考訳): 正確な行動モデルは効果的な計画に不可欠である。
既存の行動モデル学習法は、条件付きおよび定量化された効果を学習する際に、主に単純な行動表現を仮定するか、計算的に難解になる。
環境との限られた相互作用から条件付きおよび定量化された効果を持つ行動モデルを学ぶためのオンライン・仮説駆動型条件付き行動モデル学習(OHCAM)を提案する。
OHCAMは仮説化された行動モデルに対する信念を維持し、競合する仮説間の不一致を最大化して不確実性を低減するために情報的行動を選択する。
スケーラビリティを実現するために、OHCAMは小さな単純なアクションモデル仮説から始まり、現在の仮説がデータと矛盾するときにのみ、より複雑な状態へと拡張する。
6つのベンチマーク計画領域の実験では、OHCAMは観測ノイズがあってもベースラインよりもはるかに多くのタスクを解く行動モデルを学ぶのに有効であることが示された。
我々は,Kinova Gen3ロボットを用いた2つのタスクにおけるOHCAMの有効性を検証する。
関連論文リスト
- Personalized and Robust Proactive Robot Assistance with Uncertainty-Guided LLM Reasoning [4.243926243206826]
家庭環境における積極的ロボット支援は、ダイナミックでノイズの多い環境下での人間の活動と物体の使用を正確に予測する必要がある。
我々は,n時間マルコフモデルと不確実性誘導型大言語モデル(LLM)推論を組み合わせた軽量なフレームワークGLOBEを提案する。
その結果、GLOBEは最先端の手法と競合する性能を達成し、クリーンノイズの両設定における堅牢性と計算効率を改善した。
論文 参考訳(メタデータ) (2026-06-07T05:18:30Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction [53.745458605360675]
効率的な相互作用とアクティブ推論(WMAct)による世界モデル内在化を探求する。
WMActは、モデルを構造化推論から解放し、モデルがその実行を通じて思考を直接形作ることを可能にする。
ソコバン, 迷路, タクシーの実験から, WMActは一つのターンでタスクを解決できる効果的な世界モデル推論を導出することを示した。
論文 参考訳(メタデータ) (2025-11-28T18:59:47Z) - ACT-JEPA: Novel Joint-Embedding Predictive Architecture for Efficient Policy Representation Learning [90.41852663775086]
ACT-JEPAは模倣学習と自己教師型学習を統合する新しいアーキテクチャである。
我々はアクションシーケンスと抽象的な観察シーケンスを予測するポリシーを訓練する。
実験の結果,ACT-JEPAは時間環境の動的学習によって表現の質を向上させることがわかった。
論文 参考訳(メタデータ) (2025-01-24T16:41:41Z) - Can foundation models actively gather information in interactive environments to test hypotheses? [43.42688356541211]
基礎モデルはシングルターン推論において優れているが、動的環境におけるマルチターン探索に苦慮している。
これらのモデルを,経験から学び,適応し,情報を収集する能力に基づいて評価した。
論文 参考訳(メタデータ) (2024-12-09T12:27:21Z) - STAR: Constraint LoRA with Dynamic Active Learning for Data-Efficient Fine-Tuning of Large Language Models [21.929902181609936]
我々は不確実性に基づくアクティブラーニングとLoRAを統合する新しい手法を提案する。
不確実性ギャップについて、ベースモデルの不確実性とフルモデルの不確実性を組み合わせた動的不確実性測定を導入する。
モデルのキャリブレーションが不十分な場合、LoRAトレーニング中に正規化手法を導入し、モデルが過度に信頼されないようにする。
論文 参考訳(メタデータ) (2024-03-02T10:38:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。