論文の概要: Capability-Gated Planning: Cost-to-Goal Discovery and the Limits of Myopic Experiment Selection
- arxiv url: http://arxiv.org/abs/2608.05085v1
- Date: Wed, 05 Aug 2026 17:25:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.045203
- Title: Capability-Gated Planning: Cost-to-Goal Discovery and the Limits of Myopic Experiment Selection
- Title(参考訳): 能力向上型プランニング:コスト・ツー・ゴールの発見とミオピック実験選択の限界
- Authors: Ahmed Hassoon, Mark Dredze,
- Abstract要約: 科学的発見を自動化するシステムは、どの実験を実行するか、どの仮説をテストするか、どのツールを構築するか、いつ停止するかを繰り返す必要がある。
多くのシステムは、単位コスト当たりの期待情報ゲインや学習された可否スコアなどのスコアを最大化することで、これらの決定を行う。
いくつかのアクションは構成的であり、すぐに返される情報ではなく、それが利用できる将来的なアクションに価値をもたらす能力を取得する。
- 参考スコア(独自算出の注目度): 11.987280372027032
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Systems that automate scientific discovery must repeatedly decide which experiment to run, which hypothesis to test, which tool to build, and when to stop. Many systems make these decisions by maximizing a myopic score such as expected information gain per unit cost or a learned plausibility score. We identify a structural limitation of this approach. Some actions are constructive: they acquire an epistemic capability (an instrument, assay, pipeline, simulator, or abstraction) whose value lies not in the information returned immediately but in the future actions it makes available. When the least-cost route to a confident answer requires a chain of such constructions, a planner that scores actions only by information obtainable within a bounded horizon cannot value the first construction: it yields no information within the horizon and is dominated by any measurement with positive information, however small. We formulate goal-directed discovery as a stochastic shortest-path problem in belief space in which constructive experiments change the downstream action graph, and prove that for every lookahead depth d there is an instance on which every myopic information-maximizing planner has an unbounded approximation ratio, and a related instance on which it never reaches the goal. The mechanism is a capability-indistinguishability lemma: within the horizon, acquiring a capability can be observationally indistinguishable from paying for a null action. This establishes capability gating as a reachability axis of difficulty distinct from curvature (submodularity) and information order (adaptivity gaps). We introduce CG-Plan, an incremental replanner with a capability-aware cost-to-go heuristic h = h_cap + h_exp. In a controlled testbed, the performance gap appears only under gating, persists for every fixed horizon, and arises when near-miss hypotheses come from a data-consistent proposer.
- Abstract(参考訳): 科学的発見を自動化するシステムは、どの実験を実行するか、どの仮説をテストするか、どのツールを構築するか、いつ停止するかを繰り返す必要がある。
多くのシステムは、単位コスト当たりの情報ゲインや学習された可視性スコアなどのミオピックスコアを最大化することで、これらの決定を行う。
このアプローチの構造的制限を特定します。
エピステミック能力(測定器、パイプライン、シミュレータ、抽象化)を入手し、その価値はすぐに返される情報ではなく、それが利用できる将来的なアクションにある。
信頼度の高い答えへの最小コストの経路がそのような構成の連鎖を必要とする場合、境界地平線内で取得可能な情報のみによってアクションをスコアするプランナーは、最初の構成を評価できない。
建設実験が下流の行動グラフを変化させる信念空間における確率的最短パス問題としてゴール指向発見を定式化し、すべてのルックアヘッド深さdに対して、すべての筋情報最大化プランナーが非有界近似比を持ち、その目標に到達しない関連事例が存在することを証明する。
このメカニズムは能力の区別不可能な補題であり、水平線内では、能力の獲得は、ヌルアクションの支払いから観察的に区別できない。
これは、曲率(部分モジュラリティ)と情報順序(適応性ギャップ)とは異なる難易度軸としての能力ゲーティングを確立する。
CG-Planは,能率を意識した高コストヒューリスティックh = h_cap + h_exp のインクリメンタルリプランナである。
制御されたテストベッドでは、パフォーマンスギャップはゲーティングの下でのみ現れ、固定された水平線毎に持続し、データ一貫性のあるプロポーサからほぼミス仮説が生じる。
関連論文リスト
- Active Timepoint Selection for Learning Measure-Valued Trajectories [55.49809248697036]
スナップショットから連続確率パスを推定することは、単細胞生物学のような領域における根本的な課題である。
スパース測度空間にアクティブな実験を拡張するフレームワークを導入する。
これにより、不確実性を最小限に抑えるために測定時間を反復的に選択する取得ポリシーが得られる。
論文 参考訳(メタデータ) (2026-05-28T22:22:35Z) - Prediction and Empowerment: A Theory of Agency through Bridge Interfaces [0.10152838128195464]
決定論的物理・シミュレートされた世界における部分的観測可能性の下でエージェントを研究する。
我々は予測、圧縮、エンパワーメントの分離を証明している。
現代のAIエージェントにとって、結果は必然性の定理ではなく設計原則を示唆している。
論文 参考訳(メタデータ) (2026-05-07T14:30:46Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - Active Epistemic Control for Query-Efficient Verified Planning [1.8055130471307603]
モデルに基づく信念管理とカテゴリー的可能性チェックを統合した計画層である textbfActive Epistemic Control (AEC) を提案する。
AECは、コミットメントに使用されるアンフグラウンドのファクトストアと、候補プランの刈り取りにのみ使用されるエンフベーリフストアとを厳格に分離している。
論文 参考訳(メタデータ) (2026-02-03T19:51:10Z) - Bayesian Inverse Games with High-Dimensional Multi-Modal Observations [23.911680800112375]
マルチエージェントの相互作用シナリオは自然に非協調ゲームとしてモデル化され、各エージェントの判断は他のエージェントの将来の行動に依存する。
逆ゲーム問題を解くための近似ベイズ推論手法を提案する。
提案フレームワークは,事前および後続分布の学習に成功し,推論品質を向上し,下流での意思決定をより安全に行えることを示す。
論文 参考訳(メタデータ) (2026-01-02T14:23:38Z) - Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation [6.993095391722284]
エージェントは限られた知識で未知の環境を探索しなければならないため、身体的視覚ナビゲーションは依然として困難な課題である。
既存のゼロショット研究では、ゴール指向動作をサポートするメモリ機構を組み込むことで、長期計画性能が向上することが示されている。
ゼロショットフレームワークであるセマンティック・コグニション・オーバー・ポテンシャルベース探索(SCOPE)を提案する。
論文 参考訳(メタデータ) (2025-11-12T03:23:09Z) - Trust Your $\nabla$: Gradient-based Intervention Targeting for Causal Discovery [49.084423861263524]
本稿では,GIT を短縮した新しいグラディエント型インターベンションターゲティング手法を提案する。
GITは、介入獲得関数の信号を提供するために勾配に基づく因果探索フレームワークの勾配推定器を「信頼」する。
我々はシミュレーションおよび実世界のデータセットで広範な実験を行い、GITが競合するベースラインと同等に動作することを示す。
論文 参考訳(メタデータ) (2022-11-24T17:04:45Z) - Temporal Difference Uncertainties as a Signal for Exploration [76.6341354269013]
強化学習における探索の効果的なアプローチは、最適な政策に対するエージェントの不確実性に依存することである。
本稿では,評価値のバイアスや時間的に矛盾する点を強調した。
本稿では,時間差誤差の分布の導出に依存する値関数の不確かさを推定する手法を提案する。
論文 参考訳(メタデータ) (2020-10-05T18:11:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。