論文の概要: Temporal-Causal Inference for Reinforcement Learning via Automata Learning
- arxiv url: http://arxiv.org/abs/2609.07461v1
- Date: Mon, 07 Sep 2026 13:12:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.429848
- Title: Temporal-Causal Inference for Reinforcement Learning via Automata Learning
- Title(参考訳): オートマタ学習による強化学習のための時間・因果推論
- Abstract要約: 隠れ時間パターンによって支配される不可逆的な位相遷移を行う動的環境下での強化学習について考察する。
制御ポリシを共同で学習し,位相遷移の隠された時間的原因を推測するフレームワークであるTCIRL(Temporal-Causal Inference for Reinforcement Learning)を紹介する。
- 参考スコア(独自算出の注目度): 5.850768184616051
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We consider reinforcement learning in environments with dynamics that undergo an irreversible phase transition governed by a hidden temporal pattern. The agent observes the base state but cannot observe the phase directly. We formalize this problem as a two-phase non-Markovian decision process and introduce Temporal-Causal Inference for Reinforcement Learning (TCIRL), a framework that jointly learns a control policy and infers the hidden temporal cause of the phase transition. TCIRL maintains a hypothesis deterministic finite automaton (DFA) to track what phase is active and refines it via counterexample-driven SAT-based synthesis. We prove that the hypothesis converges almost surely to a DFA recognizing the true cause language on all attainable label sequences, yielding an optimal policy for the original non-Markovian decision process. Experiments on a genetic therapy gridworld and a traffic signal environment show that TCIRL recovers the correct cause DFA and matches the full-information baseline in both domains.
- Abstract(参考訳): 隠れ時間パターンによって支配される不可逆的な位相遷移を行う動的環境下での強化学習について考察する。
エージェントは基底状態を観察するが、直接位相を観察することはできない。
我々はこの問題を2相非マルコフ決定プロセスとして形式化し、制御ポリシーを共同で学習し、位相遷移の隠された時間的原因を推測するフレームワークTCIRLを導入する。
TCIRLは仮説決定論的有限オートマトン(DFA)を維持して、どのフェーズがアクティブかを追跡し、逆例駆動SATベースの合成によってそれを洗練する。
この仮説はほぼ確実に DFA に収束し、到達可能な全てのラベル列上の真の因果言語を認識し、元の非マルコフ決定過程に最適なポリシーをもたらすことを証明している。
遺伝子治療グリッドワールドと交通信号環境の実験は、TCIRLが正しい原因DFAを回復し、両方のドメインの完全な情報ベースラインと一致していることを示している。
関連論文リスト
- Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models [49.46165710676499]
最初のアライメント段階から意味収束が観察される。
我々は収束を明らかにし増幅することができるが、SFTデータでは導入されないことを発見した。
その結果,LMトレーニングの根底にある目的から,意味収束が自然に生じる可能性が示唆された。
論文 参考訳(メタデータ) (2026-08-11T20:47:06Z) - Constructed Reality, Contested Priors: Decoupling and the Architecture of Cognitive Relapse Under the Free Energy Principle [0.0]
自由エネルギー原理の下では、予測システムは直接現実を観察しない。
それは世界の生成モデルを維持し、そのモデルの最良の仮説を経験する。
合成環境は、予測システムの独自の推論機構がこのデフォルト仮説として採用するのに十分な整合性を持たせることができるのか?
論文 参考訳(メタデータ) (2026-07-12T07:08:49Z) - Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation [5.524438437366922]
変形可能なオブジェクト操作のための位相条件付き力覚フレームワークを提案する。
FiLM条件のACTエンコーダは、現在のタスクフェーズに基づいて特徴抽出を変調する。
視覚、力、ポーズフィードバックを融合させた多モード位相予測器は、視覚単独では見えない接触障害をリアルタイムで推定する。
論文 参考訳(メタデータ) (2026-05-28T05:59:53Z) - Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency [53.28076739140119]
本稿では,視覚・言語モデル(VLM)における論理的一貫性を幾何学的・言語的双対性演算によって実現する枠組みを提案する。
SAGEは、従来のGRPO法に比べてモデルに依存しず、データ効率が良く、既存のVLMに軽量な後学習段階として適用することができる。
ビデオおよび空間推論ベンチマークの実験では、強いベースラインよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-18T10:05:21Z) - Modular Continual Learning via Zero-Leakage Reconstruction Routing and Autonomous Task Discovery [0.9137554315375919]
ニューラルネットワークのシーケンシャルなタスク学習において、破滅的な忘れは依然として主要なハードルである。
本稿では,タスク特化専門家と分散型外乱型ゲートキーパーを用いた構造パラメータ分離を実現するシリコンネイティブなモジュールアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-04-15T19:48:40Z) - Cognitive Friction: A Decision-Theoretic Framework for Bounded Deliberation in Tool-Using Agents [0.0]
制約のないツール使用エージェントは、どの情報ソースをクエリして実行するかを決めなければなりません。
本稿では,これらの障害モードを認知的摩擦によって形式化する決定論的枠組みであるTCAを提案する。
我々は,TCAを2つの制御された環境において,停止品質,混雑時の行動選択,時間的緊急性の分離を図った。
論文 参考訳(メタデータ) (2026-03-31T17:30:25Z) - Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method [59.30562121800656]
Open-Vocabulary Object Detectionは、新しいカテゴリへの一般化において大きな成功を収めた。
我々は、OVODパラダイムの原則的な見直しを行い、根本的な脆弱性を明らかにする。
PICA(Progressive Domain-invariant Cross-Modal Alignment)を提案する。
論文 参考訳(メタデータ) (2026-03-29T07:39:31Z) - Uncovering Latent Phase Structures and Branching Logic in Locomotion Policies: A Case Study on HalfCheetah [7.647276696906605]
移動制御タスクでは、Deep Reinforcement Learningは高いパフォーマンスを示した。
しかし、学習方針の決定過程は依然としてブラックボックスであり、人間が理解することが困難である。
この研究は、移動制御のために訓練されたポリシーは、人間によって解釈される相構造を表わすかもしれないという仮説を立てた。
論文 参考訳(メタデータ) (2026-03-18T08:12:40Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - Understanding Catastrophic Interference: On the Identifibility of Latent Representations [67.05452287233122]
破滅的な干渉、あるいは破滅的な忘れ(Caastrophic forgetting)は、機械学習の根本的な課題である。
本稿では,破滅的干渉を識別問題として定式化する新しい理論枠組みを提案する。
我々のアプローチは、合成データセットとベンチマークデータセットの両方で理論的保証と実用的なパフォーマンスの改善を提供する。
論文 参考訳(メタデータ) (2025-09-27T00:53:32Z) - Causal Temporal Representation Learning with Nonstationary Sparse Transition [22.6420431022419]
Causal Temporal Representation Learning (Ctrl) 法は、複雑な非定常時間列の時間的因果ダイナミクスを特定することを目的としている。
この研究は、人間の直感的な理解と整合したスパース遷移の仮定を採用し、理論的な観点から識別可能性の結果を提示している。
本稿では,非定常スパース遷移を用いた因果時間表現学習(CtrlNS)を提案する。
論文 参考訳(メタデータ) (2024-09-05T00:38:27Z) - On the Identification of Temporally Causal Representation with Instantaneous Dependence [50.14432597910128]
時間的因果表現学習は時系列観測から潜在因果過程を特定することを目的としている。
ほとんどの方法は、潜在因果過程が即時関係を持たないという仮定を必要とする。
我々は,インスタントtextbfOus textbfLatent dynamics のための textbfIDentification フレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-24T08:08:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。