論文の概要: Answer-Set-Programming-based Abstractions for Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.31444v1
- Date: Fri, 29 May 2026 15:40:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.707661
- Title: Answer-Set-Programming-based Abstractions for Reinforcement Learning
- Title(参考訳): 強化学習のためのAnswer-Set-Programming-based Abstractions
- Abstract要約: 強化学習(Reinforcement Learning, RL)は、自律的なエージェントによる学習を可能にする。
Martijn van Otterlo氏によるCARCASSフレームワークは、一階述語におけるマルコフ決定過程(MD)の論理近似がどのようにモデル化できるかを実証している。
我々は、CARCASSの抽象化を実現するために、完全に宣言的なモデリング言語であるPrologとは対照的に、リッチな世界であるASPを探究する。
- 参考スコア(独自算出の注目度): 11.527421282223946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement Learning (RL) enables autonomous agents to learn policies from experience, but realistic problems often involve enormous state spaces, making learning and generalisation challenging. Abstraction and approximation are therefore essential. Relational Reinforcement Learning (RRL) offers a way to reason about objects and their relations, and the CARCASS framework by Martijn van Otterlo demonstrates how logical representations can model Markov Decision Processes (MDPs) in first-order domains. Originally implemented in Prolog, CARCASS leverages domain knowledge to create powerful abstractions. We explore Answer-Set Programming (ASP), which is a rich and, contrary to Prolog, fully declarative modelling language, to realise CARCASS abstractions. We evaluate our ASP-based implementation in case studies of two domains, viz. Blocks World and Minigrid. Our results indicate that CARCASS with ASP provides a promising approach to constructing abstractions for RL, especially when domain knowledge is available.
- Abstract(参考訳): 強化学習(RL)は、自律エージェントが経験からポリシーを学ぶことを可能にするが、現実的な問題はしばしば巨大な状態空間を伴い、学習と一般化が困難になる。
したがって抽象化と近似が不可欠である。
リレーショナル強化学習(RRL)はオブジェクトとその関係を推論する手段を提供し、Martijn van Otterlo氏によるCARCASSフレームワークは、一階述語領域におけるマルコフ決定プロセス(MDP)のモデル化方法を示している。
元々Prologで実装され、CARCASSはドメイン知識を活用して強力な抽象化を作成する。
我々は、リッチで完全に宣言的なモデリング言語であるAnswer-Set Programming (ASP)を調査し、CARCASSの抽象化を実現する。
ASP-based implementation in case study of two domain, viz。
ブロック・ワールドとミニグリッド。
この結果から,ASP と CARCASS は RL の抽象化,特にドメイン知識が利用可能である場合に,将来性のあるアプローチを提供することが明らかとなった。
関連論文リスト
- Understanding Automated Web GUI Testing: An Empirical Study Across Exploration Strategies and State Abstractions [12.068986139687908]
探索戦略と状態抽象化がテストの有効性にどのように影響するかを考察する。
カテゴリはコードカバレッジ、状態カバレッジ、障害発見において相補的な長所を示す。
論文 参考訳(メタデータ) (2026-06-15T12:40:12Z) - Learning Abstractions for Hierarchical Planning in Program-Synthesis Agents [54.73952501784257]
人間は抽象化を学び、それらを効率的に計画し、タスクをまたいで迅速に一般化する。
我々は,再利用可能な抽象化を積極的に学習する新しい大規模言語モデル (LLM) エージェントである TheoryCoder-2 を紹介する。
我々は,BabyAI,Minihack,SokobanのようなVGDLゲームなど,さまざまな環境で実験を行っている。
論文 参考訳(メタデータ) (2026-01-31T23:01:51Z) - Using Large Language Models for Abstraction of Planning Domains - Extended Version [6.021787236982658]
PDDLにおけるエージェントの具体的な振る舞いをモデル化し、大規模言語モデル(LLM)を用いた文脈内学習の利用について検討する。
代替具体的なアクションの選択の抽象化、具体的なアクションのシーケンスの抽象化、アクション/述語パラメータの抽象化の3つのカテゴリについて検討する。
生成された抽象PDDLドメインと問題インスタンスは、シンボル検証ツールと人間の専門家によってチェックされる。
論文 参考訳(メタデータ) (2025-10-23T06:27:03Z) - Integrating Domain Knowledge into Process Discovery Using Large Language Models [3.7448613209842967]
本稿では,自然言語で表現されたドメイン知識をプロセス発見パイプラインに組み込む対話型フレームワークを提案する。
このフレームワークは、LLM(Large Language Models)、ドメインエキスパート、バックエンドサービスのセット間のインタラクションを調整する。
我々の実証研究は、実際のイベントログに基づくケーススタディと、フレームワークのユーザビリティと有効性を評価するドメインエキスパートの関与を含む。
論文 参考訳(メタデータ) (2025-10-08T15:59:11Z) - RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems [98.98963933669751]
問題が発生したら、複数の抽象化を提案できるモデルをトレーニングし、続いてソリューション構築のインセンティブを与えるRLを作ります。
この結果、RLトレーニングパラダイムはRLADと呼ばれ、抽象化ジェネレータとソリューションジェネレータを共同で訓練する。
我々は、大規模なテスト予算で多くのソリューションを生成するよりも、より多くのテスト時間計算を抽象化の生成に割り当てることが、パフォーマンスに有益であることを示しています。
論文 参考訳(メタデータ) (2025-10-02T17:44:23Z) - Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains [92.36624674516553]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデル(LLM)の数学的推論と符号化性能の向上に成功している。
本稿では,医学,化学,心理学,経済学,教育など,さまざまな現実世界領域におけるRLVRの有効性と拡張性について検討する。
我々は,2値検証による制限を克服するために,ソフトなモデルに基づく報酬信号を生成する生成的スコアリング手法を利用する。
論文 参考訳(メタデータ) (2025-03-31T08:22:49Z) - R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning [87.30285670315334]
textbfR1-Searcherは、大規模言語モデルの検索能力を高めるために設計された、2段階の結果に基づく新しいRLアプローチである。
本フレームワークは, コールドスタート時に, プロセス報酬や蒸留を必要とせず, RLのみに依存している。
提案手法は, クローズドソースGPT-4o-miniと比較して, 従来の強力なRAG法よりも有意に優れていた。
論文 参考訳(メタデータ) (2025-03-07T17:14:44Z) - Reasoning Language Models: A Blueprint [16.04440875855868]
推論言語モデル(RLM)は、AIの問題解決能力を再定義した。
しかし、それらの高コスト、プロプライエタリな性質、複雑なアーキテクチャは、アクセシビリティとスケーラビリティの課題を提示している。
本稿では、RLMコンポーネントをモジュール化フレームワークにまとめる包括的青写真を提案する。
論文 参考訳(メタデータ) (2025-01-20T02:16:19Z) - Multi-step Inference over Unstructured Data [2.169874047093392]
医療、法律、金融などの分野における高い意思決定タスクは、精度、包括性、論理的一貫性のレベルを必要とする。
これらの問題に対処するための,ニューロシンボリックAIプラットフォームを開発した。
このプラットフォームは、知識抽出とアライメントのための微調整LDMと、堅牢なシンボリック推論エンジンを統合している。
論文 参考訳(メタデータ) (2024-06-26T00:00:45Z) - Building Minimal and Reusable Causal State Abstractions for
Reinforcement Learning [63.58935783293342]
Causal Bisimulation Modeling (CBM) は、各タスクのダイナミクスと報酬関数の因果関係を学習し、最小限のタスク固有の抽象化を導出する手法である。
CBMの学習された暗黙的ダイナミクスモデルは、明確なものよりも根底にある因果関係と状態抽象化を正確に識別する。
論文 参考訳(メタデータ) (2024-01-23T05:43:15Z) - Knowledge Plugins: Enhancing Large Language Models for Domain-Specific
Recommendations [50.81844184210381]
本稿では,大規模言語モデルをDOmain固有のKnowledgEで拡張し,実践的アプリケーション,すなわちDOKEの性能を向上させるためのパラダイムを提案する。
このパラダイムはドメイン知識抽出器に依存し,1)タスクに効果的な知識を準備すること,2)特定のサンプルごとに知識を選択すること,3)LLMで理解可能な方法で知識を表現すること,の3つのステップで動作する。
論文 参考訳(メタデータ) (2023-11-16T07:09:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。