論文の概要: From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments
- arxiv url: http://arxiv.org/abs/2603.23964v1
- Date: Wed, 25 Mar 2026 05:56:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-26 21:06:11.149909
- Title: From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments
- Title(参考訳): 画像からデジタルエージェントへ:強化学習環境の分類学と技術動向に関する実証的研究
- Authors: Lijing Luo, Yiben Luo, Alexey Gorbatovski, Sergey Kovalchuk, Xiaodan Liang,
- Abstract要約: 強化学習(RL)は、人工エージェントの訓練や評価に用いられる環境と本質的に結びついている。
この研究は、従来の定性的なレビューを超えて、進化に関する大規模な実証的研究を提示する。
- 参考スコア(独自算出の注目度): 40.37268689666231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The remarkable progress of reinforcement learning (RL) is intrinsically tied to the environments used to train and evaluate artificial agents. Moving beyond traditional qualitative reviews, this work presents a large-scale, data-driven empirical investigation into the evolution of RL environments. By programmatically processing a massive corpus of academic literature and rigorously distilling over 2,000 core publications, we propose a quantitative methodology to map the transition from isolated physical simulations to generalist, language-driven foundation agents. Implementing a novel, multi-dimensional taxonomy, we systematically analyze benchmarks against diverse application domains and requisite cognitive capabilities. Our automated semantic and statistical analysis reveals a profound, data-verified paradigm shift: the bifurcation of the field into a "Semantic Prior" ecosystem dominated by Large Language Models (LLMs) and a "Domain-Specific Generalization" ecosystem. Furthermore, we characterize the "cognitive fingerprints" of these distinct domains to uncover the underlying mechanisms of cross-task synergy, multi-domain interference, and zero-shot generalization. Ultimately, this study offers a rigorous, quantitative roadmap for designing the next generation of Embodied Semantic Simulators, bridging the gap between continuous physical control and high-level logical reasoning.
- Abstract(参考訳): 強化学習(RL)の顕著な進歩は、人工エージェントの訓練と評価に使用される環境と本質的に結びついている。
従来の定性的なレビューを超えて、この研究はRL環境の進化に関する大規模でデータ駆動の実証的研究を提示する。
学術文献の膨大なコーパスをプログラム的に処理し,2000件以上のコアパブリッシングを厳格に蒸留することにより,独立した物理シミュレーションから一般言語主体の基盤エージェントへの遷移をマッピングする定量的手法を提案する。
新たな多次元分類法を実装し,多様なアプリケーションドメインと必要な認知能力に対して,ベンチマークを体系的に分析する。
大規模言語モデル(LLM)とドメイン特化一般化(Domain-Specific Generalization)のエコシステムが支配する「セマンティックプライオリティ」エコシステムへの分野の分岐。
さらに、これらの異なるドメインの「認知指紋」を特徴付け、クロスタスク・シナジー、マルチドメイン干渉、ゼロショット一般化の基礎メカニズムを明らかにする。
最終的に、この研究は、次世代のエンボディード・セマンティック・シミュレータを設計するための厳密で定量的なロードマップを提供し、連続的な物理的制御と高レベルの論理的推論のギャップを埋める。
関連論文リスト
- THETA: A Textual Hybrid Embedding-based Topic Analysis Framework and AI Scientist Agent for Scalable Computational Social Science [5.225859530177356]
本稿では,テキストハイブリッド埋め込みに基づくトピック分析(THETA)を紹介する。
THETAは、膨大なデータスケールと豊富な理論深度の間のギャップを埋める、新しい計算パラダイムとオープンソースツールである。
以上の結果から,LDA,EMM,CTMなどの従来のモデルよりも高い性能を示した。
論文 参考訳(メタデータ) (2026-03-06T07:12:05Z) - The Landscape of Agentic Reinforcement Learning for LLMs: A Survey [103.32591749156416]
エージェント強化学習(Agentic RL)の出現は、大規模言語モデル(LLM RL)に適用された従来の強化学習からパラダイムシフトを示している。
本研究では, LLM-RLの縮退した単段階マルコフ決定過程(MDPs)と, エージェントRLを定義する部分可観測マルコフ決定過程(POMDPs)とを対比することにより, この概念シフトを定式化する。
論文 参考訳(メタデータ) (2025-09-02T17:46:26Z) - A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers [251.23085679210206]
科学大規模言語モデル(Sci-LLMs)は、科学研究において、知識の表現、統合、適用の方法を変えつつある。
この調査は、モデルとその基盤となるデータ基板の共進化として、Sci-LLMの開発を再考する。
我々は、科学的データの統一された分類法と、科学的知識の階層的なモデルを定式化する。
論文 参考訳(メタデータ) (2025-08-28T18:30:52Z) - Transformer-based Spatial Grounding: A Comprehensive Survey [3.309903719647421]
本稿では,2018年から2025年にかけての変圧器を用いた空間接地手法について,系統的な文献レビューを行った。
我々の分析では、支配的なモデルアーキテクチャ、一般的なデータセット、広く採用されている評価指標を識別する。
この研究は、研究者や実践者にとって不可欠な洞察と構造化されたガイダンスを提供し、堅牢で信頼性があり、業界対応のモデルの開発を促進する。
論文 参考訳(メタデータ) (2025-07-17T02:44:01Z) - Adaptive Token Boundaries: Integrating Human Chunking Mechanisms into Multimodal LLMs [0.0]
本研究は,ヒトのクロスモーダルチャンキング機構とトークン表現手法の並列性について,系統的研究を行った。
本稿では,適応的境界,階層的表現,認知科学の原理に基づくアライメント機構を取り入れた動的クロスモーダルトークン化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-03T09:14:24Z) - A Survey on Post-training of Large Language Models [185.51013463503946]
大規模言語モデル(LLM)は、自然言語処理を根本的に変革し、会話システムから科学的探索まで、さまざまな領域で欠かせないものにしている。
これらの課題は、制限された推論能力、倫理的不確実性、最適なドメイン固有のパフォーマンスといった欠点に対処するために、先進的な訓練後言語モデル(PoLM)を必要とする。
本稿では,タスク固有の精度を向上するファインチューニング,倫理的コヒーレンスと人間の嗜好との整合性を保証するアライメント,報酬設計の課題によらず多段階の推論を進める推論,統合と適応の5つのパラダイムを体系的に追跡したPoLMの総合的な調査について述べる。
論文 参考訳(メタデータ) (2025-03-08T05:41:42Z) - Deep Learning and Machine Learning -- Object Detection and Semantic Segmentation: From Theory to Applications [17.571124565519263]
オブジェクト検出とセマンティックセグメンテーションの詳細な探索を行う。
機械学習とディープラーニングの最先端を概観する。
ビッグデータ処理の解析について述べる。
論文 参考訳(メタデータ) (2024-10-21T02:10:49Z) - Towards Next-Generation Urban Decision Support Systems through AI-Powered Construction of Scientific Ontology using Large Language Models -- A Case in Optimizing Intermodal Freight Transportation [1.6230958216521798]
本研究では,事前学習された大規模言語モデル(LLM)を活用する可能性について検討する。
推論コアとしてChatGPT APIを採用することで、自然言語処理、メソノロジーベースのプロンプトチューニング、トランスフォーマーを含む統合ワークフローを概説する。
我々の方法論の成果は、広く採用されているオントロジー言語(OWL、RDF、SPARQLなど)の知識グラフである。
論文 参考訳(メタデータ) (2024-05-29T16:40:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。