論文の概要: Q-Learning Lab: Teaching Reinforcement Learning Through Learner-Generated Trace Analysis
- arxiv url: http://arxiv.org/abs/2607.10802v1
- Date: Sun, 12 Jul 2026 15:18:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.544392
- Title: Q-Learning Lab: Teaching Reinforcement Learning Through Learner-Generated Trace Analysis
- Title(参考訳): Q-Learning Lab:学習者生成トレース分析による強化学習の指導
- Authors: Ekkachai Jueng,
- Abstract要約: Q-ラーニングラボ(Q-Learning Lab)は、Q-ラーニングを教えるための、シングルファイル、ブラウザベース、バイリンガル(タイ語/英語)ツールである。
このツールは、各ステップで数値更新を示すライブのベルマン置換パネルを公開し、各トランジションをログする。
学習者は自身のエージェントを実行し、完全なトレースをCSVとしてエクスポートし、それ自身で分析する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning is usually introduced through the Bellman update, yet the equation often remains abstract to undergraduates: they watch policy arrows converge but rarely observe how each value is computed or why an action is chosen. We present Q-Learning Lab, a single-file, browser-based, bilingual (Thai/English) tool for teaching tabular Q-learning that requires no installation. Beyond the usual gridworld visualization - color-coded Q-values and policy arrows on a $5 \times 5$ world - the tool exposes a live Bellman-substitution panel showing the numeric update at every step, and logs each transition, including the full pre-action Q-row, the greedy-versus-random decision under $\varepsilon$-greedy exploration, and wall-collision events, into an exportable trace. The central contribution is a learn-export-analyze loop: learners run their own agent, export the complete trace as CSV, and analyze it themselves, producing learning curves, value heatmaps, and visitation maps, turning a passive demonstration into a source of learner-generated data for reflective inquiry. We validate the tool without human-subject data through three complementary evaluations: (i) correctness of the learned values and policy against a value-iteration ground truth on the identical MDP; (ii) hyperparameter sweeps over $α$, $γ$, and $\varepsilon$ showing that every pedagogical claim the tool makes is reproducible; and (iii) a reward-editing study that uses the ground-truth optimal policy to separate two behaviorally identical but diagnostically opposite failure modes - an exploration failure versus genuine reward misspecification - that a single edited reward can produce. We also compare the tool against existing gridworld visualizers, describe its grounding in learning-by-doing pedagogy, and include a 50-minute lesson plan. The tool and all experiment code are openly available.
- Abstract(参考訳): 強化学習は通常、ベルマンの更新によって導入されるが、この方程式は学部生には抽象的であり、政策矢印が収束するのを見るが、それぞれの値がどのように計算されるか、なぜアクションが選択されるかを見ることは稀である。
Q-Learning Labは、シングルファイル、ブラウザベース、バイリンガル(タイ語/英語)ツールで、インストール不要な表形式のQ-ラーニングを教える。
通常のグリッドワールドビジュアライゼーションに加えて、カラーコードされたQ値とポリシー矢印が5ドル(約5万2000円)の世界に表示される。このツールは、すべてのステップで数値更新を示すライブのベルマン置換パネルを公開し、フルプレアクションのQ-row、$\varepsilon$-greedyの探索によるgreedy-versus-random決定、壁の衝突イベントなど、各トランジションをエクスポート可能なトレースに記録する。
学習者は自身のエージェントを実行し、完全なトレースをCSVとしてエクスポートし、それを自身で分析し、学習曲線、価値ヒートマップ、訪問マップを生成し、受動的デモを学習者が生成したデータソースに変換して反射的調査を行う。
我々は,3つの相補的評価を通して,人体データのないツールを検証する。
一 同一のMDP上の価値判断基盤真理に対する学習価値及び政策の正当性
(ii)ハイパーパラメータが$α$、$γ$、$\varepsilon$を超えると、ツールが行うすべての教育的主張が再現可能であることを示す。
三 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第二報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一報 第一章 第一章 第二章 第二章 第二章 第二章 第二章 第一章 第一章 第一章 第一章 第一章 第一章 第一章 第一報。
また、既存のグリッドワールド・ヴィジュアライザーと比較し、学習ごとの教育の基盤を説明し、50分間のレッスンプランも含んでいる。
ツールとすべての実験コードは、公開されています。
関連論文リスト
- One RL to See Them All: Visual Triple Unified Reinforcement Learning [92.90120580989839]
V-Triuneは、視覚的推論と知覚タスクを1つのトレーニングパイプライン内で実現するビジュアルトリプル統一強化学習システムである。
V-Triuneは3つの補完的なコンポーネントで構成されている: Sample-Level Datashelf (多様なタスク入力を統一する)、Verifier-Level Reward (特殊検証を通じてカスタム報酬を提供する)。
本稿では,V-Triuneが処理する知覚タスクに対して適応的,進行的,明確なフィードバックを提供する,新しい動的IoU報酬を提案する。
論文 参考訳(メタデータ) (2025-05-23T17:41:14Z) - Understanding the Multi-modal Prompts of the Pre-trained Vision-Language
Model [15.828023370166411]
我々は、以下の質問をすることで、マルチモーダルプロンプトを直接分析する。
$(i)$ 学習したマルチモーダルはどのように認識性能を向上させるのか?
$(ii)$ マルチモーダルプロンプトは何を学習しますか?
論文 参考訳(メタデータ) (2023-12-18T04:49:03Z) - Deep Active Learning Using Barlow Twins [0.0]
畳み込みニューラルネットワーク(CNN)の一般化性能は、トレーニング画像の量、品質、多様性に大きく左右される。
タスクのアクティブラーニングの目標は、ラベルのないプールから最も情報に富んだサンプルを引き出すことである。
本稿では,すべてのデータセットに対する能動的学習手法であるBarlowTwins(DALBT)を用いたDeep Active Learningを提案する。
論文 参考訳(メタデータ) (2022-12-30T12:39:55Z) - Multi-Task Imitation Learning for Linear Dynamical Systems [50.124394757116605]
線形システム上での効率的な模倣学習のための表現学習について検討する。
学習対象ポリシーによって生成された軌道上の模倣ギャップは、$tildeOleft(frack n_xHN_mathrmshared + frack n_uN_mathrmtargetright)$で制限されている。
論文 参考訳(メタデータ) (2022-12-01T00:14:35Z) - Deep Q-learning: a robust control approach [4.125187280299247]
ニューラルネットワークカーネルを用いて不確実な線形時間不変モデルを定式化し,学習を記述する。
周波数領域におけるエージェントの動作を学習し解析することの不安定さを示す。
OpenAI Gym環境における数値シミュレーションにより,$mathcalH_infty$制御学習はDouble Deep Q-learningよりも若干優れていたことが示唆された。
論文 参考訳(メタデータ) (2022-01-21T09:47:34Z) - PsiPhi-Learning: Reinforcement Learning with Demonstrations using
Successor Features and Inverse Temporal Difference Learning [102.36450942613091]
時間差学習(ITD)と呼ばれる逆強化学習アルゴリズムを提案する。
Psi Phi$-learningと呼ばれるデモで強化学習のための新しいアルゴリズムに到達し、オンライン環境の相互作用から学習とITDをシームレスに統合する方法を示します。
論文 参考訳(メタデータ) (2021-02-24T21:12:09Z) - Understanding Self-supervised Learning with Dual Deep Networks [74.92916579635336]
本稿では,2組の深層ReLUネットワークを用いたコントラスト型自己教師学習(SSL)手法を理解するための新しい枠組みを提案する。
種々の損失関数を持つSimCLRの各SGD更新において、各層の重みは共分散演算子によって更新されることを示す。
共分散演算子の役割と、そのようなプロセスでどのような特徴が学習されるかをさらに研究するために、我々は、階層的潜在木モデル(HLTM)を用いて、データ生成および増大過程をモデル化する。
論文 参考訳(メタデータ) (2020-10-01T17:51:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。