論文の概要: DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search
- arxiv url: http://arxiv.org/abs/2607.29491v1
- Date: Fri, 31 Jul 2026 14:58:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.774339
- Title: DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search
- Title(参考訳): DreamQAS: VQE効率の良い量子アーキテクチャ検索のための決定に有効な世界モデルを学ぶ
- Authors: Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli Ren,
- Abstract要約: Reinforcement-learning-based quantum architecture search (RL-QAS) は、回路を拡張した後、繰り返し変動量子固有解器 (VQE) を最適化する。
本稿では、正確な回路力学を保存し、VQE後の高価なフィードバックのみを学習するモデルベースのRLフレームワークであるDreamQASを紹介する。
- 参考スコア(独自算出の注目度): 9.679776057194056
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement-learning-based quantum architecture search (RL-QAS) repeatedly optimizes a variational quantum eigensolver (VQE) after extending a circuit, although circuit construction and action legality are deterministic and known. We introduce DreamQAS, a model-based RL framework that preserves these exact circuit dynamics and learns only the expensive post-VQE feedback. A recurrent randomized-prior ensemble predicts an oracle-free score relative to an empirical energy frontier and supports multi-step imagined policy learning over explicit legal circuits. Ranking-based activation, uncertainty-aware pessimism and truncation, and selective real-VQE verification form a reliability-controlled learning loop. Under a common 15,000-episode budget and frozen evaluation for the RL methods, DreamQAS has the lowest mean frozen-policy energy error on four of five molecular tasks and the second-lowest on one. At fine-error targets reached by all seeds of both methods, it uses 1.6x to 2.0x fewer real VQE calls on four tasks and 10.6x fewer on BeH2-8q. Counterfactual action-ranking utility increases across all five tasks, with a mean increase of 0.346 and a 95 percent confidence interval of [0.185, 0.507], while direct greedy and beam use of the same model does not recover the gains of imagined policy learning. Ensemble disagreement also improves risk-coverage over random rejection on all three probed tasks. These results establish a world-model design for QAS whose value lies in decision-useful feedback rather than exact energy prediction.
- Abstract(参考訳): 強化学習に基づく量子アーキテクチャ探索(RL-QAS)は、回路の構成と動作の合法性は決定論的で知られているが、回路を拡張した後、変分量子固有解器(VQE)を繰り返し最適化する。
モデルベースのRLフレームワークであるDreamQASを導入し、これらの正確な回路力学を保存し、高価なVQE後フィードバックのみを学習する。
繰り返しランダム化された事前アンサンブルは、経験的エネルギフロンティアに対するオラクルフリースコアを予測し、明示的な法回路上での多段階的なポリシー学習をサポートする。
ランク付けに基づくアクティベーション、不確実性を考慮した悲観主義、切り離し、選択的な実VQE検証は信頼性制御学習ループを形成する。
一般的な15,000エピソードの予算とRL法に対する凍結評価の下では、ドリームQASは5つの分子課題のうち4つで、そして1つで2番目に低い平均的な凍結政治エネルギー誤差を有する。
両方のメソッドのすべてのシードから到達した微細エラーターゲットでは、実際のVQEコールを4つのタスクで1.6倍から2.0倍、BeH2-8qで10.6倍削減する。
対実的行動水準のユーティリティは5つのタスクすべてで増加し、平均的な0.346と95%の信頼区間(0.185,0.507)が増加し、一方、同一モデルの直接的な欲求とビーム利用は、想像された政策学習の利益を回復しない。
アンサンブル不一致はまた、3つの調査された全てのタスクに対するランダムな拒絶よりもリスクカバレッジを改善する。
これらの結果は、正確なエネルギー予測よりも、決定に有用なフィードバックに価値があるQASのワールドモデル設計を確立する。
関連論文リスト
- When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - QnRL: Quantum-Native Reinforcement Learning [82.36163324220894]
量子強化学習(QRL)は、環境のある複数のアプリケーションにわたる効果的な意思決定戦略を学ぶための有望なアプローチである。
既存のQRLアーキテクチャは、予測された結果を推定することで環境挙動を間接的に近似し、その表現力と適応ポテンシャルを制限する。
このような課題を克服するには、環境変数を直接量子状態分布としてモデル化するために、量子コンピュータの分布特性を利用する新しいQRLアプローチが必要である。
論文 参考訳(メタデータ) (2026-06-06T17:54:58Z) - Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs [24.596649747603724]
2つの重要なイノベーションに基づいて構築された新しいRLベースのアルゴリズムであるFREIAを紹介する。
FERは、自由エネルギー原則に基づくコンセンサスと探索のバランスを取るために報酬を適合させる。
数学的推論タスクでは、FREIAは平均0.5から3.5ポイントの他の手法を上回ります。
論文 参考訳(メタデータ) (2026-04-11T07:26:04Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities [10.235183326885794]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLMs)における推論の強化に欠かせないパラダイムとして登場した。
我々は、この問題をサンプリング確率力学の観点から分析し、標準目的が高次様相の経路を不均等に強化することを特定する。
提案手法は,すべての応答に対する信頼度を平衡化するための新しいアドバンテージ再重み付け機構 (ARM) を提案する。
論文 参考訳(メタデータ) (2026-02-05T04:06:55Z) - Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling [90.87033586963828]
マルチモーダル大言語モデル(MLLM)のステップ・バイ・ステップ推論を洗練させる手段としては,アウトカム・リワード強化学習(RL)が一般的であり,ますます重要になっている。
この問題を修正するために,自己整合サンプリング(SCS)を提案する。
Qwen2.5-VL-7B-インストラクトに基づいて、SCSは、無視できる余分な計算を伴う6つのマルチモーダルベンチマークにおいて、最大7.7ポイントの精度を向上する。
論文 参考訳(メタデータ) (2025-11-13T18:59:57Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward [57.56453588632619]
Reinforcement Learning with Verifiable Reward (RLVR) を用いた細調整大型言語モデル(LLM)における中心的パラドックスは、多目的性能の頻繁な劣化である。
これはしばしば破滅的な忘れが伴い、モデルが以前獲得したスキルを失う。
我々は,標準RLVR目標には知識保持のための重要なメカニズムが欠如していると主張している。
論文 参考訳(メタデータ) (2025-09-09T06:34:32Z) - Artificial-Intelligence-Driven Shot Reduction in Quantum Measurement [6.649102874357367]
変量量子固有解法(VQE)は、分子基底エネルギーを近似するための強力な解を提供する。
量子ハードウェアにおける推定確率は繰り返し測定を必要とする(ショット)
本稿では,全撮影量を最小化するために,自動でショット割り当てポリシーを学習する強化学習に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2024-05-03T21:51:07Z) - Extreme Q-Learning: MaxEnt RL without Entropy [88.97516083146371]
現代のDeep Reinforcement Learning (RL)アルゴリズムは、連続的な領域での計算が困難である最大Q値の推定を必要とする。
エクストリーム値理論(EVT)を用いた最大値を直接モデル化するオンラインおよびオフラインRLの新しい更新ルールを導入する。
EVTを使用することで、Extreme Q-Learningフレームワークをオンラインに導き、その結果、初めてオフラインのMaxEnt Q-learningアルゴリズムをオフラインにします。
論文 参考訳(メタデータ) (2023-01-05T23:14:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。