論文の概要: GRPO-QPS: Target-Preserving Reinforcement Learning for Quantum Posterior Sampling
- arxiv url: http://arxiv.org/abs/2609.14711v2
- Date: Mon, 21 Sep 2026 19:51:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.617515
- Title: GRPO-QPS: Target-Preserving Reinforcement Learning for Quantum Posterior Sampling
- Title(参考訳): GRPO-QPS:量子後部サンプリングのための目標保存強化学習
- Abstract要約: GRPO-QPSは、GRPOが提案動作を学習し、正確なメトロポリス補正が訓練後の後部を保存するターゲット保存フレームワークである。
6キュービットと800ショットで、学習された提案では、1,000ドル(約1万1000円)の通話に対して、最小有効サンプルサイズ102を達成している。
- 参考スコア(独自算出の注目度): 42.21989596721942
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bayesian quantum tomography requires efficient inference while preserving a posterior fixed by the prior and Born likelihood. Learned transport provides fast amortized samples, but reward tuning can reshape the generated distribution rather than improve exploration of this fixed target. We introduce GRPO-QPS, a target-preserving framework in which GRPO learns proposal behavior and an exact Metropolis correction preserves the posterior after training. Across the evaluated reconstruction benchmarks, GRPO-QPS improves over BuresTomFlow and Flow-GRPO on thermal, cat, Dicke, and cluster families, and it closely matches an exact two-qubit reference posterior. Tuned conventional MCMC is slightly stronger on several original continuous benchmarks where the available fixed proposals already match the posterior geometry well. To test whether this reflects a fundamental limitation of learned exploration, we evaluate a more challenging multimodal thermal posterior. At six qubits and 800 shots, the learned proposal achieves a minimum effective sample size of 102 per $1{,}000$ likelihood calls, compared with 28 for prior independence, 27 for a tuned fixed mixture, and 20 for Haario adaptive Metropolis. A record-conditioned policy also transfers to unseen 3,000-shot records, matching or exceeding the strongest conventional baseline in all nine held-out seed-record comparisons. These results show that GRPO-QPS combines target-preserving Bayesian inference with broad gains over learned transport baselines and a sampling advantage when efficient exploration requires proposal geometry beyond the evaluated conventional kernels.
- Abstract(参考訳): ベイズ量子トモグラフィーは、事前およびボルン確率で固定された後部を保ちながら効率的な推測を必要とする。
学習された輸送は、高速な償却サンプルを提供するが、報酬チューニングは、この固定されたターゲットの探索を改善するのではなく、生成された分布を再構成することができる。
GRPO-QPSは、GRPOが提案動作を学習し、正確なメトロポリス補正が訓練後の後部を保存するターゲット保存フレームワークである。
評価された再構成ベンチマーク全体を通して、GRPO-QPSは、熱、猫、ディック、クラスターファミリーにおけるBuresTomFlowとFlow-GRPOよりも改善され、正確な2ビットの参照後部と密に一致している。
調整された従来のMCMCは、利用可能な固定された提案が既に後部幾何学とよく一致しているいくつかの元の連続ベンチマークにおいてわずかに強い。
学習した探索の基本的な限界を反映しているかどうかを調べるため,より困難な多モード熱後部の評価を行った。
6キュービットと800ショットで、学習された提案は、事前独立の28、調整された固定混合の27、ハリオ適応メトロポリスの20に対して、最低有効サンプルサイズが1$${,}000$コールあたり102である。
記録条件付きポリシーはまた、9つの保持されたシード記録の比較において、最強の基準値と一致するか、または超える3000ショットの記録に転送する。
これらの結果から, GRPO-QPSは, 目標保存ベイズ推定と, 学習された輸送基盤線に対する広い利得と, 効率的な探索を行うためには, 評価された従来のカーネルを超える提案幾何を必要とする場合に, サンプリングの利点とを組み合わせていることがわかった。
関連論文リスト
- Query-Conditioned Spherical Centroid Aggregation for Multimodal Retrieval [5.4018351446007875]
マルチモーダル検索は、ビデオ、オーディオ、字幕、テキストを統合する。
最近の幾何学的アグリゲータは、すべてのモダリティを対称に扱う。
SCALARはクエリ条件付きアグリゲータで、各利用可能なモダリティに関連性ベースの重みを割り当てる。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - Information-Calibrated Quantum Diffusion: Aligning Forward Noise with Reverse Recoverability [10.481986290704821]
古典量子情報デクリメント $_t=I(X:Q_t-1)-I(X:Q_t) を固有拡散座標として導入する。
偏極化とともに$_t$が等しくなると、前方情報損失の唯一の最小値の離散化が得られる。
論文 参考訳(メタデータ) (2026-08-14T08:44:51Z) - SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions [17.763106379903228]
物理ロボット上での強化学習エージェントの訓練は、転倒によってプラットフォームが損傷し、シミュレータのリセットのように解除できないため、すべての転倒をコストがかかる。
標準緩和ハンドコントロールは、設計者が指定した安全領域を離れるたびに、別の回復ポリシーに制御する。
我々は、近位政策最適化(PPO)のドロップイン修正により、このバイアスに対処する。
我々のアルゴリズムは、標準的なPPOよりも、HalfCheetah、Ant、Unitree Go1上の233x、48x、26xの要素でトレーニング時間の低下を減らす。
論文 参考訳(メタデータ) (2026-07-09T20:41:45Z) - Explaining RhythmFormer: A Systematic XAI Analysis of Periodic Sparse Attention for Remote Photoplethysmography [1.647210198730602]
Photoplethys変換器は、ベンチマークで心拍数エラーが低いが、その決定は不透明である。
既存のXAIは、定量的忠実度測定や生理的根拠による検証を伴わない定性的なヒートマップ検査によって支配されている。
我々は、RhythmFormerの2レベルの注意をトップ$k$選択で定量化するために、4つの方法(raw attention, rollout, flow, Beyond Intuition)を適用する。
論文 参考訳(メタデータ) (2026-06-11T19:10:06Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards [41.19082300691048]
本稿では,ルーリック型報酬による強化学習の訓練のバランスをとるための新しい目的であるFocal Rewardを提案する。
3つのモデルスケールと6つのベンチマーク実験により、Focal Reward法が最強の静的アグリゲーションベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-26T05:50:46Z) - Posterior Coreset Construction with Kernelized Stein Discrepancy for
Model-Based Reinforcement Learning [78.30395044401321]
我々は、強化学習(MBRL)のための新しいモデルベースアプローチを開発する。
ターゲット遷移モデルの仮定を緩和し、混合モデルの一般的な族に属する。
連続的な制御環境では、壁時計の時間を最大50%削減することができる。
論文 参考訳(メタデータ) (2022-06-02T17:27:49Z) - Semi-supervised Contrastive Learning with Similarity Co-calibration [72.38187308270135]
SsCL(Semi-supervised Contrastive Learning)と呼ばれる新しいトレーニング戦略を提案する。
ssclは、自己教師付き学習におけるよく知られたコントラスト損失と、半教師付き学習におけるクロスエントロピー損失を組み合わせる。
SsCLはより差別的な表現を生じさせ,ショット学習に有益であることを示す。
論文 参考訳(メタデータ) (2021-05-16T09:13:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。