論文の概要: GRPO-QM: Target Preserving Exploration for Quantum Tomography
- arxiv url: http://arxiv.org/abs/2609.14711v1
- Date: Sun, 13 Sep 2026 18:09:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.900988
- Title: GRPO-QM: Target Preserving Exploration for Quantum Tomography
- Title(参考訳): GRPO-QM:量子トモグラフィーのためのターゲット保存探索
- Abstract要約: GRPO-QMは、量子トモグラフィー後部の探索戦略のみを学ぶことでこれを後押しする。
次に、物理的な提案メカニズムや事前知識を超えて、学習が貢献するものについて検討する。
- 参考スコア(独自算出の注目度): 42.21989596721942
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reward-based learning can alter the very posterior distribution that scientific inference aims to estimate. GRPO-QM sidesteps this by learning only an exploration strategy for a stated quantum-tomography posterior: a group-relative policy chooses among reversible physical moves, and an exact Metropolis correction ensures the posterior remains stationary once the policy is fixed. We then examine what learning contributes beyond physical proposal mechanisms and prior knowledge. Reconstruction comparisons suggest that most of the gains over the tested flows come from those two components rather than from learning itself, and a closed-form counterexample explains why: a reward tied to accepted motion can increase even when a physical observable remains highly correlated. Reward comparisons that control for initialization also show that aggregating across posteriors can invert the ranking that a reward implies within any single posterior. Lastly, on 45 enumerated posteriors with three training seeds each, exact and sampled gradients of the same trajectory objective reduce mean physical estimation variance by $12.63\%$ and $6.32\%$ relative to a tuned mixture, while averaging the trajectory score without rescaling its penalty yields only $0.43\%$. This indicates that objective scaling accounts for part of the disparity between sampled and exact training. The regained benefit is concentrated at four shots and flips sign at sixteen, so these exact, visible-bank diagnostics identify a concrete, reproducible failure mode in sampled training, the objective-scaling fix that addresses part of it, and the remaining gap.
- Abstract(参考訳): 逆流に基づく学習は、科学的推論が見積もる後部分布を変えることができる。
GRPO-QMは、記載された量子トモグラフィー後部の探索戦略のみを学習し、グループ相対ポリシーは可逆的な物理運動の中から選択し、正確なメトロポリス補正は、ポリシーが固定された後、後部の残留が定常であることを保証する。
次に、物理的な提案メカニズムや事前知識を超えて、学習が貢献するものについて検討する。
レコンストラクション比較では、テストフローよりも多くの利得は、学習自体からではなく、これらの2つのコンポーネントから得られることを示唆しており、クローズドフォームの反例は、なぜこう説明している。
初期化制御の逆比較は、後部をまたぐアグリゲーションが、報酬が任意の後部において意味するランクを逆転させることができることを示している。
最後に、3つの訓練種子を持つ45個の列挙後部では、同一軌跡対象の正確な勾配とサンプル勾配により、調整された混合物に対して平均的な物理的推定誤差が12.63 %$と6.32 %$と減少する一方、そのペナルティを再スケーリングすることなく軌道スコアを平均化すると、0.43 %$しか得られない。
これは、客観的なスケーリングが、サンプルと正確なトレーニングの相違の一部を占めていることを示している。
回復した利益は4ショットと16フリップで集中しており、これらの正確な銀行診断は、サンプルトレーニングにおける具体的かつ再現可能な障害モード、その一部に対処する客観的なスケール修正、および残りのギャップを識別する。
関連論文リスト
- Query-Conditioned Spherical Centroid Aggregation for Multimodal Retrieval [5.4018351446007875]
マルチモーダル検索は、ビデオ、オーディオ、字幕、テキストを統合する。
最近の幾何学的アグリゲータは、すべてのモダリティを対称に扱う。
SCALARはクエリ条件付きアグリゲータで、各利用可能なモダリティに関連性ベースの重みを割り当てる。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - Information-Calibrated Quantum Diffusion: Aligning Forward Noise with Reverse Recoverability [10.481986290704821]
古典量子情報デクリメント $_t=I(X:Q_t-1)-I(X:Q_t) を固有拡散座標として導入する。
偏極化とともに$_t$が等しくなると、前方情報損失の唯一の最小値の離散化が得られる。
論文 参考訳(メタデータ) (2026-08-14T08:44:51Z) - SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions [17.763106379903228]
物理ロボット上での強化学習エージェントの訓練は、転倒によってプラットフォームが損傷し、シミュレータのリセットのように解除できないため、すべての転倒をコストがかかる。
標準緩和ハンドコントロールは、設計者が指定した安全領域を離れるたびに、別の回復ポリシーに制御する。
我々は、近位政策最適化(PPO)のドロップイン修正により、このバイアスに対処する。
我々のアルゴリズムは、標準的なPPOよりも、HalfCheetah、Ant、Unitree Go1上の233x、48x、26xの要素でトレーニング時間の低下を減らす。
論文 参考訳(メタデータ) (2026-07-09T20:41:45Z) - Explaining RhythmFormer: A Systematic XAI Analysis of Periodic Sparse Attention for Remote Photoplethysmography [1.647210198730602]
Photoplethys変換器は、ベンチマークで心拍数エラーが低いが、その決定は不透明である。
既存のXAIは、定量的忠実度測定や生理的根拠による検証を伴わない定性的なヒートマップ検査によって支配されている。
我々は、RhythmFormerの2レベルの注意をトップ$k$選択で定量化するために、4つの方法(raw attention, rollout, flow, Beyond Intuition)を適用する。
論文 参考訳(メタデータ) (2026-06-11T19:10:06Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards [41.19082300691048]
本稿では,ルーリック型報酬による強化学習の訓練のバランスをとるための新しい目的であるFocal Rewardを提案する。
3つのモデルスケールと6つのベンチマーク実験により、Focal Reward法が最強の静的アグリゲーションベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-26T05:50:46Z) - Posterior Coreset Construction with Kernelized Stein Discrepancy for
Model-Based Reinforcement Learning [78.30395044401321]
我々は、強化学習(MBRL)のための新しいモデルベースアプローチを開発する。
ターゲット遷移モデルの仮定を緩和し、混合モデルの一般的な族に属する。
連続的な制御環境では、壁時計の時間を最大50%削減することができる。
論文 参考訳(メタデータ) (2022-06-02T17:27:49Z) - Semi-supervised Contrastive Learning with Similarity Co-calibration [72.38187308270135]
SsCL(Semi-supervised Contrastive Learning)と呼ばれる新しいトレーニング戦略を提案する。
ssclは、自己教師付き学習におけるよく知られたコントラスト損失と、半教師付き学習におけるクロスエントロピー損失を組み合わせる。
SsCLはより差別的な表現を生じさせ,ショット学習に有益であることを示す。
論文 参考訳(メタデータ) (2021-05-16T09:13:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。