論文の概要: Latent Poincaré Shaping for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2602.09375v1
- Date: Tue, 10 Feb 2026 03:35:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-11 20:17:43.353225
- Title: Latent Poincaré Shaping for Agentic Reinforcement Learning
- Title(参考訳): エージェント強化学習のための潜在ポアンカレ整形
- Abstract要約: LaPhaは、AlphaZeroに似たLLMエージェントをポアンカレ潜在空間で訓練する方法である。
MATH-500では、Qwen2.5-Math-1.5Bを66.2%から88.2%に改善している。
AIME'24ではLaPha-1.5Bが56.7%、AIME'24ではLaPha-7Bが60.0%、AIME'25では53.3%に達する。
- 参考スコア(独自算出の注目度): 12.089248000026863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose LaPha, a method for training AlphaZero-like LLM agents in a Poincaré latent space. Under LaPha, the search process can be visualized as a tree rooted at the prompt and growing outward from the origin toward the boundary of the Poincaré ball, where negative curvature provides exponentially increasing capacity with radius. Using hyperbolic geodesic distance to rule-verified correctness, we define a node potential and assign dense process rewards by potential differences. We further attach a lightweight value head on the same shared latent space, enabling self-guided test-time scaling with almost no additional overhead. On MATH-500, LaPha improves Qwen2.5-Math-1.5B from 66.0% to 88.2%. With value-head-guided search, LaPha-1.5B reaches 56.7% accuracy on AIME'24, and LaPha-7B further achieves 60.0% on AIME'24 and 53.3% on AIME'25.
- Abstract(参考訳): ポアンカレ潜在空間におけるAlphaZeroのようなLSMエージェントの訓練方法であるLaPhaを提案する。
ラパの下では、探索過程はプロンプトに根付いた木として視覚化され、ポアンカレ球の境界に向かって外側に成長し、負の曲率によって半径が指数関数的に増加する。
双曲的測地線距離を規則検証の正しさに用い、ノードポテンシャルを定義し、ポテンシャル差による高密度なプロセス報酬を割り当てる。
さらに、同じ共有潜在空間に軽量な値ヘッドを付加し、追加オーバーヘッドのない自己誘導テストタイムスケーリングを可能にします。
MATH-500では、Qwen2.5-Math-1.5Bを66.0%から88.2%に改善している。
AIME'24ではLaPha-1.5Bが56.7%、AIME'24ではLaPha-7Bが60.0%、AIME'25では53.3%に達する。
関連論文リスト
- From crown candidates to neighborhood screening: integrating optical GeoAI and spatial modeling for urban-canopy assessment in Davis, California [0.0]
タイムリーな都市キャノピー情報は、リモートセンシングと熱、移動性、近隣計画のリンクに不可欠である。
カリフォルニア州デイビスで,2022年国立農業画像プログラムの画像を用いた光学的GeoAIワークフローを開発した。
論文 参考訳(メタデータ) (2026-08-14T01:02:50Z) - Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent [98.33217711280383]
本稿では,エージェント水平線をスケーリングすることで,パラメータレベルの性能を1兆倍に向上する35B混在エージェントモデルであるAgens-A1を紹介する。
我々は、外部の知識、行動、観察、検証結果を接続する長期の知識-行動基盤を構築します。
Agents-A1は、ロングホライゾンエージェントベンチマークに対して強力で幅広いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-29T17:50:54Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling [11.537163059885687]
2つの軽量プラグインモジュールを用いたExploration-Prioritized Policy Optimization (EXPO)を提案する。
我々は6つの数学的推論ベンチマークでDeepSeek-R1-Distill-Qwen-1.5BとQwen3-8B-Baseの実験を行った。
AIME 2025 pass@32では13.34で、63.33パーセントから76.67パーセントに上昇し、8Bモデルでは平均2.66でパス@32が改善されている。
論文 参考訳(メタデータ) (2026-05-11T03:19:04Z) - FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - Bayesian Transformer for Probabilistic Load Forecasting in Smart Grids [0.0]
本研究では,3つの相補的不確実性機構をPatchTSTバックボーンに統合したベイズ変圧器フレームワークを提案する。
7段階のマルチクエンタリーピンボールロス予測ヘッドと、訓練後の等音波回帰キャリブレーションにより、鋭く、ほぼ一意にカバーされた予測間隔が生成される。
主要なベンチマーク(PJM, H=24h)では、BTは0.0289のCRPSを達成し、Deep Ensemblesより7.4%、決定論的LSTMより29.9%改善した。
論文 参考訳(メタデータ) (2026-03-09T02:39:51Z) - Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters [169.7981969517903]
Step 3.5 Flashは、フロンティアレベルのエージェントインテリジェンスと計算効率を橋渡しする。
エージェントを構築する上で最も重要なもの、すなわち、シャープな推論と高速で信頼性の高い実行に重点を置いています。
論文 参考訳(メタデータ) (2026-02-11T07:53:51Z) - Temporal Zoom Networks: Distance Regression and Continuous Depth for Efficient Action Localization [6.908972852063454]
時間的行動の局所化は、正確な境界検出と計算効率の両方を必要とする。
我々は、境界距離回帰(BDR)と適応時間制限(ATR)という2つの補完的なイノベーションを通じてこの問題に対処する。
THUMOS14では、ActionFormer++ (55.7% mAP@0.7 at 235G) よりも36%少ないFLOPを用いて、151GのFLOPで56.5% mAP@0.7を達成する。
論文 参考訳(メタデータ) (2025-11-06T00:41:54Z) - Balanced Multi-Task Attention for Satellite Image Classification: A Systematic Approach to Achieving 97.23% Accuracy on EuroSAT Without Pre-Training [0.0]
本研究は、衛星土地利用分類のための独自の畳み込みニューラルネットワークアーキテクチャを体系的に研究する。
事前訓練されたモデルに依存することなく、EuroSATデータセット上で97.23%のテスト精度を達成する。
我々の手法は、外部データを必要としない微調整されたResNet-50(98.57%)の1.34%で性能を達成する。
論文 参考訳(メタデータ) (2025-10-17T10:59:24Z) - Pre-Trained Policy Discriminators are General Reward Models [81.3974586561645]
政策差別学習(POLAR)という,スケーラブルな事前学習手法を提案する。
POLARは報酬モデル(RM)を訓練し、同一のポリシーを識別し、異なるポリシーを識別する。
実証実験の結果、POLARは従来の非事前学習法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-07-07T16:56:31Z) - Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning [2.1637240640145343]
我々は、ステップワイズ選好学習を活用し、強化学習による自己検証を強化する。
算術的推論タスクの評価において,本手法は MaTH 上で OpenMath2-Llama3.1-8B,dart-math-mistral-7b-uniform より優れている。
論文 参考訳(メタデータ) (2024-12-23T08:51:48Z) - Preference Optimization for Reasoning with Pseudo Feedback [100.62603571434167]
提案手法では,解のラベル付けを関連するテストケースに対する評価として行うことで,推論タスクに対する疑似フィードバックを生成する手法を提案する。
本研究では,擬似フィードバックを優先最適化に用いる数学的推論と符号化の両タスクについて実験を行い,両タスク間の改善を観察する。
論文 参考訳(メタデータ) (2024-11-25T12:44:02Z) - Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play [52.3079697845254]
evaは、オフラインとオンラインのRLポストトレーニングの両方で、言語モデルがトレーニングプロンプトを適応的に作成できるようにする最初の方法である。
我々は,エバが有効なRLキュリキュラを作成でき,アブレーションにまたがって堅牢であることを示す。
論文 参考訳(メタデータ) (2024-10-31T08:15:32Z) - BootsTAP: Bootstrapped Training for Tracking-Any-Point [62.585297341343505]
Tracking-Any-Point (TAP) は、ビデオ中の固体表面上の任意の点を追跡するアルゴリズムとして形式化することができる。
大規模でラベルなし、未修正のリアルワールドデータが、最小限のアーキテクチャ変更でTAPモデルを改善することができることを示す。
我々は,TAP-Vidベンチマークにおける最先端性能が,従来の結果よりも広いマージンで上回っていることを示す。
論文 参考訳(メタデータ) (2024-02-01T18:38:55Z) - Tactile Grasp Refinement using Deep Reinforcement Learning and Analytic
Grasp Stability Metrics [70.65363356763598]
解析的把握安定性指標が強化学習アルゴリズムの強力な最適化目標であることを示す。
幾何的および力量に依存しないグリップ安定性の指標を組み合わせることで、カブイドの平均成功率は95.4%となることを示す。
第2の実験では,触覚情報を持たないベースラインよりも,接触フィードバックで訓練したグリップリファインメントアルゴリズムが最大6.6%向上することを示した。
論文 参考訳(メタデータ) (2021-09-23T09:20:19Z) - End-to-End Semi-Supervised Object Detection with Soft Teacher [63.26266730447914]
本稿では,従来の複雑な多段階法とは対照的に,終端から終端までの半教師付き物体検出手法を提案する。
提案手法は, 種々のラベル付け比において, 従来手法よりも大きなマージンで性能を向上する。
最先端のSwin Transformerベースの物体検出器では、検出精度を+1.5 mAPで大幅に向上させることができる。
論文 参考訳(メタデータ) (2021-06-16T17:59:30Z) - Using Deep Learning to Predict Beam-Tunable Pareto Optimal Dose
Distribution for Intensity Modulated Radiation Therapy [0.5735035463793008]
我々は、2つの異なるビーム構成モードで予測する2つのディープラーニングネットワークを実装し、比較する。
モデルIとモデルIIの2つのモデルについて検討・比較を行った。
我々の深層学習モデルは、地上の真理線量分布と正確に一致したボクセルレベルの線量分布を予測した。
論文 参考訳(メタデータ) (2020-06-19T17:15:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。