論文の概要: SpikeCredit: Temporal Credit Carrier for Reinforcement Learning with Sparse Rewards
- arxiv url: http://arxiv.org/abs/2609.35268v1
- Date: Mon, 28 Sep 2026 14:25:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 07:00:59.806661
- Title: SpikeCredit: Temporal Credit Carrier for Reinforcement Learning with Sparse Rewards
- Title(参考訳): SpikeCredit: スパースリワードによる強化学習のための一時クレジットキャリア
- Abstract要約: 疎度な報酬を伴う強化学習(RL)は、中間計算が成功または失敗を引き起こしたかについてのガイダンスをほとんど提供しないため、難しい。
信頼度の高い信用割当には、時間とともに信用関連情報を保存・公開する政策ダイナミクスが必要であると我々は主張する。
スパース報酬を持つSNNベースのRLフレームワークであるSpikeCreditを提案する。
- 参考スコア(独自算出の注目度): 27.9064608581665
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) with sparse rewards is challenging because delayed outcomes provide little guidance about which intermediate computations caused success or failure. We argue that reliable credit assignment requires policy dynamics that preserve and expose credit-relevant information over time, a role we formalize as Temporal Credit Carriers (TCCs) and that spiking neural networks (SNNs) naturally fulfill through graded membrane traces and event-driven spikes. Based on this hypothesis, we propose SpikeCredit, an SNN-based framework for RL with sparse rewards that first performs task-adaptive TCC selection and then closes the loop between a fast TCC-reading pathway, where self-motion feedback constraint uses local behavior-grounded cues to constrain transition-level credit recovery, and a slow TCC-writing pathway, where credit-targeted trace alignment feeds recovered credit back into the actor to make future TCC dynamics more credit-readable. Across sparse-reward MuJoCo tasks, SpikeCredit improves Last10 return over sparse SNN baselines by +1169% on Ant, +953% on Hopper, +723% on Swimmer, and +1781% on Walker2d, and exceeds the dense-reward baseline on Swimmer by +113%. Mechanistic analyses further show substantially stronger alignment with dense rewards than the sparse SNN baseline. These results position spiking dynamics as credit-preserving substrates for sparse-reward RL.
- Abstract(参考訳): 疎度な報酬を伴う強化学習(RL)は、中間計算が成功または失敗を引き起こしたかについてのガイダンスをほとんど提供しないため、難しい。
我々は、信頼度の高いクレジット割り当てには、時間とともに信用関連情報を保存し、公開するポリシーのダイナミクス、時間的信用キャリア(TCC)として形式化し、グレードされた膜トレースとイベント駆動スパイクによってスパイキングニューラルネットワーク(SNN)が自然に満たされる役割が必要であると論じている。
この仮説に基づき、まずタスク適応型TCC選択を行い、次に高速なTCC読解経路のループを閉じるSNNベースのRLフレームワークであるSpikeCreditを提案する。
スパースリワードのMuJoCoタスク全体で、SpikeCreditはLast10のリターンを、スパースSNNベースラインで+1169%、ホッパーで+953%、スイマーで+723%、ウォーカー2dで+1781%、スイマーで高密度リワードベースラインで+113%改善している。
メカニスティック解析により,スパースSNNベースラインよりも高密度報酬とのアライメントが著しく高められた。
これらの結果はスパルス・リワードRLの信用保存基板としてスパイキングダイナミクスを位置づけた。
関連論文リスト
- When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning [32.70365827239751]
Tail-Aware Credit calibratiOn (TACO) は、望ましくないポジティブな更新を抑えるために、均一なクレジット割り当てを校正する手法である。
3つのLSMと8つのベンチマークの結果、TACOはGRPOスタイルのベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-08T23:00:54Z) - ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning [69.64972562984882]
提案するThoughtFoldは,よりきめ細かい選好学習を,効率的な推論のための冗長探索に活用するフレームワークである。
ThoughtFoldは効率を大幅に向上させる。
最先端の精度を維持しつつ、DeepSeek-R1-Distill-Qwen-7Bのトークン使用量を約56%削減する。
論文 参考訳(メタデータ) (2026-06-02T11:21:27Z) - Towards Sample-Efficient and Stable Reinforcement Learning for LLM-based Recommendation [56.92367609590823]
Long Chain-of-Thought (Long CoT)推論は、Large Language Models (LLMs)において有望であることを示している。
我々はLong CoTが本質的にシーケンシャルなレコメンデーションドメインに不適合であると主張している。
提案するRISER(Reinforced Item Space Exploration framework for Recommendation)を提案する。
論文 参考訳(メタデータ) (2026-01-31T10:02:43Z) - PACR: Progressively Ascending Confidence Reward for LLM Reasoning [55.06373646059141]
我々は、PACR(Progressive Ascending Confidence Reward)を提案する。
PACRは、正解に対するモデルの進化的信念から直接計算された、密集したモデル固有の報酬である。
以上の結果から,RLVRトレーニングはより効果的で信頼性が高いことが示唆された。
論文 参考訳(メタデータ) (2025-10-25T11:25:35Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Timestep-Compressed Attack on Spiking Neural Networks through Timestep-Level Backpropagation [5.234835661080496]
スパイキングニューラルネットワーク(SNN)に対する最先端の敵攻撃は、重大な制限に直面している。
本稿では,TCA(Timestep-compressed attack)を提案する。
論文 参考訳(メタデータ) (2025-08-19T13:17:15Z) - Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards [13.70228195630989]
本稿では,マルチターンインタラクション,dockerベースの実行,カスタマイズ可能な報酬関数をサポートする統合システムであるSWE指向RLフレームワークを紹介する。
Gated Reward Accumulation (G-RA) も提案する。これは,高位(長期)の報酬が予め定義された閾値を満たす場合にのみ,即時報酬を蓄積する新しい手法である。
論文 参考訳(メタデータ) (2025-08-14T11:37:02Z) - Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning [14.852334980733369]
共用型マルチエージェント強化学習において、各エージェントの共用報酬への貢献を阻害する信用割り当ては重要な課題である。
本稿では、この制約から信用モデリングを分離するアプローチであるTAR(Temporal-Agent Reward Redistribution)を導入する。
本手法は,モデル精度によらず最適ポリシーが維持されることを保証するPBRSと等価であることを示す。
論文 参考訳(メタデータ) (2025-02-07T12:07:57Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。