論文の概要: CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning
- arxiv url: http://arxiv.org/abs/2607.02262v1
- Date: Thu, 02 Jul 2026 14:50:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.876374
- Title: CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning
- Title(参考訳): CheckRLM:Retrieval-Augmented Reasoningにおける効果的な知識量コヒーレンスチェック
- Authors: Dingling Xu, Ruobing Wang, Qingfei Zhao, Yukun Yan, Zhichun Wang, Daren Zha, Shi Yu, Zhenghao Liu, Shuo Wang, Xu Han, Maosong Sun,
- Abstract要約: 実ミスのタイムリーなチェックと修正によって推論プロセスの信頼性を向上させるフレームワークであるCheckRLMを提案する。
CheckRLMは推論中の微妙な知識の不整合を識別し、局所化するために、推論チェーンから事実的クレームを抽出する。
- 参考スコア(独自算出の注目度): 45.23957787978941
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning Language Models (RLMs) have significantly improved performance on complex tasks by extending the reasoning chain. However, these chains are prone to containing factual errors, particularly in knowledge-intensive tasks. To address this issue, we propose CheckRLM, a framework that improves the reliability of the reasoning process through Retrieval-Augmented Generation (RAG) by timely checking and correcting factual errors. Specifically, CheckRLM extracts factual claims from the reasoning chain to identify and localize subtle knowledge inconsistencies during inference. Upon detection of errors, a refinement mechanism performs minimal-cost yet precise corrections by leveraging external knowledge, ensuring coherence between the reasoning chain and correct knowledge. Extensive experiments demonstrate that CheckRLM substantially outperforms existing baselines, exhibiting a strong capability to mitigate error accumulation in long-horizon reasoning with lower costs. The code and data are available at https://github.com/AI9Stars/CheckRLM.
- Abstract(参考訳): RLM(Reasoning Language Models)は、推論チェーンを拡張することで、複雑なタスクのパフォーマンスを大幅に改善した。
しかしながら、これらの連鎖は、特に知識集約的なタスクにおいて、事実的エラーを含む傾向にある。
この問題に対処するために,実ミスをタイムリーにチェックし,修正することで,RAG(Retrieval-Augmented Generation)による推論プロセスの信頼性を向上させるフレームワークであるCheckRLMを提案する。
特に、CheckRLMは推論中に微妙な知識の不整合を識別し、局所化するために、推論チェーンから事実的クレームを抽出する。
誤りを検出すると、リファインメント機構は外部知識を活用して最小限の精度で修正を行い、推論チェーンと正しい知識の一貫性を確保する。
大規模な実験により、CheckRLMは既存のベースラインを大幅に上回り、低コストで長期の推論においてエラーの蓄積を緩和する強力な能力を示すことが示された。
コードとデータはhttps://github.com/AI9Stars/CheckRLMで公開されている。
関連論文リスト
- SERC: LDPC-Inspired Semantic Error Correction for Retrieval-Augmented Generation [3.53018552538156]
大きな言語モデル(LLM)は目覚ましい能力を示しているが、その信頼性は幻覚によって著しく損なわれている。
検索強化生成(SERC)のためのLDPCにインスパイアされた意味的誤り訂正を提案する。
我々は,テキスト生成過程を意味ノイズチャネルとして再構成し,生成した応答をノイズ破損したコードワードとして扱う。
論文 参考訳(メタデータ) (2026-04-12T09:09:46Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution [79.98699884805636]
Reasoning Execution by Multiple Listeners (REMUL) は多人数の強化学習手法である。
REMULは、推論が他の当事者に従えるかがより忠実になるという仮説に基づいている。
スピーカーは、リスナーにとって明らかな推論を生み出すことで報われます。
論文 参考訳(メタデータ) (2026-02-18T02:55:55Z) - Constraint-Rectified Training for Efficient Chain-of-Thought [60.52883907721588]
CoT (Chain-of-Thought) は,Large Language Models (LLMs) の推論能力を大幅に向上させた。
より長い推論トレースは、自己訂正のような回答の品質とアンロック能力を改善することができるが、高い推論コストを発生させ、過度に考えることとして知られる冗長なステップをしばしば導入する。
近年の研究は、推論の長さと精度のバランスをとる効率的な推論戦略の開発を目指している。
論文 参考訳(メタデータ) (2026-02-13T02:13:45Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains [13.626335241662977]
Reinforcement Learning with Verifiable Rewards (RLVR)-based post-training of Large Language Models (LLMs) は、推論タスクの精度を向上させることが示されている。
直接インセンティブのない中間トークンに対するRLポストトレーニングの効果について検討する。
論文 参考訳(メタデータ) (2025-10-20T23:58:31Z) - Retrieving, Rethinking and Revising: The Chain-of-Verification Can Improve Retrieval Augmented Generation [38.80878966092216]
大規模言語モデル(LLM)の強化を目的とした最近の検索拡張生成(RAG)
本稿では,外部検索の正しさと内部生成の整合性を高めるためのチェーン・オブ・バリフィケーション(CoV-RAG)を提案する。
論文 参考訳(メタデータ) (2024-10-08T08:34:54Z) - Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification [52.095460362197336]
大規模言語モデル(LLM)は一貫性と正確な推論に苦しむ。
LLMは、主に正しいソリューションに基づいて訓練され、エラーを検出して学習する能力を減らす。
本稿では,CoT(Chain-of-Thought)とPoT(Program-of-Thought)を組み合わせた新しい協調手法を提案する。
論文 参考訳(メタデータ) (2024-10-05T05:21:48Z) - Derailer-Rerailer: Adaptive Verification for Efficient and Reliable Language Model Reasoning [11.765298236504155]
Derailer-Rerailerは推論精度と計算効率のバランスをとる新しいフレームワークである。
提案手法は,従来の検証手法に比べて2~3倍の効率を維持しつつ,大幅な精度向上(8~11%)を実現している。
論文 参考訳(メタデータ) (2024-08-25T21:20:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。