論文の概要: Distilling Reasoning Without Knowledge: A Framework for Reliable LLMs
- arxiv url: http://arxiv.org/abs/2603.14458v1
- Date: Sun, 15 Mar 2026 16:06:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-17 16:19:35.818913
- Title: Distilling Reasoning Without Knowledge: A Framework for Reliable LLMs
- Title(参考訳): 知識のない推論を蒸留する - 信頼性の高いLLMのためのフレームワーク
- Abstract要約: 本稿では,実際の検索と回答の合成からプランニングを分離するモジュラーフレームワークを提案する。
ライトウェイトな学生プランナーは、教師-学生フレームワークを介して訓練され、構造化された分解を生成する。
提案手法をSEAL-0(SEAL-0)で評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fact-seeking question answering with large language models (LLMs) remains unreliable when answers depend on up-to-date or conflicting information. Although retrieval-augmented and tool-using LLMs reduce hallucinations, they often rely on implicit planning, leading to inefficient tool usage. We propose a modular framework that explicitly separates planning from factual retrieval and answer synthesis. A lightweight student planner is trained via a teacher-student framework to generate structured decompositions consisting of abstract reasoning steps and searchable fact requests. The supervision signals contain only planning traces and fact requests, without providing factual answers or retrieved evidence. At inference, the planner produces plans, while prompt-engineered modules perform retrieval and response synthesis. We evaluate the proposed framework on SEAL-0, an extremely challenging benchmark for search-augmented LLMs. Results show that supervised planning improves both accuracy and latency compared to monolithic reasoning models and prompt-based tool-augmented frameworks, demonstrating that explicitly learned planning structures are essential for reliable fact-seeking LLMs.
- Abstract(参考訳): 大きな言語モデル (LLM) で答える実測的な質問は、答えが最新の情報や矛盾する情報に依存する場合、信頼性が低いままである。
検索が強化され、ツールを使用するLLMは幻覚を減少させるが、暗黙の計画に依存することが多く、非効率なツールの使用につながる。
本稿では,実際の検索と回答の合成から計画を明確に分離するモジュラーフレームワークを提案する。
軽量な学生プランナーは教師の学習フレームワークを介して訓練され、抽象的な推論ステップと検索可能な事実要求からなる構造化された分解を生成する。
監視信号は、事実の回答や証拠の回収なしに、計画的トレースと事実要求のみを含む。
推測において、プランナーは計画を生成し、プロンプトエンジニアリングされたモジュールは検索および応答合成を行う。
提案手法をSEAL-0(SEAL-0)で評価した。
その結果、教師ありプランニングはモノリシック推論モデルやプロンプトベースのツール拡張フレームワークと比較して精度とレイテンシを向上し、信頼性の高いファクト検索 LLM には明示的に学習されたプランニング構造が不可欠であることを示した。
関連論文リスト
- Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward [4.833783769369]
DecomposeRは、研究計画を表すプランナー中心のディープリサーチフレームワークであり、型付き有向非巡回グラフ(DAG)である。
プランナー強化学習(RL)はまず,研究計画を改善するためにグラフ構造とクエリ分解を学習し,回答者強化学習(RL)は,学習計画に基づいて分岐レベルの実行と最終合成を学習する。
実験によると、DecomposeRは、計画と回答能力の改善により、人気のあるロングフォームベンチマークにおいて、強力なオープンベースラインよりも5.1-8.0ポイント改善されている。
論文 参考訳(メタデータ) (2026-05-29T04:18:55Z) - PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models [52.48858778580074]
計画は大規模言語モデル(LLM)の基本的な機能である
PlanningBenchは、評価とトレーニングの両方のためのスケーラブルで多様な検証可能な計画データを生成するためのフレームワークである。
論文 参考訳(メタデータ) (2026-05-20T08:10:15Z) - STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering [9.69666629029613]
マルチホップ質問応答 (MHQA) は、複数の文書にまたがる証拠を検索し、推論することで、複雑なクエリに対する正確な回答を可能にする。
既存のMHQAアプローチは主に、次の2つの大きな問題に苦しむ反復的な検索強化世代に依存している。
戦略計画,動的制御,接地型実行を分離するフレームワークSTRIDEを提案する。
論文 参考訳(メタデータ) (2026-04-19T12:19:43Z) - DUPLEX: Agentic Dual-System Planning via LLM-Driven Information Extraction [11.920443665332629]
大規模言語モデル(LLM)は、ロボットタスク計画のためのセマンティックな柔軟性を提供する。
幻覚や論理的不整合への感受性は、長い水平領域における信頼性を制限している。
本稿では,LLMをスキーマ誘導情報抽出に厳密に閉じ込めるデュアルシステムニューロシンボリックアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-03-25T03:57:44Z) - Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs [52.16166558205338]
Graph-RFTは、"plan-KGsearch-and-Websearch-during-think"パラダイムを備えた、2段階強化KGQAフレームワークである。
これにより、LLMは、不完全な知識条件下で、KGやWebソース間で自律的な計画と適応的なスケジューリングを行うことができる。
論文 参考訳(メタデータ) (2025-10-23T16:04:13Z) - Self-Reflective Planning with Knowledge Graphs: Enhancing LLM Reasoning Reliability for Question Answering [9.601307470705732]
本稿では,知識グラフと大規模言語モデルを相乗化するフレームワークである自己回帰計画(SRP)を提案する。
計画プロセスにおいて、SRPはまず、ガイドプランニングとリフレクションのための参照を検索する。
推論経路を介してKGから知識を検索した後、検索結果を判断し、回答が正しく検索されるまで推論経路を編集して反復反射を行う。
論文 参考訳(メタデータ) (2025-05-26T01:59:00Z) - DataPuzzle: Breaking Free from the Hallucinated Promise of LLMs in Data Analysis [10.98270220152657]
大規模言語モデル(LLM)は、マルチモーダルデータ分析にますます応用されている。
一般的なPrompt-to-Answer'パラダイムは、LSMをブラックボックスアナリストとして扱う。
複雑な質問を分解する概念的マルチエージェントフレームワークであるDataPuzzleを提案する。
論文 参考訳(メタデータ) (2025-04-14T09:38:23Z) - Language Agents Meet Causality -- Bridging LLMs and Causal World Models [50.79984529172807]
因果表現学習を大規模言語モデルと統合する枠組みを提案する。
このフレームワークは、自然言語表現に関連付けられた因果変数を持つ因果世界モデルを学ぶ。
本研究では,時間的スケールと環境の複雑さを考慮した因果推論と計画課題の枠組みを評価する。
論文 参考訳(メタデータ) (2024-10-25T18:36:37Z) - Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge Graphs [59.76268575344119]
知識グラフ(KG)から得られた計画データを用いて,大規模言語モデル(LLM)計画能力を向上するための新しいフレームワークを提案する。
KGデータで微調整されたLLMは、計画能力を向上し、検索を含む複雑なQAタスクを処理するのがより適している。
論文 参考訳(メタデータ) (2024-06-20T13:07:38Z) - Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More? [54.667202878390526]
長文言語モデル(LCLM)は、従来、検索システムやデータベースといった外部ツールに依存していたタスクへのアプローチに革命をもたらす可能性がある。
実世界のタスクのベンチマークであるLOFTを導入し、文脈内検索と推論においてLCLMの性能を評価するために設計された数百万のトークンを出力する。
以上の結果からLCLMは,これらのタスクを明示的に訓練したことがないにも関わらず,最先端の検索システムやRAGシステムと競合する驚くべき能力を示した。
論文 参考訳(メタデータ) (2024-06-19T00:28:58Z) - Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration [68.29746557968107]
本稿では,多エージェント協調のための新しいフレームワークを提案する。これは,効率的な自己調整のための強化アドバンテージフィードバック(Reinforced Advantage feedback, ReAd)を導入する。
Over-AIと難解なRoCoBenchの実験は、ReAdが成功率のベースラインを超え、エージェントの相互作用ステップを著しく減少させることを示している。
論文 参考訳(メタデータ) (2024-05-23T08:33:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。