論文の概要: HippoSpark: An On-Demand Experience System for LLM Reasoning
- arxiv url: http://arxiv.org/abs/2606.29929v1
- Date: Mon, 29 Jun 2026 08:05:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.120878
- Title: HippoSpark: An On-Demand Experience System for LLM Reasoning
- Title(参考訳): HippoSpark: LLM推論のためのオンデマンドエクスペリエンスシステム
- Authors: Jingyao Liu, Danling Meng, Chen Huang, Yukun Yan, Zhenghao Liu, Wenqiang Lei, See-Kiong Ng, Maosong Sun,
- Abstract要約: 我々は,現在の推論状態の即時ニーズに合わせてオンデマンド検索を行う,状態レベルのエクスペリエンスシステムであるHippoSparkを紹介する。
以上の結果から,最も効果的な体験システムは,一般的なタスクレベルのコンテキストとして機能するのではなく,重要なボトルネックに対して行動可能なガイダンスを提供するシステムであることが判明した。
- 参考スコア(独自算出の注目度): 92.24105095253198
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Distilling historical trajectories into reusable experience to enhance future problem-solving has become a focal point of recent LLM research. However, existing methods predominantly operate at the task level, leveraging general summaries or rules under the assumption that analogous tasks share universal solution patterns. This approach often fails in complex reasoning, which typically falters at local bottlenecks that require precise, state-specific guidance rather than broad heuristics. We introduce HippoSpark, a state-level experience system that performs on-demand retrieval tailored to the immediate needs of the current reasoning state. Across mathematical, scientific, and programming benchmarks, HippoSpark consistently outperforms both standard prompting and task-level experience baselines. Our findings reveal that the most effective experience systems are those that provide actionable guidance at critical bottlenecks rather than serving as generic task-level context. Our code is available at https://github.com/DanlingMeng/HippoSpark.
- Abstract(参考訳): 近年のLLM研究の焦点は, 過去の軌跡を再利用し, 今後の問題解決を促進することである。
しかし、既存の手法は主にタスクレベルで動作し、類似タスクが共通解パターンを共有するという仮定の下で一般的な要約やルールを活用する。
このアプローチは複雑な推論で失敗することが多く、広いヒューリスティックスではなく、正確に州固有のガイダンスを必要とする局所的なボトルネックに悩まされる。
我々は,現在の推論状態の即時ニーズに合わせてオンデマンド検索を行う,状態レベルのエクスペリエンスシステムであるHippoSparkを紹介する。
数学、科学、プログラミングのベンチマーク全体において、HippoSparkは標準のプロンプトとタスクレベルのエクスペリエンスのベースラインを一貫して上回っている。
以上の結果から,最も効果的な体験システムは,一般的なタスクレベルのコンテキストとして機能するのではなく,重要なボトルネックに対して行動可能なガイダンスを提供するシステムであることが判明した。
私たちのコードはhttps://github.com/DanlingMeng/HippoSpark.comで利用可能です。
関連論文リスト
- Retrieval-Augmented LLM Agents: Learning to Learn from Experience [16.248836438253814]
本研究では,検索対象のLLMエージェントを学習し,検索したトラジェクトリをコンテキスト内で活用する方法について検討する。
最先端のエージェントトレーニングパイプラインよりも優れたロラを用いた,堅牢な教師付き微調整(SFT)レシピを確立した。
その結果,この組み合わせによるタスクの一般化が著しく向上することが示唆された。
論文 参考訳(メタデータ) (2026-03-18T20:45:04Z) - DEEPQUESTION: Systematic Generation of Real-World Challenges for Evaluating LLMs Performance [3.9770095824794516]
私たちは、Bloomの分類に基づいて既存のデータセットを拡張するスケーラブルな自動化フレームワークであるDeepQuestionを紹介します。
我々は,高次タスクにおいて高い性能低下(最大70%の精度低下)を示し,深い推論において持続的なギャップを減らした。
論文 参考訳(メタデータ) (2025-05-30T12:39:42Z) - Can LLMs Generate Tabular Summaries of Science Papers? Rethinking the Evaluation Protocol [83.90769864167301]
文献レビュー表は、科学論文の集合を要約し比較するために欠かせないものである。
学術論文の収集にあたり,ユーザの情報ニーズを最大限に満たす表を作成するタスクについて検討する。
我々の貢献は、現実世界で遭遇する3つの重要な課題に焦点を当てている: (i)ユーザープロンプトは、しばしば未特定である; (ii)検索された候補論文は、しばしば無関係な内容を含む; (iii)タスク評価は、浅いテキスト類似性技術を超えて進むべきである。
論文 参考訳(メタデータ) (2025-04-14T14:52:28Z) - CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing [70.25689961697523]
クロスタスク体験の共有と選択によるシーケンシャル推論を強化する一般化可能なアルゴリズムを提案する。
我々の研究は、既存のシーケンシャルな推論パラダイムのギャップを埋め、タスク間体験の活用の有効性を検証する。
論文 参考訳(メタデータ) (2024-10-22T03:59:53Z) - P-RAG: Progressive Retrieval Augmented Generation For Planning on Embodied Everyday Task [94.08478298711789]
Embodied Everyday Taskは、インボディードAIコミュニティで人気のあるタスクである。
自然言語命令は明示的なタスクプランニングを欠くことが多い。
タスク環境に関する知識をモデルに組み込むには、広範囲なトレーニングが必要である。
論文 参考訳(メタデータ) (2024-09-17T15:29:34Z) - Can LLMs Reason in the Wild with Programs? [20.47557047823847]
本研究では, LLM が未知型推論問題の解法を課題とする, 野生における推論の課題を紹介する。
我々は,多種多様な推論問題に対する詳細な解を含む大規模戦術誘導軌道データセットを作成する。
実験では、既存のLLMは曖昧で混在したスコープの問題で著しく失敗する。
論文 参考訳(メタデータ) (2024-06-19T18:26:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。