論文の概要: KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning
- arxiv url: http://arxiv.org/abs/2606.00532v1
- Date: Sat, 30 May 2026 04:51:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.512139
- Title: KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning
- Title(参考訳): KACE:数学的推論のための知識適応型コンテキスト工学
- Abstract要約: 知識適応コンテキスト工学(KACE)を紹介する。
KACEはストレージを、難易度とドメインベースの組織を通じて利用から分離する。
AIME 2025では、KACEは62.2%の精度で、固定されたベスト・オブ・5の自己整合性よりも10.4ポイントの絶対的な利得を達成している。
- 参考スコア(独自算出の注目度): 4.6726884183570645
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Context engineering can improve large language models without updating their weights, but mathematical reasoning exposes a key limitation: feedback accumulated in one growing prompt causes context bloat and limits the amount of learned guidance that can be used. Existing methods often conflate storage, what is learned across runs, with usage, what is included for a particular problem, and therefore inherit this prompt-size ceiling. We introduce Knowledge-Adaptive Context Engineering (KACE), which separates storage from usage through difficulty- and domain-based organization. Offline, a self-reflective learning loop distills training traces into an epistemic tree: a knowledge base of typed cards stratified by problem difficulty and epistemic domain. Each card is assigned to the difficulty-domain node corresponding to the failure from which it originated. At evaluation time, tiered self-consistency with per-tier agreement gates dynamically classifies each problem as easy, medium, or hard. Easy problems exit without retrieved cards, while harder problems retrieve only the matching branch of the tree. This tiered scheme matches or exceeds Best-of-N while using comparable compute, and it classifies problem difficulty with 78 percent pairwise concordance. The main empirical contribution is the construction and use of a difficulty- and domain-stratified knowledge base enabled by tiered self-consistency. On AIME 2025, KACE achieves 62.2 percent accuracy, a 10.4-point absolute gain over fixed Best-of-5 self-consistency at a comparable solver-call budget and a 5.6-point gain over the strongest learned-context baseline, Tiered + GEPA. We also observe consistent gains on MATH-HARD and the verifiable subset of OlymMATH.
- Abstract(参考訳): コンテキストエンジニアリングは重みを更新せずに大きな言語モデルを改善することができるが、数学的推論は重要な制限を露呈する。
既存のメソッドは、しばしばストレージを分割し、実行中に何を学んだか、使用法、特定の問題に何が含まれているか、そして、このプロンプトサイズの天井を継承する。
我々は,知識適応コンテキスト工学(KACE)を導入し,ストレージと利用を困難かつドメインベースの組織で分離する。
オフライン、自己反射学習ループは、学習の痕跡をエピステマティックツリーに蒸留する:問題難易度とエピステマティックドメインによって階層化されたタイプドカードの知識ベース。
各カードは、その発生した障害に対応する困難領域ノードに割り当てられる。
評価時に、階層ごとの合意ゲートと結びついた自己整合性は、各問題を簡単、中、あるいは困難と動的に分類する。
難易度はカードを取り外し、難易度は木の枝のみを取り出す。
この結合されたスキームは、同等の計算量を用いてBest-of-Nと一致または超え、問題の難易度を78%のペア一致で分類する。
主な実証的貢献は、自己整合性によって実現される困難かつドメイン階層化された知識ベースの構築と利用である。
AIME 2025では、KACEの精度は62.2%、Best-of-5よりも10.4ポイント、最強の学習テキストベースラインであるTiered + GEPAよりも5.6ポイント向上している。
また、MATH-HARDとOlymMATHの検証可能な部分集合に対する一貫した利得も観察する。
関連論文リスト
- NTDH: Complex Reasoning for Comprehensive Affective Analysis [28.280253328311346]
包括的感情分析は2つの理由から困難である。
連続、順序、複数ラベルの出力を持つ異種予測タスクにまたがる。
我々はそのタスクを複雑な推論問題として再考した。
これは感情と感情の両方をカバーする最初の治療法である。
論文 参考訳(メタデータ) (2026-08-05T18:59:43Z) - Scaling Self-Play with Self-Guidance [62.13619253976748]
Self-Guided Self-Play (SGS)は、Conjecturerをジェネラシーから遠ざけるセルフプレイアルゴリズムである。
SGSは80ラウンド未満のセルフプレイで、最強のベースラインの解決率を上回っています。
論文 参考訳(メタデータ) (2026-04-22T05:50:23Z) - Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models [60.418191092851636]
OmanicはオープンドメインのマルチホップQAリソースであり、推論プロセスを分析するための構造アノテーションとして分解されたサブクエストと中間回答を提供する。
10,296個の機械によるトレーニング例(Omanic Synth)と967個の専門家による注釈付き評価例(OmanicBench)を含む。
論文 参考訳(メタデータ) (2026-03-17T15:23:37Z) - GONE: Structural Knowledge Unlearning via Neighborhood-Expanded Distribution Shaping [4.740962650068887]
本稿では,Large Language Models (LLMs) における構造化知識グラフ (KG) 事実に対する知識未学習の評価ベンチマークである Graph Oblivion and Node Erasure (GONE) を紹介する。
このKGベースのベンチマークは、直接事実除去、推論に基づくリーク、破滅的な忘れという3つの非学習効果の解離を可能にする。
新たなアンラーニングフレームワークであるNEDSは、グラフ接続を活用してアンカー関係の隣人を識別し、忘れられた事実とそのセマンティック・エリア間の正確な決定境界を強制するように設計されている。
論文 参考訳(メタデータ) (2026-02-21T04:08:37Z) - DART: Difficulty-Adaptive Reasoning Truncation for Efficient Large Language Models [36.962276192354174]
textbfDARTは、問題の難易度に応じて思考長を調整する。
textbfTruncationフレームワークは、いつ考えるのをやめるかを学ぶ
論文 参考訳(メタデータ) (2025-11-03T02:41:20Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge [14.367146529900609]
大規模言語モデル(LLM)は、幅広いタスクにわたって強力なパフォーマンスを示してきたが、複雑な数学的推論に苦戦している。
我々は,LLMに明示的で再利用可能な数学的構造を持たせる2段階の因果関係フレームワークであるtextbfCAusal textbfMAthematician (textbfCAMA) を提案する。
論文 参考訳(メタデータ) (2025-08-04T16:39:24Z) - ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models [14.403953640255823]
強化学習フレームワークに報酬信号として用いられる新しいスコアを導入し、モデルが正確かつ簡潔な推論トレースを生成するよう誘導する。
このスコアは、ジャッジとして機能する大きな言語モデルによって評価され、単純なトークン長を超えて動的でコンテキスト対応のフィードバックを可能にする。
提案手法は,MATHデータセット上での最先端の効率・正確性トレードオフを実現し,簡単な問題ではトークン使用率を最大31倍に削減し,精度を7%向上させるとともに,最も難しい問題では,トークン使用率を最大3.6倍に抑えながら,完全な推論を+7.5%向上させる。
論文 参考訳(メタデータ) (2025-05-22T19:56:35Z) - Ineq-Comp: Benchmarking Human-Intuitive Compositional Reasoning in Automated Theorem Proving on Inequalities [46.111273938884295]
本研究では,AM/GMのような既知の不等式を適用することにより,与えられた問題が単純化されることを認識するプロバーの能力について検討する。
これらの問題は人間にとって容易なままだが、Goedel、書き直し、Kimina-7Bを含むほとんどのプローバーは、かなり苦労している。
我々の結果は、現在のAIプロデューサの行動と人間の直感の間に持続的なギャップを露呈する。
論文 参考訳(メタデータ) (2025-05-19T03:56:05Z) - MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations [90.07275414500154]
各種モデルにおけるMATH-P-Hardの性能低下を観察する。
また、学習した問題解決スキルを盲目的に適用する新しい形態の記憶に関する懸念も提起する。
論文 参考訳(メタデータ) (2025-02-10T13:31:46Z) - Harnessing Large Language Models for Knowledge Graph Question Answering via Adaptive Multi-Aspect Retrieval-Augmentation [81.18701211912779]
本稿では,KG(Amar)フレームワーク上での適応型マルチアスペクト検索手法を提案する。
この方法は、エンティティ、リレーション、サブグラフを含む知識を検索し、検索した各テキストを即時埋め込みに変換する。
提案手法は2つの共通データセットに対して最先端の性能を達成した。
論文 参考訳(メタデータ) (2024-12-24T16:38:04Z) - Konstruktor: A Strong Baseline for Simple Knowledge Graph Question Answering [60.6042489577575]
Konstruktor - 問題を3つのステップに分割する,効率的で堅牢なアプローチ。
我々のアプローチは言語モデルと知識グラフを統合し、前者の力と後者の解釈可能性を活用する。
関係検出において、ワークフローの最も困難なステップとして、関係分類・生成とランク付けの組み合わせが、他の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-09-24T09:19:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。