論文の概要: Inducing Reasoning Primitives from Agent Traces
- arxiv url: http://arxiv.org/abs/2606.02994v1
- Date: Tue, 02 Jun 2026 01:11:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 22:00:04.668113
- Title: Inducing Reasoning Primitives from Agent Traces
- Title(参考訳): エージェントトレースからの推論プリミティブの誘導
- Authors: Zhihan Lei, Jiarui Yan, Joshua Momo, William W. Cohen,
- Abstract要約: Reasoning Primitive Injectionは、成功したReActトレース、クラスタの繰り返し推論をマイニングし、最も頻繁な動きを型付き擬似ツールのコンパクトライブラリに変換する。
単一の固定構成は、すべてのサブタスクでゼロショットのチェイン・オブ・ランゲージを改善し、専門家が認可した分解と一致または超過し、平均推論コストでAWMを上回っている。
- 参考スコア(独自算出の注目度): 15.491011995582808
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: ReAct-style LLM agents often rediscover the same reasoning routines across problems, yet leave those routines trapped in transient scratchpads. We introduce Reasoning Primitive Induction, a single-pass method that mines successful ReAct traces, clusters recurrent reasoning moves, and converts the most frequent moves into a compact library of typed pseudo-tools. Each pseudo-tool is specified by a natural-language docstring interpreted by an LLM at invocation time, and a standard ReAct loop composes these primitives at test time. The central result is that induced libraries outperform the very agent that generated their traces: by +44pp on RuleArena NBA (30 -> 74), +30pp on MuSR team allocation (38 -> 68), and +22pp on NatPlan meeting planning (7 -> 29). Across five comparable subtasks spanning narrative deduction, rule application, and constraint-satisfaction planning, a single fixed configuration improves over zero-shot Chain-of-Thought on every subtask, matches or surpasses expert-authored decompositions, and outperforms AWM at lower average inference cost.
- Abstract(参考訳): リアクトスタイルのLLMエージェントは、問題全体で同じ推論ルーチンを再発見することが多いが、それらのルーチンは一時的なスクラッチパッドに閉じ込められている。
Reasoning Primitive Injectionは、ReActトレースをマイニングするシングルパス手法であり、クラスタの繰り返し推論を移動させ、最も頻繁な動きを擬似ツールのコンパクトライブラリに変換する。
それぞれの擬似ツールは、起動時にLLMによって解釈される自然言語ドクストリングによって指定され、標準のReActループはテスト時にこれらのプリミティブを構成する。
その結果、誘導ライブラリは、そのトレースを発生させたエージェントよりも優れており、RustArena NBA (30 ->74) では +44pp、 MuSR チームのアロケーション (38 ->68) では +30pp、NatPlan のミーティング計画 (7 ->29) では +22pp である。
物語の推論、ルールの適用、制約-満足の計画にまたがる5つの同等のサブタスクの中で、単一の固定された構成は、すべてのサブタスクにおいてゼロショットの連鎖よりも改善され、専門家が認可した分解と一致または超え、平均推論コストの低いAWMよりもパフォーマンスが向上する。
関連論文リスト
- Prompt Codebooks: Discrete Compositional Optimization for Language Model Instruction Refinement [10.441136483320205]
本稿では,新しい合成プロンプト最適化フレームワークであるPrompt Codebooksを提案する。
これは、APOを自然言語本能の有限語彙上の離散学習であると再認識する。
ゼロショット以上は+30.36ポイントまで改善され、HotpotQAでは+3.34、アグリゲートでは+1.11で最強のベースライン(GEPA)を超える。
論文 参考訳(メタデータ) (2026-05-27T11:57:12Z) - Margin-calibrated Classifier Guidance for Property-driven Synthesis Planning [23.782236689125995]
比較的議論とマージンに基づく損失を利用して分類器の校正を行うSCR(Sequence Completion Ranking)を導入する。
SCRはマルチステップ解決率を16.8%ドル(無誘導発電機)から78.4%ドル(反応型誘導)、9.3%ドル(谷本誘導)に大幅に改善している。
また,テンプレートフリー手法とテンプレートベース手法の長期的多様性ギャップを効果的に解消する。
論文 参考訳(メタデータ) (2026-05-13T07:12:53Z) - PLUME: Latent Reasoning Based Universal Multimodal Embedding [52.35354073629127]
ユニバーサルマルチモーダル埋め込み(UME)は、異種入力を単一のモデルで共有検索空間にマッピングする。
最近のアプローチでは、埋め込みを抽出する前に明確なチェーン・オブ・シント(CoT)論理を生成することにより、UMEを改善している。
PLUMEは,言語化されたCoTを連続的潜伏状態の短時間の自己回帰ロールアウトに置き換えることで,UMEを進化させる潜在的推論フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T14:04:53Z) - Decomposing and Composing: Towards Efficient Vision-Language Continual Learning via Rank-1 Expert Pool in a Single LoRA [50.97792275353563]
単一低ランク適応 (LoRA) モジュールを分解可能な Rank-1 エキスパートプールとして再構成する,新しいフレームワークを提案する。
本手法では,このエキスパートプールから[Guided]トークンのセマンティクスに導かれて,疎結合でタスク固有の更新を動的に作成することを学ぶ。
論文 参考訳(メタデータ) (2026-01-30T10:54:51Z) - Evaluating LLMs' Reasoning Over Ordered Procedural Steps [3.9261455058620083]
手順の順序が結果に直接影響を与える手続き的シーケンスに対する推論は、大規模言語モデル(LLM)にとって重要な能力である。
本研究では,食品レシピのキュレートしたデータセットを用いて,シャッフルした手続き段階からグローバルに順序付けられたシーケンスを再構築する作業について検討する。
本稿では、ランク付けとシーケンスアライメントから確立されたメトリクスを適応させる包括的な評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-25T23:37:00Z) - Stop Spinning Wheels: Mitigating LLM Overthinking via Mining Patterns for Early Reasoning Exit [114.83867400179354]
オーバーライドは、大きな言語モデル全体のパフォーマンスを低下させる可能性がある。
推論は, 探索段階の不足, 補償推論段階, 推論収束段階の3段階に分類される。
我々は,ルールに基づく軽量なしきい値設定戦略を開発し,推論精度を向上させる。
論文 参考訳(メタデータ) (2025-08-25T03:17:17Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - Recursive Speculative Decoding: Accelerating LLM Inference via Sampling
Without Replacement [11.91629418177851]
投機的復号法(英: Speculative decoding)は、大規模言語モデルの推論・加速度法である。
近年の作業では、草稿の伐採によってこの方法が進歩している。
再帰的投機的復号法(Recursive Speculative Decoding:RSD)を提案する。
論文 参考訳(メタデータ) (2024-02-21T22:57:49Z) - Tree-Planner: Efficient Close-loop Task Planning with Large Language Models [63.06270302774049]
Tree-Plannerは、大きな言語モデルでタスクプランニングを3つの異なるフェーズに再構成する。
Tree-Plannerは高い効率を維持しながら最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-10-12T17:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。