論文の概要: A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination
- arxiv url: http://arxiv.org/abs/2608.04872v1
- Date: Wed, 05 Aug 2026 14:01:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.950086
- Title: A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination
- Title(参考訳): A-SR: 階層的コーディネーションによるシンボリック回帰のための自己進化型エージェントLLM
- Authors: Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Yingnian Wu, Fenghua Ling, Haobo Li, Lei Bai,
- Abstract要約: 本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
- 参考スコア(独自算出の注目度): 51.06539604709775
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Symbolic regression aims to discover closed-form equations from data, but existing LLM-guided methods often rely on a unified proposal loop that compresses heterogeneous search failures into a scalar score and a single prompt. We propose A-SR, a self-evolving agentic framework that shifts the control unit from expression edits to role-conditioned evidence views. A-SR coordinates formula discovery through routing among coordination protocols, an online evaluator-reward role policy, and state-routed process memory. During search, evaluator feedback characterizes reliability and productivity, updates role-level utilities, and routes elite motifs, failure traces, and validity diagnostics to different agents. The framework self-evolves at two timescales: within a run, it adapts the search process without updating LLM parameters; across runs, recorded trajectories can be distilled into open-source LLMs as role-conditioned proposal priors. Averaged over the four LSR-Synth scientific domains in LLM-SRBench, A-SR improves Acc@0.01 over baselines from 25.79% to 48.30% with Llama3.1-8B, while A-SR-LoRA improves the corresponding Qwen3-4B result from 24.58% to 38.29%. On four real-world scientific discovery tasks, A-SR obtains the best in-distribution or out-of-distribution normalized mean squared error on 7 of 8 reported metrics.
- Abstract(参考訳): シンボリック回帰は、データから閉形式方程式を発見することを目的としているが、既存のLLM誘導法は、不均一な探索失敗をスカラースコアと1つのプロンプトに圧縮する統一された提案ループに依存することが多い。
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
検索中、評価者フィードバックは信頼性と生産性を特徴付け、役割レベルのユーティリティを更新し、エリートモチーフ、障害トレース、妥当性診断を異なるエージェントにルートする。
実行中、LLMパラメータを更新せずに検索プロセスに適応し、実行中、記録されたトラジェクトリをロール条件の提案先としてオープンソースのLLMに蒸留することができる。
LLM-SRBenchの4つのLSR-Synth科学領域に平均して、A-SRは25.79%から48.30%に改善し、A-SR-LoRAは対応するQwen3-4Bを24.58%から38.29%に改善した。
4つの実世界の科学的発見タスクにおいて、A-SRは、報告された8つの指標のうち7つの平均二乗誤差の最良の分布または分布外分布を得る。
関連論文リスト
- LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents [51.74109282213905]
トレーニング後の戦略はデータセットに依存しており、繰り返し発生する経験的パターンを明らかにする。
正規化パラメータは、シフトトレーニングのダイナミクスに応答して発振する。
我々は,LLMエージェントが木探索を通じて学習軌跡を探索するシステムを用いた。
論文 参考訳(メタデータ) (2026-06-16T18:33:08Z) - Deliberate Evolution: Agentic Reasoning for Sample-Efficient Symbolic Regression with LLMs [52.89778838903305]
Deliberate Evolution (DE) は、検索制御からシンボル生成を分離するエージェントフレームワークである。
LLM-SRBenchの実験では、DEMは様々な科学領域でLLMベースのSRベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-03T02:22:16Z) - Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning [79.88942231770629]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を向上させるための訓練後の中心的なツールとなっている。
統一表記によるロールアウトパイプラインの形式化とGenerate-Filter-Control-Replay(GFCR)の導入
検証可能な報酬、プロセスの監督、判断に基づくゲーティング、ガイドとツリー/セグメントのロールアウト、アダプティブな計算割り当て、早期終了と部分的なロールアウト、スループット最適化、自己改善のための再生/再配置でRLにまたがる手法を合成する。
論文 参考訳(メタデータ) (2026-04-08T00:53:29Z) - REX-RAG: Reasoning Exploration with Policy Correction in Retrieval-Augmented Generation [35.0649927279081]
強化学習(RL)は、大規模言語モデル(LLM)が複雑な推論タスクを実行できるための強力なパラダイムとして浮上している。
本稿では、厳格な政策学習を維持しつつ、代替推論経路を探求するフレームワークであるREX-RAGを提案する。
その結果,REX-RAG は Qwen2.5-3B では5.1%, Qwen2.5-7B では3.6% であることがわかった。
論文 参考訳(メタデータ) (2025-08-11T16:25:25Z) - DAMR: Efficient and Adaptive Context-Aware Knowledge Graph Question Answering with LLM-Guided MCTS [28.828541350757714]
本稿では,知識グラフ質問応答(KGQA)のための動的適応MCTSベースの推論(DAMR)を提案する。
DAMRは、MCTS(Monte Carlo Tree Search)と適応経路評価を統合し、コンテキスト対応のKGQAを実現する。
複数のKGQAベンチマークの実験では、DAMRはSOTA法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-08-01T15:38:21Z) - RePCS: Diagnosing Data Memorization in LLM-Powered Retrieval-Augmented Generation [0.0]
モデルは依然として記憶されたトレーニングデータに依存し、得られた証拠をバイパスし、汚染された出力を生成する。
RePCS(Retrieval-Path Contamination Scoring)は,モデルアクセスや再トレーニングを必要とせずに,そのような動作を検出する診断手法である。
論文 参考訳(メタデータ) (2025-06-18T14:48:19Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。