論文の概要: SelfAI: Building a Self-Training AI System with LLM Agents
- arxiv url: http://arxiv.org/abs/2512.00403v1
- Date: Sat, 29 Nov 2025 09:18:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-02 19:46:34.223622
- Title: SelfAI: Building a Self-Training AI System with LLM Agents
- Title(参考訳): SelfAI: LLMエージェントによる自己学習AIシステムの構築
- Abstract要約: SelfAIは、高レベルの研究目的を標準化された実験構成に変換するためのUser Agentを組み合わせた、一般的なマルチエージェントプラットフォームである。
実験マネージャは、連続的なフィードバックのための構造化知識ベースを維持しながら、異種ハードウェアをまたいだ並列かつフォールトトレラントなトレーニングを編成する。
回帰、コンピュータビジョン、科学計算、医用画像、薬物発見ベンチマークなどを通じて、SelfAIは一貫して高いパフォーマンスを達成し、冗長な試行を減らしている。
- 参考スコア(独自算出の注目度): 79.10991818561907
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work on autonomous scientific discovery has leveraged LLM-based agents to integrate problem specification, experiment planning, and execution into end-to-end systems. However, these frameworks are often confined to narrow application domains, offer limited real-time interaction with researchers, and lack principled mechanisms for determining when to halt exploration, resulting in inefficiencies, reproducibility challenges, and under-utilized human expertise. To address these gaps, we propose \textit{SelfAI}, a general multi-agent platform that combines a User Agent for translating high-level research objectives into standardized experimental configurations, a Cognitive Agent powered by LLMs with optimal stopping criteria to iteratively refine hyperparameter searches, and an Experiment Manager responsible for orchestrating parallel, fault-tolerant training workflows across heterogeneous hardware while maintaining a structured knowledge base for continuous feedback. We further introduce two novel evaluation metrics, Score and $\text{AUP}_D$, to quantify discovery efficiency and search diversity. Across regression, NLP, computer vision, scientific computing, medical imaging, and drug discovery benchmarks, SelfAI consistently achieves strong performance and reduces redundant trials compared to classical Bayesian optimization and LLM-based baselines, while enabling seamless interaction with human researchers.
- Abstract(参考訳): 自律的な科学的発見に関する最近の研究は、LLMベースのエージェントを活用して、問題仕様、実験計画、実行をエンドツーエンドシステムに統合している。
しかしながら、これらのフレームワークは、狭いアプリケーションドメインに限定され、研究者とのリアルタイムのやりとりが制限され、探索をいつ停止するかを決めるための原則的なメカニズムが欠如しており、その結果、非効率性、再現性の問題、未使用の人間の専門知識が欠如している。
これらのギャップに対処するために,高レベルの研究目的を標準化された実験構成に翻訳するユーザエージェントと,高パラメータ探索を反復的に洗練するための最適な停止基準を持つ認知エージェントと,異種ハードウェア間で並列でフォールトトレラントなトレーニングワークフローを編成する実験マネージャとを組み合わせた,汎用的なマルチエージェントプラットフォームである‘textit{SelfAI} を提案する。
さらに、探索効率と探索多様性を定量化するために、Scoreと$\text{AUP}_D$という2つの新しい評価指標を導入する。
回帰、NLP、コンピュータビジョン、科学計算、医用画像、薬物発見ベンチマークなどを通じて、SelfAIは一貫して高いパフォーマンスを達成し、古典的ベイズ最適化やLLMベースのベースラインと比較して冗長な試行を減らし、人間の研究者とのシームレスな対話を可能にしている。
関連論文リスト
- Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive [46.53605767076999]
不適切な構成選択は、かなりの計算資源を浪費し、モデルがその潜在能力を最大限に実現できないようにする。
従来の自動手法は、繰り返し試行錯誤が可能な安価な設定のために設計されている。
我々は,人間研究者が低忠実度実験から一般化可能な原理を学習する方法を模倣するエージェントフレームワークであるAutoLLMResearchを提案する。
論文 参考訳(メタデータ) (2026-05-12T04:42:35Z) - Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Agent Collaboration [53.772014300855375]
我々は,自律型エンドツーエンド神経画像解析のためのマルチエージェントシステムであるNIAgentを紹介する。
従来のフラットなツール呼び出しエージェントとは異なり、NIAgentはコード中心の実行パラダイムを採用している。
本稿では,コホートレベルの検定とエージェント視覚検査を組み合わせた,自律的品質管理のための階層的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-10T06:30:19Z) - An Empirical Study of Multi-Agent Collaboration for Automated Research [41.906658558789545]
本稿では,機械学習の自動最適化のための異なるマルチエージェント構造の比較効果について検討する。
サブエージェントアーキテクチャとエージェントチームアーキテクチャという,2つのマルチエージェントパラダイムに対して,単一エージェントベースラインをベンチマークする。
この結果から,運用安定性と理論的検討の根本的なトレードオフが明らかになった。
論文 参考訳(メタデータ) (2026-03-31T11:57:00Z) - Pitfalls in Evaluating Interpretability Agents [91.49742416116635]
我々は,実験を反復的に設計し,仮説を洗練するエージェントシステムを構築した。
我々の研究は、複雑な自動解釈可能性システムを評価する上での根本的な課題を実証している。
論文 参考訳(メタデータ) (2026-03-20T16:27:17Z) - Sandpiper: Orchestrated AI-Annotation for Educational Discourse at Scale [3.0317183198617066]
Sandpiperは、高ボリュームの会話データと人間の質的な専門知識の橋渡しとして設計された混合開始システムである。
本稿では,AIを用いた定性分析における研究効率の向上,レータ間信頼性,研究者信頼度を評価するためのシステムの有効性を評価するためのユーザスタディを提案する。
論文 参考訳(メタデータ) (2026-03-09T14:01:42Z) - AI Agents for Inventory Control: Human-LLM-OR Complementarity [12.448705668487852]
大規模言語モデル(LLM)は、柔軟に推論し、リッチなコンテキストシグナルを組み込むことができるAIエージェントへの関心を生んでいる。
我々は, ORアルゴリズム, LLM, 人間がどのように相互作用し, 相互に補完するかを, 多周期在庫管理設定で検討する。
平均して、人間とAIのチームは、人間またはAIエージェントが単独で運営するよりも高い利益を得る。
論文 参考訳(メタデータ) (2026-02-13T05:23:46Z) - An Agentic Framework for Autonomous Materials Computation [70.24472585135929]
大規模言語モデル(LLM)は、科学的発見を加速するための強力なツールとして登場した。
近年の進歩はLLMをエージェントフレームワークに統合し、複雑な科学実験のための検索、推論、ツールの使用を可能にしている。
本稿では,第一原理計算の信頼性向上を目的としたドメイン特化エージェントを提案する。
論文 参考訳(メタデータ) (2025-12-22T15:03:57Z) - A Flexible Multi-Agent LLM-Human Framework for Fast Human Validated Tool Building [0.8373057326694192]
CollabToolBuilderは、HITL(Expert-in-the-loop)ガイダンスを備えた柔軟なマルチエージェントLLMフレームワークである。
目標を達成するためのツールを反復的に作成し、人間の意図とプロセスに合わせることを学習する。
アーキテクチャは4つの専門エージェントを介してツールを生成し、検証する。
論文 参考訳(メタデータ) (2025-12-01T09:19:18Z) - AgentEvolver: Towards Efficient Self-Evolving Agent System [51.54882384204726]
本稿では,自律型エージェント学習を駆動する自己進化型エージェントシステムであるAgentEvolverを紹介する。
AgentEvolverは、セルフクエスト、セルフナビゲート、セルフコントリビューションという3つのシナジスティックメカニズムを導入している。
予備実験により、AgentEvolverは従来のRLベースのベースラインと比較して、より効率的な探索、より優れたサンプル利用、より高速な適応を実現していることが示された。
論文 参考訳(メタデータ) (2025-11-13T15:14:47Z) - AutoLabs: Cognitive Multi-Agent Systems with Self-Correction for Autonomous Chemical Experimentation [0.10999592665107412]
AutoLabsは、自然言語命令を自動で実行可能なプロトコルに変換するように設計された、自己修正型マルチエージェントアーキテクチャである。
複雑化に関する5つのベンチマーク実験を特徴とする総合評価フレームワークを提案する。
以上の結果から,エージェント推論能力が成功の最も重要な要因であることが示唆された。
論文 参考訳(メタデータ) (2025-09-30T01:51:46Z) - SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents [93.26456498576181]
本稿では,ディープリサーチのためのネイティブ自律単エージェントモデルの開発に焦点をあてる。
我々の最良の変種であるSFR-DR-20Bは、HumanityのLast Examベンチマークで28.7%に達する。
論文 参考訳(メタデータ) (2025-09-08T02:07:09Z) - Benchmarking LLM-based Agents for Single-cell Omics Analysis [6.915378212190715]
AIエージェントは、適応的な計画、実行可能なコード生成、トレース可能な決定、リアルタイム知識融合を可能にする、パラダイムシフトを提供する。
本稿では,シングルセルオミクス解析におけるエージェント能力の厳格な評価を行うためのベンチマーク評価システムを提案する。
論文 参考訳(メタデータ) (2025-08-16T04:26:18Z) - Agentic Reinforced Policy Optimization [66.96989268893932]
検証可能な報酬付き大規模強化学習(RLVR)は,大規模言語モデル(LLM)を単一ターン推論タスクに活用する効果を実証している。
現在のRLアルゴリズムは、モデル固有のロングホライゾン推論能力と、マルチターンツールインタラクションにおけるその習熟性のバランスが不十分である。
エージェント強化ポリシー最適化(ARPO: Agentic Reinforced Policy Optimization)は,マルチターンLDMエージェントを学習するためのエージェントRLアルゴリズムである。
論文 参考訳(メタデータ) (2025-07-26T07:53:11Z) - Heterogeneous Group-Based Reinforcement Learning for LLM-based Multi-Agent Systems [25.882461853973897]
本稿では、相対報酬の利点を推定して政策更新を導くマルチエージェント不均一グループ政策最適化(MHGPO)を提案する。
MHGPOは、批判的ネットワークの必要性を排除し、安定性を向上し、計算オーバーヘッドを減らす。
また,効率性と有効性を両立させる3つのグループロールアウトサンプリング戦略も導入する。
論文 参考訳(メタデータ) (2025-06-03T10:17:19Z) - The BrowserGym Ecosystem for Web Agent Research [151.90034093362343]
BrowserGymエコシステムは、Webエージェントの効率的な評価とベンチマークの必要性の高まりに対処する。
本稿では,Webエージェント研究のためのBrowserGymベースの拡張エコシステムを提案する。
大規模なマルチベンチマークWebエージェント実験を初めて実施し、6つのWebエージェントベンチマークで6つの最先端LCMの性能を比較した。
論文 参考訳(メタデータ) (2024-12-06T23:43:59Z) - SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative Refinement [18.84439000902905]
現在の大規模言語モデル(LLM)ベースのソフトウェアエージェントは、しばしば線形でシーケンシャルなプロセスに従う。
モンテカルロ木探索(MCTS)と自己改善機構を統合したマルチエージェントフレームワークであるSWE-Searchを提案する。
これは、複雑なソフトウェアエンジニアリング環境における自己評価駆動検索技術の可能性を強調している。
論文 参考訳(メタデータ) (2024-10-26T22:45:56Z) - FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models [50.331708897857574]
本稿では,高度に訓練された高密度FFNを余分なサブネットワークに分解する新しいアプローチであるFacterLLMを紹介する。
FactorLLMは、最大85%のモデル性能を確保しながら、推論速度を30%以上増加させながら、ソースモデルに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-08-15T16:45:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。