論文の概要: DeepResearch Agent System
- arxiv url: http://arxiv.org/abs/2607.27562v1
- Date: Thu, 30 Jul 2026 01:15:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.356888
- Title: DeepResearch Agent System
- Title(参考訳): ディープリサーチエージェントシステム
- Authors: Yong Huang, Yulu Huang, for the team Collaboration,
- Abstract要約: DeepResearch Agent Systemは、ディープ情報検索、多段階推論、自律的な研究タスクのために設計された、大規模な言語モデルシステムである。
システムは128Kのコンテキストウィンドウをサポートし、18.7%の精度と23.4%のリコール改善をもたらす階層的な注意機構を備えている。
システムは、データ合成、トレーニング、推論コードを含む完全にオープンソースであり、学術研究、ビジネス分析、研究開発支援、教育の応用をサポートする。
- 参考スコア(独自算出の注目度): 0.919770842662809
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The DeepResearch Agent System is a large language model system engineered for deep information retrieval, multi-step reasoning, and autonomous research tasks. Built upon a sparse activation architecture with 30 billion total parameters of which only 3 billion are activated per token, the system achieves state-of-the-art performance on multiple agent search benchmarks while delivering 3.2 times faster inference compared to dense counterparts of equivalent scale. The system supports a 128K-token context window with hierarchical attention mechanisms that yield 18.7% accuracy and 23.4% recall improvements over standard long-context approaches. A dual-mode reasoning engine provides both a ReAct paradigm for basic multi-step problem solving and an IterResearch mode for high-performance iterative research with up to 20 reasoning steps, collectively delivering a 31.2% accuracy improvement over single-pass baselines. Multi-tool coordination integrates retrieval, computation, web search, and file parsing modules to achieve 92.1% tool-use accuracy. A reinforcement learning optimization framework based on the GRPO algorithm provides token-level policy gradients that improve training stability by 35% and accelerate convergence by 42%. An automated data synthesis pipeline with seed-based expansion achieves a 92.5% usability rate. Benchmark results include 87.3% on Humanity's Last Exam, 85.3% on BrowserComp Chinese, and 91.2% on WebWalkerQA. The system is fully open-sourced, including data synthesis, training, and inference code, and supports applications in academic research, business analysis, R&D support, and education.
- Abstract(参考訳): DeepResearch Agent Systemは、ディープ情報検索、多段階推論、自律的な研究タスクのために設計された大規模な言語モデルシステムである。
トークンごとに30億のパラメータが活性化されるスパースアクティベーションアーキテクチャに基づいて構築され、複数のエージェントサーチベンチマークで最先端のパフォーマンスを達成すると同時に、等価スケールの高密度なパラメータに比べて3.2倍高速な推論を実現する。
このシステムは128Kのコンテキストウィンドウをサポートし、18.7%の精度と23.4%のリコール改善をもたらす階層的な注意機構を備えている。
デュアルモード推論エンジンは、基本的な多段階問題解決のためのReActパラダイムと、20段階までの推論ステップを持つ高性能反復研究のためのIterResearchモードの両方を提供し、単一のパスベースラインに対して31.2%の精度向上を提供する。
マルチツール調整は、検索、計算、Web検索、ファイル解析モジュールを統合し、92.1%のツール使用精度を実現する。
GRPOアルゴリズムに基づく強化学習最適化フレームワークは、トレーニング安定性を35%向上し、収束率を42%向上させるトークンレベルポリシー勾配を提供する。
シードベースの拡張を備えた自動データ合成パイプラインは、92.5%のユーザビリティを達成する。
ベンチマークの結果は、HumanityのLast Examで87.3%、BrowserComp Chineseで85.3%、WebWalkerQAで91.2%である。
このシステムは、データ合成、トレーニング、推論コードを含む完全にオープンソースであり、学術研究、ビジネス分析、研究開発支援、教育の応用をサポートする。
関連論文リスト
- optimize_anything: A Universal API for Optimizing any Text Parameter [98.42497715725356]
単一タスク検索をサポートする1つのAIベースの最適化システム、クロスプロブレム転送によるマルチタスク検索、および目に見えない入力への一般化を示す。
LLMに基づく検索によるテキストの最適化は汎用的な問題解決パラダイムであることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:18:12Z) - Adaptive ToR: Complexity-Aware Tree-Based Retrieval for Pareto-Optimal Multi-Intent NLU [0.15293427903448018]
多言語自然言語理解には、高い精度と計算効率を同時に達成する検索システムが必要である。
本稿では,クエリ特性に基づいた検索トポロジを動的に構成する複雑性を考慮した検索アーキテクチャであるAdaptive Tree-of-Retrieval (Adaptive ToR)を提案する。
論文 参考訳(メタデータ) (2026-04-27T09:24:10Z) - From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents [51.12380889298618]
POISEは、言語モデルのためのポリシー最適化アルゴリズムの自動発見のためのフレームワークである。
PoISEは構造化され、属学的にリンクされたアーカイブリンクの提案、実行可能な実装、標準化された評価、自然言語のリフレクションを維持している。
論文 参考訳(メタデータ) (2026-03-25T05:19:23Z) - PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models [5.598141218271656]
大規模言語モデルは様々な推論タスクにまたがって顕著な能力を示してきたが、アルゴリズム的推論のパフォーマンスは依然として限られている。
本稿では,3つの専門エージェントからなるフレームワークPRIME,ステップバイステップ推論のエグゼキュータ,制約チェックの検証器,バックトラック制御のコーディネータを提案する。
これまでで最大のアルゴリズム推論ベンチマークであるPRIME-Benchを導入し,12のカテゴリにわたる86のタスクと51,600のインスタンスを比較検討した。
論文 参考訳(メタデータ) (2026-01-19T07:57:01Z) - ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment [1.6968020497268546]
ROADは、最適化を検索ではなく動的デバッグ調査として扱う新しいフレームワークである。
道路はサンプリング効率が高く、成功率は5.6%、検索精度は3.8%向上している。
これらの結果は、ヒューマンエンジニアリングの失敗分析とパッチングのループを模倣することで、リソース集約的なトレーニングに代わる、実行可能なデータ効率の代替が可能になることを示唆している。
論文 参考訳(メタデータ) (2025-12-30T07:31:34Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Balanced Multi-Task Attention for Satellite Image Classification: A Systematic Approach to Achieving 97.23% Accuracy on EuroSAT Without Pre-Training [0.0]
本研究は、衛星土地利用分類のための独自の畳み込みニューラルネットワークアーキテクチャを体系的に研究する。
事前訓練されたモデルに依存することなく、EuroSATデータセット上で97.23%のテスト精度を達成する。
我々の手法は、外部データを必要としない微調整されたResNet-50(98.57%)の1.34%で性能を達成する。
論文 参考訳(メタデータ) (2025-10-17T10:59:24Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Advanced Multi-Architecture Deep Learning Framework for BIRADS-Based Mammographic Image Retrieval: Comprehensive Performance Analysis with Super-Ensemble Optimization [0.0]
マンモグラフィ画像検索システムでは、5つの異なるクラスにまたがる正確なBIRADSカテゴリマッチングが必要である。
現在の医用画像検索研究は方法論的限界に悩まされている。
論文 参考訳(メタデータ) (2025-08-06T18:05:18Z) - Building Math Agents with Multi-Turn Iterative Preference Learning [56.71330214021884]
本稿では,モデル性能をさらに向上させるために,補完的な直接選好学習手法について検討する。
既存の直接選好学習アルゴリズムは、もともとシングルターンチャットタスク用に設計されている。
この文脈に合わせたマルチターン直接選好学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-04T02:41:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。