論文の概要: LongCat-DeepResearch Technical Report
- arxiv url: http://arxiv.org/abs/2609.36071v1
- Date: Mon, 28 Sep 2026 18:22:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.936392
- Title: LongCat-DeepResearch Technical Report
- Title(参考訳): LongCat-DeepResearch技術報告
- Abstract要約: LongCat-DeepResearchは、強化されたLongCatモデルとマルチエージェントワークフローを組み合わせたディープリサーチシステムである。
このワークフローは、世界計画と詳細な調査とセクションレベルでの調整を分離する。
LongCat-DeepResearchはDeepResearchBenchで55.25、DeepResearchBench IIで51.35、ResearchRubricsで79.83を達成している。
- 参考スコア(独自算出の注目度): 51.471456427725826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present LongCat-DeepResearch, a deep research system that combines an enhanced LongCat model with a multi-agent workflow for producing comprehensive, evidence-grounded reports. The workflow separates global planning from detailed investigation and coordinates revision at the section level. Multiple planning agents first explore external sources and refine an actionable research plan, termed ResearchSpec. Research agents then investigate and draft their assigned sections in parallel, gathering additional evidence in separate contexts as their analyses develop. Once the sections are assembled, global review guides targeted local revisions, reducing reliance on repeated full-report rewriting. This workflow also supports the construction of research tasks and trajectories for the mid-training and post-training of LongCat's general-purpose models. LongCat-DeepResearch achieves 55.25 on DeepResearchBench, 51.35 on DeepResearchBench II, and 79.83 on ResearchRubrics. On an in-house benchmark, it scores 76.04, ranking second among four compared systems. Development-set analyses show benefits from combining planning perspectives, while further planning refinement has mixed effects. Additional editing improves average automatic readability preference across two benchmarks, with different trends on each.
- Abstract(参考訳): 我々はLongCat-DeepResearchという,拡張されたLongCatモデルとマルチエージェントワークフローを組み合わせるディープリサーチシステムについて紹介する。
このワークフローは、世界計画と詳細な調査とセクションレベルでの調整を分離する。
複数の計画エージェントはまず外部ソースを探索し、ResearchSpecと呼ばれる実行可能な研究計画を洗練する。
調査エージェントは、割り当てられたセクションを並行して調査し、ドラフトし、分析が発展するにつれて別の文脈で追加の証拠を収集する。
セクションが組み立てられると、グローバルレビューガイドはローカルリビジョンをターゲットとし、再レポートされた全書き直しへの依存を減らす。
このワークフローはまた、LongCatの汎用モデルのミッドトレーニングとポストトレーニングのための研究タスクと軌道の構築もサポートする。
LongCat-DeepResearchはDeepResearchBenchで55.25、DeepResearchBench IIで51.35、ResearchRubricsで79.83を達成している。
社内ベンチマークでは76.04点であり、4つの比較システムの中で2位である。
開発セット分析は、計画の観点を組み合わせることの利点を示し、さらに計画の洗練には様々な効果がある。
追加の編集により、2つのベンチマークで平均的な自動読みやすさが向上し、それぞれに異なる傾向がある。
関連論文リスト
- DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded Reasoning [58.09293442211248]
Deep Research(DR)は、複雑でオープンな研究課題に取り組むための新しいエージェントパラダイムとして登場した。
本稿では,Qianfan Agent Foundry上に構築されたマルチエージェントDRフレームワークであるDuMate-DeepResearchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T14:10:48Z) - MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning [74.07254720088926]
長文の視覚的質問応答に対処するために,エージェント型視覚認識ワークフローを利用する新しいフレームワークMM-Doc-R1を紹介する。
GRPOのような既存のマルチターン強化学習(RL)アルゴリズムにおけるベースライン推定バイアスに対処する、類似性に基づくポリシー最適化(SPO)を提案する。
MMLongbench-Docベンチマークの実験では、MM-Doc-R1が以前のベースラインを10.4%上回る結果となった。
論文 参考訳(メタデータ) (2026-04-15T07:39:08Z) - Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization [64.61432234404276]
emphSearch More, Think Less (SMTL) は、効率性と一般化の両方をターゲットとした長期エージェント検索のためのフレームワークである。
我々は、教師付き微調整と強化学習を用いてエンドツーエンドエージェントを訓練し、ベンチマーク全体にわたって、強固で頻繁なパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-02-26T06:46:41Z) - Deep Researcher with Sequential Plan Reflection and Candidates Crossover (Deep Researcher Reflect Evolve) [0.0]
本稿では、複雑なPhDレベルのトピックに関する詳細な研究レポートを作成するために設計された、新しいDeep Researcherアーキテクチャを提案する。
本システムでは,リフレクションによる逐次研究計画修正と候補クロスオーバーアルゴリズムという,2つの重要なイノベーションを活用している。
我々の建築は46.21点を達成し、先進的な深層研究エージェントを超越して優れた性能を示した。
論文 参考訳(メタデータ) (2026-01-28T18:45:39Z) - IterResearch: Rethinking Long-Horizon Agents via Markovian State Reconstruction [107.49922328855025]
IterResearchは、マルコフ決定過程として長期研究を再構築する、新しい反復的深層研究パラダイムである。
6つのベンチマークで平均+14.5ppの既存のオープンソースエージェントよりも大幅に改善されている。
これは効果的なプロンプト戦略として機能し、ロングホライゾンタスクにおけるReActよりも19.2ppのフロンティアモデルを改善する。
論文 参考訳(メタデータ) (2025-11-10T17:30:08Z) - Deep Research: A Survey of Autonomous Research Agents [33.96146020332329]
大規模言語モデル(LLM)の急速な進歩は、複雑なタスクを自律的に実行可能なエージェントシステムの開発を促している。
これらの制約を克服するため、深層研究のパラダイムが提案され、エージェントは、Webベースの証拠に根ざした包括的で忠実な分析レポートを生成するために、計画、検索、合成に積極的に従事する。
本稿では,計画,質問開発,Web探索,レポート生成の4段階からなるディープリサーチパイプラインの体系的概要について述べる。
論文 参考訳(メタデータ) (2025-08-18T09:26:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。