論文の概要: Apodex 1.1: Scaling Agentic Intelligence for Complex Work
- arxiv url: http://arxiv.org/abs/2608.23283v2
- Date: Tue, 25 Aug 2026 15:06:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.265051
- Title: Apodex 1.1: Scaling Agentic Intelligence for Complex Work
- Title(参考訳): Apodex 1.1: 複雑な作業のためのエージェントインテリジェンスの拡張
- Authors: B. An, B. Li, B. Wang, B. Zhang, B. L. Wang, C. Feng, C. Wei, C. Xue, C. Zhang, D. Ng, D. Ye, E. Min, F. Chen, F. Liu, F. Yang, F. Ye, G. Sun, H. Ji, H. Xu, H. Yang, H. Ye, H. Zhang, H. Zhao, J. Li, J. Lin, J. Xia, K. Jin, K. Wang, K. Yang, L. Bing, L. Lei, L. Su, Le. Wang, Lu. Wang, N. Wang, Q. Ren, Q. Yang, R. Li, S. Bai, S. Du, S. Li, S. Lin, S. Nie, S. Wang, S. Zhang, S. Z. Wang, T. Ge, Ta. Q. Fang, Ti. Q. Fang, W. Fang, W. Li, W. Zhang, X. Chen, X. Li, X. Tang, X. Wang, X. Xu, X. Zhang, X. Q. Wang, X. Y. Wang, Y. Deng, Y. Gao, Y. Hu, Y. Li, Y. Sui, Y. Wang, Y. Xiao, Y. Zhang, Y. Zhou, Z. Chen, Z. Cheng, Z. Feng, Z. Liang, Z. Liu, Z. Zhang,
- Abstract要約: 私たちはこれを、現実の目標に向けて持続的で検証可能な進歩(containmented, verible progress)と呼んでいます。
アポデックス 1.1は、多くのフロンティアシステムよりもかなり小さなモデルを使っているにもかかわらず、主要なパフォーマンスバンドに到達した。
- 参考スコア(独自算出の注目度): 6.38250564903872
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: General-purpose language models can reason and synthesize knowledge, but complex work also requires sustained interaction with files, information sources, and executable code, together with state maintenance, failure recovery, and verifiable delivery. We call this \emph{working capability}: sustained, verifiable progress toward a real-world objective. Apodex 1.1 develops this capability along two complementary dimensions. \emph{Environment Scaling} expands the diversity and verifiability of executable file, search, and code environments, while \emph{Agentic Coordination Scaling} trains agents to decompose long-horizon tasks, delegate parallel work, integrate asynchronous results, and replan. A shared execution harness and AgentOS maintain task state and provenance across tools and agents, and training turns environment trajectories and coordination traces into reliable behavior. Across complex professional work, finance, scientific research, mathematics, coding, and search, Apodex 1.1 reaches the leading performance band despite using a substantially smaller model than many frontier systems. The 35B-parameter Apodex 1.1 Mini further retains strong working capability in a locally deployable form. These results ground agentic intelligence in useful, verifiable work completed over time and advance our goal of building a \emph{Heavy-Duty Solver} for ambitious, long-running tasks.
- Abstract(参考訳): 汎用言語モデルは知識を推論し、合成することができるが、複雑な作業には、ファイル、情報ソース、実行可能コードとの持続的な相互作用、状態維持、障害復旧、検証可能なデリバリも必要である。
私たちはこれを"emph{working ability}"と呼びます。
Apodex 1.1はこの能力を2つの相補的な次元に沿って開発している。
\emph{Environment Scaling} は実行ファイル、検索、コード環境の多様性と妥当性を拡大するが、 \emph{Agentic Coordination Scaling} はエージェントを訓練して、長い水平タスクの分解、並列処理の委譲、非同期結果の統合、再計画を行う。
共有実行ハーネスとAgentOSは、ツールとエージェント間のタスク状態と前処理を維持し、トレーニングは環境トラジェクトリと調整トレースを信頼性のある動作に変換する。
アポデックス1.1は、金融、科学研究、数学、コーディング、検索など複雑な専門分野の分野において、多くのフロンティアシステムよりもかなり小さなモデルを用いているにもかかわらず、主要なパフォーマンス・バンドに到達している。
35BパラメーターのApodex 1.1 Miniは、より強力な作業能力をローカルに展開可能な形で維持する。
これらの結果は、有効で検証可能な作業でエージェントインテリジェンスを基礎にし、野心的で長期にわたるタスクのために 'emph{Heavy-Duty Solver} を構築するという私たちの目標を前進させます。
関連論文リスト
- Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence [115.91847478507736]
LLMは言語ジェネレータから、複雑な長距離タスクが可能な自律エージェントへと進化してきた。
多くのタスクにはヘテロジニアスな専門知識、相互依存サブタスク、並列実行、独立検証、永続状態が必要である。
私たちはこれをシステムインテリジェンス(System Intelligence)と呼び、複数のインテリジェントなコンポーネントを一貫した適応的な全体へと整理し、コーディネートするエージェントシステムの能力である。
論文 参考訳(メタデータ) (2026-08-21T14:27:57Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - When Parallelism Pays Off: Cohesion-Aware Task Partitioning for Multi-Agent Coding [19.03671411536556]
マルチエージェント大規模言語モデル(LLM)システムは、並列化やコンテキスト分離を通じて、コーディングのような複雑なタスクを分解する方法を提供する。
我々は,マルチエージェントオーケストレーションをグラフ分割問題として定式化し,通信対計算のトレードオフを捉える。
静的解析から依存性グラフを構築し,構造的ハブファイルを分離し,コミュニティ検出を通じてグラフを分割し,依存関係対応スケジューラで分割を実行するCohesion-aware Coder(Co-Coder)を提案する。
論文 参考訳(メタデータ) (2026-05-31T02:10:12Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning [57.72181998599248]
AgentFugueは、共通の推論ハブを中心に構築された、集合的推論フレームワークである。
ピアエージェントが同じタスクを並列に探索する際、ハブは各エージェントが何を確立、試み、あるいは除外したかを簡潔に記録する。
この結果から,集団推論によってピアエージェントシステムのスケールアウトが実現可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-23T09:21:51Z) - Code as Agent Harness [107.31925305395957]
新興のエージェントシステムでは、コードはもはや単なる目標出力ではない。
コードはエージェントの推論、行動、環境モデリング、実行ベースの検証のための運用上の基盤としてますます役立っている。
この調査は、実行可能、検証可能、ステートフルなAIエージェントシステムに向けた統一されたロードマップを提供する。
論文 参考訳(メタデータ) (2026-05-18T17:59:03Z) - A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications [18.01291032624805]
大きな言語モデル(LLM)ベースのエージェントは、複雑なタスクを自動化するための有望なパラダイムとして、ツール、メモリ、構造化された相互作用を推論し、計画し、行動する。
しかし、エージェントがオープンエンドの現実世界のデプロイメントに向かっていくにつれ、すべてのタスクに対するオフスクラッチ推論と低レベルのツールコールが、ますます非効率になり、エラーが発生し、メンテナンスが困難になる。
本研究は,タスク固有の制約の下で,ツール,メモリ,ランタイムコンテキストを協調する再利用可能な手続き的アーティファクトとして定義する。
論文 参考訳(メタデータ) (2026-05-08T07:10:26Z) - AOrchestra: Automating Sub-Agent Creation for Agentic Orchestration [36.04766562662082]
AOrchestraはフレームワークに依存しないエージェント抽象化で、任意のエージェントをインストラクション、コンテキストツール、モデルとしてモデル化する。
タスク関連コンテキスト、ツール、モデルをキュレートし、オンザフライで自動エージェント生成を通じて実行を委譲する。
AOrchestraはGeminiと組んで最強のベースラインに対して16.28%の相対的な改善を達成した。
論文 参考訳(メタデータ) (2026-02-03T17:46:16Z) - Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models [78.73992315826035]
ネイティブエージェントインテリジェンスと高い計算効率を調和させる軽量言語モデルであるYoutu-LLMを紹介する。
Youtu-LLMは、スクラッチから体系的に推論と計画能力の育成まで事前訓練されている。
論文 参考訳(メタデータ) (2025-12-31T04:25:11Z) - GeoLLM-Engine: A Realistic Environment for Building Geospatial Copilots [1.8434042562191815]
GeoLLM-Engineは、リモートセンシングプラットフォーム上でアナリストが日常的に実行する複雑なタスクを備えた、ツール拡張されたエージェントのための環境である。
我々は100GPT-4-Turboノードにまたがる巨大な並列エンジンを活用し、50万以上の多様なマルチツールタスクと1100万の衛星画像にスケールします。
論文 参考訳(メタデータ) (2024-04-23T20:23:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。