論文の概要: AgentOmnia: Scaling Agentic Models for Full-Scenario Applications
- arxiv url: http://arxiv.org/abs/2607.23124v1
- Date: Sat, 25 Jul 2026 09:58:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.997343
- Title: AgentOmnia: Scaling Agentic Models for Full-Scenario Applications
- Title(参考訳): AgentOmnia: フルシナリオアプリケーションのためのエージェントモデルのスケーリング
- Abstract要約: 大規模言語モデルエージェントは急速に進歩しているが、ドメイン、機能、タスクの難しさ、インタラクション設定にはまだ進歩が断片化されている。
これはTo-Consumer(ToC)、To-Business(ToB)、To-Employee(ToE)アプリケーション間でタスク空間の定義、データ合成、ポストトレーニング、評価、改善を調整するフレームワークです。
- 参考スコア(独自算出の注目度): 36.656762500581216
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents have advanced rapidly, yet progress remains fragmented across domains, capabilities, task difficulty, and interaction settings. We frame this as full-scenario agentic scaling and present AgentOmnia, a framework coordinating task-space definition, data synthesis, post-training, evaluation, and improvement across To-Consumer (ToC), To-Business (ToB), and To-Employee (ToE) applications. An extensible Domain x Capability x Atomic Difficulty taxonomy aligns these stages and enables fine-grained diagnosis with OmniaBench. AgentOmnia combines bidirectional environment-task synthesis with tool-dependency, program-structured, and solver-based pipelines, constructing 5,018 stateful environments with 255,375 tools and 52,361 tasks. Programs, solvers, and verifiers provide correctness signals, while supervised fine-tuning, online agentic reinforcement learning, and a rollback curriculum support post-training. Evaluation failures translate into Product Requirement Documents (PRDs) for targeted self-evolution. Starting from Qwen3-30B-A3B-Thinking-2507, AgentOmnia raises the pass rate on the OmniaBench challenging subset from 9.16% to 37.11% and the macro-average across OmniaBench, $τ^2$-Bench, DeepPlanning, and VitaBench from 22.86% to 41.69%. Under a unified protocol,it leads the evaluated agentic post-trained baselines on OmniaBench and retains the highest four-benchmark macro-average. It also surpasses Qwen3-235B-A22B-Thinking-2507 on all four benchmarks and exceeds Qwen3.5-35B-A3B on the macro-average. Gains span three application splits, ten capability dimensions, eight atomic-difficulty factors, and 76 of 90 level-1 domains, indicating broad rather than category-specific improvement. A one-round study provides initial evidence for PRD-guided self-evolution, motivating validation at larger scales and in industrial settings.
- Abstract(参考訳): 大規模言語モデルエージェントは急速に進歩しているが、ドメイン、機能、タスクの難しさ、インタラクション設定にはまだ進歩が断片化されている。
これはTo-Consumer(ToC)、To-Business(ToB)、To-Employee(ToE)アプリケーション間でタスク空間の定義、データ合成、ポストトレーニング、評価、改善を調整するフレームワークです。
拡張可能な領域 x 能力 x アトミックな分類法はこれらの段階を整列させ、OmniaBench によるきめ細かい診断を可能にする。
AgentOmniaは、双方向環境タスク合成とツール依存、プログラム構造化、ソルバベースのパイプラインを組み合わせることで、5,018のステートフルな環境を255,375のツールと52,361のタスクで構築する。
プログラム、ソルバ、検証器は正確性信号を提供し、微調整、オンラインエージェント強化学習、ロールバックカリキュラムはポストトレーニングをサポートする。
評価失敗は、目標とする自己進化のための製品要求文書(PRD)に変換される。
Qwen3-30B-A3B-Thinking-2507から、エージェントオブニアはOmniaBenchの挑戦的なサブセットのパスレートを9.16%から37.11%に引き上げ、OmniaBenchのマクロ平均値は$τ^2$-Bench、DeepPlanning、VitaBenchを22.86%から41.69%に引き上げた。
統一されたプロトコルの下では、OmniaBench上で評価されたエージェント訓練後のベースラインを導き、最も高い4分岐マークのマクロ平均を保持する。
また、4つのベンチマークでQwen3-235B-A22B-Thinking-2507を上回り、マクロ平均でQwen3.5-35B-A3Bを上回ります。
利得は3つのアプリケーション分割、10の能力次元、8つの原子拡散因子、90のレベル-1ドメインの76にまたがる。
PRD誘導による自己進化の初期の証拠として、大規模および工業環境での検証を動機付けている。
関連論文リスト
- OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios [25.68270661401607]
OmniaBenchは、明示的な状態空間を持つ様々なシナリオにまたがる汎用エージェントを評価するベンチマークである。
実行環境を構築し,4つの相補経路を通した単一ターンタスクと複数ターンタスクを合成する。
ベンチは現在のフロンティアモデルに重大な課題を示しており、クロード・ソネット-5とGPT-5.6-ソルもそれぞれ58.54点と57.14点の総合パス@1点を達成している。
論文 参考訳(メタデータ) (2026-07-16T13:38:07Z) - Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent [98.33217711280383]
本稿では,エージェント水平線をスケーリングすることで,パラメータレベルの性能を1兆倍に向上する35B混在エージェントモデルであるAgens-A1を紹介する。
我々は、外部の知識、行動、観察、検証結果を接続する長期の知識-行動基盤を構築します。
Agents-A1は、ロングホライゾンエージェントベンチマークに対して強力で幅広いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-29T17:50:54Z) - Agentick: A Unified Benchmark for General Sequential Decision-Making Agents [30.028388632526745]
Agentickはシーケンシャルな意思決定エージェントのベンチマークである。
プロシージャで生成されたタスクは6つの機能カテゴリ、難易度レベル4、観察モード5で37になる。
27のコンフィグレーションと90,000以上のエピソードにまたがる評価では、単一のアプローチが支配的でないことが示されている。
論文 参考訳(メタデータ) (2026-05-07T19:12:03Z) - Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence? [35.30497528897595]
Agentic-MMEはマルチモーダルエージェント能力のプロセス検証ベンチマークである。
6つのドメインにまたがる418の現実世界タスクと3つの困難レベルを含んでいる。
2,000以上のステップワイズなチェックポイントがあり、1タスクあたり平均10時間以上の手動アノテーションがある。
論文 参考訳(メタデータ) (2026-04-03T13:02:01Z) - Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters [169.7981969517903]
Step 3.5 Flashは、フロンティアレベルのエージェントインテリジェンスと計算効率を橋渡しする。
エージェントを構築する上で最も重要なもの、すなわち、シャープな推論と高速で信頼性の高い実行に重点を置いています。
論文 参考訳(メタデータ) (2026-02-11T07:53:51Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - How Well Can Modern LLMs Act as Agent Cores in Radiology Environments? [54.36730060680139]
RadA-BenchPlatは、放射線学環境での大規模言語モデル(LLM)のパフォーマンスをベンチマークする評価プラットフォームである。
また、エージェント駆動型タスク解決ツールの10のカテゴリを定義し、7つの主要なLCMを評価している。
論文 参考訳(メタデータ) (2024-12-12T18:20:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。