論文の概要: AutoResearch at Production Scale: Failure Modes and a Multi-Agent Framework
- arxiv url: http://arxiv.org/abs/2609.30541v1
- Date: Thu, 24 Sep 2026 20:49:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.136629
- Title: AutoResearch at Production Scale: Failure Modes and a Multi-Agent Framework
- Title(参考訳): プロダクションスケールでのAutoResearch: 障害モードとマルチエージェントフレームワーク
- Abstract要約: Andrej Karpathy氏のAutoResearchパラダイムを運用規模で運用する12週間について報告する。
220以上の実験を行い、元の設定から5つの繰り返し失敗モードが欠落しているのを観察しました。
この2つのシステムは1石当たりのコストで約3桁の規模に及んでいるが、同じ障害モードを示す。
- 参考スコア(独自算出の注目度): 4.894899435798182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optimizing embedding systems for production recommendation pipelines demands systematic exploration that consumes disproportionate engineering effort at scale. We apply Andrej Karpathy's AutoResearch paradigm -- a large language model that iteratively edits a training script and retains modifications that improve a held-out scalar metric -- to automate this exploration. We report on twelve weeks of running this paradigm at production scale, where iterations consume hours of multi-GPU compute, evaluation involves competing criteria, and campaigns span weeks across many training jobs. Across two independently developed representation-learning systems for a book recommendation pipeline, we ran 220+ experiments and observed five recurring failure modes absent from the original setting: infrastructure fragility, agent memory decay, search-direction stagnation, iteration-cost asymmetry, and metric fixation. We contribute a three-principle scaffolding design -- prevent, persist, redirect -- that maps each failure mode to a structural remedy and whose instantiation scales with iteration cost. The framework produced a 1.82x Recall@6 lift and a 2.1x coherence lift over hand-tuned baselines, and the agent autonomously designed a text-only fallback that expanded catalog coverage by 5.8x. The two systems span nearly three orders of magnitude in per-iteration cost yet exhibit the same failure modes, suggesting these are structural properties of production-scale autonomous research rather than artifacts of either application.
- Abstract(参考訳): 製品レコメンデーションパイプラインへの組み込みシステムの最適化は、大規模に不適切なエンジニアリング作業を消費する体系的な探索を必要とする。
Andrej Karpathy氏のAutoResearchパラダイムは、トレーニングスクリプトを反復的に編集し、保持されたスカラーメトリックを改善する修正を保持する、大規模な言語モデルです。
イテレーションがマルチGPU計算の時間を消費し、評価は競合する基準を伴い、キャンペーンは多くのトレーニングジョブで数週間にわたって行われる。
本リコメンデーションパイプラインのための2つの独立して開発された表現学習システムで、220以上の実験を行い、インフラの不安定性、エージェントメモリの劣化、探索方向の停滞、イテレーションコストの非対称性、メートル法固定の5つの繰り返し故障モードを観測した。
私たちは、各障害モードを構造的救済にマッピングし、イテレーションコストとともにインスタンス化がスケールする3つの基本的な足場設計 -- 予防、持続、リダイレクト -- に貢献しています。
このフレームワークは1.82倍のRecall@6リフトと2.1倍のコヒーレンスリフトを手動のベースライン上に作り、エージェントは自動でテキストのみのフォールバックを設計し、カタログのカバレッジを5.8倍に拡大した。
この2つのシステムは、氷点当たりのコストの約3桁にまたがるが、同じ障害モードを示しており、これらはどちらの用途のアーティファクトよりも、生産規模での自律的な研究の構造的特性であることを示唆している。
関連論文リスト
- Auto-RecSys: Harnessing Autonomous Research Agents for Industry-Scale Recommender System [20.228106034590336]
Auto-RecSysは、産業規模のレコメンデーションモデルに関する長期実験のための自律的な研究システムである。
Auto-RecSysは、実験サイクルあたりの人的時間を大幅に削減し、プレイブックが成熟するにつれて実行信頼性を向上させる。
論文 参考訳(メタデータ) (2026-09-10T00:09:18Z) - Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1 [4.486629113012585]
ARC-AGI-1の最近の進歩は、フロンティアモデルよりも重いテスト時間計算と、ARCデータに基づいて小さなモデルを微調整するベンチマーク固有のトレーニングの2つから来ている。
パターン発見とプログラム合成の段階を明示的に分解するエージェントハーネスを構築する。
論文 参考訳(メタデータ) (2026-07-07T19:49:35Z) - AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems [82.01232437066487]
AgentXはプロダクションデプロイされたマルチエージェントシステムで、このプロダクション機能を再構築する。
自律的に生成し、実装し、評価し、レコメンデーション実験から学ぶ。
AgentXは4つの密結合したステージをクローズドループでオーケストレーションする。
論文 参考訳(メタデータ) (2026-06-25T10:42:28Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale [92.09717763663873]
我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
論文 参考訳(メタデータ) (2026-04-06T15:44:18Z) - SCoTER: Structured Chain-of-Thought Transfer for Enhanced Recommendation [24.019381388104236]
本稿では,パターン発見と構造認識伝達を協調最適化問題として扱う統合フレームワークであるSCoTERを提案する。
具体的には、SCoTERは、自動パターン検出のためのGVMパイプラインと、ステップワイズロジックを効率的なモデルに転送する構造保存統合アーキテクチャという、2つの相乗的コンポーネントを通じてこれを運用する。
論文 参考訳(メタデータ) (2025-11-24T03:00:04Z) - AutoMaAS: Self-Evolving Multi-Agent Architecture Search for Large Language Models [4.720605681761044]
AutoMaASは自己進化型マルチエージェントアーキテクチャ検索フレームワークである。
ニューラルネットワーク検索の原則を使用して、最適なエージェント構成を自動的に検出する。
1.0-7.1%の性能向上を実現し、最先端の手法と比較して推論コストを3~5%削減する。
論文 参考訳(メタデータ) (2025-10-03T01:57:07Z) - OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking System [61.12400636463362]
OnePieceは、LLMスタイルのコンテキストエンジニアリングと推論を、検索モデルとランキングモデルの両方にシームレスに統合する統合フレームワークである。
OnePieceは、Shopeeの主要なパーソナライズされた検索シナリオにデプロイされ、さまざまな主要なビジネス指標で一貫したオンラインゲインを実現している。
論文 参考訳(メタデータ) (2025-09-22T17:59:07Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。