論文の概要: SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks
- arxiv url: http://arxiv.org/abs/2606.15872v1
- Date: Sun, 14 Jun 2026 15:45:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.905576
- Title: SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks
- Title(参考訳): SciOrch: 最先端のマルチモーダル科学推論タスクを解決するためのエキスパートLLMのオーケストレーションを学ぶ
- Abstract要約: SciOrchは、科学的な推論のためにフロンティアLSMを編成する軽量8Bモデルを訓練するフレームワークである。
SGI-ReasoningとScientificsの最初の試験にまたがる240回の試験セットでは、SciOrchの平均精度は56.66%に達した。
また、一般的なマルチエージェントメソッドのAPIコストの半分未満で、SGIとSFEの両方で最高の精度を実現する。
- 参考スコア(独自算出の注目度): 65.14594927081983
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Frontier scientific reasoning remains a major challenge for large language models (LLMs), where even the strongest commercial systems fall short of expert-level performance. A closer look at model behavior reveals substantial complementarity that single-model evaluation hides: different frontier models excel on different question types, and no single model captures the full picture. We present SciOrch, a framework that trains a lightweight 8B model to orchestrate frontier LLMs for scientific reasoning. The orchestrator decomposes each question, delegates sub-problems to selected commercial models through API calls, and synthesizes a final answer. Training such an orchestrator is fundamentally harder than conventional agentic RL: each action triggers an API call that is expensive in both dollar cost and latency, making standard online rollouts infeasible. We address this with MCTS-based approach, producing diverse orchestration trajectories, extracting per-node single-turn samples, and optimizing the orchestrator with GRPO-style training. On a 240-question test set spanning SGI-Reasoning and Scientists' First Exam, SciOrch reaches 56.66% average accuracy, outperforming the strongest single commercial model by 3.74% and the strongest multi-agent baseline by 3.33%. It also attains the best accuracy on both SGI and SFE with less than half the API cost of typical multi-agent methods.
- Abstract(参考訳): 最強の商業システムでさえ、専門家レベルの性能に欠ける大規模言語モデル(LLM)にとって、最前線の科学的推論は依然として大きな課題である。
モデルビヘイビアを詳しく見てみると、単一モデル評価が隠している相当な相補性が見られる: 異なるフロンティアモデルは異なる質問タイプに優れ、単一のモデルが全体像をキャプチャすることはない。
SciOrchは、科学的な推論のためにフロンティアLSMを編成する軽量8Bモデルを訓練するフレームワークである。
オーケストレータは各質問を分解し、APIコールを通じて選択した商用モデルにサブプロブレムを委譲し、最終的な回答を合成する。
このようなオーケストレータのトレーニングは、従来のエージェントRLよりも基本的に難しい — 各アクションは、コストとレイテンシの両方で高価なAPIコールをトリガーし、標準的なオンラインロールアウトが実現不可能になります。
我々は、MCTSベースのアプローチでこの問題に対処し、多様なオーケストレーショントラジェクトリを生成し、ノードごとのシングルターンサンプルを抽出し、GRPOスタイルのトレーニングでオーケストレータを最適化する。
SGI-ReasoningとScientifics' First Examにまたがる240のクエストテストセットでは、SciOrchの平均精度は56.66%に達し、最強の商業モデルである3.74%、最強のマルチエージェントベースラインである3.33%を上回った。
また、一般的なマルチエージェントメソッドのAPIコストの半分未満で、SGIとSFEの両方で最高の精度を実現する。
関連論文リスト
- Reward Modeling for Multi-Agent Orchestration [43.79233309038303]
LLM(Large Language Models)上に構築されたマルチエージェントシステム(MAS)は、特殊エージェントを協調するための効果的なオーケストレーションを必要とする。
人間のアノテーションを使わずにオーケストレーション品質を評価するための自己組織化フレームワークOrchRMを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:16:24Z) - LLM-driven design of physics-constrained constitutive models: two agents are better than one [0.0]
モデル生成のためのマルチエージェントLPM駆動型アプローチを初めて導入する。
作成エージェントがデータに合わせたモデルを提案し、インスペクタエージェントが9つの物理的制約に対して各提案を監査する。
この概念を、人工ニューラルネットワーク(CANN)で実証し、脳組織、実験ゴム、合成ゴムでベンチマークする。
論文 参考訳(メタデータ) (2026-05-22T15:27:09Z) - CascadeDebate: Multi-Agent Deliberation for Cost-Aware LLM Cascades [3.2562960801091094]
CascadeDebateは、モデルと人間の専門家を協調して精度、コスト、そして不確実性の下での棄権のバランスをとるマルチエージェントシステムである。
我々のアーキテクチャは、モデルスケールにまたがる選択的なマルチエージェント検討と単一モデル推論を交互に行い、最終的なフォールバックとして人間の専門家を導いた。
科学、医学、一般知識にまたがる5つのベンチマークで、CascadeDebateは強力なシングルモデルカスケードとスタンドアロンのマルチエージェントシステムより最大26.75パーセントパフォーマンスがある。
論文 参考訳(メタデータ) (2026-04-14T04:26:39Z) - RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty [102.02839046225468]
RankLLMは質問の難しさとモデルの能力の両方を定量化する新しいフレームワークである。
複数のドメインにまたがる35,550の質問に対して30のモデルを評価する。
論文 参考訳(メタデータ) (2026-02-12T21:28:46Z) - CARGO: A Framework for Confidence-Aware Routing of Large Language Models [6.002503434201551]
CARGOは動的大規模言語モデル(LLM)選択のための軽量で信頼性に配慮したフレームワークである。
CARGOは、LLM-judgedペアワイド比較に基づいて訓練された単一の埋め込みベースの回帰器を用いて、モデル性能を予測する。
CARGOは76.4%でトップ1のルーティング精度を達成し、個々の専門家に対して72%から89%の勝利率を達成した。
論文 参考訳(メタデータ) (2025-09-18T12:21:30Z) - Multi-Model Synthetic Training for Mission-Critical Small Language Models [0.0]
海上情報に対する261倍のコスト削減を実現する新しい手法を提案する。
提案手法は,320億個の自動識別システム (AIS) の船体追跡記録を21,543個の質問と回答のペアに変換する。
その結果得られた微調整Qwen2.5-7Bモデルは、海事作業において75%の精度を達成し、推論のためにより大きなモデルを使用するよりもかなり安価である。
論文 参考訳(メタデータ) (2025-09-16T13:04:48Z) - CTTS: Collective Test-Time Scaling [58.564620942591866]
テスト時スケーリング(TTS)は,大規模言語モデル(LLM)のパフォーマンス向上のための,有望かつトレーニング不要なアプローチとして登場した。
単体テストタイムスケーリング(STTS)パラダイムを克服するために、CTTS(Collective Test-Time Scaling)を導入します。
CTTS-MMは、マルチエージェントとマルチリワードのコラボレーションを運用する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-08-05T11:19:08Z) - APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay [86.01901238059261]
APIGen-MTは検証可能で多様なマルチターンエージェントデータを生成するフレームワークである。
xLAM-2-fc-r 級数で 1B から 70B のパラメータを持つモデル群を訓練する。
我々のモデルは、$tau$-benchとBFCLベンチマークでGPT-4oやClaude 3.5のようなフロンティアモデルより優れている。
論文 参考訳(メタデータ) (2025-04-04T17:13:57Z) - From Dense to Dynamic: Token-Difficulty Driven MoEfication of Pre-Trained LLMs [37.50902921493273]
異なる推論制約に対する大規模言語モデル(LLM)のトレーニングには計算コストがかかる。
DynaMoEは、最小の微調整コストでトークン微分駆動型Mixture-of-Expertsモデルに事前訓練された高密度LCMを適用する。
提案手法は, 微調整コストの$frac19textth$しか使用していないにもかかわらず, 下流タスク間で類似の集計精度を実現する。
論文 参考訳(メタデータ) (2025-02-17T21:12:57Z) - Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training [73.90260246781435]
私たちは、このようなアーキテクチャを自動回帰言語モデルに拡張する最初のアプローチであるLoryを紹介します。
パラメータマッチングされた高密度モデルよりも、多種多様な下流タスクにおいて顕著な性能向上を示す。
セグメントレベルのルーティングにもかかわらず、Loryモデルはトークンレベルのルーティングを備えた最先端のMoEモデルと比較して、競合的なパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-06T03:06:33Z) - Toward Inference-optimal Mixture-of-Expert Large Language Models [55.96674056805708]
大規模言語モデル(LLM)のスケーリング法則について検討する。
少数の(4/8)専門家を持つMoEsは、同じパフォーマンスで最も効率的なソリューションであるが、トレーニングでは2.5-3.5倍のコストがかかる。
検証損失以外の指標として推論効率を導入することで,MoEのスケーリング法則の改正を提案する。
論文 参考訳(メタデータ) (2024-04-03T16:33:42Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。