論文の概要: MARS: Multi-Specialist LLM Relay System for Competitive Programming
- arxiv url: http://arxiv.org/abs/2608.23918v1
- Date: Mon, 24 Aug 2026 23:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.663998
- Title: MARS: Multi-Specialist LLM Relay System for Competitive Programming
- Title(参考訳): MARS:競合プログラミングのためのマルチスペシャリストLLMリレーシステム
- Authors: Andrei Mikhailov, Mikhail Burtsev, Alsu Sagirova,
- Abstract要約: MARS(Multi-Agent Relay of Specialized LLMs)は、各エージェントがトピックスペシャリストとなるプロンプトのみのフレームワークである。
スタータが初期C++17ソリューションを書き、その後各ターンがサンドボックス内の公開例に対して候補を実行します。
単一のインフラストラクチャー固定器が最後にボイラープレートを正規化する。
- 参考スコア(独自算出の注目度): 3.8421682531018564
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models excel at code generation, yet competitive programming exposes a persistent failure mode: existing multi-agent pipelines distribute work over generic planner, coder, and debugger roles and delegate the choice of algorithmic technique to the backbone alone. We present MARS (Multi-Agent Relay of Specialized LLMs), a prompt-only framework in which each agent is a topic specialist---dynamic programming, graphs, strings, geometry, and so on---grounded by retrieval-augmented generation over an algorithm-theory corpus. Given a problem, retrieval selects a small team of relevant specialists; a starter writes an initial C++17 solution, and each subsequent turn runs the candidate against public examples in a sandbox, lets the active specialist keep, repair, or hand off the draft, and forwards a structured packet to the next specialist. A single infrastructure-fixer pass normalizes boilerplate at the end. On the CodeContests test split with Gemma 4, MARS reaches $0.624 \pm 0.006$ pass rate at $2.3$ recorded pipeline stages per task ($+14.4$ percentage points over direct prompting), closing most of the gap to CodeSIM ($0.731$) at $3.3{\times}$ lower wall-clock cost and substantially smaller variance in per-task token spend. The source code is available on GitHub: https://github.com/fckand/mars.
- Abstract(参考訳): 既存のマルチエージェントパイプラインは、ジェネリックプランナー、コーダ、デバッガーロールに作業を分散し、アルゴリズムテクニックの選択をバックボーンのみに委譲します。
提案するMARS(Multi-Agent Relay of Specialized LLMs)は,各エージェントがトピックスペシャリストであるプロンプトのみのフレームワークである。
スタータが初期C++17ソリューションを書き、各ターンがサンドボックス内の公開例に対して候補を実行し、アクティブなスペシャリストがドラフトを保持し、修復し、手渡しし、構造化されたパケットを次のスペシャリストに転送する。
単一のインフラストラクチャー固定器が最後にボイラープレートを正規化する。
CodeContestsテストがGemma 4で分割された場合、MARSは0.624 \pm 0.006$パスレートでタスク毎のパイプラインステージを2.3ドル($+14.4$%)で達成し、CodeSIM($0.731$)へのギャップの大半を3.3{\timesで閉じる。
ソースコードはGitHubで入手できる。
関連論文リスト
- Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes [70.61868608402723]
我々は$textbfSelf-Correcting Coupled Markov Jump Processes (SC-CMJP)を紹介する。
SC-CMJPと組み合わせて、共同マルチモーダルジェネレーションのための新しいトレーニングフリーシングルパスサンプリングであるtextttCO_texttt2textttJump$を紹介する。
トレーニングと評価のために,我々は3つの大規模ジョイントマルチモーダル生成コーパスを作成し,リリースする。
論文 参考訳(メタデータ) (2026-07-14T18:39:29Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring [2.4112990554464235]
textbfDeep Researcher Agentは,大規模言語モデル(LLM)エージェントが時計周辺で自律的にディープラーニング実験を行うことを可能にする,オープンソースのフレームワークである。
論文作成やコード生成に重点を置く既存のAI研究アシスタントとは異なり、私たちのシステムは仮説形成、コード実装、トレーニング実行、結果分析、反復的洗練という、完全な実験ライフサイクルに対処しています。
論文 参考訳(メタデータ) (2026-04-07T13:16:31Z) - Co-Designing Quantum Codes with Transversal Diagonal Gates via Multi-Agent Systems [1.5948632947109136]
我々は、所定の対角ゲートを持つ量子符号を共設計するマルチエージェント・ヒューマン・イン・ザ・ループワークフローを提案する。
このワークフローはGPT-5を使っており、RA(https://texra.ai)-マルチエージェントリサーチアシスタントプラットフォームで実装されている。
論文 参考訳(メタデータ) (2025-10-23T16:45:39Z) - DuoLens: A Framework for Robust Detection of Machine-Generated Multilingual Text and Code [5.38764489657443]
多言語テキストとソースコードを生成するLarge Language Models (LLMs) は、マシン生成コンテンツ検出器がドメイン全体にわたって正確かつ効率的であることの必須条件を増大させるだけである。
現在の検出器は、Fast DetectGPTやGPTZeroのようなゼロショット法を主に利用しており、高い計算コストまたは十分な精度が欠如している。
本稿では,エンコーダのみのSmall Language Models (SLM) の微調整,特にRoBERTAとCodeBERTaの事前学習モデルについて,ソースコードやその他の自然言語に関する特別なデータセットを用いて提案する。
論文 参考訳(メタデータ) (2025-10-21T00:17:00Z) - Superposed Decoding: Multiple Generations from a Single Autoregressive Inference Pass [72.07642648108849]
Superposed Decodingは、1つの自己回帰推論パスのコストで$k$のドラフトを生成する新しい復号アルゴリズムである。
Superposed Decodingは、他のデコード戦略と組み合わせることで、推論時間計算のスケーリング時に普遍的なカバレッジが向上する。
論文 参考訳(メタデータ) (2024-05-28T17:40:48Z) - Federated Combinatorial Multi-Agent Multi-Armed Bandits [79.1700188160944]
本稿では,Banditを用いたオンライン最適化に適したフェデレーション学習フレームワークを提案する。
この設定では、エージェントのアームサブセットは、個々のアーム情報にアクセスせずにこれらのサブセットに対するノイズの多い報酬を観察し、特定の間隔で協力して情報を共有することができる。
論文 参考訳(メタデータ) (2024-05-09T17:40:09Z) - In-Context Learning for Extreme Multi-Label Classification [29.627891261947536]
数千のクラスを持つマルチラベル分類問題は、文脈内学習だけでは解決が難しい。
本稿では,これらの問題に効率的に対処するために,LMとレトリバー間のマルチステップインタラクションを定義する汎用プログラムを提案する。
我々のソリューションは微調整を必要とせず、新しいタスクに容易に適用でき、迅速なエンジニアリングを緩和し、ラベル付きサンプルを数十個しか必要としない。
論文 参考訳(メタデータ) (2024-01-22T18:09:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。