論文の概要: Post-Training Language Models for Gold-Medal Performance in Coding Competitions
- arxiv url: http://arxiv.org/abs/2609.02849v2
- Date: Fri, 04 Sep 2026 16:57:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 16:04:20.338098
- Title: Post-Training Language Models for Gold-Medal Performance in Coding Competitions
- Title(参考訳): 符号化競争における金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・金・
- Authors: Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg,
- Abstract要約: 本稿では,大規模問題キュレーション,合成推論トレース,教師付き微調整,強化学習を組み合わせたエンドツーエンドの特殊化パイプラインを提案する。
SFTとRLでNemotron-3-Nano-CCを,SFT単独でNemotron-3-Ultra-CC(550B-A55B)を訓練した。
IOI 2025では、Nano-CCはポストトレーニング後の130点から291点に改善され、GenCorrectでは468点に改善され、Ultra-CCは502点に達した。
- 参考スコア(独自算出の注目度): 70.8192632995446
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Competitive programming has become a key test of large language model reasoning, with international competitions such as IOI and ICPC representing its most challenging settings. We present an end-to-end specialization pipeline combining large-scale problem curation, synthetic reasoning traces, supervised fine-tuning (SFT), and reinforcement learning (RL). Using 22,000 curated problems, we train Nemotron-3-Nano-CC (30B-A3B) with SFT and RL and Nemotron-3-Ultra-CC (550B-A55B) with SFT alone. We further introduce GenCorrect, a feedback-driven test-time compute strategy that iteratively generates, evaluates, and refines diverse solutions. On IOI 2025, Nano-CC improves from 130 points to 291 after post-training and to 468 with GenCorrect, exceeding the gold threshold of 438.3 while Ultra-CC reaches 502. Guided by these results, we develop a competition-specific Ultra-CC system and evaluate it prospectively during IOI 2026. Under the same time, internet-access, and submission constraints as human contestants, it scores 535.4 out of 600, exceeding both the gold threshold of 361.12 and the top human score of 498.27. To our knowledge, this is the first AI system to outscore the highest-scoring human contestant on an IOI problem set.
- Abstract(参考訳): 競合プログラミングは、IOIやICPCといった国際コンペティションが最大の課題となっているため、大きな言語モデル推論の重要なテストとなっている。
本稿では、大規模問題キュレーション、合成推論トレース、教師付き微調整(SFT)、強化学習(RL)を組み合わせたエンドツーエンドの特殊化パイプラインを提案する。
SFTとRLでNemotron-3-Nano-CC(30B-A3B)、SFT単独でNemotron-3-Ultra-CC(550B-A55B)を訓練する。
我々はまた、さまざまなソリューションを反復的に生成し、評価し、洗練するフィードバック駆動テストタイムコンピューティング戦略であるGenCorrectを紹介した。
IOI 2025では、Nano-CCはポストトレーニング後の130点から291点に改善され、GenCorrectでは468点に改善され、Ultra-CCは502点に達した。
これらの結果から, 競合特異的なUltra-CCシステムを開発し, IOI 2026において将来的な評価を行った。
同時に、インターネットアクセス、人間競技者の提出制限、600点中535.4点、金のしきい値361.12点、ヒトのトップスコア498.27点を上回っている。
私たちの知る限り、このAIシステムは、IOI問題セットにおいて最も高い評価を受けた人間の競争相手を抜いた最初のAIシステムです。
関連論文リスト
- Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling [108.48818215929494]
訓練後,背骨を厳密なオリンピックレベル解法に変換するためのシンプルで統一的なレシピを紹介した。
約340Kのサブ8K軌道上でSFTで30B-A3Bのバックボーンをトレーニングし,200RLステップを行った。
結果として得られるモデル SU-01 は、100Kトークンを超える軌道上の難しい問題に対する安定な推論をサポートする。
論文 参考訳(メタデータ) (2026-05-13T10:13:26Z) - Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving [65.02106674311908]
本稿では,マルチラウンド階層的推論を行う長期水平数学エージェントであるIntern-S1-MOを紹介する。
コンパクトメモリをレムマの形で維持することにより、Intern-S1-MOはレムマリッチ推論空間をより自由に探索することができる。
実験の結果、インターンS1-MOはIMO2025の非幾何学的問題で35点中26点を得ることができ、銀メダリストのパフォーマンスに匹敵することがわかった。
論文 参考訳(メタデータ) (2025-12-11T15:26:28Z) - Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models [72.52332895840279]
GenClusterはテスト時の計算フレームワークで、オープンウェイトモデルを使用してIOIゴールドレベルのパフォーマンスを実現する。
GenClusterは、オープンウェイトモデルで、初めてIOI 2025で金メダルを獲得できることを示します。
論文 参考訳(メタデータ) (2025-10-16T02:19:25Z) - LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads? [5.835205320809048]
LiveOIBenchは403のOlympiadレベルの競合プログラミング問題と60のエキスパート設計テストケースを特徴とするベンチマークである。
この問題は2023年から2025年の間に行われた、72の公式のインフォマティクス・オリンピアード(英語版)から直接引き起こされている。
LiveOIBenchは,詳細なサブタスクと広範なプライベートテストケースを備えた,厳密にキュレートされた高品質なタスクという,4つの重要な機能を通じて,自分自身を区別する。
論文 参考訳(メタデータ) (2025-10-10T17:54:24Z) - Competitive Programming with Large Reasoning Models [73.7455809592467]
大規模言語モデル(LLM)に適用した強化学習は、複雑なコーディングや推論タスクの性能を大幅に向上させることを示す。
OpenAI o1 と初期チェックポイント o3 の2つの汎用推論モデルとドメイン固有のシステム o1-ioi を比較した。
以上の結果から,o1-ioiなどの特殊なパイプラインでは,手作りの推論に頼らずに,スケールアップされた汎用o3モデルがこれらの結果を上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-02-03T23:00:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。