論文の概要: Competitive Programming with Large Reasoning Models
- arxiv url: http://arxiv.org/abs/2502.06807v2
- Date: Tue, 18 Feb 2025 22:21:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-02-20 15:43:06.291788
- Title: Competitive Programming with Large Reasoning Models
- Title(参考訳): 大規模推論モデルによる競合プログラミング
- Abstract要約: 大規模言語モデル(LLM)に適用した強化学習は、複雑なコーディングや推論タスクの性能を大幅に向上させることを示す。
OpenAI o1 と初期チェックポイント o3 の2つの汎用推論モデルとドメイン固有のシステム o1-ioi を比較した。
以上の結果から,o1-ioiなどの特殊なパイプラインでは,手作りの推論に頼らずに,スケールアップされた汎用o3モデルがこれらの結果を上回っていることが明らかとなった。
- 参考スコア(独自算出の注目度): 73.7455809592467
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We show that reinforcement learning applied to large language models (LLMs) significantly boosts performance on complex coding and reasoning tasks. Additionally, we compare two general-purpose reasoning models - OpenAI o1 and an early checkpoint of o3 - with a domain-specific system, o1-ioi, which uses hand-engineered inference strategies designed for competing in the 2024 International Olympiad in Informatics (IOI). We competed live at IOI 2024 with o1-ioi and, using hand-crafted test-time strategies, placed in the 49th percentile. Under relaxed competition constraints, o1-ioi achieved a gold medal. However, when evaluating later models such as o3, we find that o3 achieves gold without hand-crafted domain-specific strategies or relaxed constraints. Our findings show that although specialized pipelines such as o1-ioi yield solid improvements, the scaled-up, general-purpose o3 model surpasses those results without relying on hand-crafted inference heuristics. Notably, o3 achieves a gold medal at the 2024 IOI and obtains a Codeforces rating on par with elite human competitors. Overall, these results indicate that scaling general-purpose reinforcement learning, rather than relying on domain-specific techniques, offers a robust path toward state-of-the-art AI in reasoning domains, such as competitive programming.
- Abstract(参考訳): 大規模言語モデル(LLM)に適用した強化学習は、複雑なコーディングや推論タスクの性能を大幅に向上させることを示す。
さらに、OpenAI o1とO3の早期チェックポイントという2つの汎用推論モデルと、ドメイン固有のシステムo1-ioiを比較した。
私たちはIOI 2024でo1-ioiとライブで出場し、手作りのテストタイム戦略を使って49位にランクインしました。
ゆるやかな競技の制約の下で、o1-ioiは金メダルを獲得した。
しかし、o3のような後のモデルを評価する場合、o3は手作りのドメイン固有の戦略や緩和された制約なしで金を達成する。
以上の結果から,o1-ioiなどの特殊なパイプラインでは,手作りの推論ヒューリスティックに頼らずに,大規模で汎用的なo3モデルがこれらの結果を上回ることが示唆された。
特に、O3は2024年のIOIで金メダルを獲得し、エリート・ヒューマン・コンペティターに匹敵するCodeforces格付けを得た。
これらの結果は、ドメイン固有の技術に頼るのではなく、汎用強化学習のスケーリングが、競合プログラミングのようなドメインを推論する最先端のAIへの堅牢な道を提供することを示している。
関連論文リスト
- Post-Training Language Models for Gold-Medal Performance in Coding Competitions [70.8192632995446]
本稿では,大規模問題キュレーション,合成推論トレース,教師付き微調整,強化学習を組み合わせたエンドツーエンドの特殊化パイプラインを提案する。
SFTとRLでNemotron-3-Nano-CCを,SFT単独でNemotron-3-Ultra-CC(550B-A55B)を訓練した。
IOI 2025では、Nano-CCはポストトレーニング後の130点から291点に改善され、GenCorrectでは468点に改善され、Ultra-CCは502点に達した。
論文 参考訳(メタデータ) (2026-09-02T17:33:37Z) - ARC Prize 2025: Technical Report [0.45671221781968335]
ARC-AGIベンチマークシリーズは、新規タスクにおける数ショットの一般化の重要な指標である。
2025年の世界大会は、新たにリリースされたARC-AGI-2データセットをターゲットにした。
2025年の定義テーマは改良ループの出現である。
論文 参考訳(メタデータ) (2026-01-15T23:23:56Z) - Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model [100.86587937568832]
Ring-1Tは、数兆のパラメータを持つ最初のオープンソースの最先端の思考モデルである。
総パラメータは1兆で、1トークンあたり約500億を活性化する。
論文 参考訳(メタデータ) (2025-10-21T17:46:14Z) - Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models [72.52332895840279]
GenClusterはテスト時の計算フレームワークで、オープンウェイトモデルを使用してIOIゴールドレベルのパフォーマンスを実現する。
GenClusterは、オープンウェイトモデルで、初めてIOI 2025で金メダルを獲得できることを示します。
論文 参考訳(メタデータ) (2025-10-16T02:19:25Z) - LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads? [5.835205320809048]
LiveOIBenchは403のOlympiadレベルの競合プログラミング問題と60のエキスパート設計テストケースを特徴とするベンチマークである。
この問題は2023年から2025年の間に行われた、72の公式のインフォマティクス・オリンピアード(英語版)から直接引き起こされている。
LiveOIBenchは,詳細なサブタスクと広範なプライベートテストケースを備えた,厳密にキュレートされた高品質なタスクという,4つの重要な機能を通じて,自分自身を区別する。
論文 参考訳(メタデータ) (2025-10-10T17:54:24Z) - OJBench: A Competition Level Code Benchmark For Large Language Models [23.061564017225734]
OJBenchは、大規模言語モデル(LLM)の競合レベルのコード推論能力を評価するために設計された、新しくて挑戦的なベンチマークである。
我々は,オープンソースモデルとオープンソースモデルの両方,推論指向モデルと非推論指向モデルを含む37モデルに対して,OJBenchを用いた包括的評価を行う。
以上の結果から,o4-miniやGemini-2.5-pro-expといった最先端の推論指向モデルでさえ,競争レベルの問題に悩まされていることが示唆された。
論文 参考訳(メタデータ) (2025-06-19T15:27:02Z) - MoL for LLMs: Dual-Loss Optimization to Enhance Domain Expertise While Preserving General Capabilities [0.0]
本稿では,ドメイン固有および汎用コーパスの最適化目標を分離する新しいフレームワークであるMixture of Losses (MoL)を提案する。
具体的には、クロスエントロピー(CE)損失は知識獲得を保証するためにドメイン・コーパスに適用され、一方、Kulback-Leibler(KL)の分散は、一般的なコーパストレーニングとベースモデルの基本的な能力とを一致させる。
論文 参考訳(メタデータ) (2025-05-17T15:12:47Z) - START: Self-taught Reasoner with Tools [51.38785489790888]
ツール統合長チェーン・オブ・シークレット(CoT)推論LSMであるSTART(Self-Taught Reasoner with Tools)を紹介する。
STARTは複雑な計算、自己チェック、多様な方法の探索、そして自己老化を行うことができる。
基礎となるQwQ-32Bを著しく上回り、最先端のオープンウェイトモデルR1-Distill-Qwen-32Bに匹敵する性能を達成する。
論文 参考訳(メタデータ) (2025-03-06T17:11:51Z) - Dedicated Feedback and Edit Models Empower Inference-Time Scaling for Open-Ended General-Domain Tasks [7.686622572497795]
推論時間スケーリングは、OpenAI o1やDeepSeek R1といった最近のモデルの成功に不可欠である。
私たちは、人間が最初に試みる方法からインスピレーションを得て、他の人から詳細なフィードバックを求め、そのようなフィードバックに基づいて改善します。
Arena EloのベンチマークであるArena Hardのパフォーマンスは、初期レスポンスドラフトの数、効果的なフィードバック、編集されたレスポンスをスケールすることで向上できることを示す。
論文 参考訳(メタデータ) (2025-03-06T12:30:24Z) - CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings [70.95565672516979]
LiveCodeBenchやUSACOといった既存のベンチマークは、プライベートテストケースの可用性の欠如、特別な審査員のサポートの欠如、不整合実行環境のために不足している。
CodeEloは標準化された競合レベルのコード生成ベンチマークで、これらすべての課題に初めて効果的に対処する。
論文 参考訳(メタデータ) (2025-01-02T13:49:00Z) - A Comparative Study on Reasoning Patterns of OpenAI's o1 Model [69.08287909042421]
OpenAIのo1モデルは、ほとんどのデータセットで最高のパフォーマンスを実現しています。
また、いくつかの推論ベンチマークについて詳細な分析を行う。
論文 参考訳(メタデータ) (2024-10-17T15:09:03Z) - Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models [63.31878920079154]
Olympiadレベルでの大規模言語モデルの数学的推論を評価するためのベンチマークを提案する。
既存のOlympiad関連のベンチマークとは違って、我々のデータセットは数学に特化しており、厳密な人間のアノテーションを使った4428の競合レベルの問題の膨大なコレクションを含んでいる。
実験の結果,最も先進的なモデルであるOpenAI o1-miniとOpenAI o1-previewでさえ,60.54%と52.55%の精度で,オリンピアードレベルの問題に悩まされ,オリンピアードレベルの数学的推論において重大な課題が浮き彫りにされていることがわかった。
論文 参考訳(メタデータ) (2024-10-10T14:39:33Z) - Double Oracle Neural Architecture Search for Game Theoretic Deep Learning Models [28.238075755838487]
本稿では,ゲーム理論の概念を用いたディープラーニングモデルの学習手法を提案する。
最良応答オラクルを用いた二重対角フレームワークをデプロイする。
主観的質的評価と定量的指標の両面で,我々の変種は有意な改善が見られた。
論文 参考訳(メタデータ) (2024-10-07T05:42:01Z) - Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training [73.90260246781435]
私たちは、このようなアーキテクチャを自動回帰言語モデルに拡張する最初のアプローチであるLoryを紹介します。
パラメータマッチングされた高密度モデルよりも、多種多様な下流タスクにおいて顕著な性能向上を示す。
セグメントレベルのルーティングにもかかわらず、Loryモデルはトークンレベルのルーティングを備えた最先端のMoEモデルと比較して、競合的なパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-06T03:06:33Z) - Double A3C: Deep Reinforcement Learning on OpenAI Gym Games [0.0]
強化学習(Reinforcement Learning, RL)とは、エージェントが未知の環境でどのように行動し、報酬を最大化するかを判断する機械学習の分野である。
両アルゴリズムがOpenAI Gym Atari 2600をプレイしてベンチマークを上回り,両アルゴリズムの強みを生かしたDouble A3Cアルゴリズムの改良版を提案し,実装する。
論文 参考訳(メタデータ) (2023-03-04T00:06:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。