論文の概要: Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3
- arxiv url: http://arxiv.org/abs/2603.27844v1
- Date: Sun, 29 Mar 2026 20:05:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.141145
- Title: Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3
- Title(参考訳): モデル能力が支配的:AIMO 3からの推論時間最適化の教訓
- Authors: Natapong Nitarach,
- Abstract要約: 複数のLLM試行に対する多数決は数学的推論を改善するが、相関誤差は有効サンプルサイズを制限する。
自然な修正: 異なる有権者に構造的に異なる推論戦略を割り当て、誤りを訂正する。
AIMO3コンペティションでは、3つのモデル、23以上の実験、50 IMOレベルの問題を1つのH100 80GBで5時間制限でテストしています。
- 参考スコア(独自算出の注目度): 0.3142545134917645
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Majority voting over multiple LLM attempts improves mathematical reasoning, but correlated errors limit the effective sample size. A natural fix: assign structurally different reasoning strategies to different voters to decorrelate errors. We test this Diverse Prompt Mixer in the AIMO~3 competition: 3 models, 23+ experiments, and 50 IMO-level problems on a single H100 80 GB with a 5-hour limit. Every intervention fails. High-temperature sampling already decorrelates errors sufficiently; weaker prompt strategies reduce per-attempt accuracy more than they reduce correlation. Across a 17-point model capability gap and every inference-time optimization we tried, model capability dominates by an order of magnitude.
- Abstract(参考訳): 複数のLLM試行に対する多数決は数学的推論を改善するが、相関誤差は有効サンプルサイズを制限する。
自然な修正: 異なる有権者に構造的に異なる推論戦略を割り当て、誤りを訂正する。
このDiverse Prompt Mixerは、3つのモデル、23以上の実験、50 IMOレベルの問題を、1つのH100 80 GBで5時間制限でテストします。
すべての介入は失敗する。
高温サンプリングは、既に十分な誤差をデコレーションしており、より弱いプロンプト戦略は、相関を減少させるよりも、暗黙の精度を低下させる。
17ポイントのモデル能力ギャップと、私たちが試したすべての推論時間の最適化によって、モデル能力は桁違いに支配されます。
関連論文リスト
- MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning [85.05204262206296]
大きな推論モデル(LRM)は、長い思考の連鎖を生成することによって、強い性能を達成するが、その推論コストは高い。
小型言語モデル(SLM)はより効率的であるが、多段階推論タスクでは困難である。
本研究では, LRM が SLM を選択的かつ簡潔にガイドする推論時協調手法である MentorCollab を提案する。
論文 参考訳(メタデータ) (2026-02-05T04:58:16Z) - Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding [59.60915947702282]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論能力の向上に成功している。
既存のRLVR手法は、訓練データの困難さとモデルの能力のミスマッチにより、探索の非効率に悩まされることが多い。
本稿では,高効率領域に留まることの難易度を動的に調整する新しい監視支援RLVRフレームワークであるSEELEを提案する。
論文 参考訳(メタデータ) (2025-09-08T17:36:21Z) - Learning from Peers in Reasoning Models [30.683206230784]
大きな推論モデル(LRM)は、推論パスでミスをしても自己修正する能力を持つ。
我々の研究は、推論プロセスが短いが貧弱な開始から始まると、モデルが回復することが困難になることを示している。
ピアインタラクションが、すでに正確な個人に悪影響を及ぼすことなく自己補正を促進するという心理学的な知見に触発されて、この現象に対処するために、 **Learning from Peers**(LeaP)を提案する。
論文 参考訳(メタデータ) (2025-05-12T17:39:56Z) - Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing [59.405145971637204]
eRror-Injected Self-Editing (RISE) と呼ばれる新しい好み学習フレームワークを提案する。
RISEは、事前定義された微妙なエラーをピボットトークンに注入する。
RISEの有効性を検証する実験では、Qwen2-7B-Instructでの優先学習により、GSM8Kでは3.0%、MATHでは7.9%が顕著に改善され、トレーニングサンプルは4.5Kに留まった。
論文 参考訳(メタデータ) (2024-10-09T07:43:38Z) - Large Language Monkeys: Scaling Inference Compute with Repeated Sampling [81.34900892130929]
モデルから候補解を繰り返しサンプリングする簡単な手法を用いて、推論計算をスケーリングのための別の軸として検討する。
複数のタスクやモデルにまたがって、カバレッジは4桁以上のサンプル数でスケールする。
コードや形式的証明のようなドメインでは、回答が自動的に検証されるので、カバレッジの増加は直接的にパフォーマンスの向上につながります。
論文 参考訳(メタデータ) (2024-07-31T17:57:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。