論文の概要: Modular Norm RandOpt: Population-Efficient Ensembling through Architecture-Aware Perturbations
- arxiv url: http://arxiv.org/abs/2609.25745v2
- Date: Wed, 23 Sep 2026 08:20:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.672953
- Title: Modular Norm RandOpt: Population-Efficient Ensembling through Architecture-Aware Perturbations
- Title(参考訳): Modular Norm RandOpt: アーキテクチャを考慮した摂動による人口効率向上
- Abstract要約: RandOptは重み付き言語モデルをサンプリングし、複数の投票を通じて上位候補をアンサンブルする。
モジュールワイズ自然ノルムと校正スケールを用いたアーキテクチャ対応サンプリング手法であるModular Norm RandOptを提案する。
RandOptはCountdownで$3times、GSM8Kで$12times($12times)で$2B($12times)で、ウォールタイムでは$3times($3/$)で上回る。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: RandOpt samples weight-perturbed language models and ensembles top-ranked candidates through plurality voting, but its global perturbation scale ignores heterogeneous module geometry. We propose Modular Norm RandOpt, an architecture-aware sampling method using module-wise natural norms and calibrated scales while preserving selection and voting. It outperforms RandOpt using $3\times$ fewer candidates on Countdown and at least $12\times$ fewer on GSM8K, with corresponding wall-clock savings. Evaluations across seven tasks and three Qwen scales ($0.5$B--$3$B) show higher mean accuracy than RandOpt on Countdown, GSM8K, and MATH-500 at every scale. The gains extend to Llama 3.2 $3$B and Gemma 3 $4$B on Countdown and GSM8K. On Qwen2.5-1.5B, our ensembles also achieve higher mean accuracy than iterative baselines on both tasks at comparable main-run evaluation budgets. On GSM8K, a tail-density diagnostic implies only a $1.2$--$1.8\times$ candidate reduction, while most ensemble improvement is associated with more favorable correct-expert support. These results highlight perturbation geometry as a key design choice for population-efficient, gradient-free search around pretrained models.
- Abstract(参考訳): RandOptは重み付き言語モデルをサンプリングし、複数の投票によって上位候補をアンサンブルするが、その大域的摂動スケールは異種モジュール幾何学を無視する。
モジュールワイズ自然ノルムと校正スケールを用いたアーキテクチャ対応サンプリング手法であるModular Norm RandOptを提案する。
これは、Countdownで$3\times、GSM8Kで$12\timesで$12\timesで$3\timesでRandOptを上回っている。
7つのタスクと3つのQwenスケール(0.5$B--3$B)による評価では、すべてのスケールでRandOpt、GSM8K、MATH-500よりも高い平均精度を示している。
獲得額はLlama 3.2$B、Gemma 3$B、Countdown、GSM8Kまで伸びた。
また,Qwen2.5-1.5Bでは,主実行評価予算の両タスクの反復的ベースラインよりも高い平均精度を実現している。
GSM8Kでは、尾の密度診断は1.2$--1.8\times$候補の減少を意味するが、ほとんどのアンサンブルの改良はより好ましい正解支援と関連している。
これらの結果は、摂動幾何学が、事前訓練されたモデル周辺での人口効率が高く、勾配のない探索の鍵となる設計選択であることを示している。
関連論文リスト
- Frozen Cores Need Task Signal: Fisher-Whitened Cross-Covariance for Low-Resource LLM Adaptation [18.8104643146881]
厳格な訓練州予算の下で, コンストラクタ効率の高い微調整の選択について検討した。
我々は、署名された入力-エラーの相互共分散を推定し、対角的なフィッシャーモーメントと白くし、その結果の局所距離でそれを切り離し、選択した方向を写像し、より薄いQRを適用して安定したコア座標を得るFCCAを紹介する。
Qwen2.5-3B では、FCCA は 83.0 のマクロ平均値に達し、その2.3 ポイントは、マッチした予算のコンストラクタよりも高く、11 タスクすべてにおいて未白の RawGrad コントロールを超えている。
論文 参考訳(メタデータ) (2026-09-01T05:52:38Z) - Multi-Modal Spatio-Temporal Graph Neural Network with Mixture of Experts for Soil Organic Carbon Prediction [0.0]
既存のアプローチでは、手作りのコモーダルを古典的なMLとペアリングするか、豊富なスペクトルと時間情報を見逃す単一モードのディープモデルである。
本稿では,SpTGNNとグリッドベースアーキテクチャの両方に対処するマルチテンポラルグラフニューラルネットワークであるSpTG-NNを紹介する。
微調整されたTerraMindエンコーダは、Sentinel-2、Sentinel-1、DEM信号からノード特徴を抽出する。
論文 参考訳(メタデータ) (2026-06-15T11:25:38Z) - Sample Where You Struggle: Sharpening Base Model Reasoning via Entropy-Guided Power Sampling [7.8682919561927065]
エントロピー誘導パワーサンプリング(Entropy-Guided Power Smpling、EGPS)は、トレーニングフリーで検証不要なサンプル装置である。
EGPSは決定論的ブロックをスキップし、各MCMCを高エントロピー地区にローカライズし、決定点に多重Tryメトロポリスを適用する。
論文 参考訳(メタデータ) (2026-06-07T14:06:20Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - What Do EEG Foundation Models Capture from Human Brain Signals? [64.48249643001402]
現代の脳波基礎モデルは、自己教師付き事前訓練を通じて生信号から直接学習する。
我々は3つのサブクエストに分解する: モデルが何を学習するか、モデルを何に使用するのか、そしてどのように説明できるのか。
3つの基礎モデル(CSBrain, CBraMod, LaBraM),5つの臨床タスク(MDD, Stress, ISRUC-Sleep, TUSL, Siena)と6ファミリー63機能レキシコンを含む。
論文 参考訳(メタデータ) (2026-05-12T01:57:53Z) - Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization [4.365822392824561]
本稿では,SIMP最適化のためのオンラインコントローラとして,大規模言語モデルが機能するフレームワークを提案する。
ハードグレーネスゲートは未熟なバイナライゼーションを防止し、メタ最適化ループは第2パスを使用してエージェントの呼び出し周波数を調整する。
エージェントはすべてのベンチマークの最終的なコンプライアンスを達成する:$5.7%$から$-1%、すべてのソリューションが完全にバイナリである。
論文 参考訳(メタデータ) (2026-03-26T07:14:31Z) - CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning [62.56541355300587]
本稿では,高逆推論経路に向けてモデルを適応的に修正する一般的なテスト時間校正フレームワークを提案する。
本フレームワークでは,まず解空間を探索し,次にロジットの校正を学習する二相法であるCarBoNを提案する。
MATH-500とAIME-2024の実験では、CarBoNは効率を向上し、同じ精度に達するために最大4倍のロールアウトが可能である。
論文 参考訳(メタデータ) (2025-10-17T14:04:37Z) - S*: Test Time Scaling for Code Generation [55.11863577956177]
コード生成のための最初のハイブリッドテストタイムスケーリングフレームワークであるS*を提案する。
S*は生成されたコードのカバレッジと選択精度を大幅に改善する。
論文 参考訳(メタデータ) (2025-02-20T09:18:53Z) - Combinatorial Stochastic-Greedy Bandit [79.1700188160944]
我々は,選択した$n$のアームセットのジョイント報酬以外の余分な情報が観測されない場合に,マルチアームのバンディット問題に対する新規グリーディ・バンディット(SGB)アルゴリズムを提案する。
SGBは最適化された拡張型コミットアプローチを採用しており、ベースアームの大きなセットを持つシナリオ用に特別に設計されている。
論文 参考訳(メタデータ) (2023-12-13T11:08:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。