論文の概要: Asymmetric Capacity Allocation in Self-Refinement Pipelines
- arxiv url: http://arxiv.org/abs/2608.21345v1
- Date: Fri, 21 Aug 2026 17:52:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.669168
- Title: Asymmetric Capacity Allocation in Self-Refinement Pipelines
- Title(参考訳): 自己精製パイプラインにおける非対称容量割当
- Abstract要約: 異なる領域の5つのベンチマーク上で、自己精製パイプラインの最初の段階的モデルサイズについて検討する。
より大型の発電機や精錬機は一般的にパイプラインを改善するが、小型の精錬機は性能を損なうこともあると結論付けている。
- 参考スコア(独自算出の注目度): 14.227188394452673
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-refinement, typically structured as generation, critique, and revision, is a widely adopted paradigm for improving LLM generation and serves as a core mechanism in many LLM agents. While the three stages involve different cognitive demands, most existing approaches conveniently treat the model size as an implementation detail rather than a subject of study, which may lead to a waste of resources. Little work has systematically examined how model size affects each stage or whether effective self-refinement requires equally capable models for generation, critique, and revision. We present the first stage-wise model size study of the self-refinement pipeline on 5 benchmarks from different domains using 6 model sizes of Qwen3 and 4 model sizes of Gemma 3. We conclude that larger generators and refiners generally improve the pipeline, whereas an undersized refiner can even harm performance. Second, performance is highly insensitive to the size of the critic, although including even a small critic consistently outperforms omitting critique altogether. Our findings demonstrate that model capacity should not be allocated uniformly across self-refinement pipelines. Instead, different stages exhibit distinct size scaling characteristics, providing practical guidance for designing more computationally efficient multi-stage language model systems.
- Abstract(参考訳): セルフリファインメント(Self-refinement)は、一般的にジェネレーション、批判、リビジョンとして構成され、LLM生成を改善するための広く採用されているパラダイムであり、多くのLLMエージェントの中核となるメカニズムとして機能する。
3つの段階は異なる認知的要求を伴うが、既存のアプローチのほとんどは、モデルのサイズを研究対象ではなく実装詳細として便利に扱い、リソースの浪費につながる可能性がある。
モデルのサイズが各ステージにどのように影響するか、あるいは効果的な自己再定義が生成、批判、修正に等しく有能なモデルを必要とするかどうかを体系的に検討する研究はほとんどない。
本稿では,Qwen3の6つのモデルサイズとGemma 3の4つのモデルサイズを用いて,異なる領域の5つのベンチマーク上での自己精製パイプラインの最初の段階的モデルサイズについて述べる。
より大型の発電機や精錬機は一般的にパイプラインを改善するが、小型の精錬機は性能を損なうこともあると結論付けている。
第二に、批評家の規模には非常に敏感だが、小さな批評家でさえ、批判を軽視している。
本研究は, モデル容量を自己精製パイプライン全体にわたって均一に割り当てるべきではないことを示す。
代わりに、異なるステージは異なる大きさのスケーリング特性を示し、より計算効率の良い多段階言語モデルシステムの設計のための実用的なガイダンスを提供する。
関連論文リスト
- Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design [43.328395470827665]
大規模言語モデル(LLM)は自然言語記述からBPMNプロセスモデルを生成することができる。
Supervised Fine-tuning (SFT)は、トレーニングデータに存在するパターンに出力品質を制限します。
本稿では,RLに基づくプロセスモデル生成のための報酬関数設計を体系的に検討する。
論文 参考訳(メタデータ) (2026-07-07T11:53:02Z) - Large Language Models as Discounted Bayesian Filters [14.164508061248775]
大規模言語モデル(LLM)におけるオンライン推論を評価するためのベイズフィルタリングフレームワークを提案する。
LLMの信念更新はベイズ的後部と似ているが, モデル固有割引係数が1より小さい指数的忘れフィルタにより, より正確に特徴付けられる。
固有の先入観はしばしば誤解されるが、更新メカニズム自体は構造化され原則化されたままである。
論文 参考訳(メタデータ) (2025-12-20T19:56:39Z) - Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models [77.55829017952728]
EntPrunerは、拡散およびフローモデルのためのエントロピー誘導自動プログレッシブプルーニングフレームワークである。
DiTモデルとSiTモデルの実験はEntPrunerの有効性を示し、最大2.22$times$推論スピードアップを達成する。
論文 参考訳(メタデータ) (2025-11-26T07:20:48Z) - Can large language models assist choice modelling? Insights into prompting strategies and current models capabilities [0.0]
大規模言語モデル(LLM)は様々な分野をサポートするために広く使われているが、その選択肢モデリングの可能性はいまだに解明されていない。
本研究は, LLMの仕様における補助エージェントとしての可能性を検討するとともに, 技術的に実現可能なマルチノードロジットモデルの推定を行う。
論文 参考訳(メタデータ) (2025-07-29T13:24:44Z) - SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models [21.933379266533098]
大規模言語モデル(LLM)は、推論品質と計算コストの間に重要なトレードオフをもたらす。
既存のサービス戦略では、固定されたモデルスケールや静的な2段階の投機的デコードを用いることが多い。
本稿では,LLM推論を適応的ルーティング問題として再定義する新しいフレームワークであるsystemnameを紹介する。
論文 参考訳(メタデータ) (2025-05-12T15:46:28Z) - Large EEG-U-Transformer for Time-Step Level Detection Without Pre-Training [1.3254304182988286]
局所的特徴と大域的特徴の両方を捉えることで表現を効率的に学習する単純なU字モデルを提案する。
他のウィンドウレベルの分類モデルと比較して,本手法は時間段階の予測を直接出力する。
我々のモデルは、てんかんおよび他の神経疾患における人工知能に関する国際会議において、2025年の第1回「青信号検出チャレンジ」で優勝した。
論文 参考訳(メタデータ) (2025-04-01T01:33:42Z) - Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning [78.72226641279863]
SMOE(Sparse Mixture of Expert)モデルは、言語モデリングにおける高密度モデルに代わるスケーラブルな代替品として登場した。
本研究は,SMoEアーキテクチャの設計に関する意思決定を行うために,タスク固有のモデルプルーニングについて検討する。
適応型タスク対応プルーニング手法 UNCURL を導入し,MoE 層当たりの専門家数をオフラインで学習する手法を提案する。
論文 参考訳(メタデータ) (2024-09-02T22:35:03Z) - SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models [85.67096251281191]
我々は、ゼロショットスパースミクチャー(SMILE)と呼ばれるモデル融合に対する革新的なアプローチを提案する。
SMILEは、余分なデータやさらなるトレーニングなしに、ソースモデルをMoEモデルにアップスケーリングできる。
画像分類やテキスト生成タスクなど,さまざまなシナリオに対して,フル微調整とLoRA微調整を用いて広範な実験を行う。
論文 参考訳(メタデータ) (2024-08-19T17:32:15Z) - EMR-Merging: Tuning-Free High-Performance Model Merging [55.03509900949149]
Elect, Mask & Rescale-Merging (EMR-Merging) は既存のマージ手法と比較して優れた性能を示した。
EMR-Mergingはチューニング不要なので、データアベイラビリティや追加のトレーニングは必要ありません。
論文 参考訳(メタデータ) (2024-05-23T05:25:45Z) - The Role of Model Architecture and Scale in Predicting Molecular Properties: Insights from Fine-Tuning RoBERTa, BART, and LLaMA [0.0]
本研究では,各種ケミノフォマティクスタスクの微調整におけるLarge Language Models(LLMs)の有効性を比較するための体系的枠組みを提案する。
分子特性を予測するために,RoBERTa,BART,LLaMAの3つのモデルを評価した。
LLaMAベースのモデルは、一般的に最低限のバリデーション損失を提供しており、タスクやスケールの順応性が優れていることを示唆している。
論文 参考訳(メタデータ) (2024-05-02T02:20:12Z) - Exploring the Limits of Domain-Adaptive Training for Detoxifying
Large-Scale Language Models [84.30718841659531]
言語モデルの毒性を低減するために,ドメイン適応型学習について検討する。
トレーニングコーパスでは, LMの生成能力を活用することを提案する。
次に,126Mから530Bまでのパラメータサイズを持つLMを包括的に研究した。
論文 参考訳(メタデータ) (2022-02-08T22:10:40Z) - Reinforcement Learning as One Big Sequence Modeling Problem [84.84564880157149]
強化学習(Reinforcement Learning, RL)は、通常、単一ステップポリシーや単一ステップモデルの推定に関係している。
我々は、RLをシーケンスモデリング問題とみなし、高い報酬のシーケンスにつながる一連のアクションを予測することを目標としている。
論文 参考訳(メタデータ) (2021-06-03T17:58:51Z) - How Faithful is your Synthetic Data? Sample-level Metrics for Evaluating
and Auditing Generative Models [95.8037674226622]
ドメインに依存しない方法で生成モデルの忠実度,多様性,一般化性能を特徴付ける3次元評価指標を提案する。
当社のメトリクスは、精度リコール分析により統計的発散測定を統合し、モデル忠実度と多様性のサンプルおよび分布レベルの診断を可能にします。
論文 参考訳(メタデータ) (2021-02-17T18:25:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。