論文の概要: Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute
- arxiv url: http://arxiv.org/abs/2608.09351v1
- Date: Mon, 10 Aug 2026 09:31:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.1858
- Title: Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute
- Title(参考訳): LLMのテスト時間拡張:入力の多様性が一致した計算における出力の多様性に勝つとき
- Abstract要約: 自己整合性(self-consistency)は、この予算を完全にアウトプット側で費やす、確立したアプローチの1つです。
入力を摂動させることで自己整合性を高めるテスト時間拡張(TTA)について検討する。
TTAは、より強力なモデルが利用できない、あるいは高すぎる中層モデルにとって最も費用効果が高い。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test-time scaling improves LLM accuracy but multiplies inference cost, making the accuracy gained per unit of compute the metric that matters in deployment. Self-consistency is one of the established approaches, which spends this budget entirely on the output side by sampling repeated reasoning paths. We study Test-Time Augmentation (TTA), which extends self-consistency by also perturbing the input, aggregating predictions across transformed versions of the input, and ask whether input-side diversity converts compute into accuracy more efficiently than output-side diversity. We perform a systematic, matched-compute comparison: we evaluate three simple input-side strategies (semantic rephrasing, lexical perturbations, and visual transformations) across six datasets covering general and multilingual knowledge, mathematical reasoning, multi-modal question answering, and sentiment classification, against chain-of-thought prompting and self-consistency. Semantic rephrasing delivers consistent and statistically significant accuracy gains while Pareto-dominating self-consistency on cost-effectiveness, delivering roughly 1.8X more accuracy per dollar and outperforming it on five of six tasks. We further analyze the number of augmentations, multi-modal strategies, and base model scaling, finding that TTA is most cost-effective for mid-tier models where a stronger model is unavailable or too expensive. Our findings indicate that for current mid-tier LLMs, varying the input converts inference compute into accuracy more efficiently than varying the reasoning path alone. The TTA implementation is available at https://github.com/aws-samples/sample-genai-reflection-for-bedrock.
- Abstract(参考訳): テストタイムスケーリングはLLMの精度を改善するが、推論コストを乗じると、計算単位当たりの精度がデプロイメントで重要なメトリックになる。
自己整合性(Self-Consistency)は確立されたアプローチのひとつで、反復的な推論パスをサンプリングすることで、この予算を完全にアウトプット側で使用する。
入力を摂動させ、入力の変換されたバージョン間で予測を集約することで自己整合性を拡張するテスト時間拡張(TTA)について検討し、入力側の多様性が計算を出力側の多様性よりも効率的に精度に変換するかどうかを問う。
汎用的・多言語的な知識、数学的推論、多モーダルな質問応答、感情分類を含む6つのデータセットに対して、3つの単純な入力側戦略(意味的言い換え、語彙的摂動、視覚的変換)をチェーン・オブ・シンセサイティングと自己整合性に対して評価する。
セマンティック・リフレージングは一貫性と統計的に有意な精度を達成し、パレートはコスト効率で自己整合性を支配し、1ドルあたりの精度を約1.8倍にし、6つのタスクのうち5つでそれを上回っている。
さらに、強化、マルチモーダル戦略、ベースモデルスケーリングの数を分析し、より強力なモデルが利用できない、あるいは高すぎる中層モデルにおいて、TTAが最もコスト効率が高いことを発見した。
以上の結果から,現在の中層LLMでは,入力の変動は推論計算を推論経路のみの変更よりも効率的に精度に変換することがわかった。
TTAの実装はhttps://github.com/aws-samples/sample-genai-reflection-for-bedrockで公開されている。
関連論文リスト
- Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling [11.219930588268433]
資源制約のある実世界のアプリケーションにとって、計算効率は鍵となる。
我々は,自己整合性,自己縮小性,マルチエージェント論争,混合エージェントの推論スケーリング戦略を体系的に分析する。
並列世代数がシーケンシャルアグリゲーションの数を超える場合、混合エージェントが最も効率的である。
論文 参考訳(メタデータ) (2026-05-02T18:31:02Z) - Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization [18.737087162461563]
テストタイムの計算スケーリングは、大規模言語モデルのパフォーマンスを向上させるための強力なレバーとなっている。
しかし、これらのテクニックを有限の推論予算の下で展開するには、現在のシステムがほとんど無視する決定が必要である。
我々はこれを制約付き最適化問題(平均計算予算の予測精度を最大化する)として定式化し、2段階のソルベ・テン・ラーンパイプラインで解いた。
論文 参考訳(メタデータ) (2026-04-16T10:39:22Z) - Learning When to Sample: Confidence-Aware Self-Consistency for Efficient LLM Chain-of-Thought Reasoning [7.8668388431725695]
大規模言語モデル(LLM)は、チェーン・オブ・ソート(CoT)推論によって強い推論性能を達成する。
最近の自己整合性に基づくアプローチは、精度をさらに向上するが、複数の推論軌道のサンプリングと集約が必要である。
本稿では,単一経路と複数経路の推論を適応的に選択するための単一経路推論軌道を解析する信頼度対応決定フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-09T22:34:06Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Predictive Scheduling for Efficient Inference-Time Reasoning in Large Language Models [6.002670452103349]
大規模言語モデル(LLM)は複雑な推論タスクにおいて最先端の精度を達成する。
しかし、クエリ毎に固定されたトークン予算を使用することで、簡単な入力の過剰計算とハードな入力の過小計算につながる。
プラグイン・アンド・プレイのフレームワークであるPredictive Schedulingを導入する。このフレームワークは軽量な予測器を事前実行し、各クエリの最適な推論の長さや難易度を全世代前に推定する。
論文 参考訳(メタデータ) (2026-02-01T13:58:23Z) - Sample Complexity and Representation Ability of Test-time Scaling Paradigms [91.34339030453425]
テスト時間スケーリングのパラダイムは、複雑なタスクにおいて、大きな言語モデル(LLM)の能力を向上した。
本稿では, 自己整合性, ベスト・オブ・n$, 自己補正など, 様々なテストタイム戦略のサンプル効率について検討する。
単一のTransformerアーキテクチャは、ユーザクエリに関連する特定のタスクを事前に知ることなく、複数のタスクを確実に解決することができる。
論文 参考訳(メタデータ) (2025-06-05T17:48:19Z) - Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning [71.3533541927459]
アクティベーション推論ポテンシャル(RAP)と呼ばれる新しいデータ選択パラダイムを提案する。
RAPは、真のマルチモーダル推論を刺激する各サンプルのポテンシャルを推定することで、認知サンプルを識別する。
我々のRAP法は、トレーニングデータの9.3%しか使用せず、計算コストを43%以上削減しながら、常に優れた性能を実現している。
論文 参考訳(メタデータ) (2025-06-05T08:40:24Z) - Scalable Best-of-N Selection for Large Language Models via Self-Certainty [75.1351701045874]
Best-of-N selectionは、Large Language Models(LLMs)の推論性能を改善するための重要なテクニックである。
本稿では, LLM出力の固有確率分布を利用して, 外部報酬モデルを必要としない応答品質を推定する, 新規で効率的な指標である自己確実性を提案する。
本研究は, LLM推論能力を向上させるための実用的で効率的な方法として, 自己確実性を確立した。
論文 参考訳(メタデータ) (2025-02-25T19:08:07Z) - The Right Tool for the Job: Matching Model and Instance Complexities [62.95183777679024]
NLPモデルが大きくなればなるほど、訓練されたモデルを実行するには、金銭的・環境的なコストを発生させる重要な計算資源が必要である。
我々は、推論中、早期(かつ高速)の"exit"を可能にする文脈表現微調整の修正を提案する。
3つのテキスト分類データセットと2つの自然言語推論ベンチマークの2つのタスクで、5つの異なるデータセットに対して提案した修正を検証した。
論文 参考訳(メタデータ) (2020-04-16T04:28:08Z) - Meta-Learned Confidence for Few-shot Learning [60.6086305523402]
数ショットのメトリックベースのアプローチのための一般的なトランスダクティブ推論手法は、最も確実なクエリ例の平均で、各クラスのプロトタイプを更新することである。
本稿では,各クエリの信頼度をメタラーニングして,ラベルのないクエリに最適な重みを割り当てる手法を提案する。
4つのベンチマークデータセットに対してメタ学習の信頼度で、少数ショットの学習モデルを検証した。
論文 参考訳(メタデータ) (2020-02-27T10:22:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。