論文の概要: When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness
- arxiv url: http://arxiv.org/abs/2607.22969v1
- Date: Sat, 25 Jul 2026 00:31:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.951886
- Title: When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness
- Title(参考訳): Few-Shot Promptingはいつ役に立つのか? モデルスケール, アーキテクチャ, 出力パーシングロバスト性におけるショットコート効果の系統的研究
- Authors: Ayush Dwivedi, Ashvi Soni,
- Abstract要約: 少数のインプット・アウトプット・デモペアをクエリにプリプロンプトして大きな言語モデルに提示する手法であるFew-shot promptingは、NLPで広く採用されている。
しかし、分類性能において、ショットカウントがモデルスケール、アーキテクチャ、出力フォーマットのコンプライアンスとどのように相互作用するかについて、体系的な研究はほとんど行われていない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Few-shot prompting, the practice of prepending a small number of input-output demonstration pairs to a query before presenting it to a large language model (LLM), is among the most widely adopted inference-time techniques in NLP. Yet little systematic work investigates how shot count interacts with model scale, architecture, and output format compliance in determining classification performance. This paper presents a controlled study of five LLMs across six shot-count configurations (k in {0,1,2,3,5,8}) on the AG News four-class benchmark (n=200). Our models span proprietary and open-source families: Gemini Flash Lite, GPT-4o-mini, Llama 3.1 8B, Llama 3.3 70B, and Llama 4 Scout 17B. We report macro-averaged F1 with 95% bootstrap confidence intervals (B=10,000), permutation-test p-values, and Cohen's d effect sizes across all 30 configurations. Our findings reveal four qualitatively distinct behavioral regimes: (1) models already well-calibrated at zero-shot that show modest, statistically insignificant gains (Gemini, GPT-4o-mini); (2) models that undergo catastrophic zero-shot failure but recover dramatically with a single example (Llama 3.1 8B, d=10.98, p<0.0001); (3) models optimal at zero-shot that degrade monotonically with additional examples (Llama 4 Scout); and (4) models exhibiting a U-shaped curve (Llama 3.3 70B: 0-shot F1=0.907, 2-shot F1=0.635, 5-shot F1=0.785 with parser corrected). We additionally identify, diagnose, and correct a systematic parsing artifact that artificially deflated Llama 3.3 70B performance by up to 206%, constituting a methodological contribution to LLM evaluation practice. Our results demonstrate that the relationship between shot count and classification performance is not monotonic, not universal, and not predictable from model scale alone.
- Abstract(参考訳): 少数のインプット・アウトプット・デモペアをクエリにプリプロンプトし、大きな言語モデル(LLM)に提示するプラクティスは、NLPにおいて最も広く採用されている推論時間技術の一つである。
しかし、分類性能を決定する際に、ショットカウントがモデルスケール、アーキテクチャ、出力フォーマットのコンプライアンスとどのように相互作用するかについて、体系的な研究はほとんど行われていない。
本稿では,AG News の4クラスベンチマーク (n=200) において,6つのショットカウント構成 (k in {0,1,2,3,5,8}) にまたがる5つのLSMについて,制御された検討を行った。
Gemini Flash Lite、GPT-4o-mini、Llama 3.1 8B、Llama 3.3 70B、Llama 4 Scout 17B。
95%のブートストラップ信頼区間 (B=10,000), 置換テスト p-値, コーエンのd 効果を全30構成で報告した。
その結果,(1) ゼロショットにおいて, 統計的に有意な利得を示すモデル (Gemini, GPT-4o-mini) と(2) 破滅的なゼロショット故障を経験するモデル (Llama 3.1 8B, d=10.98, p<0.0001) と, (3) ゼロショットで最適なモデル (Llama 4 Scout) と, (4) U字曲線を示すモデル (Llama 3.3 70B: 0-shot F1=0.907, 2-shot F1=0.635, 5-shot F1=0.785) の4つの定性的に異なる行動規則が明らかになった。
また,Llama 3.3 70Bの性能を最大206%まで低下させ,LLM評価に方法論的貢献を成す系統的解析アーティファクトを同定し,診断し,補正する。
その結果, ショットカウントと分類性能の関係は単調ではなく, 普遍的ではなく, モデルスケールだけでは予測できないことがわかった。
関連論文リスト
- Beyond Exact Match: How Evaluation Methodology Dominates Model Choice in LLM-Based Product Attribute Extraction [0.0]
ゼロショット、少数ショット、スキーマ誘導、定義強化の4つのプロンプト戦略を、2つのプロダクショングレードの大規模言語モデルと比較する。
評価手法はモデル選択の約23倍のばらつきを生じることがわかった。
生産特性抽出パイプラインでは, 評価手法とデータ品質が, モデル選択と迅速なエンジニアリングの影響を支配していると結論づける。
論文 参考訳(メタデータ) (2026-07-24T23:25:16Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Disagreement-Based Cross-Model Routing for Implicit Video Question Answering [0.0]
我々はImplicitQAベンチマークを用いて,複数選択のビデオ質問応答について検討した。
このベンチマークでは、単一のフロンティアビデオLLMが、その精度の天井付近ですでに動作している。
ラベルやトレーニングを必要とせず、純粋な推論時間である、不一致に基づくクロスモデルルーティングを提案する。
論文 参考訳(メタデータ) (2026-05-31T05:56:27Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - Reliable Decision Support with LLMs: A Framework for Evaluating Consistency in Binary Text Classification Applications [0.7124971549479361]
本研究では,大言語モデル(LLM)のバイナリテキスト分類における一貫性を評価するフレームワークを提案する。
我々は,サンプルサイズ要件を定め,不適切な応答の指標を開発し,レータ内およびレータ間信頼性を評価する。
論文 参考訳(メタデータ) (2025-05-20T21:12:58Z) - Breaking the Batch Barrier (B3) of Contrastive Learning via Smart Batch Mining [72.7687229261317]
B3(Breaking the Batch Barrier)は、コントラスト学習(CL)のための高品質なバッチをキュレートする新しいバッチ構築戦略である。
提案手法は,7B と 2B のモデルスケールにおいて,従来のベストメソッドを+1.3 と +2.9 で上回り,新しい最先端の手法を設定できる。
特に、B3でトレーニングされたモデルは、バッチサイズが64まで小さくても、既存の最先端の結果を上回る。
論文 参考訳(メタデータ) (2025-05-16T14:25:43Z) - Multi-Level Collaboration in Model Merging [56.31088116526825]
本稿では,モデルマージとモデルアンサンブルの本質的な関係について考察する。
これまでの制限が満たされていない場合でも、モデルのマージによって、アンサンブルと同じような、ほぼ同一かつ優れたパフォーマンスを達成する方法がまだ存在することが分かっています。
論文 参考訳(メタデータ) (2025-03-03T07:45:04Z) - How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts [54.07541591018305]
提案するMAD-Benchは,既存のオブジェクト,オブジェクト数,空間関係などの5つのカテゴリに分割した1000の試験サンプルを含むベンチマークである。
我々は,GPT-4v,Reka,Gemini-Proから,LLaVA-NeXTやMiniCPM-Llama3といったオープンソースモデルに至るまで,一般的なMLLMを包括的に分析する。
GPT-4oはMAD-Bench上で82.82%の精度を達成するが、実験中の他のモデルの精度は9%から50%である。
論文 参考訳(メタデータ) (2024-02-20T18:31:27Z) - Fine-Tuning Language Models with Just Forward Passes [92.04219196752007]
微調整言語モデル(LM)は、様々な下流タスクで成功したが、LMのサイズが大きくなるにつれて、バックプロパゲーションは大量のメモリを必要とする。
本稿では,メモリ効率の高いゼロソーダ(MeZO)を提案する。
論文 参考訳(メタデータ) (2023-05-27T02:28:10Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。