論文の概要: When Does Supervised Fine-Tuning Reduce Instruction Sensitivity?
- arxiv url: http://arxiv.org/abs/2608.26661v1
- Date: Thu, 27 Aug 2026 06:15:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.256927
- Title: When Does Supervised Fine-Tuning Reduce Instruction Sensitivity?
- Title(参考訳): 微調整による指導感度の低下はいつ起こるか?
- Authors: Jaekeol Choi,
- Abstract要約: 大規模言語モデルは、同じタスク命令の代替的な定式化において、かなりの性能変化を示すことができる。
本稿では,複数のパラフレーズ命令による固定モデルチェックポイントの評価を行い,タスク性能の標準偏差として命令感度を定義する。
- 参考スコア(独自算出の注目度): 0.45687771576879593
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models can exhibit substantial performance variation across alternative formulations of the same task instruction, yet it remains unclear how conventional task-specific supervised fine-tuning (SFT) changes this instruction sensitivity. We study this question by evaluating fixed model checkpoints under multiple paraphrased instructions and defining instruction sensitivity as the standard deviation of task performance across them. We conduct a controlled scale analysis with Qwen3 models at 1.7B, 4B, and 8B on MS MARCO, together with targeted cross-family checks using Mistral-7B and Gemma-2-9B. Before SFT, instruction sensitivity decreases sharply with Qwen3 model scale. At 1.7B and 4B, SFT consistently reduces sensitivity across training instructions, with reductions of approximately 54--71%. At 8B, individual sensitivity changes are not statistically distinguishable from zero, but paired contrasts between training instructions are statistically reliable under query-level bootstrap analysis and have consistent directions across all three random seeds. Gemma-2-9B shows the same directional training-instruction contrast as Qwen3-8B, whereas Mistral-7B does not, suggesting that the strength of this effect also varies across models. Experiments on ESCI-English further show that free-generation and likelihood-based forced-choice evaluation can yield qualitatively different robustness conclusions even when valid-label generation is nearly perfect and average task performance is similar. Overall, SFT does not uniformly reduce instruction sensitivity: its robustness effect depends on the adaptation setting, while measured sensitivity can additionally depend on the prediction and scoring protocol.
- Abstract(参考訳): 大規模言語モデルは、同じタスク命令の代替的な定式化において、かなりの性能変化を示すことができるが、従来のタスク固有の教師付き微調整(SFT)が、この命令の感度をどのように変化させるかは定かではない。
本稿では,複数のパラフレーズ命令の下での固定モデルチェックポイントの評価と,タスク性能の標準偏差として命令感度を定義することで,この問題を考察する。
我々は,MS MARCOの1.7B, 4B, 8BでQwen3モデルを用いて,Mistral-7BとGemma-2-9Bを用いた家族間比較を行った。
SFTの前には、Qwen3モデルスケールで命令感度が急激に低下する。
1.7Bと4Bでは、SFTはトレーニング命令間の感度を継続的に低下させ、約54~71%の低下を減少させる。
8Bでは、個々の感度の変化は0と統計的に区別できないが、トレーニング命令間のペアコントラストは、クエリレベルのブートストラップ分析によって統計的に信頼性が高く、3つのランダムシードすべてに対して一貫した方向を持つ。
Gemma-2-9B は Qwen3-8B と同じ方向の訓練命令コントラストを示すが、Mistral-7B は示していない。
ESCI- Englishの実験は、有効ラベル生成がほぼ完璧であり、平均タスク性能が類似している場合でも、自由世代および可能性に基づく強制選択評価が質的に異なるロバスト性結論が得られることを示した。
全体として、SFTは命令感度を均一に低減せず、その堅牢性効果は適応設定に依存し、測定された感度は予測とスコアリングプロトコルに依存する。
関連論文リスト
- Evaluation Awareness Is Not One Capability: Evidence from Open Language Models [1.758143872501506]
安全ベンチマークは、テスト条件の振る舞いがデプロイメントの振る舞いを予測すると仮定する。
これにより、ベンチマークパフォーマンスとデプロイメントの動作のギャップが開ける。
我々は、37のオープンウェイトモデルと7つのファミリーにわたる8つの実験を通して、この評価意識を特徴づける。
論文 参考訳(メタデータ) (2026-06-22T16:48:43Z) - When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL [10.399451281089318]
我々はMiniGridをコア評価として,MuJoCoを境界応力試験として用いたPPO訓練剤について検討した。
私たちの監査では、報酬の洪水とセマンティック/API誤解という、2つの主要なワンショット障害モードを見つけました。
本稿では,トレーニング診断と障害モード分類ガイドが報酬関数の修正を対象とする,診断駆動反復改善法を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:57:43Z) - FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection [63.91351553178842]
FACTORはオープン語彙オブジェクト検出のためのトレーニング不要なテスト時間適応である。
属性依存性の予測を選択的に抑制するために、属性の感度、意味的関連性、予測のバリエーションを定量化する。
PASCAL-C, COCO-C, FoggyCityscapes の実験では、FACTOR が従来の TTA 法より一貫して優れていたことが示されている。
論文 参考訳(メタデータ) (2026-05-05T02:31:18Z) - Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking [0.0]
本稿では,トークン制御プロトコル下での分散について検討し,FSI(Format Sensitivity Index),ラッパー選択による精度範囲,PSI(Parseability Sensitivity Index)の2つの相補的指標を紹介する。
FSIはモデルによって30倍以上の違いがあり、コンプライアンスの失敗によって大きく説明されています。
固定効果回帰は、タスク、モデル、ラッパーを制御した後でも、パーセビリティが高い精度の予測因子であることを示している。
論文 参考訳(メタデータ) (2026-05-02T22:51:41Z) - SWE-RM: Execution-free Feedback For Software Engineering Agents [61.86380395896069]
実行ベースフィードバックは、テストタイムスケーリング(TTS)と強化学習(RL)を通じて、コーディングエージェントの開発に広く利用されている。
対照的に、報酬モデルによる実行不要なフィードバックは、単体テストケースに依存することなく、よりきめ細かい信号を提供することができる。
SWE-RMは,30Bの合計パラメータと3Bのアクティベートされた3Bの混合実験アーキテクチャを採用した,正確で堅牢な報酬モデルである。
論文 参考訳(メタデータ) (2025-12-26T08:26:18Z) - From Flows to Words: Can Zero-/Few-Shot LLMs Detect Network Intrusions? A Grammar-Constrained, Calibrated Evaluation on UNSW-NB15 [0.41998444721319217]
大規模言語モデル(LLM)は自然言語入力を推論できるが、微調整なしでの侵入検出におけるそれらの役割は未だ不明である。
本研究では、各ネットワークフローをコンパクトなテキストレコードに変換し、軽量でドメインにインスパイアされたフラグで拡張することで、プロンプトオンリーなアプローチを評価する。
ゼロショット,命令誘導,スプリットショットを比較して,同一のスプリット下での強い神経ベースライン,精度,精度,リコール,F1,マクロスコアを比較した。
論文 参考訳(メタデータ) (2025-10-18T02:11:50Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z) - Improving Adversarial Robustness to Sensitivity and Invariance Attacks
with Deep Metric Learning [80.21709045433096]
対向ロバスト性の標準的な方法は、サンプルを最小に摂動させることによって作られたサンプルに対して防御する枠組みを仮定する。
距離学習を用いて、最適輸送問題として逆正則化をフレーム化する。
予備的な結果から, 変分摂動の規則化は, 変分防御と敏感防御の両方を改善することが示唆された。
論文 参考訳(メタデータ) (2022-11-04T13:54:02Z) - ERNIE-SPARSE: Learning Hierarchical Efficient Transformer Through
Regularized Self-Attention [48.697458429460184]
情報ボトルネック感度と異なる注目トポロジ間の不整合の2つの要因がスパース変換器の性能に影響を及ぼす可能性がある。
本稿では,ERNIE-Sparseというモデルを提案する。
i) 局所情報とグローバル情報を逐次統一する階層スパース変換器(HST) と、(ii) 注意トポロジの異なる変換器の距離を最小化する自己注意正規化(SAR) の2つの特徴がある。
論文 参考訳(メタデータ) (2022-03-23T08:47:01Z) - Calibrate Before Use: Improving Few-Shot Performance of Language Models [68.17016463756474]
GPT-3は、いくつかのトレーニング例を含む自然言語プロンプトを提供すると、多数のタスクを実行できます。
この種の少数ショット学習は不安定である。
プロンプト形式、トレーニング例、およびトレーニング例の順序の選択は、精度をほぼチャンスから最先端のものに変化させる可能性があります。
論文 参考訳(メタデータ) (2021-02-19T00:23:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。