論文の概要: Instruction-Tuned, but Not More Verifiable Instruction-Following: A Cross-Task Diagnosis for LoRA Adapters
- arxiv url: http://arxiv.org/abs/2603.22379v1
- Date: Mon, 23 Mar 2026 12:48:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.111336
- Title: Instruction-Tuned, but Not More Verifiable Instruction-Following: A Cross-Task Diagnosis for LoRA Adapters
- Title(参考訳): インストラクション-チューニングされたが、より検証できないインストラクション-フォロー:LoRAアダプタのクロスタスク診断
- Authors: Junyi Zou,
- Abstract要約: 我々は、名目訓練の目的が、実現されたクロスタスク能力の向上と確実に一致しているかをテストする。
我々の最も強い証拠は、IFEvalが測定したように、厳密で自動検証可能な命令に結びついています。
我々は、この名目逆転型ミスマッチパターンを、記述的なラベルとして機能ドリフトと呼ぶ。
- 参考スコア(独自算出の注目度): 0.6345523830122167
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapters are often selected and deployed based on nominal labels (e.g., instruction-tuned), which implicitly suggest what capability improves after adaptation. We test whether nominal training objectives reliably align with realized cross-task capability gains by evaluating the same LoRA adapter across tasks. Our strongest evidence is tied to strict, automatically verifiable instruction following as measured by IFEval: across multiple seeds, base models, and LoRA settings, nominal labels recurrently but not universally fail to predict improvements on this verifiable target, with clear configuration sensitivity including a near-zero or negative case. As an illustrative strongest-case example in a controlled instruction-versus-numeric setting, an instruction-tuned adapter substantially improves off-target NM-based numeric benchmark performance from 0.133 to 0.632 while not improving verifiable instruction following on IFEval (ILA: 0.313 to 0.271; PLA: 0.250 to 0.143; values rounded to three decimals). We refer to this nominal-versus-realized mismatch pattern as capability drift as a descriptive label. The mismatch is visible in the raw cross-task performance matrix; we use a drift score only as a compact summary in the same units as the underlying metrics, not as a new formal metric contribution. Evidence from broader instruction-following benchmarks is benchmark-dependent and mixed, reflecting heterogeneity in how instruction following is operationalized; we therefore do not treat cross-benchmark agreement as a premise. Overall, the practical takeaway is to perform routine cross-task evaluation before deployment and to avoid treating nominal labels as reliable capability proxies.
- Abstract(参考訳): アダプタは、しばしば名前付きラベル(例:命令調整)に基づいて選択され、デプロイされる。
タスク間で同じLoRAアダプタを評価することにより、名目トレーニング目的が実現可能なクロスタスク能力の向上と確実に一致しているかを検証する。
IFEvalが測定したように、厳密で自動検証可能な命令に結びついており、複数の種、ベースモデル、LoRA設定にまたがって、名前ラベルが繰り返されるが、ほぼゼロまたは負のケースを含む明確な設定感度で、この検証可能なターゲットの改善を予測できない。
IFEval(ILA:0.313〜0.271;PLA:0.3250〜0.143;値が3桁に丸められた値)に続く検証可能な命令を改善せずに、命令調整型アダプタは、制御された命令対数値設定において、ターゲット外のNMベースの数値ベンチマーク性能を0.133〜0.1632に大幅に改善する。
我々は、この名目逆転型ミスマッチパターンを、記述的なラベルとして機能ドリフトと呼ぶ。
このミスマッチは生のクロスタスク性能行列で見ることができ、ドリフトスコアは基礎となるメトリクスと同じ単位におけるコンパクトな要約としてのみ用いられる。
より広範な命令追従ベンチマークからの証拠は、ベンチマークに依存し、混在しており、命令追従がどのように運用されるかの不均一性を反映している。
全体としては、デプロイ前に定期的なクロスタスク評価を行うことと、ラベルを信頼性のある機能プロキシとして扱うことを避けることが現実的課題である。
関連論文リスト
- When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - The Reward Model Selection Crisis in Personalized Alignment [38.08221267202287]
標準的なRM精度は、展開可能なパーソナライズアライメントの選択基準として破滅的に失敗することを示す。
我々は、RGDスコアリング機能が好ましくない応答と好ましくない応答とを正しく区別するかどうかの指標であるポリシー精度を導入する。
Pref-LaMPも導入しています。
論文 参考訳(メタデータ) (2025-12-28T20:27:15Z) - Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B [1.948261185683419]
本研究では,「評価香り」がコンメンシュレート能力を得ることなく測定性能を膨らませるかどうかを考察する。
6つのペアのA/Bシナリオを実行し、タスク内容を保持し、フレーミングの異なる状態でデコードします。
再現可能なA/Bフレームワーク(バンキング、バリデータ、ラン毎のスコア、スクリプト)と実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2025-10-08T09:49:05Z) - The Lie of the Average: How Class Incremental Learning Evaluation Deceives You? [48.83567710215299]
クラスインクリメンタルラーニング(CIL)では、モデルが学習済みのクラスを忘れずに、新しいクラスを継続的に学習する必要がある。
我々は、ロバストなCIL評価プロトコルは、性能分布全体を正確に特徴付け、推定するべきであると論じる。
我々は,タスク間類似度を用いて,極端なクラスシーケンスを適応的に識別し,サンプリングする評価プロトコルEDGEを提案する。
論文 参考訳(メタデータ) (2025-09-26T17:00:15Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - A Study of Unsupervised Evaluation Metrics for Practical and Automatic
Domain Adaptation [15.728090002818963]
教師なしドメイン適応(UDA)メソッドは、ラベルなしでターゲットドメインへのモデル転送を容易にする。
本稿では,対象の検証ラベルにアクセスすることなく,移動モデルの品質を評価できる評価指標を見つけることを目的とする。
論文 参考訳(メタデータ) (2023-08-01T05:01:05Z) - Unsupervised Dense Retrieval with Relevance-Aware Contrastive
Pre-Training [81.3781338418574]
関連性を考慮したコントラスト学習を提案する。
我々は、BEIRおよびオープンドメインQA検索ベンチマークにおいて、SOTAアン教師なしコントリバーモデルを一貫して改善する。
本手法は, 目標コーパスの事前訓練後, BM25に打ち勝つだけでなく, 優れた数発学習者として機能する。
論文 参考訳(メタデータ) (2023-06-05T18:20:27Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。