論文の概要: From Baselines to Preferences: A Comparative Study of LoRA/QLoRA and Preference Optimization for Mental Health Text Classification
- arxiv url: http://arxiv.org/abs/2604.00773v1
- Date: Wed, 01 Apr 2026 11:36:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.959309
- Title: From Baselines to Preferences: A Comparative Study of LoRA/QLoRA and Preference Optimization for Mental Health Text Classification
- Title(参考訳): 基準から選好へ:LoRA/QLoRAとメンタルヘルステキスト分類のための選好最適化の比較研究
- Abstract要約: 本稿では,統合型メンタルヘルス分類課題における最適化経路の体系的比較研究について述べる。
まず、古典的および参照を定式化し、次にLoRA/QLoRAを用いてパラメータ効率の高い微調整を行う。
DPO,ORPO,KTOによる嗜好に基づく最適化の評価を行った。
- 参考スコア(独自算出の注目度): 2.115174610040722
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mental health text classification has rapidly adopted modern adaptation methods, yet practical guidance on which optimization strategy to use, when, and why remains limited. This paper presents a systematic comparative study of optimization pathways for a joint mental-health classification task, moving from strong vanilla baselines to progressively more specialized techniques. We first establish classical and encoder references, then examine parameter-efficient supervised fine-tuning with LoRA/QLoRA under multiple objective and optimization settings, and finally evaluate preference-based optimization with DPO, ORPO, and KTO, including class-rebalanced training. Rather than emphasizing a single headline score, we focus on methodological insight: how performance changes with objective formulation, adapter choice, optimizer behavior, context windowing, and class-balance intervention. The results show that optimization effects are highly method-dependent: some approaches deliver stable, transferable gains, while others are sensitive to configuration and data balance. Preference optimization, in particular, exhibits large variation across objectives, indicating that method selection is more consequential than simply adding a preference-training stage. The central contribution is a clear optimization narrative for mental health NLP: start from transparent baselines, apply controlled tuning, and use preference optimization selectively where its gains are demonstrable. This provides a reproducible and practically grounded framework for choosing effective training strategies beyond architecture choice alone.
- Abstract(参考訳): メンタルヘルステキスト分類は、近代的な適応手法を急速に採用してきたが、どの最適化戦略を使うか、いつ、なぜかは限定的のままである。
本稿では, 強大なバニラベースラインから, より高度に専門的な技術へと移行した, 統合型メンタルヘルス分類タスクにおける最適化経路の体系的比較研究について述べる。
まず、古典的およびエンコーダの参照を設定し、複数の目的および最適化設定下でLoRA/QLoRAによるパラメータ効率の制御された微調整を検証し、最後にDPO、ORPO、KTOを用いて、クラス再バランストレーニングを含む好みに基づく最適化を評価する。
1つの見出しスコアを強調するのではなく、客観的な定式化によるパフォーマンスの変化、アダプタの選択、オプティマイザの振る舞い、コンテキストのウィンドウニング、クラスバランスの介入といった方法論的な洞察に注目します。
いくつかのアプローチは安定的で転送可能なゲインを提供し、他のアプローチは構成やデータのバランスに敏感である。
特に、選好最適化は、目的によって大きなバリエーションを示し、メソッドの選択は単に選好学習段階を追加するよりも、より簡潔であることを示す。
中心的な貢献は、メンタルヘルスのための明確な最適化の物語であり、透明なベースラインから始まり、制御されたチューニングを適用し、利得が実証可能な場所を選択的に使用することである。
これは、アーキテクチャ選択だけでなく、効果的なトレーニング戦略を選択するための再現可能で実用的な基盤となるフレームワークを提供する。
関連論文リスト
- PLOT: Enhancing Preference Learning via Optimal Transport [28.079554847535107]
PLOTは、最適輸送から導出されるトークンレベルの損失を通じて、微調整に基づくアライメントにおける優先度学習を強化する。
PLOTは、大規模言語モデルの本来の分布を保ちながら、モデルの出力を人間の好みに合わせる。
論文 参考訳(メタデータ) (2026-04-02T09:51:56Z) - Two-Stage Optimizer-Aware Online Data Selection for Large Language Models [49.576993784867035]
我々は,大規模言語モデルの微調整において,勾配に基づくオンラインデータ選択と重み付けのための原則付きフレームワークを提案する。
私たちのキーとなる考え方は、オンライン選択を静的なサンプルランキングではなく、次のターゲット指向のアップデートを州の下で形作ることです。
実験の結果,本手法は既存のオンラインデータ選択ベースラインに対するコンバージェンスとダウンストリームのパフォーマンスを,同じデータ予算下で一貫して改善することが示された。
論文 参考訳(メタデータ) (2026-03-08T21:46:16Z) - POP: Prior-fitted Optimizer Policies [20.784587787548436]
POP(Prior Policies Policies)は、文脈情報に基づいて段階的に座標を予測できるメタ学習モデルである。
本モデルは,不適合な目的から抽出した数百万の合成最適化問題に基づいて学習した。
論文 参考訳(メタデータ) (2026-02-17T10:27:07Z) - Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization [37.54165341391688]
DPOのためのサンプルスケジューリングという,新しい問題を紹介します。
トレーニングバッチ毎にサンプルを適応的に選択する,効率的かつ効率的なアルゴリズムであるSamSを提案する。
この研究は、バッチワイドサンプル選択によるLCMアライメントを改善するための、有望な新しい方向性を示している。
論文 参考訳(メタデータ) (2025-06-08T10:26:09Z) - ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning [14.034412856423529]
直接選好最適化(DPO)は,大規模言語モデル(LLM)の整合性において,その単純さと計算効率に注目されている。
最近の進歩はDPOをマルチモーダルシナリオに拡張し、高いパフォーマンスを実現している。
従来のDPOは、細かなセグメントの正しさを考慮せずに、二分選好の最適化、報酬、全応答のペナルティ化に依存している。
本稿では、より正確な選好最適化のために個々の文を評価する適応文レベルの選好最適化(ASPO)を提案する。
論文 参考訳(メタデータ) (2025-05-25T11:33:08Z) - Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment [45.45508377432791]
本稿では、人気のある選好最適化手法を統合する数学的フレームワークであるReward-Aware Preference Optimization (RPO)を紹介する。
RPOは、様々な設計選択の影響を混乱させ、体系的に研究するための構造化されたアプローチを提供する。
そこで我々は,このような設計選択をクリーンかつ直接アブレーションできる新しい実験装置を提案する。
論文 参考訳(メタデータ) (2025-01-31T22:39:04Z) - Adaptive Preference Scaling for Reinforcement Learning with Human Feedback [103.36048042664768]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の価値を合わせるための一般的なアプローチである。
本稿では,分散ロバスト最適化(DRO)に基づく適応的優先損失を提案する。
提案手法は多用途であり,様々な選好最適化フレームワークに容易に適用可能である。
論文 参考訳(メタデータ) (2024-06-04T20:33:22Z) - LLM as a Complementary Optimizer to Gradient Descent: A Case Study in Prompt Tuning [69.95292905263393]
グラデーションベースとハイレベルなLLMは、協調最適化フレームワークを効果的に組み合わせることができることを示す。
本稿では,これらを相互に補完し,組み合わせた最適化フレームワークを効果的に連携させることができることを示す。
論文 参考訳(メタデータ) (2024-05-30T06:24:14Z) - Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer [52.09480867526656]
人間の嗜好を学習する際の分布変化と不確実性の一形態として,不一致の原因を同定する。
過度な最適化を緩和するために、まず、逆選択された報酬モデルに最適なポリシーを選択する理論アルゴリズムを提案する。
報奨モデルとそれに対応する最適ポリシーの等価性を用いて、優先最適化損失と教師付き学習損失を組み合わせた単純な目的を特徴とする。
論文 参考訳(メタデータ) (2024-05-26T05:38:50Z) - Unleashing the Potential of Large Language Models as Prompt Optimizers: Analogical Analysis with Gradient-based Model Optimizers [108.72225067368592]
本稿では,大規模言語モデル(LLM)に基づくプロンプトの設計について検討する。
モデルパラメータ学習における2つの重要な要素を同定する。
グラディエントにインスパイアされた Prompt ベースの GPO を開発した。
論文 参考訳(メタデータ) (2024-02-27T15:05:32Z) - Towards Efficient Exact Optimization of Language Model Alignment [93.39181634597877]
嗜好データから直接ポリシーを最適化するために、直接選好最適化(DPO)が提案された。
問題の最適解に基づいて導出されたDPOが,現実の最適解の妥協平均探索近似に繋がることを示す。
本稿では、アライメント目的の効率的な精度最適化(EXO)を提案する。
論文 参考訳(メタデータ) (2024-02-01T18:51:54Z) - Introduction to Online Control [31.67032731719622]
オンラインの非確率制御では、コスト関数と仮定された力学モデルからの摂動の両方が敵によって選択される。
目標は、ベンチマーククラスの政策から見て、最高の政策に対して低い後悔を得ることだ。
論文 参考訳(メタデータ) (2022-11-17T16:12:45Z) - Accelerated Federated Learning with Decoupled Adaptive Optimization [53.230515878096426]
フェデレートドラーニング(FL)フレームワークは、クライアント上のトレーニングデータのプライバシを維持しながら、共有モデルを協調的に学習することを可能にする。
近年,SGDM,Adam,AdaGradなどの集中型適応最適化手法をフェデレートした設定に一般化するためのイテレーションが多数実施されている。
本研究は、常微分方程式(ODE)のダイナミクスの観点から、FLの新しい適応最適化手法を開発することを目的としている。
論文 参考訳(メタデータ) (2022-07-14T22:46:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。