論文の概要: From Baselines to Preferences: A Comparative Study of LoRA/QLoRA and Preference Optimization for Mental Health Text Classification
- arxiv url: http://arxiv.org/abs/2604.00773v1
- Date: Wed, 01 Apr 2026 11:36:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.959309
- Title: From Baselines to Preferences: A Comparative Study of LoRA/QLoRA and Preference Optimization for Mental Health Text Classification
- Title(参考訳): 基準から選好へ:LoRA/QLoRAとメンタルヘルステキスト分類のための選好最適化の比較研究
- Authors: Mihael Arcan,
- Abstract要約: 本稿では,統合型メンタルヘルス分類課題における最適化経路の体系的比較研究について述べる。
まず、古典的および参照を定式化し、次にLoRA/QLoRAを用いてパラメータ効率の高い微調整を行う。
DPO,ORPO,KTOによる嗜好に基づく最適化の評価を行った。
- 参考スコア(独自算出の注目度): 2.115174610040722
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mental health text classification has rapidly adopted modern adaptation methods, yet practical guidance on which optimization strategy to use, when, and why remains limited. This paper presents a systematic comparative study of optimization pathways for a joint mental-health classification task, moving from strong vanilla baselines to progressively more specialized techniques. We first establish classical and encoder references, then examine parameter-efficient supervised fine-tuning with LoRA/QLoRA under multiple objective and optimization settings, and finally evaluate preference-based optimization with DPO, ORPO, and KTO, including class-rebalanced training. Rather than emphasizing a single headline score, we focus on methodological insight: how performance changes with objective formulation, adapter choice, optimizer behavior, context windowing, and class-balance intervention. The results show that optimization effects are highly method-dependent: some approaches deliver stable, transferable gains, while others are sensitive to configuration and data balance. Preference optimization, in particular, exhibits large variation across objectives, indicating that method selection is more consequential than simply adding a preference-training stage. The central contribution is a clear optimization narrative for mental health NLP: start from transparent baselines, apply controlled tuning, and use preference optimization selectively where its gains are demonstrable. This provides a reproducible and practically grounded framework for choosing effective training strategies beyond architecture choice alone.
- Abstract(参考訳): メンタルヘルステキスト分類は、近代的な適応手法を急速に採用してきたが、どの最適化戦略を使うか、いつ、なぜかは限定的のままである。
本稿では, 強大なバニラベースラインから, より高度に専門的な技術へと移行した, 統合型メンタルヘルス分類タスクにおける最適化経路の体系的比較研究について述べる。
まず、古典的およびエンコーダの参照を設定し、複数の目的および最適化設定下でLoRA/QLoRAによるパラメータ効率の制御された微調整を検証し、最後にDPO、ORPO、KTOを用いて、クラス再バランストレーニングを含む好みに基づく最適化を評価する。
1つの見出しスコアを強調するのではなく、客観的な定式化によるパフォーマンスの変化、アダプタの選択、オプティマイザの振る舞い、コンテキストのウィンドウニング、クラスバランスの介入といった方法論的な洞察に注目します。
いくつかのアプローチは安定的で転送可能なゲインを提供し、他のアプローチは構成やデータのバランスに敏感である。
特に、選好最適化は、目的によって大きなバリエーションを示し、メソッドの選択は単に選好学習段階を追加するよりも、より簡潔であることを示す。
中心的な貢献は、メンタルヘルスのための明確な最適化の物語であり、透明なベースラインから始まり、制御されたチューニングを適用し、利得が実証可能な場所を選択的に使用することである。
これは、アーキテクチャ選択だけでなく、効果的なトレーニング戦略を選択するための再現可能で実用的な基盤となるフレームワークを提供する。
関連論文リスト
- POP: Prior-fitted Optimizer Policies [20.784587787548436]
POP(Prior Policies Policies)は、文脈情報に基づいて段階的に座標を予測できるメタ学習モデルである。
本モデルは,不適合な目的から抽出した数百万の合成最適化問題に基づいて学習した。
論文 参考訳(メタデータ) (2026-02-17T10:27:07Z) - Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization [37.54165341391688]
DPOのためのサンプルスケジューリングという,新しい問題を紹介します。
トレーニングバッチ毎にサンプルを適応的に選択する,効率的かつ効率的なアルゴリズムであるSamSを提案する。
この研究は、バッチワイドサンプル選択によるLCMアライメントを改善するための、有望な新しい方向性を示している。
論文 参考訳(メタデータ) (2025-06-08T10:26:09Z) - ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning [14.034412856423529]
直接選好最適化(DPO)は,大規模言語モデル(LLM)の整合性において,その単純さと計算効率に注目されている。
最近の進歩はDPOをマルチモーダルシナリオに拡張し、高いパフォーマンスを実現している。
従来のDPOは、細かなセグメントの正しさを考慮せずに、二分選好の最適化、報酬、全応答のペナルティ化に依存している。
本稿では、より正確な選好最適化のために個々の文を評価する適応文レベルの選好最適化(ASPO)を提案する。
論文 参考訳(メタデータ) (2025-05-25T11:33:08Z) - Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment [45.45508377432791]
本稿では、人気のある選好最適化手法を統合する数学的フレームワークであるReward-Aware Preference Optimization (RPO)を紹介する。
RPOは、様々な設計選択の影響を混乱させ、体系的に研究するための構造化されたアプローチを提供する。
そこで我々は,このような設計選択をクリーンかつ直接アブレーションできる新しい実験装置を提案する。
論文 参考訳(メタデータ) (2025-01-31T22:39:04Z) - Adaptive Preference Scaling for Reinforcement Learning with Human Feedback [103.36048042664768]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の価値を合わせるための一般的なアプローチである。
本稿では,分散ロバスト最適化(DRO)に基づく適応的優先損失を提案する。
提案手法は多用途であり,様々な選好最適化フレームワークに容易に適用可能である。
論文 参考訳(メタデータ) (2024-06-04T20:33:22Z) - LLM as a Complementary Optimizer to Gradient Descent: A Case Study in Prompt Tuning [69.95292905263393]
グラデーションベースとハイレベルなLLMは、協調最適化フレームワークを効果的に組み合わせることができることを示す。
本稿では,これらを相互に補完し,組み合わせた最適化フレームワークを効果的に連携させることができることを示す。
論文 参考訳(メタデータ) (2024-05-30T06:24:14Z) - Unleashing the Potential of Large Language Models as Prompt Optimizers: Analogical Analysis with Gradient-based Model Optimizers [108.72225067368592]
本稿では,大規模言語モデル(LLM)に基づくプロンプトの設計について検討する。
モデルパラメータ学習における2つの重要な要素を同定する。
グラディエントにインスパイアされた Prompt ベースの GPO を開発した。
論文 参考訳(メタデータ) (2024-02-27T15:05:32Z) - Introduction to Online Control [31.67032731719622]
オンラインの非確率制御では、コスト関数と仮定された力学モデルからの摂動の両方が敵によって選択される。
目標は、ベンチマーククラスの政策から見て、最高の政策に対して低い後悔を得ることだ。
論文 参考訳(メタデータ) (2022-11-17T16:12:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。