論文の概要: Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning
- arxiv url: http://arxiv.org/abs/2407.15762v2
- Date: Wed, 23 Oct 2024 17:42:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-11-08 15:45:25.621908
- Title: Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning
- Title(参考訳): Conditional Language Policy: ステアブルな多目的ファインタニングのための汎用フレームワーク
- Abstract要約: Conditional Language Policy (CLP) は、複数の目的に対して言語モデルを微調整するためのフレームワークである。
CLPは、推論時に競合する目的を効果的にトレードオフするステアブルモデルを学ぶ。
- 参考スコア(独自算出の注目度): 72.46388818127105
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reward-based finetuning is crucial for aligning language policies with intended behaviors (e.g., creativity and safety). A key challenge is to develop steerable language models that trade-off multiple (conflicting) objectives in a flexible and efficient manner. This paper presents Conditional Language Policy (CLP), a general framework for finetuning language models on multiple objectives. Building on techniques from multi-task training and parameter-efficient finetuning, CLP learn steerable models that effectively trade-off conflicting objectives at inference time. Notably, this does not require training or maintaining multiple models to achieve different trade-offs between the objectives. Through extensive experiments and ablations on two summarization datasets, we show that CLP learns steerable language models that outperform and Pareto-dominate the existing approaches for multi-objective finetuning.
- Abstract(参考訳): リワードベースの微調整は、言語ポリシーを意図した行動(創造性と安全性など)と整合させることに不可欠である。
重要な課題は、複数の(競合する)目標を柔軟かつ効率的な方法でトレードオフする、ステアブル言語モデルを開発することである。
本稿では,多目的言語モデルを微調整するための一般的なフレームワークである条件言語政策(CLP)について述べる。
マルチタスクトレーニングとパラメータ効率の微調整のテクニックに基づいて、CLPは推論時に競合する目標を効果的にトレードオフするステアブルモデルを学習する。
特に、目標間の異なるトレードオフを達成するために、トレーニングや複数のモデルのメンテナンスは必要ありません。
CLPは2つの要約データセットに関する広範な実験と改善を通じて,多目的ファインタニングにおける既存のアプローチを上回り,Paretoが優位に立つステアブル言語モデルを学習していることを示す。
関連論文リスト
- Harmonizing Multi-Objective LLM Unlearning via Unified Domain Representation and Bidirectional Logit Distillation [11.723777730116831]
大規模言語モデル(LLM)のアンラーニングは、モデルから有害またはプライバシをリードする情報を除去するために不可欠である。
既存の未学習の手法は主にこれらの目標の限られたサブセットに焦点を当てている。
複数の未学習目標を調和させる新しい多目的学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-16T19:09:17Z) - LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation [51.071351994330605]
統一型マルチモーダル事前訓練は,単一の基礎モデル内での言語とビジョンを共同でモデル化するための,有望なパラダイムとして登場した。
既存のアプローチは暗黙的あるいは間接的なアライメント信号に大きく依存しており、マルチモーダル理解と生成を同時にサポートするのに最適である。
LVRPOは言語と視覚的表現を明確に整合させる言語-視覚的強化に基づく嗜好最適化フレームワークである。
論文 参考訳(メタデータ) (2026-03-29T13:38:21Z) - Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models [28.416254061159176]
マルチモーダルキーフレーズ予測(MMKP)は、テキストのみの手法を超えて進歩することを目的としている。
従来のマルチモーダルアプローチは、困難な不在と目に見えないシナリオを扱う上で、重大な制限があることが証明されている。
MMKPタスクに視覚言語モデル(VLM)を活用することを提案する。
論文 参考訳(メタデータ) (2025-10-10T13:13:07Z) - The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs [54.59207567677249]
大規模言語モデル(LLM)は、ハイソース言語以外のタスクで依然として苦戦している。
本研究では,タスク固有のポストトレーニングデータが不足している低リソース言語への言語間移動について検討する。
論文 参考訳(メタデータ) (2025-05-23T20:28:31Z) - Robust Multi-Objective Preference Alignment with Online DPO [6.434799451791957]
多目的選好アライメントは、パーソナライズ可能で、有用で、安全であるAIシステムの開発に不可欠である。
既存のアプローチは、トレーニングに計算コストがかかるか、モデル動作を十分に制御できないかのいずれかである。
本稿では,多目的オンラインDPOアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-03-01T02:01:49Z) - Align, Generate, Learn: A Novel Closed-Loop Framework for Cross-Lingual In-Context Learning [0.0]
言語間インコンテキスト学習(XICL)は、多言語タスクに対処するために大規模言語モデル(LLM)を活用するための変換パラダイムとして登場した。
タスク関連事例を内部的に選択・活用するために, LLMの生成能力を活用する, 自己管理型フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-12T05:36:51Z) - Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation [70.22782550540714]
QSLAWと呼ばれるマルチモーダルワームアップに基づく量子化対応スケールルアーニング法
本稿では、QSLAWと呼ばれるマルチモーダルワームアップに基づく量子化対応スケールLeArning手法を提案する。
論文 参考訳(メタデータ) (2024-08-07T12:42:09Z) - A Comparison of Language Modeling and Translation as Multilingual Pretraining Objectives [13.581385765600265]
プレトレーニング言語モデル(PLM)は優れたパフォーマンスを示し、NLPコミュニティの注目を集めている。
本稿では,制御された方法論環境における多言語事前学習目標の比較を提案する。
論文 参考訳(メタデータ) (2024-07-22T09:16:30Z) - Scalable Language Model with Generalized Continual Learning [58.700439919096155]
The Joint Adaptive Re-ization (JARe) is integrated with Dynamic Task-related Knowledge Retrieval (DTKR) to enable adapt adjust of language model based on specific downstream task。
提案手法は,様々なバックボーンやベンチマーク上での最先端性能を実証し,最小限の忘れを伴い,フルセットおよび少数ショットのシナリオにおいて効果的な連続学習を実現する。
論文 参考訳(メタデータ) (2024-04-11T04:22:15Z) - On the Analysis of Cross-Lingual Prompt Tuning for Decoder-based
Multilingual Model [49.81429697921861]
多言語自己回帰モデルにおけるパラメータ効率細調整(PEFT)と言語間タスクの相互作用について検討する。
高速チューニングは、微調整よりも低リソース言語の性能向上に有効であることを示す。
論文 参考訳(メタデータ) (2023-11-14T00:43:33Z) - Forging Multiple Training Objectives for Pre-trained Language Models via
Meta-Learning [97.28779163988833]
複数の事前学習目標が単一目的言語モデリングの理解能力の欠如を埋める。
メタラーニングに基づく新しい適応型サンプリングシステムであるtextitMOMETAS を提案し,任意の事前学習対象に対して潜時サンプリングパターンを学習する。
論文 参考訳(メタデータ) (2022-10-19T04:38:26Z) - Context-Aware Language Modeling for Goal-Oriented Dialogue Systems [84.65707332816353]
我々は、部分的に観察されたマルコフ決定過程としてゴール指向対話を定式化する。
目的を意識して言語モデルを微調整する,シンプルで効果的な手法を考案する。
本研究では,AirDialogue を用いた実践的なフライト予約タスクについて評価する。
論文 参考訳(メタデータ) (2022-04-18T17:23:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。