論文の概要: Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned
Language Models through Task Arithmetic
- arxiv url: http://arxiv.org/abs/2402.11746v1
- Date: Mon, 19 Feb 2024 00:18:09 GMT
- ステータス: 処理完了
- システム内更新日: 2024-02-20 19:08:05.803644
- Title: Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned
Language Models through Task Arithmetic
- Title(参考訳): 言語モデルはホーマー・シンプソン!
タスク演算による微調整言語モデルの安全性再評価
- Authors: Rishabh Bhardwaj, Do Duc Anh, Soujanya Poria
- Abstract要約: RESTA は Task Arithmetic による安全の維持の略です。
パラメータ効率およびフル微調整におけるRESTAの有効性を示す。
また、既存の3つの安全性評価ベンチマークと多言語ベンチマークデータセットにおいて、RESTAの一般化可能性を示す。
- 参考スコア(独自算出の注目度): 27.277409583885508
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Aligned language models face a significant limitation as their fine-tuning
often results in compromised safety. To tackle this, we propose a simple method
RESTA that performs LLM safety realignment. RESTA stands for REstoring Safety
through Task Arithmetic. At its core, it involves a simple arithmetic addition
of a safety vector to the weights of the compromised model. We demonstrate the
effectiveness of RESTA in both parameter-efficient and full fine-tuning,
covering a wide range of downstream tasks, including instruction following in
Chinese, English, and Hindi, as well as problem-solving capabilities in Code
and Math. We also showcase the generalizability of RESTA on three existing
safety evaluation benchmarks and a multilingual benchmark dataset proposed as a
part of this work, consisting of 550 harmful questions covering 11 categories,
each with 5 sub-categories of harm. Overall, RESTA decreases the harmfulness of
the compromised model from 18.6% to 5.1% and from 9.2% to 1.5% in
parameter-efficient and full fine-tuning, respectively, while maintaining most
of the model's performance on the task. We release the source codes at:
https://github.com/declare-lab/resta.
- Abstract(参考訳): 言語モデルの微調整が安全を損なうことがしばしばあるため、言語モデルは重大な制限に直面します。
そこで本研究では,LLMの安全性向上を実現するシンプルな方法RESTAを提案する。
RESTA は Task Arithmetic による安全の維持を意味する。
中心となるのは、妥協されたモデルの重みに安全ベクトルを単純な算術的に付加することである。
我々は、パラメータ効率とフル微調整におけるRESTAの有効性を実証し、中国語、英語、ヒンディー語での指示や、コードと数学における問題解決機能を含む幅広い下流タスクをカバーした。
また,既存の3つの安全評価ベンチマークと,11のカテゴリをカバーする550の有害質問からなる多言語ベンチマークデータセットについて,restaの汎用性を示す。
全体として、restaは漏洩したモデルの有害性を18.6%から5.1%に、パラメーター効率と完全な微調整において9.2%から1.5%に低下させる。
ソースコードはhttps://github.com/declare-lab/resta。
関連論文リスト
- ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming [64.86326523181553]
ALERTは、新しいきめ細かいリスク分類に基づいて安全性を評価するための大規模なベンチマークである。
脆弱性を特定し、改善を通知し、言語モデルの全体的な安全性を高めることを目的としている。
論文 参考訳(メタデータ) (2024-04-06T15:01:47Z) - Developing Safe and Responsible Large Language Models -- A Comprehensive Framework [1.980639720136382]
SR$_textLLM$は、潜在的に安全でないコンテンツを識別し、良質なバリエーションを生成するように設計されている。
命令ベースおよびパラメータ効率の良い微調整方式を採用している。
安全対策が実施されると、安全なコンテンツの生産が大幅に改善された。
論文 参考訳(メタデータ) (2024-04-01T18:10:05Z) - Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large
Language Models [46.92994945808424]
マルチモーダル大言語モデル(MLLM)の微調整における破滅的忘れ込みの課題
本稿では,MLLMにおける破滅的忘れの包括的分析を行い,モデルタイラーと呼ばれるポストトレーニング調整手法を提案する。
論文 参考訳(メタデータ) (2024-02-19T11:02:05Z) - SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in
Large Language Models [15.896567445646784]
このような重要な安全性リスクを迅速かつ体系的に識別するための新しいテストスイートとしてSimpleSafetyTests(SST)を紹介します。
テストスイートは、5つのハーネス領域にわたる100のテストプロンプトで構成されており、LLMは、ほとんどのアプリケーションにおいて、コンプライアンスを拒否すべきである。
いくつかのモデルは単一の安全でない応答を与えないが、ほとんどのモデルは20%以上のプロンプトに対して安全でない応答を与え、極端に50%以上の安全でない応答を与える。
論文 参考訳(メタデータ) (2023-11-14T18:33:43Z) - Frontier Language Models are not Robust to Adversarial Arithmetic, or
"What do I need to say so you agree 2+2=5? [88.59136033348378]
言語モデルアライメントのための単純なテストベッドを提供する逆算術の問題を考察する。
この問題は自然言語で表される算術的な問題から成り、質問が完了する前に任意の逆文字列を挿入する。
これらの攻撃に対して、強化学習やエージェント構成ループを通じて、モデルを部分的に強化できることが示される。
論文 参考訳(メタデータ) (2023-11-08T19:07:10Z) - Fine-tuning Aligned Language Models Compromises Safety, Even When Users
Do Not Intend To! [88.90694413503614]
LLMの安全性は微調整によって損なわれる可能性がある。
我々は、GPT-3.5の安全ガードレールを10種類の例で微調整することで、脱獄した。
我々は、協調LLMのカスタム微調整のための安全プロトコルの強化に向けたさらなる研究を提唱する。
論文 参考訳(メタデータ) (2023-10-05T17:12:17Z) - Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models [102.63973600144308]
オープンソースの大規模言語モデルは、有害なコンテンツを生成するために容易に変換できる。
5つの異なる組織がリリースした8つのモデルに対する実験は、シャドーアライメントアタックの有効性を実証している。
この研究は、悪意のある攻撃者に対するオープンソースのLLMの安全性を見直し、強化するための集団的な取り組みの発端となる。
論文 参考訳(メタデータ) (2023-10-04T16:39:31Z) - All Languages Matter: On the Multilingual Safety of Large Language
Models [101.31394141244294]
我々は、大規模言語モデル(LLM)のための最初の多言語安全ベンチマークを構築した。
XSafetyは、複数の言語ファミリーにまたがる10言語にわたる14種類の一般的な安全問題をカバーしている。
本稿では,ChatGPTの多言語安全性向上のための簡易かつ効果的なプロンプト手法を提案する。
論文 参考訳(メタデータ) (2023-10-02T05:23:34Z) - Large Language Models for Failure Mode Classification: An Investigation [6.384550988144805]
故障モード分類における大規模言語モデルの有効性について検討する。
監視を対応する障害モードコードで自動的にラベル付けするタスクは、メンテナンス領域において重要なタスクである。
論文 参考訳(メタデータ) (2023-09-15T06:13:01Z) - LaMDA: Language Models for Dialog Applications [75.75051929981933]
LaMDAは、ダイアログに特化したトランスフォーマーベースのニューラルネットワークモデルのファミリーである。
注釈付きデータで微調整し、モデルが外部の知識ソースを参照できるようにすると、大幅な改善がもたらされる。
論文 参考訳(メタデータ) (2022-01-20T15:44:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。