論文の概要: Baselines for Identifying Watermarked Large Language Models
- arxiv url: http://arxiv.org/abs/2305.18456v1
- Date: Mon, 29 May 2023 04:26:16 GMT
- ステータス: 処理完了
- システム内更新日: 2023-05-31 20:44:29.759469
- Title: Baselines for Identifying Watermarked Large Language Models
- Title(参考訳): 透かし付き大規模言語モデル同定のためのベースライン
- Authors: Leonard Tang, Gavin Uberti, Tom Shlomi
- Abstract要約: 我々は,広く利用されている,公開されている,クローズドソースの大規模言語モデル(LLM)において,透かし方式の存在と使用を識別することの課題について考察する。
本稿では,LLMにおける透かしを識別するためのベースラインアルゴリズムを紹介し,透かしと無印のLLMによって生成された出力トークンとロジットの分布を解析することに依存する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We consider the emerging problem of identifying the presence and use of
watermarking schemes in widely used, publicly hosted, closed source large
language models (LLMs). We introduce a suite of baseline algorithms for
identifying watermarks in LLMs that rely on analyzing distributions of output
tokens and logits generated by watermarked and unmarked LLMs. Notably,
watermarked LLMs tend to produce distributions that diverge qualitatively and
identifiably from standard models. Furthermore, we investigate the
identifiability of watermarks at varying strengths and consider the tradeoffs
of each of our identification mechanisms with respect to watermarking scenario.
Along the way, we formalize the specific problem of identifying watermarks in
LLMs, as well as LLM watermarks and watermark detection in general, providing a
framework and foundations for studying them.
- Abstract(参考訳): 本稿では,広く利用されている,公開されている,クローズドソースの大規模言語モデル(LLM)において,透かし方式の存在と使用を識別することの課題について考察する。
本稿では,LLMにおける透かしを識別するためのベースラインアルゴリズムを紹介し,透かしと無印のLLMによって生成された出力トークンとロジットの分布を解析することに依存する。
特に、透かし付きLLMは、定性的かつ同定可能な分布を標準モデルから生成する傾向にある。
さらに,様々な強度における透かしの識別性について検討し,透かしシナリオにおける識別機構のトレードオフを検討する。
その過程で, LLMにおける透かしの特定や, LLMにおける透かしや透かしの検出といった特定の問題を形式化し, それらを研究するための枠組みと基盤を提供する。
関連論文リスト
- Topic-based Watermarks for LLM-Generated Text [46.71493672772134]
大規模言語モデル(LLM)のための「トピックベース透かしアルゴリズム」を提案する。
提案アルゴリズムは,入力プロンプトの抽出されたトピックや非透かしLLMの出力に基づいて,透かしLLM出力のトークンを生成する方法を決定する。
論文 参考訳(メタデータ) (2024-04-02T17:49:40Z) - Attacking LLM Watermarks by Exploiting Their Strengths [22.07546496631127]
生成モデルは、AIが生成したテキスト、コード、画像が、多くのアプリケーションで生成したコンテンツをミラーすることを可能にする。
モデル出力に情報を埋め込んでソースを検証する技術であるウォーターマーキングは、そのようなAI生成コンテンツの誤用を軽減するのに有用である。
既存の透かし方式が驚くほど攻撃を受けやすいことを示します。
論文 参考訳(メタデータ) (2024-02-25T20:24:07Z) - New Evaluation Metrics Capture Quality Degradation due to LLM
Watermarking [28.53032132891346]
大規模言語モデル(LLM)のための透かしアルゴリズム評価のための2つの新しい使いやすさ手法を提案する。
種々のデータセットを用いて実験を行った結果,従来の透かし法は単純な分類器でも検出可能であることがわかった。
以上の結果から,透かしの堅牢性とテキスト品質のトレードオフを浮き彫りにし,透かしの質を評価する上で,より情報的な指標を持つことの重要性を強調した。
論文 参考訳(メタデータ) (2023-12-04T22:56:31Z) - FunctionMarker: Watermarking Language Datasets via Knowledge Injection [65.33166992656024]
バックドアベースの透かしは、分類データセットの著作権を保護するための実行可能なアプローチである。
本稿では,知識注入による言語データセットの著作権保護手法であるFunctionMarkerを提案する。
論文 参考訳(メタデータ) (2023-11-16T03:22:53Z) - Publicly Detectable Watermarking for Language Models [48.024299441636245]
パブリックな検出性や検証性を備えた言語モデルに対する最初の証明可能な透かし方式を構築した。
我々のプロトコルは,生成したテキストに統計信号を埋め込まない最初の透かし方式である。
論文 参考訳(メタデータ) (2023-10-27T21:08:51Z) - Unbiased Watermark for Large Language Models [67.43415395591221]
本研究では, モデル生成出力の品質に及ぼす透かしの影響について検討した。
出力確率分布に影響を与えることなく、透かしを統合することができる。
ウォーターマークの存在は、下流タスクにおけるモデルの性能を損なうものではない。
論文 参考訳(メタデータ) (2023-09-22T12:46:38Z) - Towards Codable Watermarking for Injecting Multi-bits Information to LLMs [86.86436777626959]
大規模言語モデル(LLM)は、流布とリアリズムを増大させるテキストを生成する。
既存の透かし方式はエンコーディング非効率であり、多様な情報エンコーディングニーズに柔軟に対応できない。
テキスト透かしを複数ビットでカスタマイズ可能な情報を運ぶことができるCTWL (Codable Text Watermarking for LLMs) を提案する。
論文 参考訳(メタデータ) (2023-07-29T14:11:15Z) - Provable Robust Watermarking for AI-Generated Text [41.5510809722375]
We propose a robust and high-quality watermark method, Unigram-Watermark。
提案手法は,テキストの編集やパラフレージングに頑健で,生成品質,透かし検出の精度が保証されていることを実証する。
論文 参考訳(メタデータ) (2023-06-30T07:24:32Z) - Watermarking Images in Self-Supervised Latent Spaces [75.99287942537138]
我々は,自己教師型アプローチに照らして,事前学習した深層ネットワークに基づく透かし手法を再検討する。
我々は、マーク時間におけるデータの増大を利用して、マークとバイナリのメッセージをその潜在空間に埋め込む方法を提案する。
論文 参考訳(メタデータ) (2021-12-17T15:52:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。