論文の概要: Multi-Channel Spread-Spectrum Code Watermarking
- arxiv url: http://arxiv.org/abs/2607.06009v1
- Date: Tue, 07 Jul 2026 08:50:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.460042
- Title: Multi-Channel Spread-Spectrum Code Watermarking
- Title(参考訳): マルチチャネル拡散スペクトルコード透かし
- Abstract要約: 24ビットペイロードと形式的ロバスト性保証を備えたマルチチャネル拡散スペクトル透かしを提案する。
CodeNetおよびGPT-4.1およびLlama-4世代からの1,750以上のPythonファイルに対して、透かしは偽陽性ゼロで100%クリーン検出精度を達成している。
- 参考スコア(独自算出の注目度): 10.27405810850982
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Attributing code to the large language model that produced it is essential for provenance, licensing, and misuse accountability, yet no deployed watermark meets this need. Generation-time schemes require access to the producing model and cannot be applied to third-party code, while post-hoc schemes work on any code but carry at most 4 bits of payload, far too few to distinguish the many deployed model configurations. We present multi-channel spread-spectrum watermarking, the first post-hoc, training-free code watermark with a 24-bit payload and formal robustness guarantees. The scheme encodes bits in variable naming conventions and in eight pairs of semantically equivalent code patterns, and a keyed pseudo-random permutation maps every site to a codeword bit so that each bit receives multiple independent votes. Majority voting absorbs distributed corruption, while an outer Reed-Solomon code recovers the identifier when concentrated channel attacks defeat the vote, yielding provable robustness bounds for formatting, syntactic, and structural attacks. Across 1,750 Python files from CodeNet and from GPT-4.1 and Llama-4 generations, the watermark achieves 100% clean-detection accuracy with zero false positives. Under 17 attack types, it recovers the identifier at 97.6% accuracy under 8 variable renames and 94.1% under 10% random per-site corruption, while the strongest post-hoc baseline collapses to 0% under any single-transform attack. Embedding and detection together take under 200 ms on CPU without training data or GPU.
- Abstract(参考訳): 生成した大きな言語モデルにコードを帰属させることは、証明、ライセンス、そして誤用説明責任にとって不可欠だが、このニーズを満たすデプロイされた透かしは存在しない。
生成時のスキームは生成モデルへのアクセスを必要としており、サードパーティのコードには適用できない。
提案するマルチチャネル拡散スペクトル透かしは,24ビットペイロードと形式的堅牢性保証を備えた,最初のポストホックでトレーニング不要なコード透かしである。
このスキームは、可変命名規則および8組のセマンティック等価コードパターンにおいてビットを符号化し、キー付き擬似乱数置換は各サイトをコードワードビットにマッピングし、各ビットが複数の独立投票を受信する。
多数決投票は分散汚職を吸収する一方、外部のリード・ソロモン符号は集中チャネル攻撃が投票を破るときに識別子を復元し、フォーマット、構文、構造攻撃に対して証明可能な堅牢性境界を与える。
CodeNetおよびGPT-4.1およびLlama-4世代からの1,750以上のPythonファイルに対して、透かしは偽陽性ゼロで100%クリーン検出精度を達成している。
17の攻撃タイプでは、8つの変数のリネームで97.6%の精度で識別子を復元し、94.1%のランダムなサイト毎の汚職で94.1%の精度を回復する一方、最も強力なポストホックベースラインは、任意の単一変換攻撃で0%に崩壊する。
埋め込みと検出は、トレーニングデータやGPUなしで、200ミリ秒以下のCPUで行う。
関連論文リスト
- BitC-3DGS: High-Capacity 3D Gaussian Splatting Watermarking via Bit Compression [68.33622936663876]
高容量透かしは3Dガウススプラッティング(3DGS)資産が豊富な情報を埋め込むために必要である。
既存のビット・ツー・ケンの透かし方式は、CLIPの77ビットのコンテキスト長が固定されているため、77ビットのメッセージに制限されている。
トークン毎に複数のメッセージビットをエンコードするビット圧縮フレームワークBitC-3DGSを紹介する。
論文 参考訳(メタデータ) (2026-05-28T08:28:04Z) - Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark [16.543554028816477]
トークン位置毎にペイロードのすべてのビットをエンコードするために二項符号化を導入する。
我々は、エンコーディングの圧力を未符号化ビットに動的にリダイレクトするステートフルエンコーダを用いて、我々のアプローチを補完する。
提案手法は,メッセージの精度とロバスト性を向上し,ベースライン手法とのギャップを拡大する。
論文 参考訳(メタデータ) (2026-05-12T07:14:45Z) - Asymmetric Phase Coding Audio Watermarking [7.627186551029829]
Deepfakeオーディオは音声ベースの認証システムに挑戦する。
トレーニング不要なオーディオ用暗号署名層である非対称位相符号化を提案する。
我々は、平均Q.02および数ミリ秒のレイテンシにおける全ての条件で、97.5%から98.3%の暗号検証率を達成する。
論文 参考訳(メタデータ) (2026-05-08T04:54:59Z) - Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks [0.0]
本稿では,透かしを施したテキストが1回ではなく数回書き直された場合に何が起こるかを考察する。
透かしは、基準値閾値で元の出力の87.9%で検出される。
5つの連鎖書き直しの後、検出は4.86%に低下し、もともと検出されたテキストの94.76%は、もはやフラグ付けされない。
論文 参考訳(メタデータ) (2026-05-06T23:00:26Z) - VibeGuard: A Security Gate Framework for AI-Generated Code [0.11080037957254413]
AnthropicのClaude Code CLIは、npmパッケージに59.8MBのソースマップファイルを出荷し、512,000行のプロプライエタリなTypeScriptを公開している。
われわれは、5つの盲点を狙うプレパブリッシュのセキュリティゲートであるVibeGuardを提示する。
これらの結果が、AIコード生成に依存するチームにとって、詳細なワークフローにどのように影響するかについて議論する。
論文 参考訳(メタデータ) (2026-04-01T15:57:01Z) - Disappearing Ink: Obfuscation Breaks N-gram Code Watermarks in Theory and Practice [23.788321123219244]
人間が書いたコードからAI生成コードを識別することは、著者の帰属、コンテンツ追跡、誤用検出に不可欠である。
N-gramベースの透かしは、世代中に検出される秘密の透かしを注入する顕著な方法として出現している。
ほとんどのクレームは、攻撃のシミュレーションとして単純なコード変換やコードの最適化に対する防御にのみ依存しています。
論文 参考訳(メタデータ) (2025-07-07T22:18:19Z) - An Unforgeable Publicly Verifiable Watermark for Large Language Models [84.2805275589553]
現在の透かし検出アルゴリズムは、透かし生成プロセスで使用される秘密鍵を必要としており、公開検出中にセキュリティ違反や偽造の影響を受ける。
両段階で同じキーを使用するのではなく、2つの異なるニューラルネットワークを用いて透かしの生成と検出を行う。
論文 参考訳(メタデータ) (2023-07-30T13:43:27Z) - Who Wrote this Code? Watermarking for Code Generation [53.24895162874416]
本稿では,機械生成テキストを検出するために,Entropy Thresholding (SWEET) を用いたSelective WatErmarkingを提案する。
実験の結果,SWEETはコード品質を著しく向上し,すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2023-05-24T11:49:52Z) - Watermarking Text Generated by Black-Box Language Models [103.52541557216766]
テキスト生成中に透かしを埋め込むことのできるホワイトボックスLCMに対して,透かしに基づく手法が提案されている。
リストを認識した検出アルゴリズムは、透かし付きテキストを識別することができる。
我々はブラックボックス言語モデル利用シナリオのための透かしフレームワークを開発する。
論文 参考訳(メタデータ) (2023-05-14T07:37:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。