論文の概要: TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories
- arxiv url: http://arxiv.org/abs/2607.08400v1
- Date: Thu, 09 Jul 2026 12:25:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.525329
- Title: TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories
- Title(参考訳): TRACE: LLM-Agent軌道の補体埋め込みによる2チャンネルロバスト寄与透かし
- Abstract要約: TRACEは、アクション選択において歪みのない最初のエージェント透かしである。
これは、どのアクションが選択されるかを設定する選択チャネルを、歪みのないサンプル装置でローカルコンテンツにキー付けする。
ToolBenchとALFWorldでは、TRACEは未発見エージェントの成功率と一致している。
- 参考スコア(独自算出の注目度): 26.736610129232698
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents reach users through resellers, who may rebrand a developer's agent or substitute a cheaper model. When provenance is disputed, attribution rests on the trajectory log (the record of tool calls, observations, and executed actions, not the model's reasoning), which the reseller stores and processes to meter usage. A watermark must therefore survive an adversary with full read/write access to the very evidence it is detected from; existing agent watermarks do not, as their attribution is read straight off that log. We present TRACE, to our knowledge the first agent watermark that is distortion-free in its action choices, self-synchronizing under deletion, and unconditionally invariant under rewriting. Deletion desynchronizes a position-derived key and rewriting alters content, so a deletion-robust key must come from content and a rewrite-robust key from position, and no single key serves both. A trajectory, however, has room for two watermarks. TRACE superposes a selection channel that sets which action is chosen, keyed on local content with a distortion-free sampler, so the agent's distribution is provably unchanged and detection resynchronizes after deletions, and a tally channel that sets how many records each decision group holds, keyed on the log's skeleton alone, which no rewriting can touch. We prove this behavioral watermark's signal is bought with decision entropy, each decision paying at least half its entropy and deterministic decisions nothing, and that erasing both channels forces the reseller to corrupt the trajectories it resells. On ToolBench and ALFWorld, TRACE matches the unwatermarked agent's success rate while its selection channel reaches detection scores near z = 100 on long-horizon trajectories, stays detectable under 70% step deletion, and keeps a tally channel exactly unchanged under LLM rewriting of any strength.
- Abstract(参考訳): LLMエージェントはリセラーを通じてユーザーにリーチし、開発者のエージェントをリブランドしたり、より安価なモデルに置き換えたりすることができる。
証明が議論されるとき、帰属は軌道ログ(ツール呼び出し、観察、実行されたアクションの記録、モデルの推論ではなく、実行されたアクションの記録)にかかっている。
既存のエージェントの透かしはそのログから直接読み取られるので、既存のエージェントの透かしはそうではない。
TRACEは動作選択において歪みのない最初のエージェント透かしであり、削除の下で自己同期し、書き換え時に無条件不変である。
削除は位置由来のキーをデシンクロし、書き直しは内容を変更するので、削除ロバストキーはコンテンツと書き直しロバストキーを位置から取り出さなければならない。
しかし、軌跡には2つの透かしがある。
TRACEは、どのアクションが選択されたかを設定する選択チャネルを非歪サンプリング器でキー化しているため、エージェントの分布は確実に変化せず、削除後に再同期する。
我々は、この行動の透かしの信号は、決定エントロピーで購入され、それぞれの決定は、少なくともエントロピーと決定論的決定には何も払わず、両方のチャンネルを消去することで、再販売業者が再販売する軌跡を損なうことになることを証明している。
ToolBench と ALFWorld では、TRACE は非透かしエージェントの成功率と一致し、選択チャネルは長い水平軌道上の z = 100 付近で検出スコアに達し、70% のステップ削除の下で検出可能であり、任意の強度の LLM 書き換えの下では高いチャネルを正確に変化しない。
関連論文リスト
- DenMark: Robust Semantic Watermarking for Diffusion Language Models [56.836684262732994]
DenMarkは拡散言語モデル(DLM)のセマンティックな透かしフレームワークである
鍵依存的な信号をDLM復調プロセスに直接注入する。
出力を固定トークン領域に分割し、一時ロールアウトをセマンティックルックヘッドとして使用する。
検出のために、DenMarkは、セマンティックアタックによって導入されたバウンダリシフトに対する堅牢性を維持するために、候補ユニットサイズをキャリブレーションしたスキャンを使用する。
論文 参考訳(メタデータ) (2026-09-13T03:37:48Z) - TrajMark: Ownership Attribution and Segment-Level Tamper Localization for Coding-Agent Trajectories [6.234219482022044]
TrajMarkはトレーニングフリー、対称キー、可視性のみの軌跡透かしフレームワークである。
これは、堅牢なオーナシップの属性と、脆弱な局所的整合性検証を分離する。
評価済みの全フルウォーターマークバッチで、正確な所有者を復元する。
論文 参考訳(メタデータ) (2026-09-09T16:33:02Z) - WoE Wrote It? Watermarking Mixture-of-Experts LLMs for Black-Box Text Provenance [14.891975420982504]
我々は,新しいブラックボックステキスト証明法であるWatermarking of Experts (WoE)を紹介する。
WoEは特定の専門家の語彙をバイアスし、ウォーターマーク信号を強制できない推論ラッパーから切り離す。
疑似テキストからの透かし検出に成功し、8つのMoEモデル間でWoEを評価した。
論文 参考訳(メタデータ) (2026-08-29T08:57:06Z) - Tracing Provenance and Detecting Tampering with Complementary LLM Watermarks [68.64050157343334]
既存の透かしは編集の際は残されているが、このような堅牢性は、敵が帰属を維持しながら重要な内容を変更することを可能にする。
実証と改ざんの証拠を共同で提供する革新的な透かしを導入する。
信号は同じメカニズムを共有するが、独立キーと正規化テキスト上の異なるシードウィンドウを使用するため、一方は編集に耐性があり、もう一方は読み取り可能な変更に敏感である。
論文 参考訳(メタデータ) (2026-08-13T01:55:16Z) - Sequential Behavioral Watermarking for LLM Agents [6.193603972930103]
LLMベースのエージェントは実行可能決定のシーケンスを通じて作用するが、その軌道はどのエージェントやポリシーが生成したかの証拠はほとんど得られない。
これにより、生成されたテキストにのみ埋め込まれるのではなく、エージェントの振る舞いに直接埋め込まれた透かし信号が動機付けられる。
本稿では、履歴条件の遷移パターンに信号を埋め込むシーケンシャルな行動透かしフレームワークSeqWMを提案する。
論文 参考訳(メタデータ) (2026-05-11T02:28:34Z) - BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models [1.7118181664522618]
BackFlushは、透かしを保存しながら、バックドアの検出と除去のためのフレームワークである。
BackFlushはおよそ1%のAttack Success Rate(ASR)、約99%のクリーン精度(CACC)、および保存された透かし機能を達成する。
論文 参考訳(メタデータ) (2026-04-15T10:56:08Z) - MerkleSpeech: Public-Key Verifiable, Chunk-Localised Speech Provenance via Perceptual Fingerprints and Merkle Commitments [0.0]
本稿では,公開鍵検証・チャンク局所音声認識システムであるMerkleSpeechを提案する。
このシステムは、短い音声チャンク上で知覚指紋を計算し、それを発行キーで署名されたMerkleツリーにコミットする。
我々は,再サンプリング,帯域通過フィルタ,付加雑音下での極めて低い偽陽性率を目標とした実験を行った。
論文 参考訳(メタデータ) (2026-02-10T11:58:19Z) - Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption [94.887133335656]
私たちはこのレンズを通して透かしの3つのクラスを見直します。
emphLLMテキスト透かしは、反ミスツールとしてのみフレーム化された場合に、控えめなプロバイダの利点を提供する。
emphIn-context watermarking (ICW)は、会議の主催者や教育者といった信頼できる関係者向けに調整されている。
論文 参考訳(メタデータ) (2025-10-21T06:34:51Z) - An Ensemble Framework for Unbiased Language Model Watermarking [60.99969104552168]
本研究では,アンサンブル・フレームワークであるENSを提案する。
ENSは複数の独立した透かしインスタンスを順次構成し、それぞれ異なるキーによって管理され、透かし信号を増幅する。
実験的な評価では、ENSは信頼できる検出に必要なトークンの数を大幅に減らし、平滑化やパラフレージング攻撃に対する耐性を高めている。
論文 参考訳(メタデータ) (2025-09-28T19:37:44Z) - Character-Level Perturbations Disrupt LLM Watermarks [64.60090923837701]
我々は,Large Language Model (LLM)ウォーターマーキングのためのシステムモデルを定式化する。
我々は、透かし検出器への限られたアクセスに制約された2つの現実的な脅威モデルの特徴付けを行う。
我々は,最も制限的な脅威モデルの下で,キャラクタレベルの摂動が透かし除去に著しく有効であることを実証した。
現実的な制約下での透かし除去における文字レベルの摂動の優位性と遺伝的アルゴリズム(GA)の有効性を実験的に検証した。
論文 参考訳(メタデータ) (2025-09-11T02:50:07Z) - Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models [52.877452505561706]
データセットのオーナシップ検証(DOV)を損なうよう特別に設計された最初の著作権回避攻撃を提案する。
CEAT2Iは, 試料検出, トリガー同定, 効率的な透かし除去の3段階からなる。
実験の結果,CEAT2I はモデル性能を保ちながら DOV 機構を効果的に回避できることがわかった。
論文 参考訳(メタデータ) (2025-05-05T17:51:55Z) - ClearMark: Intuitive and Robust Model Watermarking via Transposed Model
Training [50.77001916246691]
本稿では,人間の直感的な評価を目的とした最初のDNN透かし手法であるClearMarkを紹介する。
ClearMarkは目に見える透かしを埋め込んで、厳格な値閾値なしで人間の意思決定を可能にする。
8,544ビットの透かし容量は、現存する最強の作品に匹敵する。
論文 参考訳(メタデータ) (2023-10-25T08:16:55Z) - SepMark: Deep Separable Watermarking for Unified Source Tracing and
Deepfake Detection [15.54035395750232]
悪意あるディープフェイクは、本物と偽造された顔の区別に関して激しい対立を引き起こしている。
我々はソーストレースとディープフェイク検出のための統合フレームワークを提供するSepMarkを提案する。
論文 参考訳(メタデータ) (2023-05-10T17:15:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。