論文の概要: Semantic Behavioral Watermarking: Paraphrase-Robust and Forgery-Resistant Provenance for LLM Agents
- arxiv url: http://arxiv.org/abs/2610.08668v1
- Date: Tue, 06 Oct 2026 16:50:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.129486
- Title: Semantic Behavioral Watermarking: Paraphrase-Robust and Forgery-Resistant Provenance for LLM Agents
- Title(参考訳): セマンティック・ビヘイビア・ウォーターマーキング : LLM剤のパラフレーズ・ロバスト・フォージェリ・抵抗性
- Abstract要約: 振舞いの透かしは、LLMエージェントの高レベルのアクション選択に所有者識別子を埋め込む。
先行エージェントの透かしは、透かしを正確なアクションシンボルに結合する。
キー付きビンニングは、100%から偽陽性のフロアに適応的な偽造を行う。
- 参考スコア(独自算出の注目度): 5.584439031414184
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Behavioral watermarking embeds an owner identifier in an LLM agent's high-level action choices, giving provenance without touching output tokens. Prior agent watermarks break in two ways. First, all three prior schemes bind the watermark to the exact action symbol, so renaming a tool desynchronizes decoding even when the observation is untouched; in AgentMark's own robustness test, paraphrasing the observation alone drops bit-recovery to 16.8%. Second, every prior agent watermark studies only removal: none asks whether an adversary can forge a trajectory that verifies as someone else's, a question answered affirmatively for text watermarks (Jovanović et al., 2024). We present Semantic Behavioral Watermarking (SBW): watermarking over semantic action clusters under history conditioning, with the public-cluster bin replaced by keyed collision-resistant binning whose fresh-bucket assignment is provably unpredictable in the random-oracle model. Across five agent models (3B-14B, four vendors) and three encoders the ordering holds on both benchmarks: on ToolBench (600 trajectories per model) detection under rewriting is 0.49-0.66 for cluster-level versus 0.05-0.17 for exact-symbol at a permutation-calibrated 1% FPR, at 72-83% choice agreement against 22-27% for logit biasing; on ALFWorld (100 episodes per model) it is 0.92-0.97 versus 0.00-0.01. Keyed binning takes adaptive forgery from 100% to the false-positive floor at the primary operating point (bge, r=64). We also mark the boundary that guarantee does not cover: when the adversary copies the victim's own steps, shuffled splicing is neutralized (0.000 on Qwen2.5-3B) but chained replay remains at 0.76-0.98 across the five models, reported as open. Paraphrase robustness costs about half of the per-step watermark capacity. Code is available at https://anonymous.4open.science/r/SBW-Agent-Watermark.
- Abstract(参考訳): 振る舞いの透かしは、LLMエージェントのハイレベルなアクション選択に所有者識別子を埋め込んで、出力トークンに触れることなく証明する。
先行エージェントの透かしは2つの方法で壊れます。
まず、以前の3つのスキームは、ウォーターマークを正確なアクションシンボルにバインドするため、ツールをデシンクロする。
第二に、先行するエージェントの透かしは除去のみの研究であり、相手が他人の物であるかどうかを問うものはなく、テキストの透かしに対して肯定的に回答する(Jovanović et al , 2024)。
本稿では,セマンティック行動透かし (SBW: Semantic Behavioral Watermarking, SBW) について述べる。
5つのエージェントモデル (3B-14B, 4ベンダー) と3つのエンコーダの両方のベンチマークで、リライト中のToolBench (600 trajectories per model) 検出は0.49-0.66で、置換率1%のFPRでの正確なシンボルは0.05-0.17で、22-27%のロジットバイアスは72-83%、ALFWorldでは0.92-0.97と0.00-0.01である。
キー付きビンニングは、100%から一次動作点(bge, r=64)の偽陽性フロアに適応フォージェリーを取る。
敵が被害者自身のステップをコピーすると、シャッフルスプライシングは中和される(Qwen2.5-3Bの0.000)が、チェーンリプレイは5つのモデルで0.76-0.98のままである。
パラフレーズの堅牢性は、ステップごとの透かし容量の約半分である。
コードはhttps://anonymous.4open.science/r/SBW-Agent-Watermarkで公開されている。
関連論文リスト
- TrajMark: Ownership Attribution and Segment-Level Tamper Localization for Coding-Agent Trajectories [6.234219482022044]
TrajMarkはトレーニングフリー、対称キー、可視性のみの軌跡透かしフレームワークである。
これは、堅牢なオーナシップの属性と、脆弱な局所的整合性検証を分離する。
評価済みの全フルウォーターマークバッチで、正確な所有者を復元する。
論文 参考訳(メタデータ) (2026-09-09T16:33:02Z) - Watermarks Without Verification: AI Text Watermarking After the EU AI Act [49.51124343181601]
EU AI法第50条では、生成可能なAIプロバイダに対して、システムが生成したコンテンツをマークし、AI生成として検出することを要求している。
Anthropicは、その日後にリリースされたすべてのClaudeモデルが、すべての生成されたテキストにSynthID-Textに基づく透かしを埋め込んでいることを公表した。
我々は、現在、異議や保証は確認できないし、この不信は、それ自体を透かしではなく、実質的なガバナンスの失敗であると論じている。
論文 参考訳(メタデータ) (2026-09-09T01:56:17Z) - Tracing Provenance and Detecting Tampering with Complementary LLM Watermarks [68.64050157343334]
既存の透かしは編集の際は残されているが、このような堅牢性は、敵が帰属を維持しながら重要な内容を変更することを可能にする。
実証と改ざんの証拠を共同で提供する革新的な透かしを導入する。
信号は同じメカニズムを共有するが、独立キーと正規化テキスト上の異なるシードウィンドウを使用するため、一方は編集に耐性があり、もう一方は読み取り可能な変更に敏感である。
論文 参考訳(メタデータ) (2026-08-13T01:55:16Z) - HaloMark: A Spectral Threshold for Embedding-Vector Watermarking under C2PA [3.0458514384586404]
暗号的にC2PAマニフェストに結び付けられたベクトルを埋め込むための透かしであるHaloMarkを提示する。
検証は、ベクトルあたり284usと24バイトのサイドカーで実行され、3つのC2PA参照SDKバインディングに対してエンドツーエンドで検証される。
論文 参考訳(メタデータ) (2026-08-09T11:36:59Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents [3.964533007623828]
現代の大規模言語モデル(LLM)エージェントは、行動の時点で決定に関連のある証拠を必要とする。
本稿では、事例コンテキストグラフを構築し、候補単位の決定指向ユーティリティを推定し、選択したエビデンスを型付きメモリカードに圧縮するCICLについて述べる。
CICLは、ツール使用エージェントの意思決定クリティカルコンテキストの測定、ランキング、圧縮のための実用的なレイヤを提供する。
論文 参考訳(メタデータ) (2026-06-06T13:02:28Z) - Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories [0.0]
LLMベースのコーディングエージェントは、時には自身の推論で問題を認識し、いずれにせよ前進する。
我々はClaude Sonnet 4.6のジャッジを構築し、完全なトラジェクトリとフラグがパターンの発生する場所にまたがる。
Qwen3.5-35B-A3Bのバックボーンを用いて44個の終端ベンチ2軌道上で評価を行った。
論文 参考訳(メタデータ) (2026-06-05T22:52:16Z) - Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs [13.891118064010898]
ウォーターマーキングは、検出と帰属のためのAI生成テキストに統計的シグネチャを埋め込む。
ユーザが複数のモデルにアクセスすると、透かしは自明に失敗する。
WASH(Watermark Attenuation via Statistical Hybridisation)を導入し,アンサンブル生成における実践的課題を解決する。
論文 参考訳(メタデータ) (2026-05-28T19:34:58Z) - Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents [50.78646963535282]
Skill-as-Pseudocode (SaP) はマークダウンスキルライブラリの型付き擬似コードへの自動変換である。
1つ以上のスキルから引き出された類似の手続きパスのクラスタごとに、SaPは型付きコントラクトを抽出し、それを4チェック決定性検証器を通じてフィルタリングする。
プロモートされた契約は、復元された具体的なアクションテンプレートと共に書き直されたスキルスケルトンにインライン化され、エージェントは2つの補完的な信号を与える。
論文 参考訳(メタデータ) (2026-05-27T04:48:40Z) - DMark: Order-Agnostic Watermarking for Diffusion Large Language Models [46.07844536066178]
拡散大言語モデル(dLLM)は、同等の品質を維持しながら、自己回帰モデルよりも高速な生成を提供する。
DMarkは、dLLM用に特別に設計された最初の透かしフレームワークである。
論文 参考訳(メタデータ) (2025-10-03T11:14:16Z) - ClearMark: Intuitive and Robust Model Watermarking via Transposed Model
Training [50.77001916246691]
本稿では,人間の直感的な評価を目的とした最初のDNN透かし手法であるClearMarkを紹介する。
ClearMarkは目に見える透かしを埋め込んで、厳格な値閾値なしで人間の意思決定を可能にする。
8,544ビットの透かし容量は、現存する最強の作品に匹敵する。
論文 参考訳(メタデータ) (2023-10-25T08:16:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。