論文の概要: Watermarking Game-Playing Agents in Perfect-Information Extensive-Form Games
- arxiv url: http://arxiv.org/abs/2605.14283v1
- Date: Thu, 14 May 2026 02:33:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.585086
- Title: Watermarking Game-Playing Agents in Perfect-Information Extensive-Form Games
- Title(参考訳): 完全情報集約型ゲームにおけるウォーターマーキングゲームプレイングエージェント
- Authors: Juho Kim, Fei Fang, Tuomas Sandholm,
- Abstract要約: LLMのKGW透かしは、完全情報広角ゲームにおけるウォーターマークゲームプレイングエージェントにどのように適応できるかを示す。
予測ユーティリティによって定量化されている透かし型戦略プロファイルの品質劣化は、境界づけられる可能性があるが、検出性と品質のトレードオフがある。
- 参考スコア(独自算出の注目度): 63.23335721758144
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Watermarking techniques for large language models (LLMs), which encode hidden information in the output so its source can be verified, have gained significant attention in recent days, thanks to their potential capability to detect accidental or deliberate misuse. Similar challenges involving model misuse also exist in the context of game-playing, such as when detecting the unauthorized use of AI tools in gaming platforms (e.g., cheating in online chess). In this paper, we initiate the study of how game-playing strategies can be watermarked. We show how the KGW watermark for LLMs can be adapted to watermark game-playing agents in perfect-information extensive-form games. The watermark can then be detected using a statistical test. We show that the degradation in the quality of the watermarked strategy profile, quantified by the expected utility, can be bounded, but there is a tradeoff between detectability and quality. In our experiments, we bootstrap the watermarking framework to various chess engines and demonstrate that a) the impact of the watermark on the quality of the strategy is negligible and b) the watermark can be detected with just a handful of games.
- Abstract(参考訳): 大規模言語モデル (LLM) のウォーターマーキング技術は, 偶発的, 故意的な誤用を検出する能力によって近年注目されている。
モデル誤用に関する同様の課題は、ゲームプラットフォーム(例えばオンラインチェスにおける不正行為)における不正なAIツールの使用を検出することなど、ゲームプレイングの文脈にも存在している。
本稿では,ゲームプレイ戦略のウォーターマーク化について検討する。
LLMのKGW透かしは、完全情報広角ゲームにおけるウォーターマークゲームプレイングエージェントにどのように適応できるかを示す。
その後、統計検査により透かしを検出できる。
予測ユーティリティによって定量化されている透かし型戦略プロファイルの品質劣化は、境界づけられる可能性があるが、検出性と品質のトレードオフがある。
実験では、ウォーターマーキングフレームワークを様々なチェスエンジンにブートストラップし、それを実証した。
a) 戦略の質に対する透かしの影響は無視可能で、
b) 透かしは,ほんの一握りのゲームで検出することができる。
関連論文リスト
- Mitigating Watermark Forgery in Generative Models via Randomized Key Selection [33.12939822735328]
主要なセキュリティ脅威は、敵がプロバイダの透かしをコンテンツに挿入する偽造攻撃である。
既存の防御は、複数のキーを持つ多くの透かしを同じコンテンツに埋め込むことによって偽造に抵抗する。
本稿では,攻撃者が収集した透かし付きコンテンツの数に対して,確実に偽造に抵抗する防御法を提案する。
論文 参考訳(メタデータ) (2025-07-10T15:52:32Z) - Modification and Generated-Text Detection: Achieving Dual Detection Capabilities for the Outputs of LLM by Watermark [6.355836060419373]
1つの実用的な解決策は、透かしをテキストに埋め込むことで、透かし抽出によるオーナシップの検証を可能にする。
既存の手法は主に修正攻撃に対する防御に重点を置いており、しばしば他の偽造攻撃を無視している。
本研究では, 修正に敏感な不偏形透かしに対して, テキスト中の修正を検出する手法を提案する。
論文 参考訳(メタデータ) (2025-02-12T11:56:40Z) - Unbiased Watermark for Large Language Models [67.43415395591221]
本研究では, モデル生成出力の品質に及ぼす透かしの影響について検討した。
出力確率分布に影響を与えることなく、透かしを統合することができる。
ウォーターマークの存在は、下流タスクにおけるモデルの性能を損なうものではない。
論文 参考訳(メタデータ) (2023-09-22T12:46:38Z) - On the Reliability of Watermarks for Large Language Models [95.87476978352659]
本研究では,人間による書き直し後の透かしテキストの堅牢性,非透かしLDMによる言い換え,あるいはより長い手書き文書への混在性について検討する。
人や機械の言い回しをしても、透かしは検出可能である。
また、大きな文書に埋め込まれた透かし付きテキストの短いスパンに敏感な新しい検出手法についても検討する。
論文 参考訳(メタデータ) (2023-06-07T17:58:48Z) - Evading Watermark based Detection of AI-Generated Content [45.47476727209842]
生成AIモデルは、非常に現実的なコンテンツを生成することができる。
WatermarkはAI生成コンテンツの検出に活用されている。
類似の透かしをデコードできれば、コンテンツはAI生成として検出される。
論文 参考訳(メタデータ) (2023-05-05T19:20:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。