論文の概要: The Perplexity Trap: When Patent Law Makes Human Writing Look Like AI
- arxiv url: http://arxiv.org/abs/2607.13044v1
- Date: Mon, 15 Jun 2026 05:09:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.410136
- Title: The Perplexity Trap: When Patent Law Makes Human Writing Look Like AI
- Title(参考訳): 特許法が人間の文章をAIに見せかける
- Abstract要約: 欧州特許条約第84条は,明快かつ簡潔な主張を要求し,LLMが占有する低複雑で低可逆性多様体にヒトの起草を推し進める。
5つのプロンプト戦略を用いて,500のEPO H04テレコム特許に対して,500のLCM生成特許に対して,3つのオープンソースゼロショット検出器をベンチマークした。
7つの特徴を持つ言語・複雑なロジスティック回帰は精度74.0パーセントに達し、28.1%のFPRで、同等の操作点において、パープレキシティのみのベースラインよりも13ポイント上昇した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The European Patent Office (EPO) reported record filings in 2025, and the 2026 EPO Guidelines hold applicants strictly responsible for LLM-assisted content under Article 83 and Rule 42, creating pressure to triage suspected AI-generated patent text. Two constraints make this hard. First, realistic prosecution settings often have only consumer GPUs with about 8 GB VRAM, not datacenter-class scoring stacks. Second, Article 84 of the European Patent Convention requires claims to be clear and concise, pushing human drafting onto the same low-perplexity, low-burstiness manifold that LLMs occupy. We benchmark three open-source zero-shot detectors on 500 granted EPO H04 telecom patents versus 500 LLM-generated counterparts using five prompting strategies, all under the consumer hardware envelope. At claim level, all detectors exceed 60 percent false-positive rate: Binoculars 78.3 percent, Fast-DetectGPT 61.3 percent, DetectGPT 80.5 percent. The failure persists under Qwen2.5-3B-Instruct regeneration, LoRA-adapted Pythia-2.8B scoring heads, cross-IPC replication on A61K, C07D, and F03D (mean FPR 84.6 percent), and H100 re-evaluation with published Falcon-7B and GPT-J-6B heads, arguing the issue is structural rather than substitute-model capacity. A seven-feature linguistic-complexity logistic regression reaches 74.0 percent accuracy at 28.1 percent FPR, a 13 percentage-point gain over a perplexity-only baseline at a comparable operating point, without using likelihood at inference and within the same hardware budget.
- Abstract(参考訳): 欧州特許庁(EPO)は、2025年に記録出願を報告し、2026年のEPOガイドラインは、第83条と第42条に基づいて、LSM支援コンテンツに対して厳格に責任を負う申請者を拘束し、疑わしいAI生成特許のテキストをトリアージする圧力を生み出した。
2つの制約がこれを難しくします。
まず、現実的なプロセプション設定は、データセンタークラスのスコアリングスタックではなく、約8GBのVRAMを持つコンシューマGPUのみを持つことが多い。
第二に、欧州特許条約第84条は、明快で簡潔な主張を要求し、人間の起草をLEMが占める低難易度で低損耗度な多様体に押し付ける。
3つのオープンソースゼロショット検出器を500個のEPO H04テレコム特許に対して,5つのプロンプト戦略を用いた500個のLCM生成特許に対して,いずれもコンシューマハードウェアの封筒の下でベンチマークした。
クレームレベルでは、全ての検出器は偽陽性率を60%以上、両眼は78.3%、ファストデテククトGPTは61.3%、ディテクターGPTは80.5%である。
故障はQwen2.5-3B-Instruct regeneration、LoRA対応のPythia-2.8Bスコアヘッド、A61K、C07D、F03DでのクロスIPCレプリケーション(平均FPR 84.6%)、Falcon-7BとGPT-J-6BのヘッドによるH100の再評価で継続され、問題は代替モデルの容量ではなく構造的であると主張した。
7つの特徴を持つ言語・複雑なロジスティック回帰は精度74.0パーセントに達し、28.1%のFPRで、推論の可能性を使わずに、同じハードウェア予算内で、同等の操作ポイントで、パープレクシティのみのベースラインよりも13ポイント上昇する。
関連論文リスト
- From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs [10.232931203118614]
異なる介入レベルで3つの代表的防御を比較したベンチマークであるCopyShieldを紹介した。
5冊のパブリックドメインの本を対照記憶として,LLaMA-3.1-8BとMistral-7B-v0.3の2つのモデルファミリー上でのCopyShieldの評価を行った。
論文 参考訳(メタデータ) (2026-09-01T12:43:02Z) - Annotated Surrogate Retrieval for Polish Statutory Law [0.0]
本稿では,文書代理法に基づくポーランド法典の検索方法のファミリについて述べる。
ASCRはサロゲートカスケードであり、ASCR-Hはそのカスケードに密度の高いリストを融合させ、DTFは言語モデルの両方のステージを3つの語彙と密度の高いレトリバーで置き換える。
2024年と2025年のポーランドの弁護士試験と法律顧問試験の300問に対して,これら3項目について,語彙,密集度,融解度,融解度と4つの基準値とを比較検討した。
論文 参考訳(メタデータ) (2026-08-31T15:05:00Z) - InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification [0.0]
BERT-for-PatentsのマイクロF1の改良は,主に体積効果を反映していることが示されている。
生のマイクロF1における分類性能を+0.58まで向上させるコーパスは、ジャカードオーバーラップ検索プロキシに悪影響を及ぼす可能性がある。
論文 参考訳(メタデータ) (2026-05-22T23:49:52Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Brain-inspired spike-timing plasticity for reliable label-efficient event-camera vision [0.3823356975862005]
ローカルスパイクタイピング依存可塑性(STDP)モジュールは、GPUをサポートせずに単一のCPUスレッドで動作する。
密度勾配訓練検出器は, 勾配訓練, 密度行列乗算, 局所可塑性自由運転を建設によって組み合わせることができない。
論文 参考訳(メタデータ) (2026-05-17T22:56:16Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Delta-Based Neural Architecture Search: LLM Fine-Tuning via Code Diffs [48.83701310501069]
大規模言語モデル(LLM)は、ニューラルアーキテクチャ生成の強力な可能性を示している。
既存のアプローチは、ゼロから完全なモデル実装を生成します。
我々はデルタ符号生成法を提案し、細調整されたLLMはコンパクトな統一差分を生成する。
論文 参考訳(メタデータ) (2026-05-06T13:32:05Z) - Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice [0.0]
実行サンドボックス(L1)、意図検証(L2)、ゼロトラスト間認証(L3)、不変監査ロギング(L4)からなる4層フレームワークであるレイヤガバナンスアーキテクチャ(LGA)を提案する。
LGAを評価するために、1,081のツールコールサンプル(インジェクション、RAG中毒、悪意のあるスキルプラグインなど)のベンチマーク(中国語のオリジナル、機械翻訳による英語)を構築し、それをオープンソースの代表的なエージェントフレームワークであるOpenClawに適用する。
論文 参考訳(メタデータ) (2026-03-07T13:05:14Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models [67.15960154375131]
大規模推論モデル(LRM)は、多段階推論トレースを明示した大規模言語モデルを拡張する。
この能力は、推論の高い計算コストを生かした、新しいタイプのプロンプト誘発推論時間拒否攻撃(PI-DoS)を導入している。
本稿では,強化学習に基づくPI-DoSフレームワークであるReasoningBombについて紹介する。
論文 参考訳(メタデータ) (2026-01-29T18:53:01Z) - Adaptive Multi-Stage Patent Claim Generation with Unified Quality Assessment [4.173681299587575]
現在の特許クレーム生成システムは、3つの基本的な制限に直面している。
本稿では,関係認識類似性分析,ドメイン適応クレーム生成,統一品質評価を通じて,これらの課題に対処する新しい3段階フレームワークを提案する。
本手法は, ベースラインが89.4%, ベースラインが76.2%であり, 自動的特許訴訟に対する包括的解決法が確立されている。
論文 参考訳(メタデータ) (2026-01-14T03:44:27Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。