論文の概要: Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy Detection
- arxiv url: http://arxiv.org/abs/2609.03416v2
- Date: Mon, 07 Sep 2026 06:33:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.862422
- Title: Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy Detection
- Title(参考訳): Dude: 筆跡識別のためのデュアル検出マルチエージェントシステム
- Authors: Weijie Liu, Running Zhao, Wenhao Yuan, Jinfeng Xu, Zhanfeng Xu, Xiaoxi Zhang, Edith Cheuk-Han Ngai,
- Abstract要約: 紙コード一致検出のための第1号デュアル検出マルチエージェントシステムであるDudeを提案する。
我々は、デュドの大幅なリコールと精度の改善を最大22.8%向上させ、F1スコアをベースライン法と比較して最大18.7%向上させた。
- 参考スコア(独自算出の注目度): 8.256019539172463
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-empowered paper-code discrepancy detection has received growing concern since the scaling of research submissions exceeds the manual review capability. However, the limited context capacity and one-sided discrepancy detection of existing single-agent LLM paradigms lead to an inferior recall performance in detecting discrepancies. In this paper, we propose Dude, the first Dual-Detection Multi-Agent System for paper-code discrepancy detection. We discover that the granularity asymmetry of the paper-language and code-language introduces over-interpretation and over-reporting challenges in a multi-agent system design for discrepancy detection, resulting in increasing false positives. To address this, we propose a granularity-aligned negotiation and a two-stage salience-filtering mechanism in Dude, which effectively prevents agents from falsely reporting discrepancies. Experimental results in real-world paper-code discrepancy datasets showcase Dude's significant recall and precision improvement by up to 22.8%, increasing F1 score by up to 18.7% compared to baseline methods.
- Abstract(参考訳): LLMを用いた紙コード不一致検出は,手動によるレビュー能力を超えているため,関心が高まっている。
しかし,既存の単一エージェントLDMパラダイムのコンテクストキャパシティの制限と一方的な不一致検出は,不一致検出におけるリコール性能の低下につながる。
本稿では,Dudeを提案する。Dude,Dude,Dude,Dude,Dude,Dude、Dude、Dude、Dude、Dude、Dude、Dude、Dude、Dude、Dude、Dude、Dual-Detection Multi-Agent。
論文言語とコード言語の粒度非対称性は, 誤り検出のためのマルチエージェントシステム設計において, 過度解釈と過度報告の課題を導入し, 偽陽性が増大することを発見した。
そこで本研究では, エージェントが不一致を誤報することを効果的に防止する, 粒度整合性交渉と2段階のサリエンスフィルタリング機構を提案する。
実世界の紙コード不一致データセットの実験結果では、デュドの大幅なリコールと精度の改善が22.8%向上し、F1スコアはベースライン法と比較して18.7%向上した。
関連論文リスト
- PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - Improved Evidence Extraction for Document Inconsistency Detection with LLMs [10.610567456326235]
本稿では,新しい包括的エビデンス抽出指標と制約付きフィルタリングによる再試行フレームワークを提案する。
有望な実験結果で私たちの主張を支持します。
論文 参考訳(メタデータ) (2026-01-06T00:58:20Z) - Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection [76.91230292971115]
大規模言語モデル (LLM) に基づくマルチエージェントシステム (MAS) は複雑なタスクを解く上で強力な能力を示している。
XG-Guardは、MAS内の悪意のあるエージェントを検出するための、説明可能な、きめ細かい保護フレームワークである。
論文 参考訳(メタデータ) (2025-12-21T13:46:36Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Who Stole Your Data? A Method for Detecting Unauthorized RAG Theft [16.826893547339548]
本稿では,RAGプラジャリズム検出に特化して設計された新しいデータセットであるRADを紹介する。
セマンティックレベルと語彙レベルの両方で保護を埋め込んだ二重層透かしシステムを開発した。
この研究は、検索強化AIシステムにおける知的財産権保護の基盤となる枠組みを確立する。
論文 参考訳(メタデータ) (2025-10-09T03:09:18Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - RepreGuard: Detecting LLM-Generated Text by Revealing Hidden Representation Patterns [50.401907401444404]
大規模言語モデル(LLM)は、誤用を防止し、信頼できるAIシステムを構築するために不可欠である。
本稿では,統計量に基づく効率的な検出手法であるRepreGuardを提案する。
実験結果から、RepreGuardは、平均94.92%のAUROCですべてのベースラインでID(in-distriion)とOOD(OOD)の両方のシナリオでパフォーマンスが向上していることが示された。
論文 参考訳(メタデータ) (2025-08-18T17:59:15Z) - CAMOUFLAGE: Exploiting Misinformation Detection Systems Through LLM-driven Adversarial Claim Transformation [4.02943411607022]
既存のブラックボックステキストベースの敵攻撃は、証拠に基づく誤情報検出システムには不適である。
本稿では,2エージェントシステムを用いた反復的LCM駆動型アプローチであるCAMOUFLAGEについて述べる。
最近の2つの学術システムと2つの実世界のAPIを含む4つのシステムでCAMOUFLAGEを評価し、平均的な攻撃成功率は46.92%である。
論文 参考訳(メタデータ) (2025-05-03T19:14:24Z) - MOSAIC: Multiple Observers Spotting AI Content [35.67613230687864]
大規模言語モデル(LLM)は大規模に訓練され、強力なテキスト生成能力を備えている。
本研究では,人文テキストから人工的に生成したテキストを自動的に識別する手法を提案する。
種々のジェネレータLSMを用いて実験を行った結果,本手法は各モデルの強度を効果的に活用できることが示唆された。
論文 参考訳(メタデータ) (2024-09-11T20:55:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。