論文の概要: Project-wise Comparison of Software Birthmarks Using Weighted Partial Similarity
- arxiv url: http://arxiv.org/abs/2606.25418v2
- Date: Sat, 27 Jun 2026 16:00:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 13:45:02.005086
- Title: Project-wise Comparison of Software Birthmarks Using Weighted Partial Similarity
- Title(参考訳): 重み付き部分的類似性を用いたソフトウェア誕生マークのプロジェクトワイズ比較
- Authors: Nikolay Fedorov, Akito Monden, Hiroki Inayoshi, Haruaki Tamada, Masateru Tsunoda,
- Abstract要約: 我々は,モジュールレベルの類似性の対称的なアグリゲーションに基づくプロジェクトワイドな誕生マーク比較のためのフレームワークを構築した。
非常に類似したモジュールペアの上位部分に焦点をあてた部分類似性手法を提案する。
10のカテゴリにわたる35のオープンソースJavaプロジェクトに対する提案されたアプローチを評価し、同じプロジェクトの異なるバージョンを再利用ケースとして扱う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Software birthmarks provide a robust approach to detecting code plagiarism even under substantial modifications, while distinguishing independently developed software. Existing similarity measures are typically applied at the module level (e.g., source or class files). However, in practice, software reuse often occurs at the project level, where only a subset of modules may be reused. This setting introduces two key challenges: (1) partial reuse, where reused modules constitute only a small fraction of the project, and (2) incidental similarity from small modules, which can lead to false positives. In this paper, we establish a framework for project-wise birthmark comparison based on a symmetric aggregation of module-level similarities. On top of this framework, we propose two complementary mechanisms to address the above challenges. First, we introduce a weighting scheme that assigns higher importance to larger modules, reducing the influence of noisy matches from small modules. Second, we propose a partial similarity method that focuses on the top fraction of highly similar module pairs, enabling robust detection of partial reuse. We evaluate the proposed approach on 35 open-source Java projects across ten categories, where different versions of the same project are treated as reuse cases. The dataset and experimental artifacts are made publicly available to support reproducibility. Performance is assessed using two complementary properties of software birthmarks, resilience and credibility, combined via their harmonic mean. The results show that the proposed method consistently outperforms existing approaches, achieving robust and stable detection of partial code reuse at the project level.
- Abstract(参考訳): ソフトウェアの初期マークは、実質的な修正の下でもコード盗作を検出するための堅牢なアプローチを提供すると同時に、独立して開発されたソフトウェアを区別する。
既存の類似度尺度は、通常、モジュールレベル(例えば、ソースまたはクラスファイル)で適用される。
しかし実際には、ソフトウェア再利用はしばしばプロジェクトレベルで発生し、モジュールのサブセットのみが再利用される。
この設定では、(1)再利用されたモジュールがプロジェクトのごく一部を構成する部分的再利用、(2)小さなモジュールと偶然に類似しているため、偽陽性につながる可能性がある。
本稿では,モジュールレベルの類似性の対称的アソシエーションに基づくプロジェクトワイド・ライヴマーク比較の枠組みを確立する。
この枠組みの上に、上記の課題に対処する2つの相補的なメカニズムを提案する。
まず、重み付け方式を導入し、より大きい加群により高い重み付けを割り当て、小さな加群からノイズマッチの影響を減らす。
第2に,高度に類似したモジュールペアの上位部分に着目した部分的類似性手法を提案し,部分的再利用の堅牢な検出を可能にする。
10のカテゴリにわたる35のオープンソースJavaプロジェクトに対する提案されたアプローチを評価し、同じプロジェクトの異なるバージョンを再利用ケースとして扱う。
データセットと実験的なアーティファクトは、再現性をサポートするために公開されています。
パフォーマンスは、2つの相補的な特性、レジリエンスと信頼性を使って評価されます。
その結果,提案手法は既存の手法を一貫して上回り,プロジェクトレベルで部分的コード再利用の堅牢かつ安定した検出を実現していることがわかった。
関連論文リスト
- COMBINER: Composed Image Retrieval Guided by Attribute-based Neighbor Relations [73.40758654107724]
By attrIbute-based NEighbor Relations (COMBINER) によるCOMposed画像検索ネットワークについて紹介する。
具体的には,まずアダプティブ・セマンティック・ディスタングルメント・モジュールを設計する。
次に, クロスモーダルな統一プロトタイプを構築可能なUnified Prototypeベースのコンポジションモジュールを提案する。
最後にDual Relations Modelingモジュールを導入し、属性の類似性に基づいてペアと隣り合う関係をマイニングする。
論文 参考訳(メタデータ) (2026-06-03T08:43:51Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z) - Toward Reproducible Cross-Backend Compatibility for Deep Learning: A Configuration-First Framework with Three-Tier Verification [1.5269986601063288]
本稿では,ディープラーニングシステムにおけるクロスバックエンド互換性を評価するための構成優先フレームワークを提案する。
このフレームワークはYAMLを使ったコードから実験を分離し、ライブラリモデルとリポジトリモデルの両方をサポートし、3層認証プロトコルを使用している。
ランの72.0%が通過し、ほとんどの不一致はより厳格な閾値で発生している。
論文 参考訳(メタデータ) (2025-08-29T16:28:28Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - An Empirical Study on the Impact of Code Duplication-aware Refactoring Practices on Quality Metrics [5.516979718589074]
128のオープンソースJavaプロジェクトから、日々の変更で開発者が適用し、ドキュメント化した332のコミットのコーパスを抽出します。
我々は、これらの操作が共通の最先端の設計品質指標に与える影響を実証的に分析する。
論文 参考訳(メタデータ) (2025-02-06T13:34:25Z) - DOCE: Finding the Sweet Spot for Execution-Based Code Generation [69.5305729627198]
本稿では,候補生成,$n$-best再ランク,最小ベイズリスク(MBR)復号化,自己老化などを含む包括的フレームワークを提案する。
本研究は,実行ベースメソッドの重要性と,実行ベースメソッドと実行フリーメソッドとの差を明らかにする。
論文 参考訳(メタデータ) (2024-08-25T07:10:36Z) - Symmetrical Joint Learning Support-query Prototypes for Few-shot Segmentation [33.33249452130038]
クラス内変動の重要な問題に対処するFew-Shot(FSS)のための新しいフレームワークであるSym-Netを提案する。
我々は、クエリとプロトタイプの両方を対称的に学習し、学習プロセスが他方よりも1つのセット(サポートまたはクエリ)を好まないようにします。
実験の結果,提案したSym-Netは最先端モデルよりも優れていた。
論文 参考訳(メタデータ) (2024-07-27T17:37:56Z) - LTSim: Layout Transportation-based Similarity Measure for Evaluating Layout Generation [16.936872796841527]
レイアウト生成の結果を評価するために,レイアウト類似度尺度を導入する。
本稿では, 要素のより柔軟なマッチングを容易にする最適輸送に基づく新しい類似度尺度を提案する。
FIDが一般的に使用される非条件レイアウト生成のようなタスクに対しては、コレクションレベルの類似性を扱うために、我々の測度を拡張します。
論文 参考訳(メタデータ) (2024-07-17T07:21:44Z) - Dual Adaptive Representation Alignment for Cross-domain Few-shot
Learning [58.837146720228226]
ベース知識から学習することで、限られたサポートサンプルを持つ新規なクエリを認識することを目的としている。
この設定の最近の進歩は、ベース知識と新しいクエリサンプルが同じドメインに分散されていることを前提としている。
本稿では,ターゲットドメインで利用可能なサンプルが極めて少ないドメイン間数ショット学習の問題に対処することを提案する。
論文 参考訳(メタデータ) (2023-06-18T09:52:16Z) - BSNet: Bi-Similarity Network for Few-shot Fine-grained Image
Classification [35.50808687239441]
いわゆるtextitBi-Similarity Network (textitBSNet) を提案する。
両相似モジュールは、多様な特性の2つの類似度尺度に従って特徴写像を学習する。
このようにして、モデルはより差別的で類似度に富んだ特徴を、よりきめ細かい画像の少ないショットから学習することができる。
論文 参考訳(メタデータ) (2020-11-29T08:38:17Z) - Deep Keypoint-Based Camera Pose Estimation with Geometric Constraints [80.60538408386016]
連続するフレームから相対的なカメラのポーズを推定することは、視覚計測の基本的な問題である。
本稿では,検出,特徴抽出,マッチング,外乱除去のための学習可能なモジュールで構成されるエンドツーエンドのトレーニング可能なフレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-29T21:41:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。