論文の概要: Checked-In Secret Detection: Strings Are All You Need
- arxiv url: http://arxiv.org/abs/2608.04523v1
- Date: Wed, 05 Aug 2026 06:55:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.76637
- Title: Checked-In Secret Detection: Strings Are All You Need
- Title(参考訳): Checked-In Secret Detection: 文字列は必要なだけ
- Authors: Zhengdong Huang, Kevin Li, Jinqiu Yang, Yepang Liu, Lili Wei,
- Abstract要約: シークレットコードには重大なセキュリティ脆弱性があり、悪意のある敵に簡単に悪用できる。
文字列は、より優れたコンテキスト密度、難読化、言語独立性を提供する、コードセマンティクスの重要な情報ソースとして機能する。
我々は,潜在的な秘密を取り巻く文字列をマイニングする新しい文脈抽出アルゴリズムStringGroupを提案する。
当社のツールを実環境にデプロイし,26のアプリケーションから,これまで知られていなかった48の秘密鍵を正常に検出する。
- 参考スコア(独自算出の注目度): 10.0766016663762
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Hardcoded secrets in source code pose critical security vulnerabilities which can be easily exploited by malicious adversaries. Existing regex-based detection approaches suffer from fundamental limitations, as secrets often lack identifiable patterns, resulting in poor precision and recall. Recent studies have explored context-aware detection methods, as surrounding code can reveal the purpose of candidate strings. However, these methods confront three key challenges: (1) obfuscation robustness where models over-rely on easily obfuscated identifiers, (2) cross-language generalization difficulties due to uneven training data distribution, and (3) lengthy and noisy context that introduces excessive irrelevant tokens and slows inference. We observe that strings serve as a critical information source for code semantics, offering superior contextual density, obfuscation robustness, and language independence. Based on this insight, we propose StringGroup, a novel context extraction algorithm that mines strings surrounding potential secrets. By introducing a relatively simple modification to existing patterns that narrows the analysis specifically to string literals, the method achieves significant gains. With only 33.2% of the original context, it preserves over 80% of semantic information and significantly improves the signal-to-noise ratio for secret detection. We further design a context-aware secret detection tool, Secretron, based on StringGroup methods and Transformer model. Evaluation on the SecretBench dataset demonstrates high accuracy with 98.74% F1-score and strong robustness under obfuscation and cross-language scenarios, outperforming state-of-the-art LLM-based baselines. We deploy our tool in real-world environments and successfully detect 48 previously unknown secret keys from 26 applications, demonstrating the practical effectiveness of our approach.
- Abstract(参考訳): ソースコードのハードコードされたシークレットは、悪意のある敵によって簡単に悪用できる重要なセキュリティ脆弱性を引き起こす。
既存のRegexベースの検出アプローチは、秘密はしばしば識別可能なパターンを欠いているため、基本的な制限に悩まされる。
近年の研究では、周辺コードは候補文字列の目的を明らかにすることができるため、文脈認識検出法が検討されている。
しかし,これらの手法は,(1)難解な識別子を重畳したモデルによる難解性,(2)不均一なトレーニングデータ分布による言語間一般化の難しさ,(3)過度に無関係なトークンを導入し,推論を遅くする長大でノイズの多いコンテキスト,という3つの課題に直面している。
文字列がコードセマンティクスの重要な情報源として機能し、文脈密度、難解性、言語独立性を向上する。
この知見に基づいて,潜在的秘密を取り巻く文字列をマイニングする新しい文脈抽出アルゴリズムであるStringGroupを提案する。
文字列リテラルに解析を絞り込むような既存のパターンに比較的単純な修正を導入することで、この手法は大きな利益を得ることができる。
元の文脈のわずか33.2%で、意味情報の80%以上を保存し、シークレット検出のための信号と雑音の比率を大幅に改善した。
さらに、StringGroupメソッドとTransformerモデルに基づいて、コンテキスト対応のシークレット検出ツールであるSecretronを設計する。
SecretBenchデータセットの評価では、98.74%のF1スコアで高精度で、難読化とクロスランゲージシナリオの下で強い堅牢性を示し、最先端のLCMベースラインを上回っている。
当社のツールを実環境にデプロイし,これまで未知の秘密鍵48個を26のアプリケーションから検出し,本手法の有効性を実証した。
関連論文リスト
- Plaintext Structure Vulnerability: Robust Cipher Identification via a Distributional Randomness Fingerprint Feature Extractor [23.713094083283334]
暗号文バイトからエンドツーエンドを学習しない手法を提案する。
具体的には、暗号文のランダム性特徴を計算するための統計テストのセットに基づいている。
実験結果から,本手法は高い判別性能を実現することが示された。
論文 参考訳(メタデータ) (2025-11-11T14:29:42Z) - LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting [118.93173826110815]
高精度検出のための低ランク近似に基づく新しいパラメータ化テキスト形状法を提案する。
異なるテキストの輪郭間の固有形状相関を利用して、形状表現の一貫性とコンパクト性を実現する。
我々は、LRANet++と呼ばれるエンドツーエンドテキストスポッティングフレームワークを構築するために、拡張検出モジュールを軽量な認識ブランチに統合する。
論文 参考訳(メタデータ) (2025-11-08T03:08:03Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Decompiling Smart Contracts with a Large Language Model [51.49197239479266]
Etherscanの78,047,845のスマートコントラクトがデプロイされているにも関わらず(2025年5月26日現在)、わずか767,520 (1%)がオープンソースである。
この不透明さは、オンチェーンスマートコントラクトバイトコードの自動意味解析を必要とする。
バイトコードを可読でセマンティックに忠実なSolidityコードに変換する,先駆的な逆コンパイルパイプラインを導入する。
論文 参考訳(メタデータ) (2025-06-24T13:42:59Z) - Secret Breach Prevention in Software Issue Reports [4.177725820146491]
機密情報の 偶然の暴露は セキュリティの脅威の増大だ
この研究は、大規模な分析とGitHub問題における公開シークレットの実用的な検出パイプラインによるギャップを埋めるものだ。
GitHubの公開イシューから54,148のインスタンスのベンチマークを構築しました。
論文 参考訳(メタデータ) (2024-10-31T06:14:17Z) - Speech privacy-preserving methods using secret key for convolutional neural network models and their robustness evaluation [5.762345156477736]
信頼できないサードパーティがCNNベースのシステムを提供している環境では、音声クエリのプライバシが不可欠である。
本稿では,秘密鍵を用いた音声クエリの暗号化手法を提案する。
論文 参考訳(メタデータ) (2024-08-07T16:51:39Z) - Improving the Robustness of Summarization Systems with Dual Augmentation [68.53139002203118]
頑健な要約システムは、入力中の特定の単語の選択やノイズに関わらず、文書のギストをキャプチャできるべきである。
まず,単語レベルの同義語置換や雑音を含む摂動に対する要約モデルの頑健性について検討する。
SummAttackerを提案する。これは言語モデルに基づく対数サンプルを生成するための効率的な手法である。
論文 参考訳(メタデータ) (2023-06-01T19:04:17Z) - Spatial-Frequency Discriminability for Revealing Adversarial Perturbations [53.279716307171604]
敵の摂動に対するディープニューラルネットワークの脆弱性は、コンピュータビジョンコミュニティで広く認識されている。
現在のアルゴリズムは、通常、自然および敵対的なデータの識別的分解を通じて、敵のパターンを検出する。
空間周波数Krawtchouk分解に基づく識別検出器を提案する。
論文 参考訳(メタデータ) (2023-05-18T10:18:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。