論文の概要: Agentic Repository Mining: A Multi-Task Evaluation
- arxiv url: http://arxiv.org/abs/2605.04845v1
- Date: Wed, 06 May 2026 12:43:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.815665
- Title: Agentic Repository Mining: A Multi-Task Evaluation
- Title(参考訳): エージェントリポジトリマイニング:マルチタスク評価
- Authors: Johannes Härtel,
- Abstract要約: ソフトウェアリポジトリをマイニングするには、コミット、レビュー、コード行、リポジトリ全体といったアーティファクトをカテゴリに分類する必要があることが多い。
標準的なbashコマンドでレポジトリを動的に探索するLLMエージェントが,プレエンジニアリングコンテキストを受信する単純なLLMの分類品質に適合するかどうかを検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mining software repositories often requires classifying artifacts like commits, reviews, code lines, or entire repositories into categories. Human labeling is expensive and error-prone; limited context frequently leads to misclassifications or uncertainty in labels. We investigate whether LLM agents that dynamically explore repositories through standard bash commands can match the classification quality of simple LLMs that receive pre-engineered context. Across four tasks, eight approach configurations, and 4943 classifications, agents achieve competitive accuracy despite retrieving their own context. The primary advantage is robustness: agents avoid context-window overflows and scale independently of artifact size. A manual diagnosis of 100 cases where approaches disagree with the ground truth reveals specification ambiguities and labels produced under limited context, suggesting that accuracy against such ground truth may underestimate approaches with broader context access.
- Abstract(参考訳): ソフトウェアリポジトリをマイニングするには、コミット、レビュー、コード行、リポジトリ全体といったアーティファクトをカテゴリに分類する必要があることが多い。
ヒューマンラベリングは高価でエラーを起こしやすいが、限られたコンテキストはラベルの誤分類や不確実性につながることが多い。
標準的なbashコマンドでレポジトリを動的に探索するLLMエージェントが,プレエンジニアリングコンテキストを受信する単純なLLMの分類品質に適合するかどうかを検討する。
4つのタスク、8つのアプローチ構成、4943の分類において、エージェントは、自身のコンテキストを取得するにもかかわらず、競争精度を達成する。
エージェントはコンテキスト-ウィンドウオーバーフローを避け、アーティファクトサイズとは無関係にスケールする。
根拠的真理と一致しない100例の手動診断では、特定の曖昧さやラベルが限られた文脈で生成され、そのような根拠的真理に対する精度が、より広いコンテキストアクセスによるアプローチを過小評価する可能性があることを示唆している。
関連論文リスト
- When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift [0.0]
有害なリクエスト、ジェイルブレイク、間接的なプロンプトインジェクション、抽出攻撃にまたがる18のデータセットのベンチマークを用いて、包括的な分析を行う。
我々は,真のアウト・オブ・ディストリビューションの一般化を評価するために,LODO(Leave-One-Dataset-Out)評価を提案する。
論文 参考訳(メタデータ) (2026-02-15T14:21:43Z) - Favia: Forensic Agent for Vulnerability-fix Identification and Analysis [5.43098755190303]
脆弱性修正識別のための法医学的エージェントベースのフレームワークであるFaviaを提案する。
Faviaは、スケーラブルな候補ランキングと、深く反復的なセマンティック推論を組み合わせる。
私たちは、実世界の3,708のリポジトリから800万以上のコミットからなる大規模なデータセットであるCVEVC上で、Faviaを評価しました。
論文 参考訳(メタデータ) (2026-02-13T00:51:22Z) - Exploring Semantic Labeling Strategies for Third-Party Cybersecurity Risk Assessment Questionnaires [0.3568466510804538]
第三者リスクアセスメント(英: Third-Party Risk Assessment、TPRA)は、ISO/IECやNISTなどの標準に対してサプライヤーを評価するための中核的なサイバーセキュリティの実践である。
本稿では,セマンティックラベルを用いたTPRAサイバーセキュリティ問題の整理と検索戦略について検討する。
論文 参考訳(メタデータ) (2026-02-09T18:36:50Z) - Instruction Boundary: Quantifying Biases in LLM Reasoning under Various Coverage [34.247904738521136]
異なる命令形式がLLM推論能力をどのように促進するか、それとも誤解を招くかを検討する。
本稿では,インストラクション境界の概念を導入し,異なるレベルのプロンプトカバレッジが推論バイアスにどのように寄与するかを系統的に分析する。
異なる種類の命令境界条件下でスパースラベルを識別するLLMの能力を定量化する統合フレームワークであるBiasDetectorを提案する。
論文 参考訳(メタデータ) (2025-09-24T16:15:26Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Self-Regularization with Sparse Autoencoders for Controllable LLM-based Classification [29.74457390987092]
大規模言語モデル(LLM)潜在空間における意図しない特徴を特定し,規則化する新しいフレームワークを提案する。
本稿では,有毒なチャット検出,報酬モデリング,疾患診断を含む3つの実世界の課題に関する枠組みについて検討する。
論文 参考訳(メタデータ) (2025-02-19T22:27:59Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - Ambiguity-Resistant Semi-Supervised Learning for Dense Object Detection [98.66771688028426]
本研究では,一段階検出器のためのAmbiguity-Resistant Semi-supervised Learning (ARSL)を提案する。
擬似ラベルの分類とローカライズ品質を定量化するために,JCE(Joint-Confidence Estimation)を提案する。
ARSLは、曖昧さを効果的に軽減し、MS COCOおよびPASCALVOC上で最先端のSSOD性能を達成する。
論文 参考訳(メタデータ) (2023-03-27T07:46:58Z) - Dynamic Semantic Matching and Aggregation Network for Few-shot Intent
Detection [69.2370349274216]
利用可能な注釈付き発話が不足しているため、インテント検出は困難である。
セマンティック成分はマルチヘッド自己認識によって発話から蒸留される。
本手法はラベル付きインスタンスとラベルなしインスタンスの両方の表現を強化するための総合的なマッチング手段を提供する。
論文 参考訳(メタデータ) (2020-10-06T05:16:38Z) - Weakly-supervised Salient Instance Detection [65.0408760733005]
本報告では,本問題に対する第1の弱教師付きアプローチを提案する。
本稿では,候補対象の特定にクラス整合性情報を活用するSaliency Detection Branch,オブジェクト境界をデライン化するためにクラス整合性情報を利用するBundary Detection Branch,サブティナイズ情報を用いたCentroid Detection Branchを提案する。
論文 参考訳(メタデータ) (2020-09-29T09:47:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。