論文の概要: Sustainability of Open-Source Machine Learning Robustness Assessment Tools: A Repository Mining Study
- arxiv url: http://arxiv.org/abs/2608.28396v1
- Date: Fri, 28 Aug 2026 14:49:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.369065
- Title: Sustainability of Open-Source Machine Learning Robustness Assessment Tools: A Repository Mining Study
- Title(参考訳): オープンソースの機械学習ロバストネス評価ツールの持続可能性:リポジトリマイニング研究
- Authors: Joshua Owotogbe, Indika Kumara, Willem-Jan van den Heuvel, Damian Tamburri,
- Abstract要約: 本稿では,オープンソースのロバストネスツールエコシステムに関する実証的研究を紹介する。
私たちの結果は、エンゲージメントとメンテナンスが不均一に分散していることを示している。
これらの知見は、堅牢性ツールを進化するソフトウェアシステムとして扱う必要性を浮き彫りにしている。
- 参考スコア(独自算出の注目度): 0.19999259391104388
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robustness evaluation is essential for deploying machine-learning (ML) systems in real-world settings, where models may face adversarial perturbations, distribution shifts, and other operational stressors. Many open-source tools, including Adversarial Robustness Toolbox, Foolbox, and Robustness Gym, support robustness testing and evaluation. However, little is known about how these tools are maintained, publicly engaged with, and sustained over time, even though practitioners may rely on them to select evaluation dependencies, reproduce robustness assessments, and provide evidence for AI assurance. We present an empirical study of the open-source robustness tooling ecosystem. Starting from a curated seed set derived from prior work, we systematically searched GitHub and identified 28 robustness-tool repositories. We analyzed repository artifacts to characterize observable community engagement, maintenance activity, and project longevity using established software-engineering metrics. Our results show that engagement and maintenance are unevenly distributed, with sustained activity concentrated in a small subset of repositories. At the data collection date of January 21, 2026, five repositories were classified as active, 22 as inactive, and one as archived. These findings highlight the need to treat robustness tools as evolving software systems.
- Abstract(参考訳): 機械学習(ML)システムを現実の環境で展開するには、ロバストネスの評価が不可欠である。
Adversarial Robustness Toolbox, Foolbox, Robustness Gymなど,多くのオープンソースツールが堅牢性テストと評価をサポートしている。
しかし、これらのツールがどのように維持され、公開され、持続されるかについてはほとんど分かっていない。しかし、実践者は、依存を評価し、堅牢性の評価を再現し、AI保証の証拠を提供するためにそれらに依存するかもしれない。
本稿では,オープンソースのロバストネスツールエコシステムに関する実証的研究を紹介する。
以前の作業から得られたキュレートされたシードセットから、GitHubを体系的に検索し、28のロバストネスツールリポジトリを特定しました。
我々は,既存のソフトウェアエンジニアリング指標を用いて,観測可能なコミュニティエンゲージメント,メンテナンス活動,プロジェクト長寿を特徴付けるために,リポジトリアーティファクトを分析した。
この結果から,エンゲージメントとメンテナンスは不均一に分散しており,持続的な活動はリポジトリの小さなサブセットに集中していることがわかった。
2026年1月21日のデータ収集では5つのリポジトリがアクティブに、22は非アクティブに、1つはアーカイブに分類された。
これらの知見は、堅牢性ツールを進化するソフトウェアシステムとして扱う必要性を浮き彫りにしている。
関連論文リスト
- SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents [64.59100414726556]
大規模言語モデル(LLM)エージェントは、コンテキスト、ツール、マルチターン実行を管理するハーネスに依存している。
Retrieval-augmented Tool selectionは、自然な代替手段を提供するが、既存のワンショット検索方法は、独立したツール記述とエージェントの真のタスク意図との整合に失敗する。
我々は、ユーザ意図、ツール機能、ツールコラボレーションパターンをリンクするインテントツーオールグラフを構築する、意図認識型のアクティブツール発見フレームワークであるSINGを提案する。
論文 参考訳(メタデータ) (2026-06-15T11:37:37Z) - EvolveTool-Bench: Evaluating the Quality of LLM-Generated Tool Libraries as Software Artifacts [0.0]
ソフトウェア工学におけるツールライブラリの診断ベンチマークであるEvolveToolBenchを紹介する。
ライブラリレベルのソフトウェア品質メトリクス -- 再利用、冗長性、コンポジションの成功、回帰、安全性 -- を定義します。
課題完了度が類似したシステムでは,図書館の健康状態が最大18%異なっており,タスクのみの評価ではソフトウェア品質のリスクが見えないことが明らかとなった。
論文 参考訳(メタデータ) (2026-04-01T02:21:55Z) - Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents [22.64138018985385]
我々は、失敗は、ツール使用精度(エージェントがどのようにツールを呼び出すか)と固有のツール精度(ツール自身の正確性)の両方から生じると論じている。
ツールスキーマを標準化するコミュニティ主導のツールボックスであるOpenToolsを紹介します。
OpenToolsには、コアフレームワーク、初期ツールセット、評価パイプライン、コントリビューションプロトコルが含まれている。
論文 参考訳(メタデータ) (2026-03-31T18:42:36Z) - FeatureBench: Benchmarking Agentic Coding for Complex Feature Development [42.26354337364403]
FeatureBenchは、エンドツーエンドのフィーチャ指向ソフトウェア開発におけるエージェントコーディングのパフォーマンスを評価するために設計されたベンチマークである。
実行ベースの評価プロトコルと、人間の最小限の労力でコードリポジトリからタスクを自動的に引き出す、スケーラブルなテスト駆動メソッドが組み込まれている。
実証的な評価により、クロード4.5オプスのような最先端のエージェントモデルがSWEベンチで74.4%の解決率を達成することが明らかになった。
論文 参考訳(メタデータ) (2026-02-11T16:06:32Z) - Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments [70.42705564227548]
大規模言語モデル(LLM)のための環境自動構築パイプラインを提案する。
これにより、外部ツールに頼ることなく、詳細な測定可能なフィードバックを提供する高品質なトレーニング環境の作成が可能になる。
また、ツール使用の精度とタスク実行の完全性の両方を評価する検証可能な報酬機構も導入する。
論文 参考訳(メタデータ) (2025-08-12T09:45:19Z) - Predicting Abandonment of Open Source Software Projects with An Integrated Feature Framework [15.50732865972961]
オープンソースソフトウェア(OSS)は、現代のソフトウェア開発の基盤であるが、OSSプロジェクトの放棄が増加し、世界的なサプライチェーンが脅かされている。
本研究では,OSSプロジェクトの放棄を2つのアプローチで確実に検出することで,これらの課題に対処する。
この基盤の上に構築され、ユーザ中心、メンテナ中心、プロジェクトの進化的特徴をキャプチャする、放棄予測のための統合されたマルチパースペクティブな機能フレームワークを導入します。
私たちの仕事は、大規模なOSSエコシステムにおける放棄リスクを理解し管理するための再現性、拡張性、実践者指向のサポートを提供します。
論文 参考訳(メタデータ) (2025-07-29T10:45:24Z) - Aurora: Are Android Malware Classifiers Reliable and Stable under Distribution Shift? [51.12297424766236]
AURORAは、その信頼性と運用上のレジリエンスに基づいて、マルウェア分類器を評価するためのフレームワークである。
AURORAは、ポイント・イン・タイムのパフォーマンスを超えるように設計されたメトリクスのセットによって補完される。
さまざまなドリフトのデータセットにわたるSOTAフレームワークの脆弱性は、ホワイトボードへの復帰の必要性を示唆している。
論文 参考訳(メタデータ) (2025-05-28T20:22:43Z) - RGRecSys: A Toolkit for Robustness Evaluation of Recommender Systems [100.54655931138444]
複数の次元を包含するレコメンダシステムに対して,ロバスト性に関するより包括的視点を提案する。
本稿では、RecSys用のロバストネス評価ツールキットRobustness Gymを紹介し、リコメンダシステムモデルのロバストネスを迅速かつ均一に評価できるようにする。
論文 参考訳(メタデータ) (2022-01-12T10:32:53Z) - Uncertainty Toolbox: an Open-Source Library for Assessing, Visualizing,
and Improving Uncertainty Quantification [15.35099402481255]
Uncertainty Toolboxは、不確実性定量化を評価し、視覚化し、改善するのに役立つpythonライブラリである。
また、重要な用語の用語集や、重要な論文参照の組織化されたコレクションなど、教育的なリソースも提供する。
論文 参考訳(メタデータ) (2021-09-21T15:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。