論文の概要: RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation
- arxiv url: http://arxiv.org/abs/2606.16113v1
- Date: Mon, 15 Jun 2026 02:06:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.034098
- Title: RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation
- Title(参考訳): RecourseBench: 再現可能なアルゴリズムによるリコース評価のためのモジュールフレームワーク
- Authors: Zahra Khotanlou, Hashir Ahmed, Chenghao Tan, Ahmed Abdelaal, Amir-Hossein Karimi,
- Abstract要約: emphRecourseBenchは,3つのコミットメント,モジュール性,対話性を中心に構築された,統一的な評価フレームワークである。
我々のフレームワークは28の最先端のrecourseメソッドを統合し、私たちの知る限り、メソッドレベルの統合を明示的に実施する最初のrecourseベンチマークを構成します。
- 参考スコア(独自算出の注目度): 4.179418674608145
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Algorithmic recourse methods provide counterfactual explanations that inform individuals of the actions required to overturn an unfavorable model decision. Despite rapid methodological progress, principled comparison remains elusive; existing frameworks are often difficult to extend and lack both interoperability and systematic verification that integrated methods faithfully reproduce their originally reported results. We introduce \emph{RecourseBench}, a unified evaluation framework built around three commitments namely, modularity, reproducibility, and interactivity. The framework decomposes the pipeline into five fully decoupled layers -- Data, Preprocessing, Model, Recourse Method, and Evaluation -- governed by abstract interfaces and a dynamic registry. To address the reproducibility gap in prior benchmarks, we introduce a four-tier classification system in which every integrated method is validated by an automated test suite against its originally reported results. We further provide an interactive web interface for flexible, configuration-driven comparison across methods, datasets, and model architectures. Our framework currently integrates 28 state-of-the-art recourse methods and, to our knowledge, constitutes the first recourse benchmark to explicitly enforce method-level reproducibility through automated, quantitative testing.
- Abstract(参考訳): アルゴリズム的リコース法は、好ましくないモデル決定を覆すために必要なアクションを個人に通知する反事実的説明を提供する。
既存のフレームワークは、しばしば拡張が困難であり、相互運用性と体系的な検証が欠如しており、統合されたメソッドは、最初に報告された結果を忠実に再現する。
我々は,モジュール性,再現性,相互作用性という三つのコミットメントを中心に構築された統一評価フレームワークである \emph{RecourseBench} を紹介した。
このフレームワークは、パイプラインを5つの完全に分離されたレイヤ – データ、前処理、モデル、リコースメソッド、評価 – に分解し、抽象インターフェースと動的レジストリによって管理される。
従来のベンチマークにおける再現性ギャップに対処するため,本研究では,すべての統合手法を自動テストスイートで検証する4層分類システムを導入する。
さらに私たちは、メソッド、データセット、モデルアーキテクチャ間のフレキシブルで構成駆動的な比較のためのインタラクティブなWebインターフェースを提供しています。
我々のフレームワークは現在28の最先端のリコースメソッドを統合しており、私たちの知る限り、自動的かつ定量的なテストを通じてメソッドレベルの再現性を明示的に実施する最初のリコースベンチマークを構成しています。
関連論文リスト
- UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities [70.79422099851506]
対話型AIシステム評価のための統合評価ツールキットUniDial-EvalKit(UDE)を提案する。
UDEは異種データフォーマットを普遍的なスキーマに標準化し、モジュールアーキテクチャを通じて複雑な評価パイプラインを合理化し、一貫したスコアリングインターフェースの下でメートル法計算を調整する。
論文 参考訳(メタデータ) (2026-03-24T13:01:31Z) - Procrustean Bed for AI-Driven Retrosynthesis: A Unified Framework for Reproducible Evaluation [0.0]
RetroCastは、異種モデルの出力を共通スキーマに標準化する統合評価スイートである。
我々は、新しい標準ベンチマークスイートを用いて、検索ベースおよびシーケンスベースの主要なアルゴリズムを評価する。
論文 参考訳(メタデータ) (2025-12-08T01:26:39Z) - CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning [67.18702329644526]
CoT Referringは、構造化されたチェーン・オブ・シークレット・トレーニングデータ構造を通じて、モデル推論をモダリティにわたって強化する。
トレーニングデータを再構築して、新たな出力フォームを実行し、既存のデータセットに新たなアノテーションを提供します。
また、検出とセグメント化機能を統合MLLMフレームワークに統合し、新しい適応重み付き損失で学習して性能を最適化する。
論文 参考訳(メタデータ) (2025-10-03T08:50:21Z) - SMLE: Safe Machine Learning via Embedded Overapproximation [4.129133569151574]
本研究は,デザイナ・ちょうせん特性を満たすことが保証される識別可能なMLモデルを訓練する作業について考察する。
現代のニューラルモデルにおけるコンプライアンスの厳格な検証と実施という計算複雑性のため、これは非常に難しい。
1)保守的なセマンティクスによる効率的な検証を可能にする汎用的,シンプルなアーキテクチャ。
回帰における線形不等式によって定義される特性と、多重ラベル分類における相互排他的クラスに対するアプローチを評価する。
論文 参考訳(メタデータ) (2024-09-30T17:19:57Z) - OSM: Leveraging Model Checking for Observing Dynamic 1 behaviors in
Aspect-Oriented Applications [0.0]
観測ベース統計モデルチェック(OSM)フレームワークは、基本的なシステムコードから直接実行可能な形式モデルを構築するために開発された。
これにより、プリコンディションシフト中の電子健康記録システムの未収量性能が保証される。
論文 参考訳(メタデータ) (2024-03-03T00:03:34Z) - Diffusion Action Segmentation [63.061058214427085]
本稿では,このような反復的洗練の本質的な精神を共用した拡散モデルによる新しい枠組みを提案する。
このフレームワークでは、入力された映像の特徴を条件としてランダムノイズから行動予測を反復的に生成する。
論文 参考訳(メタデータ) (2023-03-31T10:53:24Z) - Understanding and Constructing Latent Modality Structures in Multi-modal
Representation Learning [53.68371566336254]
優れたパフォーマンスの鍵は、完全なモダリティアライメントではなく、有意義な潜在モダリティ構造にある、と我々は主張する。
具体的には,1)モダリティ内正規化のための深い特徴分離損失,2)モダリティ間正規化のためのブラウン橋損失,3)モダリティ内正規化およびモダリティ間正規化のための幾何学的整合損失を設計する。
論文 参考訳(メタデータ) (2023-03-10T14:38:49Z) - Relational Action Bases: Formalization, Effective Safety Verification,
and Invariants (Extended Version) [67.99023219822564]
我々はリレーショナルアクションベース(RAB)の一般的な枠組みを紹介する。
RABは両方の制限を解除することで既存のモデルを一般化する。
データ対応ビジネスプロセスのベンチマークにおいて、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2022-08-12T17:03:50Z) - Topic-Controllable Summarization: Topic-Aware Evaluation and Transformer Methods [4.211128681972148]
Topic-controllable summarization(トピック制御可能な要約)は、幅広い潜在的応用を持つ新興の研究分野である。
本研究は,生成した要約を自動的に評価する話題指向評価尺度を提案する。
さらに,強力なトランスフォーマーアーキテクチャを扱うためにトピック埋め込みを適用し,制御トークンによる要約生成を導くための,新しい,効率的なアプローチを提案する。
論文 参考訳(メタデータ) (2022-06-09T07:28:16Z) - fairlib: A Unified Framework for Assessing and Improving Classification
Fairness [66.27822109651757]
Fairlibは、分類の公平さを評価し改善するためのオープンソースのフレームワークである。
我々は、前処理、訓練時間、後処理を含む14のデバイアス化手法を実装した。
組み込まれたメトリクスは、最も一般的に使用されるフェアネス基準をカバーし、フェアネス評価のためにさらに一般化およびカスタマイズすることができる。
論文 参考訳(メタデータ) (2022-05-04T03:50:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。