論文の概要: AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets
- arxiv url: http://arxiv.org/abs/2607.15781v2
- Date: Fri, 24 Jul 2026 07:58:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:30.764517
- Title: AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets
- Title(参考訳): AgentFAIR: 地理空間データセットのFAIRness評価のための多言語協調フレームワーク
- Authors: Ming Chen, Pranav Pai,
- Abstract要約: 本稿では,構造抽出とサブプリンシプル固有評価器を組み合わせたマルチエージェントフレームワークであるAgentFAIRを提案する。
それぞれが0-3の成熟度スコア、エビデンス、レコメンデーションを生成します。
15データセットの専門家による予備的な研究では、フライスのカッパは0.71で、82%が専門家のコンセンサスと一致している。
- 参考スコア(独自算出の注目度): 4.193537335690018
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Geospatial datasets support applications from urban planning to climate modeling, yet consistent assessment of FAIR compliance is difficult. Existing evaluators use different rubrics and evidence sources and may fail on JavaScript-rendered pages or repository-specific identifiers. For 50 datasets from 10 repositories, the standard deviation of normalized scores across available tools averages 15.0 percentage points and reaches 30.3 for one dataset. Because these outputs are not equivalent measurements, we use them to characterize disagreement and failure modes, not comparative accuracy. We present AgentFAIR, a multi-agent framework combining structured metadata extraction with 13 sub-principle-specific LLM evaluators. Each produces a 0-3 maturity score, cited evidence, and recommendations; a critic checks evidence and consistency and can request targeted re-evaluation. Mean Findability, Accessibility, Interoperability, and Reusability scores are 79.7%, 70.4%, 45.3%, and 72.0%. Rank correlations with four baseline tools range from 0.31 to 0.61; the FAIR-enough comparison is not statistically significant. On a 10-dataset repeated-run subset, sub-principle agreement averages 89% (standard deviation: 3 percentage points), versus 71% without the critic. A preliminary 15-dataset expert study yields Fleiss' kappa of 0.71 and 82% alignment with expert consensus. API cost is approximately USD 0.054 per dataset. These results support auditability and feasibility, while the limited benchmark, incomplete ablations, and single-model-family validation constrain claims about accuracy and generalization.
- Abstract(参考訳): 地理空間データセットは、都市計画から気候モデリングまでアプリケーションをサポートするが、FAIRコンプライアンスの一貫性のある評価は難しい。
既存の評価者は異なるルーリックやエビデンスソースを使用しており、JavaScriptでレンダリングされたページやリポジトリ固有の識別子で失敗する可能性がある。
10のリポジトリから50のデータセットに対して、利用可能なツール間での正規化スコアの標準偏差は平均15.0ポイントであり、1つのデータセットで30.3に達する。
これらの出力は等価な測定値ではないので、比較精度ではなく、不一致と失敗モードの特徴付けに使用する。
本稿では,構造化メタデータ抽出と13のサブプリンシプル固有LLM評価器を組み合わせたマルチエージェントフレームワークであるAgentFAIRを提案する。
それぞれが0-3の成熟度スコア、引用されたエビデンス、レコメンデーションを生成し、エビデンスと一貫性を確認し、ターゲットの再評価を要求することができる。
平均ファインダビリティ、アクセシビリティ、インターオペラビリティ、リユースビリティのスコアは79.7%、70.4%、45.3%、そして72.0%である。
4つの基準ツールとのランク相関は0.31から0.61であり、FAIR-enough比較は統計的に有意ではない。
10データセットの繰り返し実行サブセットでは、サブプリンシプル合意は平均89%(標準偏差:3ポイント)であり、批判なしでは71%である。
15データセットの専門家による予備的な研究では、フライスのカッパは0.71で、82%が専門家のコンセンサスと一致している。
APIコストはデータセットあたり約0.054米ドルである。
これらの結果はオーディビリティと実現可能性をサポートし、一方、限られたベンチマーク、不完全な改善、単一モデル固有の検証は精度と一般化について主張する。
関連論文リスト
- ACCORD: Action-Conditioned Contextual Grounding for Language Agents [69.73525608707764]
ACCORD(Action-Conditioned Contextual Grounding)は、適応的なグラウンドのためのエージェントフレームワークである。
現状のエージェントは、しばしばそうすることができないことを示す。それらは、観察された特定の情報よりもむしろ仮定から行動し、収集した可能性のある情報を見落とし、既に返された証拠を組み込むことに失敗する。
論文 参考訳(メタデータ) (2026-06-15T09:05:55Z) - Architecture-Adaptive Uncertainty Fusion for Deepfake Detection [0.9940728137241215]
ディープフェイク検出システムはベンチマーク上でほぼ完璧な精度を達成するが、法医学的な展開は信頼性の高い予測の不確実性を要求する。
我々は,5つの相補的不確実性源を融合するアーキテクチャ適応型フレームワークである相関d Fusion(COF)を提案する。
COFは5モデルディープ・アンサンブルの20-45hに対し、モデル変更は必要とせず、重量最適化は42秒しか必要としなかった。
論文 参考訳(メタデータ) (2026-06-04T19:28:55Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline [2.4832413743954618]
本稿では,AI会議要約をインスタンス化した,生成型AIアプリケーションのための再利用可能な評価パイプラインを提案する。
このシステムは、ソースの取り込み、構造化された参照構成、候補生成、構造化されたスコアリング、レポートの5段階にわたるタスク固有のセマンティクスから再利用可能なオーケストレーションを分離する。
オフラインループをCity_council, private_data, whitehouse_press_briefingsにまたがる114のミーティングの型付きデータセットでベンチマークする。
論文 参考訳(メタデータ) (2026-04-23T07:02:11Z) - Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - EdgeJury: Cross-Reviewed Small-Model Ensembles for Truthful Question Answering on Serverless Edge Inference [0.0]
EdgeJuryは、真実性と堅牢性を改善する軽量アンサンブルフレームワークです。
TruthfulQA (MC1)では、EdgeJuryの精度は76.2%である。
200-question adversarial EdgeCasesセットでは、EdgeJuryは+48.2%の利得を得る。
論文 参考訳(メタデータ) (2025-12-29T14:48:40Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits [31.98028879922584]
SummExecEditという新しいパイプラインとベンチマークを導入し、実際のエラーを検知し、正確な説明を提供する能力についてモデルを評価する。
トップパフォーマンスモデルであるClaude3-Opusは、ベンチマークでわずか0.49のジョイント検出と説明スコアを達成している。
説明ミスの4つの主要なタイプを特定し、その45.4%は、要約の完全に無関係な部分に焦点を当てている。
論文 参考訳(メタデータ) (2024-12-17T23:26:44Z) - Tool-Augmented Reward Modeling [58.381678612409]
本稿では,外部環境へのアクセスによるRMの強化により,制約に対処するツール拡張された嗜好モデリング手法であるThemisを提案する。
我々の研究は、外部ツールをRMに統合し、様々な外部ソースとの相互作用を可能にすることを目的としている。
人間の評価では、テミスで訓練されたRLHFはベースラインと比較して平均32%の勝利率を得る。
論文 参考訳(メタデータ) (2023-10-02T09:47:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。