論文の概要: Class Imbalance and Batch Effects in LLM-Based Screening for Systematic Reviews
- arxiv url: http://arxiv.org/abs/2608.14737v1
- Date: Thu, 13 Aug 2026 09:48:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.05807
- Title: Class Imbalance and Batch Effects in LLM-Based Screening for Systematic Reviews
- Title(参考訳): システムレビューのためのLLMスクリーニングにおけるクラス不均衡とバッチ効果
- Abstract要約: その結果,有病率メタデータの影響は限定的であり,性能向上の証拠は得られなかった。
バッチ処理は、クラスの頻度に応じて変化する大きな行動変化を引き起こしました。
- 参考スコア(独自算出の注目度): 0.29737220923371155
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This study analyses LLMs in imbalanced binary classification, using study screening in systematic reviews as the application domain. An experiment was conducted in five reviews, comparing individual and batch processing, with and without prevalence metadata. The results indicate a limited influence of the prevalence metadata, with no evidence that it improves performance. In contrast, batch processing produced larger behavioral changes that varied according to the prevalence of the class. The aggregate and item-level analyses did not always coincide. Therefore, batch processing should be evaluated not only in terms of cost, but also in relation to its effects on decision-making behavior.
- Abstract(参考訳): 本研究では,非平衡二分分類におけるLCMを,体系的レビューにおける研究スクリーニングを応用領域として分析する。
個人とバッチ処理を比較した5つのレビューで実験を行った。
その結果,有病率メタデータの影響は限定的であり,性能向上の証拠は得られなかった。
対照的に、バッチ処理は、クラスの頻度に応じて変化する大きな行動変化を生み出した。
集計と項目レベルの分析は必ずしも一致しなかった。
したがって、バッチ処理はコストだけでなく、意思決定行動への影響も評価すべきである。
関連論文リスト
- Beyond Accuracy: LLM Variability in Evidence Screening for Software Engineering SLRs [0.29737220923371155]
大規模言語モデル(LLM)は、体系的な文献レビューにおいて、スクリーニングの研究に使用される。
急速な取り込みにもかかわらず、そのようなモデルが研究スクリーニングフェーズでどのように振る舞うかは限定的な証拠である。
本研究では,LLMの性能に及ぼす入力メタデータ(抽出,タイトル,キーワード)の影響について検討した。
論文 参考訳(メタデータ) (2026-04-29T08:55:16Z) - Testing Effect Homogeneity and Confounding in High-Dimensional Experimental and Observational Studies [0.552480439325792]
本研究では, 条件付き平均処理効果(CATE)の均一性をテストするためのフレームワークを提案する。
提案手法は複数のランダム化試行を利用して, 治療効果が, 試験によって異なる不均一性と異なるかどうかを評価する。
論文 参考訳(メタデータ) (2026-02-23T10:52:39Z) - Assessment of the conditional exchangeability assumption in causal machine learning models: a simulation study [0.31498833540989407]
条件交換可能性違反による因果機械学習モデルの性能評価と負の制御結果(NCO)の有用性について検討した。
サンプルサイズ,NCOコンファウンディング構造が異なる実世界のシナリオを再現するために,データをシミュレートした。
論文 参考訳(メタデータ) (2025-10-30T17:05:57Z) - Fluid Language Model Benchmarking [126.92394365620525]
我々は,複数の次元にわたるLMベンチマークを進展させる新しい評価手法であるFluid Benchmarkingを紹介する。
サイコメトリックスにインスパイアされたFluid Benchmarkingは、ベンチマーク項目の相対値がLMの能力レベルに依存するという洞察に基づいている。
効率性,妥当性,分散性,飽和性の4つの次元を検証した結果,Fluid Benchmarkingがすべてにおいて優れた性能を発揮することがわかった。
論文 参考訳(メタデータ) (2025-09-14T05:49:42Z) - Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference [63.03859517284341]
自動評価フレームワークは、人間の嗜好との整合性に基づいてLLMをランク付けすることを目的としている。
自動LLMベンチラは、入力セット、評価モデル、評価タイプ、集約方法の4つのコンポーネントから構成される。
論文 参考訳(メタデータ) (2024-12-31T17:46:51Z) - Evaluating Interventional Reasoning Capabilities of Large Language Models [58.52919374786108]
大規模言語モデル(LLM)は意思決定タスクを自動化するために使用される。
本稿では,LPMが介入に応じてデータ生成プロセスの知識を正確に更新できるかどうかを評価する。
さまざまな因果グラフ(例えば、コンバウンディング、仲介)と変数タイプにまたがるベンチマークを作成します。
これらのベンチマークにより、LLMが事実を記憶したり、他のショートカットを見つけたりすることで、変化を正確に予測する能力を切り離すことができます。
論文 参考訳(メタデータ) (2024-04-08T14:15:56Z) - Causal Machine Learning for Moderation Effects [0.0]
我々は,グループ平均治療効果(GATE)を測定する新しいパラメータBGATEを提案する。
主な推定戦略は、未確立の環境での個別処理のための二重/退化機械学習に基づいている。
本稿では,自動脱バイアス機械学習と特定の再重み付け手法の2つの方法を提案する。
論文 参考訳(メタデータ) (2024-01-16T11:34:59Z) - A Unified Generalization Analysis of Re-Weighting and Logit-Adjustment
for Imbalanced Learning [129.63326990812234]
そこで本研究では,データ依存型コンダクタンス(Data-dependent contraction)と呼ばれる手法を提案する。
この技術に加えて、不均衡学習のための微粒な一般化境界が確立され、再重み付けとロジット調整の謎を明らかにするのに役立つ。
論文 参考訳(メタデータ) (2023-10-07T09:15:08Z) - Achieving Reliable and Fair Skin Lesion Diagnosis via Unsupervised Domain Adaptation [43.1078084014722]
教師なしドメイン適応(UDA)は、信頼性の高い分類器を開発するために、大きな外部データセットを統合することができる。
UDAは少数派に対する偏見を効果的に軽減し、診断システムの公平性を高めることができる。
論文 参考訳(メタデータ) (2023-07-06T17:32:38Z) - Systematic Evaluation of Predictive Fairness [60.0947291284978]
バイアス付きデータセットのトレーニングにおけるバイアスの緩和は、重要なオープンな問題である。
複数のタスクにまたがる様々なデバイアス化手法の性能について検討する。
データ条件が相対モデルの性能に強い影響を与えることがわかった。
論文 参考訳(メタデータ) (2022-10-17T05:40:13Z) - Learning to Infer Counterfactuals: Meta-Learning for Estimating Multiple
Imbalanced Treatment Effects [41.06974193338288]
本稿では,治療群間のデータエピソードをメタラーニングタスクとみなす。
そこで本研究では,ソース処理グループから十分なサンプルを用いてメタラーナーを訓練し,対象治療における限られたサンプルによる勾配降下によるモデル更新を行う。
実世界の2つのデータセットの実験を行い、推測精度と一般化能力を評価する。
論文 参考訳(メタデータ) (2022-08-13T23:22:12Z) - Comparison of meta-learners for estimating multi-valued treatment
heterogeneous effects [2.294014185517203]
条件平均処理効果(CATE)の推定は、観測データによる因果推論における主な課題の1つである。
メタラーナーと呼ばれる非パラメトリック推定器は、特定の教師付き学習方法に対する推定を抑えない主な利点として、CATEを推定するために開発された。
本稿では,多値処理の異種効果を推定するためのメタラーナーについて検討する。
論文 参考訳(メタデータ) (2022-05-29T16:46:21Z) - Performance Evaluation of Adversarial Attacks: Discrepancies and
Solutions [51.8695223602729]
機械学習モデルの堅牢性に挑戦するために、敵対攻撃方法が開発されました。
本稿では,Piece-wise Sampling Curving(PSC)ツールキットを提案する。
psc toolkitは計算コストと評価効率のバランスをとるオプションを提供する。
論文 参考訳(メタデータ) (2021-04-22T14:36:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。