論文の概要: Can Large Language Models Detect Methodological Flaws? Evidence from Gesture Recognition for UAV-Based Rescue Operation Based on Deep Learning
- arxiv url: http://arxiv.org/abs/2604.14161v1
- Date: Mon, 23 Mar 2026 11:39:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.685907
- Title: Can Large Language Models Detect Methodological Flaws? Evidence from Gesture Recognition for UAV-Based Rescue Operation Based on Deep Learning
- Title(参考訳): 大規模言語モデルは方法論的欠陥を検出できるか? 深層学習に基づくUAVによる救助活動におけるジェスチャー認識からの証拠
- Authors: Domonkos Varga,
- Abstract要約: 我々は、人間中心の小さなデータセット上で、ほぼ完璧な精度を報告しているジェスチャー認識紙を分析した。
評価プロトコルは、非独立的なトレーニングとテストの分割により、主観レベルのデータ漏洩と整合性を示す。
次に、この欠陥が6つの最先端LCMによって独立に検出できるかどうかを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable evaluation is essential in machine learning research, yet methodological flaws-particularly data leakage-continue to undermine the validity of reported results. In this work, we investigate whether large language models (LLMs) can act as independent analytical agents capable of identifying such issues in published studies. As a case study, we analyze a gesture-recognition paper reporting near-perfect accuracy on a small, human-centered dataset. We first show that the evaluation protocol is consistent with subject-level data leakage due to non-independent training and test splits. We then assess whether this flaw can be detected independently by six state-of-the-art LLMs, each analyzing the original paper without prior context using an identical prompt. All models consistently identify the evaluation as flawed and attribute the reported performance to non-independent data partitioning, supported by indicators such as overlapping learning curves, minimal generalization gap, and near-perfect classification results. These findings suggest that LLMs can detect common methodological issues based solely on published artifacts. While not definitive, their consistent agreement highlights their potential as complementary tools for improving reproducibility and supporting scientific auditing.
- Abstract(参考訳): 信頼性評価は、機械学習研究において不可欠であるが、特に、報告された結果の妥当性を損なうために、方法論的な欠陥、特にデータ漏洩の継続が重要である。
本研究では,大規模言語モデル(LLM)が,そのような問題を識別できる独立した分析エージェントとして機能するかどうかを検討する。
ケーススタディでは、人間中心の小さなデータセット上で、ほぼ完璧な精度を報告したジェスチャー認識紙を分析した。
評価プロトコルは、非独立的なトレーニングとテストの分割により、主観レベルのデータ漏洩と整合性を示す。
次に,この欠陥を6つの最先端LCMで独立に検出できるかどうかを,それぞれ同一のプロンプトを用いて,事前の文脈を使わずに解析する。
全てのモデルは、その評価を一貫して欠陥と認識し、報告された性能を、重複学習曲線、最小の一般化ギャップ、ほぼ完全な分類結果などの指標によって支えられる非独立なデータ分割に属性付ける。
これらの結果から, LLMは, 公表された成果物のみに基づいて, 一般的な方法論的問題を検出できることが示唆された。
決定的ではないが、彼らの一貫した合意は再現性を改善し、科学的監査をサポートするための補完的なツールとしての可能性を強調している。
関連論文リスト
- On the Evaluation Protocol of Gesture Recognition for UAV-based Rescue Operation based on Deep Learning: A Subject-Independence Perspective [0.0]
本報告では,フレームレベルのランダム・トレイン・テスト・スプリットによるほぼ完全精度の測定結果について述べる。
この評価は、目に見えない個人に対する一般化を測るものではないことを実証する。
論文 参考訳(メタデータ) (2026-02-19T21:37:42Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - Towards Consistent Detection of Cognitive Distortions: LLM-Based Annotation and Dataset-Agnostic Evaluation [2.699704259580951]
テキストに基づく自動認知歪み検出は、主観的な性質のため難しい課題である。
一貫性のある信頼性のあるアノテータとしてLarge Language Models (LLM)の使用について検討する。
論文 参考訳(メタデータ) (2025-11-03T11:45:26Z) - Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check [60.77691669644931]
本研究では,非学習モデルと参照モデル間の分布類似度を測定する新しい尺度であるFADE(Functional Alignment for Distributional Equivalence)を提案する。
FADEは出力分布全体の機能的アライメントをキャプチャし、真の未学習の原則的評価を提供する。
これらの知見は、現在の評価実践における根本的なギャップを明らかにし、FADEが真に効果的な未学習手法を開発し評価するための、より堅牢な基盤を提供することを示した。
論文 参考訳(メタデータ) (2025-10-14T20:50:30Z) - Large Language Models for Full-Text Methods Assessment: A Case Study on Mediation Analysis [15.98124151893659]
大規模言語モデル(LLM)は方法論的評価の自動化の可能性を秘めている。
我々は180のフルテキストの科学論文に対して、最先端のLLMを専門家の人間レビュアーに対してベンチマークした。
論文 参考訳(メタデータ) (2025-10-12T19:04:22Z) - Perplexity Trap: PLM-Based Retrievers Overrate Low Perplexity Documents [64.43980129731587]
因果診断・矯正法(CDC)という因果推論時間脱バイアス法を提案する。
CDCはまず、パープレキシティのバイアス効果を診断し、その後、全体の関連スコアからバイアス効果を分離する。
3つの領域にまたがる実験結果から, より優れた脱バイアス効果が示された。
論文 参考訳(メタデータ) (2025-03-11T17:59:00Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z) - A Call to Reflect on Evaluation Practices for Failure Detection in Image
Classification [0.491574468325115]
本稿では,信頼度評価関数のベンチマーク化を初めて実現した大規模実証的研究について述べる。
簡便なソフトマックス応答ベースラインを全体の最高の実行方法として明らかにすることは、現在の評価の劇的な欠点を浮き彫りにする。
論文 参考訳(メタデータ) (2022-11-28T12:25:27Z) - Discover, Explanation, Improvement: An Automatic Slice Detection
Framework for Natural Language Processing [72.14557106085284]
スライス検出モデル(SDM)は、データポイントの低パフォーマンスなグループを自動的に識別する。
本稿では,NLPタスクの分類のための "Discover, Explain, improve (DEIM)" というベンチマークを提案する。
評価の結果,Edisaは情報的セマンティックな特徴を持つ誤り発生データポイントを正確に選択できることがわかった。
論文 参考訳(メタデータ) (2022-11-08T19:00:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。