論文の概要: Is the ACL Responsible NLP Checklist a Box-Ticking Exercise? A Large-Scale Analysis of EMNLP 2025
- arxiv url: http://arxiv.org/abs/2608.09280v1
- Date: Mon, 10 Aug 2026 08:35:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.161717
- Title: Is the ACL Responsible NLP Checklist a Box-Ticking Exercise? A Large-Scale Analysis of EMNLP 2025
- Title(参考訳): ACL対応NLPチェックリストはボックスタイピング運動か? : EMNLP 2025の大規模分析
- Authors: Nusrath Jinnath, Wei Zhao,
- Abstract要約: ACLはEMNLP 2025 Checklistsをリリースした。
我々は,最近のEMNLPチェックリストについて,73,922ドルの回答と正当性を調べることで,最初の分析を行った。
メイントラックでは、著者がチェックリストの倫理的疑問を新聞のバルクから切り離し、倫理が後から考える傾向を模倣していることが分かる。
チェックリストの設計と著者の努力に関する重大な問題、すなわち、すべてのチェックリストの$6%は、親と子の間の論理的な矛盾を含んでいました。
- 参考スコア(独自算出の注目度): 3.5138213455573095
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Responsible NLP practice includes a) transparency, b) ethics, and c) societal impacts. The Responsible NLP Checklist aims to push these goals, and promote responsible practice. Recently, ACL released the EMNLP 2025 Checklists to aid transparency on the current research practice, which we focus on. We curate and release the first two datasets of: a) all the checklist responses and justifications from the EMNLP 2025 Main and Finding tracks; b) checklist reference linking to paper sections. We also provide the first analysis of recent EMNLP Checklists, by examining $73,922$ responses and justifications to them. For the Main track, we find that authors isolate ethics questions of the Checklist from the paper's bulk, mimicking the trend of ethics being an afterthought. We then examine \texttt{NO} responses. We find $44.9\%$ of justifications are poor or bad-faith, being brief or empty. Then, we find significant issues with the checklist design and effort of authors, namely that $6\%$ of all checklists contained logical contradictions between parent and child responses. We also find evidence of surface compliance for responsible ethics, with $53\%$ authors dismissing potential risks or social impacts of their work, for which there should be none. We compare this to the Findings track, noticing a similar trend in both tracks. Lastly, we discuss the implications of the checklist design and provide recommendations for future checklist iterations. Including: a) enforcing a minimum word count, b) enforcing more scrutiny on the risks of appliances.
- Abstract(参考訳): 責任あるNLP実践には
透明性; 透明性; 透明性
b) 倫理,及び
c)社会的影響
Responsible NLP Checklistは、これらの目標を推進し、責任あるプラクティスを促進することを目的としている。
最近、ACLはEMNLP 2025 Checklistsをリリースした。
最初の2つのデータセットをキュレートしてリリースします。
a) EMNLP 2025Main and Finding Tracksのすべてのチェックリスト応答及び正当性
b) 紙セクションにリンクするチェックリスト参照
また,最近のEMNLPチェックリストについて,73,922ドルの回答と正当性を調べることで,最初の分析を行った。
メイントラックでは、著者がチェックリストの倫理的疑問を新聞のバルクから切り離し、倫理が後から考える傾向を模倣していることが分かる。
次に、 \texttt{NO} 応答を調べます。
正当化の44.9 % は貧弱か悪い信条であり、簡潔か空白である。
そして、チェックリストの設計と著者の努力に重大な問題、すなわち、すべてのチェックリストの6$%が、親と子の間の論理的な矛盾を含んでいることを発見しました。
また、責任ある倫理に対する表面的なコンプライアンスの証拠も見つかり、5,3 %の著者は、彼らの仕事の潜在的なリスクや社会的影響を否定する。
我々はこれをFindingsのトラックと比較し、両方のトラックで同様の傾向に気付きました。
最後に,チェックリスト設計の意義について考察し,今後のチェックリストのイテレーションについて推奨する。
以下を含む。
a) 最小の語数を実施すること
ロ 家電のリスクについてより精査すること。
関連論文リスト
- Commitment Checklist: Auditing Author Commitments in Peer Review [55.67642089544162]
本稿では,大規模言語モデル(LLM)を用いた著者のコミットメントの大規模監査を行い,カメラ対応バージョンとの比較を行う。
約束された変更の大多数が実装されているが、かなりのシェア(約25%)は提供されていない。
我々は、著者やオーガナイザに未承認の約束を通知する、著者コミットチェックリストのアイデアを提案する。
論文 参考訳(メタデータ) (2026-01-08T05:37:09Z) - Usefulness of LLMs as an Author Checklist Assistant for Scientific Papers: NeurIPS'24 Experiment [59.09144776166979]
大規模言語モデル(LLM)は、科学的ピアレビューを支援する上で有望だが議論の余地のあるツールである。
本研究は,論文提出を提出基準に適合させるツールとして,会議環境におけるLCMの有用性を評価する。
論文 参考訳(メタデータ) (2024-11-05T18:58:00Z) - ConfReady: A RAG based Assistant and Dataset for Conference Checklist Responses [5.170485483791494]
ARR Responsible NLP Research checklist Webサイトは、"チェックリストは責任ある研究のためにベストプラクティスを促進するように設計されている"と述べている。
我々はConfReadyを紹介した。これは検索拡張世代(RAG)アプリケーションで、著者が自分の仕事を振り返り、会議チェックリストで著者を支援するのに使用できる。
チェックリストアシスタントを評価するために、1,975個のACLチェックリスト応答のデータセットをキュレートし、人間の回答の問題を解析し、評価サブセットに基づいてRAGとLarge Language Model(LM)をベンチマークする。
論文 参考訳(メタデータ) (2024-08-07T21:07:13Z) - FABLES: Evaluating faithfulness and content selection in book-length summarization [55.50680057160788]
本稿では,本書の忠実度と内容選択の大規模評価を行う。
LLMが生成した26冊のサマリーで作成した3,158冊の注釈のデータセットであるFABLESを5.2KUSDで収集する。
注釈の分析によると、ほとんどの不誠実な主張は出来事や登場人物の状態に関係しており、物語を無効にするために間接的推論を必要とする。
論文 参考訳(メタデータ) (2024-04-01T17:33:38Z) - Responsible AI Considerations in Text Summarization Research: A Review
of Current Practices [89.85174013619883]
私たちは、責任あるAIコミュニティがほとんど見落としている共通のNLPタスクである、テキスト要約に重点を置いています。
我々は,2020-2022年に出版されたACLアンソロジーから333の要約論文の多段階的質的分析を行った。
私たちは、どの、どの、どの責任あるAI問題がカバーされているか、どの関係するステークホルダーが考慮されているか、そして、述べられた研究目標と実現された研究目標のミスマッチに焦点を合わせます。
論文 参考訳(メタデータ) (2023-11-18T15:35:36Z) - Just What do You Think You're Doing, Dave?' A Checklist for Responsible
Data Use in NLP [6.3596637237946725]
本論では,テキストデータの収集と共有に関する法的・倫理的原則と,それら間の緊張関係について論じる。
我々は、会議提出のピアレビューを標準化すると同時に、公表された研究のより詳細なビューを可能にする責任のあるデータ(再使用)の潜在的なチェックリストを提案する。
論文 参考訳(メタデータ) (2021-09-14T11:36:42Z) - Too Many Claims to Fact-Check: Prioritizing Political Claims Based on
Check-Worthiness [1.2891210250935146]
本報告では, チェックの信頼性に基づいて, クレームの優先順位付けを行うモデルを提案する。
BERTモデルにはドメイン固有の議論の的となっているトピックや単語の埋め込みなどが追加されています。
論文 参考訳(メタデータ) (2020-04-17T10:55:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。