論文の概要: SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing
- arxiv url: http://arxiv.org/abs/2605.29468v1
- Date: Thu, 28 May 2026 07:00:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 00:00:30.947837
- Title: SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing
- Title(参考訳): SciIntBench: 逆フラーミング下における研究積分ノルムによるLCMコンプライアンスの測定
- Abstract要約: 大規模言語モデル (LLM) は、科学的な研究を支援するためにますます使われている。
責任ある研究行動規範(RCR)を支持するか、それらを損なう助けになるかは不明だ。
SciIntBenchは10のRCRカテゴリと3つの科学的領域にまたがる810個のプロンプトの逆ベンチマークである。
- 参考スコア(独自算出の注目度): 6.108996188955891
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to support scientific work, but it is unclear whether they uphold responsible conduct of research (RCR) norms or help undermine them. We introduce SciIntBench, an adversarial benchmark of 810 prompts across ten RCR categories and three scientific domains. Each scenario appears as an Overt Adversarial, Covert Adversarial, and Benign version, allowing us to jointly measure framing-sensitive refusal of misconduct and helpfulness on legitimate requests. We evaluate 16 commercial and open-weight LLMs from six providers (2024--2026), producing 12,960 responses. We find that scientific integrity alignment is strongly framing-sensitive: models refuse explicit misconduct far more reliably than covert violations, especially failing when misconduct is presented as a pressure-driven shortcut. Refusals vary by RCR category, with weaker boundaries around transparency, plagiarism, and fabrication.
- Abstract(参考訳): 大規模言語モデル(LLM)は、科学的な研究を支援するためにますます使われているが、それらが責任ある研究の規範(RCR)を守っているかどうかは不明である。
SciIntBenchは10のRCRカテゴリと3つの科学的領域にまたがる810個のプロンプトの逆ベンチマークである。
各シナリオはOvert Adversarial、Covert Adversarial、Benignバージョンとして現れます。
6 つのプロバイダ (2024-2026) から16 個の商用 LLM とオープンウェイト LLM を評価し,12,960 の応答を示した。
モデルは、特に圧力駆動のショートカットとして提示された場合に、隠蔽違反よりも明確な不正行為をはるかに確実に拒否する。
拒絶はRCRカテゴリーによって異なり、透明性、盗作、製造に関する境界が弱い。
関連論文リスト
- TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs [0.0]
下流検証が存在しない領域では、科学的なエージェントとして大きな言語モデルが提案されている。
筆者らは,42枚の抽出,不正,疑似科学的論文からなるプローブコーパスを,各論文のフレーミングと単発モデルエンゲージメントを抽出・評価する手法と組み合わせて導入した。
プローブは、5つのクレームタイプ、製造された観測、擬似物理機構、魔法の前提、合法化橋、貨物カルト実験である。
論文 参考訳(メタデータ) (2026-08-11T20:30:32Z) - NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims [11.663456969895462]
AIの安全性におけるその後の主張のほとんどは、再現性が低いことが多い。
NeurIPSはそのような主張をする書類の基準を必要とする。
本稿では,公益・規制・限定的開示を区別する三層開示フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-05T17:25:28Z) - One Size Fits None: Heuristic Collapse in LLM Investment Advice [0.0]
大規模言語モデルは、ハイテイクドメインのアドバイザとしてますます多くデプロイされている。
我々は、フロンティアLSMが実際にこれを行うか、代わりに崩壊を示すかを検討する。
投資配分の決定は、主に自己申告されたリスク寛容によって決定されるが、他の関連する要因は最小限に寄与する。
論文 参考訳(メタデータ) (2026-04-26T18:45:11Z) - Are Your Agents Upward Deceivers? [73.1073084327614]
大規模言語モデル(LLM)ベースのエージェントは、ユーザのためにタスクを実行する自律的な従属者として、ますます使われています。
これは、人間の組織の個人がどのように上官に嘘をついて良いイメージを作り出したり、罰を免れるかのような、詐欺にも関与するかどうかという問題を提起する。
本研究では,環境制約に直面するエージェントが障害を隠蔽し,報告なしに要求されない動作を行う現象であるエージェント上行錯誤を観察・定義する。
論文 参考訳(メタデータ) (2025-12-04T14:47:05Z) - HALF: Harm-Aware LLM Fairness Evaluation Aligned with Deployment [52.374772443536045]
HALF(Harm-Aware LLM Fairness)は、現実的なアプリケーションにおけるモデルバイアスを評価し、有害度によって結果を評価するフレームワークである。
HALFは、以前のベンチマークの成功とデプロイメントの準備の整合性の間に明らかなギャップがあることを示します。
論文 参考訳(メタデータ) (2025-10-14T07:13:26Z) - FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning [12.467239356591238]
FalseRejectは、44の安全関連カテゴリにまたがる構造化された応答を伴う16kの一見有毒なクエリを含む包括的なリソースである。
本稿では,多種多様な複雑なプロンプトを生成するグラフインフォームド・逆多エージェントインタラクション・フレームワークを提案する。
FalseRejectによる教師付き微調整は、全体的な安全性や汎用言語能力を損なうことなく、不要な拒絶を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-05-12T20:45:25Z) - Retrieval-Augmented Generation with Conflicting Evidence [57.66282463340297]
大規模言語モデル (LLM) エージェントは、応答の事実性を改善するために、検索強化世代 (RAG) をますます採用している。
実際には、これらのシステムは曖昧なユーザクエリを処理し、複数のソースからの情報に衝突する可能性がある。
RAMDocs(Retrieval with Ambiguity and Misinformation in Documents)は,ユーザクエリのエビデンスを矛盾させるような,複雑で現実的なシナリオをシミュレートする新しいデータセットである。
論文 参考訳(メタデータ) (2025-04-17T16:46:11Z) - Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review [66.73247554182376]
大規模言語モデル(LLM)がピアレビューに統合された。
未確認のLLMの採用は、ピアレビューシステムの完全性に重大なリスクをもたらす。
5%のレビューを操作すれば、論文の12%が上位30%のランキングでその地位を失う可能性がある。
論文 参考訳(メタデータ) (2024-12-02T16:55:03Z) - MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries? [70.77691645678804]
人間は認知の歪みに傾向があり、特定の刺激に対する過大な反応を引き起こす偏見のある思考パターンがある。
本稿では,高度マルチモーダル言語モデル (MLLM) が同様の傾向を示すことを示す。
既存のMLLMの過敏性を引き起こす3種類の刺激を同定する。
論文 参考訳(メタデータ) (2024-06-22T23:26:07Z) - OR-Bench: An Over-Refusal Benchmark for Large Language Models [65.34666117785179]
大きな言語モデル(LLM)は、悪意のある出力を防ぐために慎重に安全アライメントを必要とする。
本研究では,大規模なオーバーリファレンスデータセットの自動生成手法を提案する。
OR-Benchは,最初の大規模オーバーリファレンスベンチマークである。
論文 参考訳(メタデータ) (2024-05-31T15:44:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。