論文の概要: Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation
- arxiv url: http://arxiv.org/abs/2608.01666v2
- Date: Tue, 04 Aug 2026 03:10:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.427449
- Title: Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation
- Title(参考訳): スタイルウィンズ, 物質損失: 理想生成におけるLCM-as-Judgeの診断
- Authors: Fengxian Ji, Yuke Li, Jingpu Yang, Juanfan Wu, Fan Zhang, Zhexuan Cui, Yu Xie, Min Peng, Qianqian Xie, Xiuying Chen, Zhuohan Xie,
- Abstract要約: 本稿では,SciStyleBenchを提案する。SciStyleBenchは,アイデア評価におけるスタイリスティックバイアスの診断と緩和のための3成分ベンチマークである。
SciStyleExtractorは、スタイル条件付評価の前に、スタイルタイプと逸脱を予測することによって、プレゼンテーションスタイルと科学的コンテンツとを分離する。
全体として、SciStyleBenchは科学的アイデア評価において、スタイリスティックなバイアスを特定し、定量化し、緩和するための体系的なフレームワークを提供する。
- 参考スコア(独自算出の注目度): 42.15398051538692
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: However, whether these judges truly evaluate the scientific substance of ideas or are influenced by superficial stylistic presentation remains an open question. To address this question, we propose SciStyleBench, a unified three-component benchmark for diagnosing and mitigating stylistic bias in LLM-based idea evaluation: (i) First, SciStyleStage, a three-stage evaluation environment that applies controlled stylistic perturbations to fixed scientific content across three settings no context, fixed-domain context, and open-domain retrieval context, covering 600 scientific ideas and 15 style variants, with 9,000 evaluation instances per setting; (ii) Second, SciStyleMetrics, a set of quantitative measures, including Style Bias Index (SBI), Substance Recognition Rate (SRR), and Adversarial Win Rate (AWR), to characterize how stylistic variation affects scoring stability, substance discrimination, and ranking robustness; (iii) Third, SciStyleExtractor, a plug-and-play evaluation module that separates presentation style from scientific content by predicting style type and deviation before style-conditioned evaluation, enabling us to assess whether style awareness reduces stylistic bias. Experiments on SciStyleBench show that direct LLM judges remain sensitive to writing style and struggle to distinguish scientific substance. In contrast, SciStyleExtractor reduces SBI from 0.566 to 0.501 while increasing SRR and AWR from 0.504 and 0.554 to 0.759 and 0.899, respectively. These results suggest that robust idea evaluation requires invariance to stylistic variation without sacrificing sensitivity to scientific substance. Overall, SciStyleBench provides a systematic framework for identifying, quantifying, and mitigating stylistic bias in scientific idea evaluation.
- Abstract(参考訳): しかし、これらの審査員がアイデアの科学的物質を真に評価するか、表面的な様式的なプレゼンテーションの影響を受けているかは、未解決のままである。
この問題に対処するために、LLMに基づくアイデア評価において、スタイリスティックバイアスを診断し緩和するための統合三成分ベンチマークであるSciStyleBenchを提案する。
第一に、SciStyleStageは、文脈、固定ドメインコンテキスト、オープンドメイン検索コンテキストを含まない3つの設定に、制御された様式的摂動を応用した三段階評価環境であり、600の科学的アイデアと15のスタイルのバリエーションをカバーし、設定毎に9,000の評価インスタンスを有する。
(二)SciStyleMetricsは、Style Bias Index(SBI)、Substance Recognition Rate(SRR)、Adversarial Win Rate(AWR)を含む一連の定量尺度で、スタイリスティックな変動がスコアリング安定性、物質識別、ロバスト性にどのように影響するかを特徴付ける。
第三にSciStyleExtractorは,スタイル条件付評価の前に,スタイルタイプや逸脱を予測し,提示スタイルを科学的内容から分離し,スタイル意識がスタイルバイアスを減少させるかどうかを評価する。
SciStyleBenchの実験では、直接LLM審査員は執筆スタイルに敏感であり、科学的物質を識別するのに苦労している。
対照的に、SciStyleExtractorはSBIを0.566から0.501に減らし、SRRとAWRは0.504から0.554へ、0.899へ増加した。
これらの結果から,頑健なアイデア評価には,科学的物質に対する感受性を犠牲にすることなく,スタイル変化に不変性が必要であることが示唆された。
全体として、SciStyleBenchは科学的アイデア評価において、スタイリスティックなバイアスを特定し、定量化し、緩和するための体系的なフレームワークを提供する。
関連論文リスト
- SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence [7.2640055022009635]
SciFigAlignは,原稿証拠の質評価を基礎とした微調整型マルチモーダルスコアラーである。
紙レベルでの分割では、SciFigAlignは0.3524のマクロMAEを達成し、テストセット上では紙内ペアの精度は81.64%である。
論文 参考訳(メタデータ) (2026-07-29T15:54:14Z) - Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges [2.8523456804049885]
安全審査員は、進化する基準に対してモデルアウトプットを評価するためにますます配置される。
最近のメタ評価研究は、プロンプトとルーブリックの変動下では脆く保たれていることを示している。
本稿では,インスタンス条件の動的ルーブリックと,信頼性と表現性を備えたカリキュラムを組み合わせたトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-06-08T08:02:57Z) - AstroConcepts: A Large-Scale Multi-Label Classification Corpus for Astrophysics [0.19804102882400357]
AstroConceptsは、Unified Astronomy Thesaurusの2,367の概念をラベル付けした21,702の天体物理学論文のコーパスである。
コーパスは厳格なラベルの不均衡を示し、概念の76%は50例未満のトレーニング例を持っている。
本評価では,科学的テキスト分類に新たな洞察を与える3つの重要なパターンを明らかにした。
論文 参考訳(メタデータ) (2026-04-02T15:27:00Z) - Evaluating Style-Personalized Text Generation: Challenges and Directions [13.84471733325089]
スタイルのパーソナライゼーションは、すべてのユーザに対して非常に具体的であり、実用的コンテキストに強く依存する。
BLEU, 埋め込み, LLMs-as-judgesなど, この分野で最も一般的な測定値の有効性について検討した。
多様な評価指標のアンサンブルを用いることで、単一評価手法よりも一貫して優れているという強い証拠が得られます。
論文 参考訳(メタデータ) (2025-08-08T15:07:31Z) - Diverging Preferences: When do Annotators Disagree and do Models Know? [92.24651142187989]
我々は,4つのハイレベルクラスにまたがる10のカテゴリにまたがる相違点の分類法を開発した。
意見の相違の大部分は、標準的な報酬モデリングアプローチに反対している。
本研究は,選好の変化を識別し,評価とトレーニングへの影響を緩和する手法を開発する。
論文 参考訳(メタデータ) (2024-10-18T17:32:22Z) - CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models [58.57987316300529]
大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクを処理するために、ますます多くデプロイされている。
LLMが示すバイアスを評価するために、研究者は最近、様々なデータセットを提案している。
我々は,様々な社会的グループやタスクにまたがる様々なバイアスをカバーした構成的評価ベンチマークであるCEBを提案する。
論文 参考訳(メタデータ) (2024-07-02T16:31:37Z) - Bias in Language Models: Beyond Trick Tests and Toward RUTEd Evaluation [49.3814117521631]
大規模言語モデル(LLM)におけるバイアスと公平性の標準ベンチマークは、プロンプトによって記述されたユーザー属性とインプットの関係を測定する。
本研究では, 子どもの就寝時間, ユーザ・ペルソナ, 英語学習演習の3つの文脈から, RUTEdの類似性を評価する。
標準偏差指標は、より現実的な偏差指標と有意な相関関係がないことがわかった。
論文 参考訳(メタデータ) (2024-02-20T01:49:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。