論文の概要: Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation
- arxiv url: http://arxiv.org/abs/2609.15467v1
- Date: Mon, 14 Sep 2026 12:28:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.32262
- Title: Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation
- Title(参考訳): トルコのMMLU Pro:トルコのマルチコース評価におけるトレーサブルオプション拡張とその妥当性限界
- Abstract要約: 回答オプションを追加することで、評価の妥当性を向上することなく、複数の選択のスコアを下げることができる。
トルコのMMLU Proは58のセクションで12,000のトルコ語ソースの質問を用いてこの区別を検証している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adding answer options can lower multiple-choice scores without improving assessment validity. Turkish MMLU Pro examines this distinction using 12,000 Turkish-source questions across 58 sections. Each question retains its stem, five original options and source key, and receives five options copied from other questions in the same section. Sentence-embedding retrieval proposes candidates; a language model selects existing identifiers. Deterministic verification reconstructs all 60,000 additions. A 25-model calibration exposes scoring and generation-budget effects. Five evaluations produce source-key accuracies of 34.8%-81.4%. On 981 shared questions, one API-served model falls from 93.7% with five choices to 83.1% with ten; 102 of 115 lost correct responses select borrowed options. The decrease is 24.4 percentage points on heuristically flagged negative stems and 5.9 points elsewhere. A completed human-checked audit of 200 sampled questions, with undocumented reviewer tool use, yields 47 and 31 multiple-answer judgments across the two record sets, 25 of the latter unresolved. These records support concern about ambiguity, while their dependence and incomplete reviewer-method documentation limit validation. Because order and labels also change, the paired comparison measures augmentation as implemented. The contribution is a traceable construction and an analysis of its validity limits, not evidence that lower ten-choice scores measure knowledge better.
- Abstract(参考訳): 回答オプションを追加することで、評価の妥当性を向上することなく、複数の選択のスコアを下げることができる。
トルコのMMLU Proは58のセクションで12,000のトルコ語ソースの質問を用いてこの区別を検証している。
各質問はその幹と5つの元のオプションとソースキーを保持し、同じセクションで他の質問からコピーされた5つのオプションを受け取る。
文埋め込み検索は候補を提案し、言語モデルが既存の識別子を選択する。
決定論的検証は6万の加算を再構築する。
25モデルのキャリブレーションは、スコアリングと世代予算効果を公開する。
5つの評価ではソースキーの精度は34.8%-81.4%である。
981の共有質問では、1つのAPI提供モデルが93.7%から5つの選択肢で83.1%、10で83.1%に落ちている。
減少率は24.4ポイント、陰茎は5.9ポイントである。
未文書のレビュアーツールを使用した200件の質問を人体検査し、その中の25件が未解決の2つのレコードセットで47件と31件の複数回答の判断を下す。
これらの記録は曖昧さに関する懸念を支持し、依存度と不完全なレビュアーメソッドは検証を制限する。
順序とラベルも変化するため、ペア比較は実装によって拡張する。
この貢献は追跡可能な構成であり、その妥当性の限界の分析であり、低い10票のスコアが知識をより良く測定する証拠ではない。
関連論文リスト
- From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection [12.159476982130286]
音声のディープフェイクは、聞き手や自動化されたシステムを騙すのに十分な説得力のある話者の声を模倣することができる。
ほとんどの検出器は発話ごとに1点のスコアで終わるが、なぜ境界線アイテムが信頼されるべきなのか、延期されたのか、あるいはレビューされるべきなのかは、ほとんど語っていない。
この疑問に答えるには、4つの整列した手がかりを後期校正ステップに伝達する監査可能な決定記録がある。
論文 参考訳(メタデータ) (2026-09-08T15:38:57Z) - Abstention Errors and Segment Support in CUAD: An Auditable Contract-Extraction Case Study [0.0]
本稿では,CUAD が発行した 102-contract test split に対する固定公開 RoBERTa チェックポイントの再現性評価について述べる。
30,464の返却候補文字列のうち19,562は注釈付き回答のない質問に現れる。
このシステムは2,938問のうち1,335問に答え、45.4%が偽陽性である。
論文 参考訳(メタデータ) (2026-09-07T21:26:53Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Auditable Release Control for Pedagogical Leakage in LLM Tutors [0.0]
大規模な言語モデルチューターは、その開示が承認される前に答えや決定的な推論を明らかにするのに役立ちます。
我々は、この状態および行動依存的障害を、教育的漏洩認識認可として定式化し、完全修復境界を導入する。
グローバルA1は0の多数と54のユーティリティフラグを獲得し、自動安全と実用性において適合Qを上回っている。
論文 参考訳(メタデータ) (2026-08-01T08:24:30Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models [2.064612766965483]
MedMCQA(4,183質問)とPubMedQA(1,000質問)でMedGemma(4Bおよび27Bパラメータ)を評価する。
実験の結果,いくつかの知見が得られた。
論文 参考訳(メタデータ) (2026-03-26T23:04:20Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Improving Selective Visual Question Answering by Learning from Your
Peers [74.20167944693424]
VQA(Visual Question Answering)モデルは、間違っていた場合の回答を控えるのに苦労する可能性がある。
本稿では,複数モーダル選択関数の学習におけるLearning from Your Peers (LYP) アプローチを提案する。
提案手法では,学習データの異なるサブセットに基づいて訓練されたモデルの予測を,選択的VQAモデルの最適化のターゲットとして利用する。
論文 参考訳(メタデータ) (2023-06-14T21:22:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。