論文の概要: Same Output, Different Gold: Measuring How Reference Choice Moves a Multilingual Benchmark Score
- arxiv url: http://arxiv.org/abs/2610.03825v1
- Date: Fri, 02 Oct 2026 08:56:29 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:45:57.223139
- Title: Same Output, Different Gold: Measuring How Reference Choice Moves a Multilingual Benchmark Score
- Title(参考訳): 金と同じ出力: 参照選択が多言語ベンチマークスコアをどのように移動させるかを測定する
- Abstract要約: ベンチマークスコアの第2項を,基準に対するシステム出力と比較した。
スコアは1つの出力で4.95F1点、もう1つの出力で2.00点(95%CI[3.23, 6.27]と[0.26, 3.37])、最悪の言語では7.55点である。
原因は文書化されていないアグリゲーションのデフォルトで、偏見が発火しなかった場合、通常は1つのアノテータを保持し、出荷された参照は出力の部分的にコピーされる。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: A benchmark score compares a system output against a reference, and methodological attention falls almost entirely on the first term. We measure the second. The retained annotation record of a six-language benchmark for personally identifiable information contains two independent annotator labellings, the aggregate shipped as gold, and a reviewer gold from independent expert re-annotation of a sample. Using it, we hold the scored output fixed and exchange the reference. The score moves by 4.95 F1 points for one output and 2.00 for the other (95% CIs [3.23, 6.27] and [0.26, 3.37]), and by 7.55 in the worst language. The comparison between two outputs moves as well: the paired interaction between reference and system is +2.95 points (CI [+1.97, +3.87]), survives correction for multiple testing, and changes one language's margin outright. The cause is an undocumented aggregation default that usually kept one annotator when adjudication did not fire, making the shipped reference a partial copy of an output being scored. We report the resulting reference-sensitivity band, show how to compute one from any retained annotation record, and argue that the quantity belongs beside the score.
- Abstract(参考訳): ベンチマークスコアは、システム出力を基準と比較し、方法論的注意は、ほぼすべて第一項に該当する。
2番目を測る。
個人識別可能な情報に対する6言語ベンチマークの保持されたアノテーション記録は、2つの独立したアノテーションラベリング、金として出荷されたアグリゲーション、サンプルの再アノテーションからのレビュアーゴールドを含む。
これを使用して、得られた出力を固定し、参照を交換します。
スコアは1つの出力で4.95F1点、もう1つの出力で2.00点(95%CI[3.23, 6.27]と[0.26, 3.37])、最悪の言語では7.55点である。
参照とシステム間の対の相互作用は +2.95 点 (CI [+1.97, +3.87]) であり、多重テストの補正を継続し、1つの言語のマージンを大きく変えている。
原因は文書化されていないアグリゲーションのデフォルトで、偏見が発火しなかった場合、通常は1つのアノテータを保持し、出荷された参照は出力の部分的にコピーされる。
得られた基準感度帯域を報告し、保持されたアノテーションレコードから1つの値を計算する方法を示し、その値がスコアの横にあることを議論する。
関連論文リスト
- NegT2IBench: When Negation Changes the Picture. A Polarity Benchmark for Text-to-Image Models [42.95507596219371]
我々は2つの属性タイプと4つの関係カテゴリをカバーする4,800のプロンプトのベンチマークであるNegT2IBenchを紹介した。
私たちの検出器に基づくスコアは再現可能で、監査可能で、要求が失敗したピンポイントです。
論文 参考訳(メタデータ) (2026-10-02T10:03:56Z) - Where the Numbers Come From: Auditing Evaluation in Provenance-Based Intrusion Detection [42.49426058823369]
証明に基づく侵入検知器のスコアを再現しても、そのアラームの出力やエンコーダが使用する情報についてそのスコアが何を言っているかは定かでない。
我々は、リリースした9つの実装を監査し、独自のコードを使用して4つの検出器を実行し、3つの測定効果を分離する。
論文 参考訳(メタデータ) (2026-09-27T13:01:02Z) - The Undetected Damage of Quantization on Retrieval and How to Fix It [51.02977749156532]
分類精度を保った量子モデルでは,トップ1検索結果の14ドルから46%の値がまだ変化していることを示す。
この失敗を2つの上位モデルスコア間のギャップに結び付け、そのギャップを使用して、定量化された回答をいつ信頼するかを決めます。
この差が最大の丸め誤差の2倍を超える場合にのみ、トップ1結果が量子化を継続することが保証されていることを示す。
論文 参考訳(メタデータ) (2026-09-21T09:26:35Z) - Ranked by the Matcher: A Reproducibility Audit of Knowledge Graph Extraction from Threat Reports [5.580052437190499]
12の検査システムのうち5つのみが記述されたマッチングルールを再実装する。
8つのプロトコルで共有ドキュメントに出力される10のシステムは、45対の注文のうち11を逆転させる。
外部、人間による調整セットでは、機械的なマーカは、-レキシカル、埋め込み、エンテーメント--10で7回以上、レビュアーとアグリーする。
論文 参考訳(メタデータ) (2026-09-01T04:45:44Z) - Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis [0.0]
ラテン音場正書法で書かれたクルド方言の音声認識を評価する。
原文のアラビア文字仮説は111.70%のWERと100.92%のCERであり、正確な単語一致はゼロである。
ラテン語の文字化では102.36%のWERと57.89%のCERが与えられ、参照を縮小した正書法に折り畳むと97.85%と51.20%となる。
論文 参考訳(メタデータ) (2026-08-17T10:31:30Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation [41.01488608247856]
アウトカム検証器は、完了した推論トレースをスコアするが、中間トークンにクレジットを割り当てない。
原始的な自己蒸留は、モデル自身のロールアウトをトレーニング専用の情報で再現することで、このギャップを埋めようとする。
スコアがより良い行動を追跡するか、フィードバック構築が比較対象を変えるか、トレーニング損失が強化されるか、という3つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-10T08:18:48Z) - Contrastive ESA: Human Evaluation of Multiple Translations at Once [45.918020796451536]
Contrastive Error Spanを紹介します。
(cESA) ソース入力(テキスト、ビデオ、オーディオ、画像)の複数翻訳を行うプロトコル。
cESAでは、アノテータは同じ文書の複数の翻訳を見て、メジャーとマイナーのエラースパンをマークし、絶対スケールでスコアを0%から100%に割り当てる。
我々は,12モデルの日本語翻訳を人体で大規模に評価したcESAを検証し,標準点評価と比較して注釈時間と雑音の低減を実証した。
論文 参考訳(メタデータ) (2026-07-29T09:01:59Z) - Same Ranking, Different Winner: How Scoring Targets Shape LLM Memory Benchmarks [2.9089118242427627]
会話記憶システムは対話履歴を事実、要約、タイムライン、および他のソースリンクされた子孫に変換する。
どのストアドフォームが検索クレジットを受け取るべきか?
このスコアリング対象の選択は、しばしば暗黙的に残され、ベンチマークの結論を実質的に変更できることを示す。
論文 参考訳(メタデータ) (2026-05-22T02:53:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。