論文の概要: EviSI: An Evidence-Based Evaluation Agent for Simultaneous Interpreting
- arxiv url: http://arxiv.org/abs/2609.08171v2
- Date: Tue, 15 Sep 2026 04:42:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.05392
- Title: EviSI: An Evidence-Based Evaluation Agent for Simultaneous Interpreting
- Title(参考訳): EviSI: 同時解釈のためのエビデンスに基づく評価エージェント
- Abstract要約: EviSIは多次元品質指標(MQM)とプロのインタプリタで開発された基準を組み合わせた大規模言語モデル評価エージェントである。
EviSIは、人格の英語から中国語、中国語、英語のデータに対して、総合的な英語から中国語の人格のランキングを復元する。
人間の評価のない5方向への多言語拡張は、次元とスコアリングルールを保持し、COMETとの正のシステムランキング相関を示す。
- 参考スコア(独自算出の注目度): 15.392286631815763
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Low-latency simultaneous speech-to-speech translation must keep pace with ongoing speech while preserving key information. To meet these demands, systems use segmentation, reformulation and condensation to reorganize and rephrase information. However, metrics developed for text translation, including BLEU and COMET, may not consistently distinguish faithful adaptations from semantic errors. We propose EviSI, a large language model evaluation agent combining Multidimensional Quality Metrics (MQM) with criteria developed with professional interpreters. Shared source evidence guides assessment across four dimensions: Anchor, Event, Logic and Fluency. Verified errors are deduplicated before deterministic scoring. On human-rated English to Chinese and Chinese to English data, EviSI recovers the aggregate English to Chinese human system ranking. Mean within-dataset Kendall correlations for system rankings reach 0.707 and 0.467, respectively, exceeding evaluated BLEU and COMET baselines. A multilingual extension to five directions without human ratings retains the dimensions and scoring rule, showing positive system ranking correlations with COMET throughout.
- Abstract(参考訳): 低遅延同時音声音声翻訳は、キー情報を保持しながら、進行中の音声とペースを保たなければならない。
これらの要求を満たすため、システムはセグメンテーション、再構成、凝縮を使用して情報を再構成し、言い換える。
しかし、BLEUやCOMETなどのテキスト翻訳のために開発されたメトリクスは、意味的誤りから忠実な適応を一貫して区別するものではない。
EviSIは,多次元品質指標(MQM)とプロフェッショナルインタプリタの基準を組み合わせた大規模言語モデル評価エージェントである。
ソースの共有エビデンスでは,Anchor, Event, Logic, Fluencyの4つの側面が評価されている。
検証されたエラーは決定論的スコアの前に重複する。
EviSIは、人格の英語から中国語、中国語、英語のデータに対して、総合的な英語から中国語の人格のランキングを復元する。
システムランキングの平均内値のKendall相関は0.707と0.467に達し、BLEUとCOMETのベースラインを超えている。
人間の評価のない5方向への多言語拡張は、次元とスコアリングルールを保持し、COMETとの正のシステムランキング相関を示す。
関連論文リスト
- BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production [16.248107085488332]
本稿では,テキスト・ツー・サイン翻訳のための言語基盤評価指標であるBackTranslation2.0を紹介する。
4つの評価次元(文法的正しさ、音韻的正確性、運動流速、生成忠実度)をヒトのレーダ評価と一致させた。
本手法は,手話生成システムにおいて,より包括的,解釈可能,言語的に規定された評価枠組みを提供するため,すべての次元にわたる人間の判断と強い相関関係を示す。
論文 参考訳(メタデータ) (2026-06-27T01:24:56Z) - XQ-MEval: A Dataset with Cross-lingual Parallel Quality for Benchmarking Translation Metrics [64.77152900881724]
9つの翻訳方向をカバーする半自動構築データセットであるXQ-MEvalを提案する。
MQMで定義されたエラーを金の翻訳に自動的に注入し、信頼性のためにネイティブスピーカーによってフィルタリングし、エラーをマージして、制御可能な品質で擬似翻訳を生成する。
XQ-MEvalを用いて, 平均的判断と人的判断の矛盾を明らかにする。
論文 参考訳(メタデータ) (2026-04-16T12:27:10Z) - Cross-Lingual Stability of LLM Judges Under Controlled Generation: Evidence from Finno-Ugric Languages [0.22009842278462158]
大規模言語モデル(LLM)の言語間評価は、典型的には、真のモデルの性能差と測定不安定性の2つの要因を混同する。
対象言語が異なる場合に生成条件を一定に保って評価信頼性を評価する。
本研究は, 形態学的に豊かな言語における談話レベルの評価には, ゼロショット・ジャッジ・トランスファーが信頼できないことを示唆している。
論文 参考訳(メタデータ) (2026-02-02T16:27:32Z) - Does Language Model Understand Language? [1.0450509067356148]
自然言語の生成と理解の進歩にもかかわらず、LMは依然として粒度の細かい言語現象に苦慮している。
本研究では,英語とベンガル語の両方の難解な文脈において,SOTA言語モデルの評価を行う。
その結果,最もバランスの取れたモデルとして,多種多様な言語条件における高い相関と低いMAEを一貫して達成していることが明らかとなった。
論文 参考訳(メタデータ) (2025-09-15T21:09:09Z) - Do LLMs Understand Your Translations? Evaluating Paragraph-level MT with Question Answering [68.3400058037817]
本稿では,TREQA(Translation Evaluation via Question-Answering)について紹介する。
我々は,TREQAが最先端のニューラルネットワークとLLMベースのメトリクスより優れていることを示し,代用段落レベルの翻訳をランク付けする。
論文 参考訳(メタデータ) (2025-04-10T09:24:54Z) - BLEURT Has Universal Translations: An Analysis of Automatic Metrics by
Minimum Risk Training [64.37683359609308]
本研究では,機械翻訳システムの学習指導の観点から,各種の主流および最先端の自動測定値について分析する。
BLEURT や BARTScore における普遍的逆変換の存在など,ある種の指標は堅牢性欠陥を示す。
詳細な分析では、これらのロバスト性障害の主な原因は、トレーニングデータセットにおける分布バイアスと、メートル法パラダイムの傾向である。
論文 参考訳(メタデータ) (2023-07-06T16:59:30Z) - Iterative Translation Refinement with Large Language Models [25.90607157524168]
本稿では,翻訳を自己修正するために,大規模言語モデルを反復的に提案する。
また,評価における課題と,人間のパフォーマンスと翻訳との関係についても論じる。
論文 参考訳(メタデータ) (2023-06-06T16:51:03Z) - BLEU Meets COMET: Combining Lexical and Neural Metrics Towards Robust
Machine Translation Evaluation [12.407789866525079]
文レベルの特徴や単語レベルのタグなど,トレーニング中に追加情報を使用することで,トレーニングされた指標が,特定の問題のある現象で翻訳をペナルティ化する能力を向上させることを示す。
文レベルの特徴や単語レベルのタグなど,トレーニング中に追加情報を使用することで,トレーニングされた指標が,特定の問題のある現象で翻訳をペナルティ化する能力を向上させることを示す。
論文 参考訳(メタデータ) (2023-05-30T15:50:46Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z) - Human-Paraphrased References Improve Neural Machine Translation [33.86920777067357]
パラフレーズ参照へのチューニングは、人間の判断によりかなり良いシステムを生み出すことを示す。
我々の研究は、パラフレーズ参照が人間の判断と相関する指標となることを確認する。
論文 参考訳(メタデータ) (2020-10-20T13:14:57Z) - Tangled up in BLEU: Reevaluating the Evaluation of Automatic Machine
Translation Evaluation Metrics [64.88815792555451]
評価法は, 評価に用いる翻訳に非常に敏感であることを示す。
本研究では,人的判断に対する自動評価基準の下で,性能改善をしきい値にする方法を開発した。
論文 参考訳(メタデータ) (2020-06-11T09:12:53Z) - On the Limitations of Cross-lingual Encoders as Exposed by
Reference-Free Machine Translation Evaluation [55.02832094101173]
クロスランガルエンコーダの評価は通常、教師付き下流タスクにおけるゼロショットのクロスランガル転送または教師なしのクロスランガル類似性によって行われる。
本稿では、ソーステキストと(低品質な)システム翻訳を直接比較するMT(Reference-free Machine Translation)の評価について述べる。
事前学習したM-BERTとLASERで得られた最先端の言語間セマンティック表現に基づいて,様々なメトリクスを体系的に検討する。
参照なしMT評価において,セマンティックエンコーダとしての性能は低く,その2つの重要な限界を同定する。
論文 参考訳(メタデータ) (2020-05-03T22:10:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。