Fugu-MT 論文翻訳(概要): Text Style Transfer Evaluation Using Large Language Models

論文の概要: Text Style Transfer Evaluation Using Large Language Models

arxiv url: http://arxiv.org/abs/2308.13577v2
Date: Sat, 23 Sep 2023 06:05:22 GMT
ステータス: 翻訳完了
システム内更新日: 2023-09-27 01:09:21.439071
Title: Text Style Transfer Evaluation Using Large Language Models
Title（参考訳）: 大規模言語モデルを用いたテキストスタイル転送評価
Authors: Phil Ostheimer, Mayank Nagda, Marius Kloft, Sophie Fellenz
Abstract要約: 大きな言語モデル(LLM)は、平均的な人間のパフォーマンスにマッチし、さらに超える能力を示している。複数の入力プロンプトを用いて、TSTにおける異なるLLMの結果を比較した。この結果から,LLMが従来の自動測定値より優れていることが示唆された(ゼロショットでも)。
参考スコア（独自算出の注目度）: 24.64611983641699
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Evaluating Text Style Transfer (TST) is a complex task due to its multifaceted nature. The quality of the generated text is measured based on challenging factors, such as style transfer accuracy, content preservation, and overall fluency. While human evaluation is considered to be the gold standard in TST assessment, it is costly and often hard to reproduce. Therefore, automated metrics are prevalent in these domains. Nevertheless, it remains unclear whether these automated metrics correlate with human evaluations. Recent strides in Large Language Models (LLMs) have showcased their capacity to match and even exceed average human performance across diverse, unseen tasks. This suggests that LLMs could be a feasible alternative to human evaluation and other automated metrics in TST evaluation. We compare the results of different LLMs in TST using multiple input prompts. Our findings highlight a strong correlation between (even zero-shot) prompting and human evaluation, showing that LLMs often outperform traditional automated metrics. Furthermore, we introduce the concept of prompt ensembling, demonstrating its ability to enhance the robustness of TST evaluation. This research contributes to the ongoing evaluation of LLMs in diverse tasks, offering insights into successful outcomes and areas of limitation.
Abstract（参考訳）: テキストスタイル転送(TST)の評価は、その多面的性質のため複雑なタスクである。生成したテキストの品質は、スタイル転送精度、コンテンツ保存、全体的な流速といった難易度に基づいて測定される。人体評価はTST評価における金の基準と考えられているが、コストがかかり、しばしば再現が困難である。したがって、これらの領域では自動メトリクスが一般的です。それでも、これらの自動測定が人間の評価と相関するかどうかは不明だ。近年のLLM(Large Language Models)の進歩は、多様な、目に見えないタスクにおいて、平均的な人的パフォーマンスを上回る能力を示した。これは、TLMが人間の評価とTST評価における他の自動メトリクスの代替になり得ることを示唆している。複数の入力プロンプトを用いて、TSTにおける異なるLLMの結果を比較する。この結果から,LLMが従来の自動測定値より優れていることが示唆された(ゼロショットでも)。さらに,本研究では,TST評価の堅牢性を高める能力を示す,即時アンサンブルの概念を紹介した。本研究は,様々なタスクにおけるLCMの継続的な評価に寄与し,成果と限界領域に関する洞察を提供する。

関連論文リスト

Evaluating Generated Commit Messages with Large Language Models [10.048749643042491]
コミットメッセージは、コード変更の文書化や説明に役立つため、ソフトウェア開発において不可欠である。本研究では,大規模言語モデル (LLM) がメッセージ品質の自動評価手段としての可能性について検討する。
論文参考訳（メタデータ） (2025-07-15T01:50:20Z)
Evaluating Text Style Transfer Evaluation: Are There Any Reliable Metrics? [9.234136424254261]
テキスト・スタイル・トランスファー(テキスト・スタイル・トランスファー、英: Text style transfer、TST)は、テキストを変換して、元のコンテンツを保持しながら特定のスタイルを反映するタスクである。人間の評価は理想的であるが、他の自然言語処理(NLP)タスクと同様にコストがかかる。本稿では,TST評価のためのNLPタスクから,既存のメトリクスと新しいメトリクスのセットについて検討する。
論文参考訳（メタデータ） (2025-02-07T07:39:17Z)
Towards Understanding the Robustness of LLM-based Evaluations under Perturbations [9.944512689015998]
大言語モデル(LLM)は、要約やダイアログベースのタスクにおいて、非標準化メトリクスの自動評価器として機能する。人間の判断に比較して,LLMが品質評価指標としていかに優れているかを検討するために,複数のプロンプト戦略にまたがる実験を行った。
論文参考訳（メタデータ） (2024-12-12T13:31:58Z)
Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models [47.545382591646565]
大きな言語モデル(LLM)は、言語理解と人間レベルのテキストの生成に優れています。 LLMは、悪意のあるユーザーがモデルに望ましくないテキストを生成するよう促す敵攻撃の影響を受けやすい。本研究では,対象のLSMから偏りのある応答を抽出する逆方向のプロンプトを自動生成するモデルを訓練する。
論文参考訳（メタデータ） (2024-08-07T17:11:34Z)
RepEval: Effective Text Evaluation with LLM Representation [55.26340302485898]
RepEvalは、評価のためにLarge Language Models(LLM)表現の投影を利用するメトリクスである。我々の研究は、LLM表現に埋め込まれたテキスト品質に関する情報の豊かさを強調し、新しいメトリクスの開発のための洞察を提供する。
論文参考訳（メタデータ） (2024-04-30T13:50:55Z)
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition [46.949604465227054]
そこで我々は,MAD(Maximum Discrepancy)コンペティションに基づく,サンプル効率のよい人的評価手法を提案する。 MAD は2つの LLM に適応した情報的かつ多様な命令群を自動的に選択する。ペア比較の結果は、Eloレーティングシステムを用いてグローバルランキングに集約される。
論文参考訳（メタデータ） (2024-04-10T01:26:24Z)
CLOMO: Counterfactual Logical Modification with Large Language Models [109.60793869938534]
本稿では,新しいタスク,CLOMO(Counterfactual Logical Modification)と高品質な人間アノテーションベンチマークを紹介する。このタスクでは、LLMは所定の論理的関係を維持するために、与えられた議論的テキストを順応的に変更しなければなりません。 LLMの自然言語出力を直接評価する革新的な評価指標である自己評価スコア(SES)を提案する。
論文参考訳（メタデータ） (2023-11-29T08:29:54Z)
Evaluation Metrics of Language Generation Models for Synthetic Traffic Generation Tasks [22.629816738693254]
BLEUのような一般的なNLGメトリクスは、合成トラフィック生成(STG)の評価には適していないことを示す。生成したトラフィックと実際のユーザテキストの分布を比較するために設計されたいくつかの指標を提案し,評価する。
論文参考訳（メタデータ） (2023-11-21T11:26:26Z)
ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate [57.71597869337909]
われわれはChatEvalと呼ばれるマルチエージェントの審判チームを構築し、異なるモデルから生成された応答の品質を自律的に議論し評価する。分析の結果,ChatEvalは単なるテキストスコアリングを超越し,信頼性評価のための人間模倣評価プロセスを提供することがわかった。
論文参考訳（メタデータ） (2023-08-14T15:13:04Z)
Large Language Models are Not Yet Human-Level Evaluators for Abstractive Summarization [66.08074487429477]
抽象的な要約のための自動評価器として,大規模言語モデル(LLM)の安定性と信頼性について検討する。また、ChatGPTとGPT-4は、一般的に使われている自動測定値よりも優れていますが、人間の代替品として準備ができていません。
論文参考訳（メタデータ） (2023-05-22T14:58:13Z)
Can Large Language Models Be an Alternative to Human Evaluations? [80.81532239566992]
大規模言語モデル(LLM)は、タスク命令のみを提供する場合、目に見えないタスクに対して例外的な性能を示す。 LLM評価の結果は、専門家による評価の結果と一致していることを示す。
論文参考訳（メタデータ） (2023-05-03T07:28:50Z)
Can ChatGPT Assess Human Personalities? A General Evaluation Framework [70.90142717649785]
大きな言語モデル(LLM)は、様々な分野で印象的な成果を上げてきたが、その潜在的な人間のような心理学はいまだに研究されていない。本稿では,Mers Briggs Type Indicator (MBTI) テストに基づく人格評価のための総合評価フレームワークを提案する。
論文参考訳（メタデータ） (2023-03-01T06:16:14Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。