論文の概要: Reference-Based Analysis of Coherence and Diversity in Open-Ended Text Generation
- arxiv url: http://arxiv.org/abs/2609.28080v1
- Date: Wed, 23 Sep 2026 13:22:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.041839
- Title: Reference-Based Analysis of Coherence and Diversity in Open-Ended Text Generation
- Title(参考訳): オープンエンディングテキスト生成におけるコヒーレンスと多様性の基準ベース解析
- Abstract要約: 3つの視点からコヒーレンスと多様性を検討するための参照ベースフレームワークを提案する。
人間の品質評価を用いた実験は、多様性に基づくアライメントと平均に基づく比較が品質関連の変化を捉えていることを示唆している。
これらの分析は、測定されたコヒーレンスと多様性が人間の判断にどのように関係しているかを調べるための構造化された方法を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating open-ended text generation involves understanding how different properties of a continuation relate to its perceived quality. We present a reference-based framework for examining coherence and diversity through three perspectives: aligning their evolution with human trajectories, comparing their summaries with a human continuation of the same prompt, and estimating their likelihood under a human reference distribution. Experiments with human quality ratings suggest that diversity-based alignment and mean-based comparisons capture quality-related variation, although the comparisons do not establish a predictive advantage for temporal alignment over simpler baselines. Reference likelihood also shows positive associations with ratings, with results varying across reference configurations and scoring horizons. Together, these analyses provide a structured way to examine how measured coherence and diversity relate to human judgments, while distinguishing similarity to human references from quality itself. Code and analysis resources are available at https://github.com/EstebanGarces/likely_human.
- Abstract(参考訳): オープンエンドテキスト生成を評価するには、継続の異なる性質が認識される品質にどのように関係するかを理解する必要がある。
本稿では,3つの視点からコヒーレンスと多様性を考察する参照ベース・フレームワークを提案する。
人間の品質評価を用いた実験では、多様性に基づくアライメントと平均ベースの比較が品質関連の変化を捉えることが示唆されているが、比較はより単純なベースラインよりも時間的アライメントの予測上の優位性を確立していない。
基準可能性はまた、評価と正の相関を示し、その結果は基準構成やスコアリング地平線によって異なる。
これらの分析は、測定されたコヒーレンスと多様性が人間の判断にどのように関係しているかを調べるための構造化された方法を提供し、品質そのものと人間の参照と類似性を区別する。
コードと分析リソースはhttps://github.com/EstebanGarces/likely_human.comで入手できる。
関連論文リスト
- Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation [80.99003754614365]
統一マルチモーダルモデルにおける共同理解と生成を評価するためのベンチマークであるUnisonを紹介する。
Unisonは2,169の高品質な統合タスクサンプルで構成されている。
また,人間の判断に適合した評価モデルであるUnison-Judgeを紹介する。
論文 参考訳(メタデータ) (2026-06-25T12:58:54Z) - Methodological Variation in Studying Staff and Student Perceptions of AI [1.701796716399534]
我々は、一般的に単一の量的または質的な尺度によって評価されるAI知覚のケースに焦点を当てる。
異なるアプローチを比較するために、スタンドアローンのコメントと構造化されたフォーカスグループという2種類の定性的データを収集する。
異なる分析によって、単一のデータソースに対して異なる結果が得られることを示す。
論文 参考訳(メタデータ) (2025-12-22T11:04:46Z) - References Matter: Investigating the Impact of Reference Set Variation on Summarization Evaluation [38.540830094027726]
本研究は,参照セットの選択に関して,広く使用されている参照ベースメトリクスの感度について検討する。
多くの一般的な指標が大きな不安定性を示していることを実証する。
この不安定性は、参照セットによってモデルランキングが異なるROUGEのようなn-gramベースのメトリクスに特に関係している。
論文 参考訳(メタデータ) (2025-06-17T09:17:41Z) - Rethinking Distance Metrics for Counterfactual Explainability [53.436414009687]
本研究では, 反事実を参照領域から独立して引き出すのではなく, 基礎となるデータ分布からの参照と共同してサンプリングする, 反事実生成手法のフレーミングについて検討する。
我々は、幅広い設定に適用可能な、反ファクト的な類似性のために調整された距離メートル法を導出する。
論文 参考訳(メタデータ) (2024-10-18T15:06:50Z) - Establishing a Unified Evaluation Framework for Human Motion Generation: A Comparative Analysis of Metrics [6.708543240320757]
本稿では,人体動作生成のための8つの評価指標について詳細に検討する。
我々は一貫したモデル比較を容易にするため、統一的な評価設定を通じて標準化されたプラクティスを提案する。
変形する多様性を分析して時間歪みの多様性を評価する新しい指標を提案する。
論文 参考訳(メタデータ) (2024-05-13T12:10:57Z) - Predicting Text Preference Via Structured Comparative Reasoning [110.49560164568791]
我々は、構造化中間比較を生成することによって、テキストの嗜好を予測するプロンプト方式であるSCを導入する。
我々は、テキスト間の差異を明確に区別するためのペアワイズ整合コンパレータと一貫した比較を選択する。
要約,検索,自動評価など多種多様なNLPタスクに対する総合的な評価は,SCがテキスト優先予測における最先端性能を達成するためにLLMを装備していることを示す。
論文 参考訳(メタデータ) (2023-11-14T18:51:38Z) - On the Faithfulness Measurements for Model Interpretations [100.2730234575114]
ポストホックな解釈は、自然言語処理(NLP)モデルがどのように予測を行うかを明らかにすることを目的とする。
これらの問題に取り組むために,我々は,削除基準,解釈の感度,解釈の安定性という3つの基準から始める。
これらの忠実性概念のデシデラタムに動機づけられ、敵対的領域からのテクニックを採用する新しい解釈方法のクラスを導入する。
論文 参考訳(メタデータ) (2021-04-18T09:19:44Z) - Weakly-Supervised Aspect-Based Sentiment Analysis via Joint
Aspect-Sentiment Topic Embedding [71.2260967797055]
アスペクトベース感情分析のための弱教師付きアプローチを提案する。
We learn sentiment, aspects> joint topic embeddeds in the word embedding space。
次に、ニューラルネットワークを用いて単語レベルの識別情報を一般化する。
論文 参考訳(メタデータ) (2020-10-13T21:33:24Z) - On the Relation between Quality-Diversity Evaluation and
Distribution-Fitting Goal in Text Generation [86.11292297348622]
本研究では, 品質と多様性の線形結合が, 生成した分布と実分布との分岐距離を構成することを示す。
品質/多様性メトリックペアの代替としてCR/NRRを提案する。
論文 参考訳(メタデータ) (2020-07-03T04:06:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。