論文の概要: Evaluating LLM Usage for Efficient and Explainable Numerical and Classified Implicit Sentiment Analysis of Product Desirability
- arxiv url: http://arxiv.org/abs/2606.23701v1
- Date: Thu, 04 Jun 2026 21:16:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.313411
- Title: Evaluating LLM Usage for Efficient and Explainable Numerical and Classified Implicit Sentiment Analysis of Product Desirability
- Title(参考訳): 有効かつ説明可能な数値的・分類的インシシト感性分析のためのLCM利用評価
- Abstract要約: 本稿では,大規模言語モデル (LLM) を用いたスケーラブルで解釈可能なフレームワークを提案する。
このフレームワークには、モデル信頼度評価と人間可読な論理的説明(xAI)も組み込まれている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Qualitative product feedback can reveal nuanced user experiences, but its implicit sentiment is difficult to measure. This paper presents a scalable and interpretable framework that uses large language models (LLMs) to quantify product desirability from such data. Using two Product Desirability Toolkit (PDT) datasets from ZORQ and CARMA comprising 106 respondent term groupings with gold-standard human annotation, zero-shot continuous numerical sentiment scoring and categorical sentiment classification are evaluated without relying on explicit review scores. Across the datasets, LLMs generated numerical sentiment scores directly from qualitative responses and closely matched expert labels, achieving Pearson correlations up to 0.97 and classification accuracy up to 94%. LLMs maintained robustness even when handling data presented in multiple forms and consistently expressed high confidence. In contrast, lexicon-based and transformer baselines did not produce statistically significant results. Among the models tested, GPT-4o-mini achieved performance comparable to larger models at 94% lower cost, supporting scalable deployment. The framework also incorporates model confidence ratings and human-readable rationale explanations (xAI), improving interpretability, transparency, and trust while supporting practical use in product satisfaction assessment. In general, using the PDT tool as a survey method along with a cost efficient LLM for sentiment analysis has the potential to provide for product evaluation with results that are rich in terms of sentiment scores (both numerical and classified sentiment) and in terms of the high-level user impressions of the product that can be used to identify ideas for product development and improvement, as well as marketing ideas for target audiences.
- Abstract(参考訳): 質的な製品フィードバックは、微妙なユーザー体験を明らかにすることができるが、その暗黙の感情を測定するのは難しい。
本稿では,大規模言語モデル(LLM)を用いたスケーラブルで解釈可能なフレームワークを提案する。
また,ZORQ と CARMA から得られた2つのプロダクトデシラビリティ・ツールキット (PDT) データセットを用いて,ゴールド・スタンダード・ヒューマン・アノテーションを用いた106個の応答項グループ,ゼロショット連続数値感情スコア,カテゴリー的感情分類を,明示的なレビュースコアに頼ることなく評価した。
データセット全体を通じて、LCMは定性的な反応と密にマッチした専門家ラベルから直接数値的な感情スコアを生成し、ピアソン相関を0.97まで、分類精度を94%まで達成した。
LLMは複数の形式で提示されたデータを扱う場合でも堅牢性を維持し、常に高い信頼性を示していた。
対照的に、レキシコンベースとトランスフォーマーベースラインは統計的に有意な結果を出さなかった。
テスト対象モデルのうち、GPT-4o-miniは、大規模モデルに匹敵するパフォーマンスを94%の低コストで達成し、スケーラブルなデプロイメントをサポートした。
このフレームワークには、モデル信頼度評価と人間可読な論理的説明(xAI)が含まれており、製品満足度評価における実用性をサポートしながら、解釈可能性、透明性、信頼を改善している。
一般に、PDTツールとコスト効率のよいLCMを用いた感情分析は、感情スコア(数値的および分類的感情の両方)と、製品開発や改善のためのアイデアの特定に使用できる製品の高レベルのユーザ印象、およびターゲットのオーディエンスに対するマーケティングアイデアの両面から製品評価を行う可能性がある。
関連論文リスト
- (Towards) Scalable Reliable Automated Evaluation with Large Language Models [0.0]
本研究は,Large Language Models (LLMs) 出力のエキスパートレベルの評価を近似するために設計された,新しい評価フレームワークを紹介する。
Eloレーティングシステムは、安定かつ解釈可能なランキングを生成するために使用される。
予備的な結果は、自動的に導出されるランキングが専門家の判断とよく相関していることを示している。
論文 参考訳(メタデータ) (2026-07-30T14:31:07Z) - DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - Latent Performance Profiling of Large Language Models [47.009623327601226]
隠れたアクティベーションと出力分布からタスクに依存しない診断を導出するフレームワークであるLatent Performance Profiling(LPP)を紹介する。
静的精度スコアとは異なり、LPPは同様のサイズのモデル間で安定でアーキテクチャに敏感なシグネチャを提供する。
類似のベンチマークスコアを持つモデルは、エントロピーや適応性の違いなど、対照的なプロファイルを示すことができることを示す。
論文 参考訳(メタデータ) (2026-05-28T14:41:26Z) - Leveraging LLMs to Evaluate Usefulness of Document [25.976948104719746]
本稿では,ユーザの検索コンテキストと行動データを大規模言語モデルに統合する,新たなユーザ中心評価フレームワークを提案する。
本研究は,文脈情報や行動情報に精通したLLMが有用性を正確に評価できることを実証する。
また,本手法で作成したラベルをユーザ満足度予測に適用し,実世界の実験により,これらのラベルが満足度予測モデルの性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2025-06-10T09:44:03Z) - T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation [60.620408007636016]
T2I-Eval-R1は,大まかな品質スコアのみを用いて,オープンソースのMLLMを訓練する新しい強化学習フレームワークである。
提案手法では,グループ相対政策最適化を命令調整プロセスに統合し,スカラースコアと解釈可能な推論チェーンの両方を生成する。
論文 参考訳(メタデータ) (2025-05-23T13:44:59Z) - Value Portrait: Assessing Language Models' Values through Psychometrically and Ecologically Valid Items [2.9357382494347264]
既存のベンチマークは、価値関連のバイアスに弱い人や機械のアノテーションに依存している。
本稿では,実生活におけるユーザ-LLMインタラクションをキャプチャするアイテムからなるValue Portraitベンチマークを提案する。
この心理的に検証されたアプローチは、特定の値と強く相関したアイテムがそれらの値を評価するための信頼できるアイテムとして機能することを保証する。
論文 参考訳(メタデータ) (2025-05-02T05:26:50Z) - Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation [57.380464382910375]
評価のためのフィードバックプロトコルの選択は,評価信頼性に大きく影響し,系統的なバイアスを生じさせることを示す。
ジェネレータモデルは、気を散らす機能を埋め込むことで好みをひっくり返すことができる。
我々は,データセットの特徴と評価目標に基づくフィードバックプロトコルの選択を推奨する。
論文 参考訳(メタデータ) (2025-04-20T19:05:59Z) - Beyond the Singular: The Essential Role of Multiple Generations in Effective Benchmark Evaluation and Analysis [10.133537818749291]
大規模言語モデル(LLM)は、現実世界のアプリケーションにおいて重要なユーティリティを実証している。
LLMの能力を評価するにはベンチマーク評価が不可欠である。
論文 参考訳(メタデータ) (2025-02-13T03:43:33Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。