論文の概要: Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild
- arxiv url: http://arxiv.org/abs/2604.16304v1
- Date: Sun, 25 Jan 2026 10:36:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:13.867571
- Title: Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild
- Title(参考訳): 結果-アクティビティギャップ:実践者が野生のLLM製品をどのように評価するかを理解する
- Authors: Willem van der Maden, Malak Sadek, Ziang Xiao, Aske Mottelson, Q. Vera Liao, Jichen Zhu,
- Abstract要約: 組織的なメタワークに対して,非公式な"バイブチェック"にまたがる10の評価プラクティスを特定します。
実践者は評価データを収集するが、その結果を具体的改善に変換することはできない。
本分析は,これらの解釈実践が,方法論的失敗よりもLCM特性に適応する必要があることを示唆している。
- 参考スコア(独自算出の注目度): 33.360335897400965
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How do product teams evaluate LLM-powered products? As organizations integrate large language models (LLMs) into digital products, their unpredictable nature makes traditional evaluation approaches inadequate, yet little is known about how practitioners navigate this challenge. Through interviews with nineteen practitioners across diverse sectors, we identify ten evaluation practices spanning informal 'vibe checks' to organizational meta-work. Beyond confirming four documented challenges, we introduce a novel fifth we call the results-actionability gap, in which practitioners gather evaluation data but cannot translate findings into concrete improvements. Drawing on patterns from successful teams, we contribute strategies to bridge this gap, supporting practitioners' formalization journey from ad-hoc interpretive practices (e.g., vibe checks) toward systematic evaluation. Our analysis suggests these interpretive practices are necessary adaptations to LLM characteristics rather than methodological failures. For HCI researchers, this presents a research opportunity to support practitioners in systematizing emerging practices rather than developing new evaluation frameworks.
- Abstract(参考訳): 製品チームはどのようにLCMを使った製品を評価するのか?
組織が大規模言語モデル(LLM)をデジタル製品に統合するにつれ、予測不可能な性質によって従来の評価アプローチが不十分になる。
多様な分野にわたる19人の実践者へのインタビューを通じて、非公式な「ビブチェック」から組織的メタワークまで10の評価プラクティスを特定した。
4つの文書化された課題の確認に加えて、我々は結果-反応可能性ギャップと呼ばれる新しい5番目の課題を紹介し、実践者が評価データを集めているが、その結果を具体的な改善には翻訳できない。
成功しているチームからのパターンに基づいて、私たちはこのギャップを埋めるための戦略に貢献し、実践者の形式化の旅を、アドホックな解釈プラクティス(例:バイブチェック)から体系的な評価まで支援します。
本分析は,これらの解釈実践が,方法論的失敗よりもLCM特性に適応する必要があることを示唆している。
HCI研究者にとって、新たな評価フレームワークを開発するのではなく、新興プラクティスを体系化する実践者を支援するための研究機会となる。
関連論文リスト
- An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems [1.9138416746729587]
大規模言語モデル(LLM)は、探索や要約といった学術的なタスクを変換しているが、その信頼性は未だに不明である。
質問応答システムにおけるLCMの誤りを評価するためのスキーマを開発し,実験者の評価戦略を反映した。
論文 参考訳(メタデータ) (2026-02-24T16:16:44Z) - Training an LLM-as-a-Judge Model: Pipeline, Insights, and Practical Lessons [9.954960702259918]
本稿では,文脈認識評価を行うLLM(en:en:en:en:en:en:en:en:LLMs)ジャッジであるThemisを紹介する。
Themisの開発パイプラインの概要を概観し、シナリオに依存した評価プロンプトを強調します。
メタ評価のための人間ラベル付きベンチマークを2つ導入し、テミスが人間の嗜好を経済的に高度に調整できることを実証した。
論文 参考訳(メタデータ) (2025-02-05T08:35:55Z) - DnA-Eval: Enhancing Large Language Model Evaluation through Decomposition and Aggregation [75.81096662788254]
大規模言語モデル(LLM)はスケーラブルで経済的な評価指標である。
これらの評価者がどの程度信頼できるかという問題は、重要な研究課題として浮上している。
本稿では,デコンプリートとアグリゲートを提案し,その評価プロセスを教育実践に基づいて異なる段階に分解する。
論文 参考訳(メタデータ) (2024-05-24T08:12:30Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。