論文の概要: Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants
- arxiv url: http://arxiv.org/abs/2608.20392v1
- Date: Tue, 30 Jun 2026 21:58:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.308256
- Title: Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants
- Title(参考訳): Evaluation-as-Search: ミーティングアシスタントにおける接地障害の適応的発見
- Abstract要約: 評価・アズ・サーチ(EaS)は、参加者が質問する自然の質問の空間を適応的に検索する手法である。
我々は3つの会議ジャンルと3つのLCMアシスタントから20のテキストにまたがる3000ドル以上の注釈付き質問応答ペアのベンチマークであるMatchProbeを構築した。
本研究では,現実的なリコールエラーではなく,談話・実践的な課題に支配される8つの繰り返し発生する障害カテゴリを,明確な能力勾配で同定する。
- 参考スコア(独自算出の注目度): 15.367038156776431
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-powered meeting assistants are deployed at scale, yet systematic evaluation of their grounding fidelity remains limited to static benchmarks that miss failure modes tied to specific discourse structures or reasoning demands. We propose Evaluation-as-Search (EaS), a feedback-driven methodology that frames quality evaluation as an adaptive search over the space of natural questions a meeting participant might ask. Rather than sampling uniformly, EaS learns from evaluator feedback across iterations to concentrate probing effort on cognitive demands where failures are most likely, guided by a UCB-scored coverage map and blind multi-dimensional quality evaluation. Using EaS, we construct MeetingProbe, a benchmark of over $3{,}000$ annotated question--answer pairs spanning 20 transcripts from three meeting genres and three LLM assistants. In ablations, adaptive search surfaces $2.5\times$ more failures than random probing ($7.1\%$ vs. $2.9\%$ finding rate), with the strategic planner contributing the largest individual effect. Across three models, we observe a clear capability gradient and identify eight recurring failure categories dominated by discourse-pragmatic challenges rather than factual recall errors. We further validate MeetingProbe across multiple model families and providers, finding a clean capability gradient and a curated subset of universal failures that no model handles. MeetingProbe is released publicly to support reproducible evaluation of meeting assistant grounding fidelity.
- Abstract(参考訳): LLMを利用したミーティングアシスタントは大規模に展開されているが、その基盤となる忠実さの体系的評価は、特定の談話構造や推論要求に結びついている障害モードを見逃す静的ベンチマークに限られている。
提案手法は,参加者が質問する自然質問の空間上で品質評価を適応的に検索する手法として,フィードバック駆動型手法である「評価・アズ・サーチ(EaS)」を提案する。
均一にサンプリングする代わりに、EaSはイテレーションを通じて評価者からのフィードバックから学び、失敗が最も可能性の高い認知的要求に探索的努力を集中させ、UCBで表されたカバレッジマップと視覚的多次元品質評価によってガイドされる。
EaSを用いて,3つの会議ジャンルと3つのLLMアシスタントから20のテキストにまたがる3,000ドル以上の注釈付き質問-回答ペアのベンチマークである MeetingProbe を構築した。
アブレーションでは、アダプティブサーチはランダムな探索よりも2.5\times$の失敗($7.1\%対$2.9\%対$2.9\%)を伴い、戦略プランナーは最大の個人効果に寄与する。
3つのモデルにまたがって、明確な能力勾配を観察し、事実的リコールエラーではなく、談話・実践的課題に支配される8つの繰り返し失敗カテゴリを同定する。
さらに、複数のモデルファミリやプロバイダにわたってMatchProbeを検証することで、クリーンな機能勾配と、モデルが扱わないユニバーサル障害のキュレートされたサブセットを見つけます。
MeetingProbeは、ミーティングアシスタントの再現可能な評価をサポートするために、公開されている。
関連論文リスト
- Diversity-Guided Search-Based Testing of Large Language Model Applications [1.0125319485475452]
大規模言語モデル(LLM)ベースのアプリケーションは、カスタマサービス、教育、モビリティを含む複数のドメインにまたがってデプロイされるようになっている。
私たちのフレームワークは生成されたテストのアーカイブを保持し、そのアーカイブからの距離を報います。
リポピュレーション・オペレーターは、調査を継続するために、定期的に人口の非障害テストを置き換える。
論文 参考訳(メタデータ) (2026-09-19T20:41:16Z) - NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - The RAT: A Unified Bayesian Model for RAG Evaluation [8.650407684623714]
本稿では,検索成功,棄却行動,回答正当性を共同でモデル化するベイズ評価フレームワークを提案する。
フレームワークを3つのデータセット、3つのレトリバー、3つのジェネレータにわたる27のRAG構成に適用する。
我々は、LLM-as-a-judgeアノテーションをキャリブレーションされたノイズ観測として組み込むようモデルを拡張した。
論文 参考訳(メタデータ) (2026-08-25T15:54:30Z) - Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation [1.6454653507226797]
機械学習の目的は、対象とするトレーニングデータの影響をモデルから取り除き、残りの能力を維持することだ。
忘れているように見える情報が、戦略的なプロンプトによってまだ回収できるかどうかを評価する。
以上の結果から,クリーンクエリの忘れやすさと敵の堅牢性の間には,かなりのギャップがあることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-21T20:19:22Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts [0.07812854697536452]
6つのベンチマークで206,000のクエリモデルペアを持つマルチ層LSMルーティングについて大規模に検討する。
報告された未解決性のかなりの部分は, 評価成果物に起因していることが示されている。
論文 参考訳(メタデータ) (2026-05-08T07:49:24Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z) - Uncertainty-Driven Action Quality Assessment [11.958132175629368]
本稿では,複数の判定スコアの多様性を捉えるために,不確実性駆動型AQA (UD-AQA) という新しい確率モデルを提案する。
我々は,AQA回帰損失の再重み付けに使用される各予測の不確かさを推定する。
提案手法は,オリンピックイベントMTL-AQAとFineDivingの3つのベンチマークと,手術スキルJIGSAWSデータセットの3つのベンチマークで比較結果を得た。
論文 参考訳(メタデータ) (2022-07-29T07:21:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。