論文の概要: Same Feedback, Different Answer: Measuring Run-to-Run Instability in Frontier-Model Customer Feedback Analysis
- arxiv url: http://arxiv.org/abs/2610.08036v1
- Date: Tue, 06 Oct 2026 09:29:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.918115
- Title: Same Feedback, Different Answer: Measuring Run-to-Run Instability in Frontier-Model Customer Feedback Analysis
- Title(参考訳): 同じフィードバックと異なる回答:フロンティアモデル顧客フィードバック分析における実行間不安定性の測定
- Abstract要約: 本稿では,意味論的に等価なカテゴリを整理し,テーマチャーンとボリューム不一致という2つの操作指標に焦点を当てた繰り返し実行評価フレームワークを提案する。
8つのフロンティアモデル,100~5000レコードのコーパスサイズ,複数プロンプト,3つの実行設計の3つの繰り返し顧客フィードバックタスクを評価した。
Claude Opus 4.8と1000レコードコーパスの固定により、TGAは生発生と階層分解の両方に対して86~88%のテーマチャーンを減少させる。
- 参考スコア(独自算出の注目度): 0.4806505912512235
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI agents are increasingly being programmed to automate knowledge work over large collections of unstructured data. Such automation requires repeatability: when the underlying evidence is unchanged, the agent's categories, priorities, and counts should not shift materially between runs, even if each individual answer appears plausible. We introduce a repeat-run evaluation framework that aligns semantically equivalent categories and focuses on two operating metrics: theme churn, the normalized change in the returned category set, and volume disagreement, the change in counts for categories that persist. We evaluate three recurring customer-feedback tasks across eight frontier models, corpus sizes from 100 to 5,000 records, multiple prompts, and three execution designs: raw generation, taxonomy-free hierarchical decomposition, and a taxonomy-grounded agent (TGA) using persistent themes, subthemes, and record-level predictions. With Claude Opus 4.8 and the 1,000-record corpus fixed, TGA reduces theme churn by 86--88% relative to both raw generation and hierarchical decomposition, while matched-theme volumes have zero disagreement. The taxonomy-grounded agent is more stable than every raw model in the screen, remains more stable at each corpus size, and keeps this advantage when theme matching is made stricter or looser. Although evaluated on customer feedback, the framework targets repeated synthesis of unstructured corpora more broadly, including financial reports, legal documents, incident records, and scientific literature. Overall, these results show that taxonomy grounding produces more consistent and repeatable outputs for recurring knowledge work.
- Abstract(参考訳): AIエージェントは、非構造化データの大規模なコレクション上での知識作業を自動化するために、ますますプログラムされている。
このような自動化には、繰り返し可能性が必要である: 基礎となる証拠が変われば、エージェントのカテゴリ、優先順位、カウントは、たとえ個々の回答が妥当に見えるとしても、実行中に実質的にシフトするべきではない。
本稿では,意味論的に等価なカテゴリを整理し,テーマチャーン,復帰したカテゴリセットの正規化変化,ボリューム不一致,継続するカテゴリのカウント数の変化という2つの操作指標に焦点を当てた繰り返し実行評価フレームワークを提案する。
我々は,8つのフロンティアモデルにまたがる3つの反復的な顧客フィードバックタスク,100~5000レコードのコーパスサイズ,複数プロンプト,および3つの実行設計を評価する。
クロードオプス4.8と1000レコードコーパスの固定により、TGAは原生成と階層的分解の両方に対してテーマチャーンを86~88%減らし、マッチしたテーマのボリュームには相違点がない。
分類学的接地剤は、画面上のすべての原モデルよりも安定であり、各コーパスサイズにおいてより安定であり、テーママッチングがより厳格または緩くされた場合、この優位性を維持する。
顧客からのフィードバックに基づいて評価されるが、このフレームワークは、財務報告、法律文書、インシデント記録、科学文献など、構造化されていないコーパスの反復的な合成をより広範囲にターゲットとしている。
これらの結果から, 分類的基盤化は, 繰り返し行われる知識労働において, より一貫性があり, 繰り返し可能なアウトプットを生み出すことが示唆された。
関連論文リスト
- Evaluating Real-Time Voice Agents: From Component Quality to Grounded Outcomes [0.0]
リアルタイム音声エージェントは、研究プロトタイプから製品展開へと移行してきたが、それらを記述する文献は断片化されている。
本稿では, TRG (Timing-Recovery-ed) について述べる。
論文 参考訳(メタデータ) (2026-09-25T04:22:20Z) - TaxCE : A Framework for Automated Taxonomy Construction and Evaluation at Scale [0.992650024444822]
TaxCEは、構造化されていないフィードバックテキストを階層的な分類に整理するための完全に自動化されたフレームワークである。
本稿では,3つのコーパスグラウンド評価指標,排他性,排他性,粒状性(EEG)を紹介する。
論文 参考訳(メタデータ) (2026-08-31T11:25:25Z) - GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation [74.44235943118994]
GenRubricは、ラベルのないクエリからルーブリック生成を改善する自己進化フレームワークである。
我々はこの原理を強化学習により実現し、ルーブリック間の包括性信号とグループレベルの報酬と基準レベルの報酬を組み合わせる。
人間の注釈付きルーブリックベンチマークの実験では、自己進化は生成されたルーブリックと専門家によるルーブリックによる評価の一致を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-30T15:39:39Z) - Compositional Benchmark Synthesis for Hierarchical Human Action Recognition [4.812022454180755]
4段階階層型インテンションベンチマークを合成するベンチマーク生成および評価フレームワークを提案する。
エピソードは、主題一貫性制約の下で遷移モデルによって組み立てられる。
被検体の使用量を0.566から0.248に削減する。
論文 参考訳(メタデータ) (2026-08-11T10:22:22Z) - Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures [5.14587904921075]
既存の評価は、エージェントの障害をシステムレベルの結果に還元し、どの障害がどこから発生し、どの介入がエージェントシステムを改善するのかを無視する。
同じ可視的障害は、トレーニング後のモデル、ハーネスエンジニアリング、環境再設計、あるいはそのソースによるベンチマーク修復を要求する可能性がある。
ほとんどの失敗は、ベンチマークに特有で共有構造がないため、この問題を解決するのにほとんど役立ちません。
そこで本研究では,障害を発生源とする相互作用に局所化し,責任成分を同定する相互作用中心の分類法を提案する。
論文 参考訳(メタデータ) (2026-07-30T19:55:14Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - TaSR-RAG: Taxonomy-guided Structured Reasoning for Retrieval-Augmented Generation [17.21708416305234]
textscTaSR-RAGは、エビデンス選択のための分類誘導構造推論フレームワークである。
textscTaSR-RAGは、強いRAGと構造化RAGベースラインを最大14%上回っている。
論文 参考訳(メタデータ) (2026-03-10T08:16:36Z) - Respecting Temporal-Causal Consistency: Entity-Event Knowledge Graphs for Retrieval-Augmented Generation [69.45495166424642]
我々は,物語文書における時間的,因果的,文字的整合性を理解するために,頑健で差別的なQAベンチマークを開発する。
次に、バイナリマッピングでリンクされたエンティティとイベントのサブグラフを分離したまま保持するデュアルグラフフレームワークであるEntity-Event RAG(E2RAG)を紹介します。
ChronoQA全体で、我々のアプローチは最先端の非構造化およびKGベースのRAGベースラインよりも優れており、因果一貫性クエリや文字整合性クエリが顕著である。
論文 参考訳(メタデータ) (2025-06-06T10:07:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。