論文の概要: Staged Linguistic Seeding: Grounded Query Expansion for Verified-Unit QA in AI Contact Centers
- arxiv url: http://arxiv.org/abs/2609.00844v2
- Date: Mon, 07 Sep 2026 07:50:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.334545
- Title: Staged Linguistic Seeding: Grounded Query Expansion for Verified-Unit QA in AI Contact Centers
- Title(参考訳): 段階的言語推論:AIコンタクトセンターにおける検証単位QAのための接地クエリ拡張
- Authors: Hyeonseop Yoon, Jeong-Eun Park,
- Abstract要約: 検証済みQAユニットのクローズドなセットからのみ回答するシステムをデプロイする。
1つの手法は両方のドメインで再利用されるため、推論はクエリ時間生成なしで1つの検索パスにとどまる。
陰性な結果を含む応用研究として報告する。
- 参考スコア(独自算出の注目度): 1.1983198417783958
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Customer-service QA in an AI contact center (AICC) runs under deployment constraints that benchmark QA misses: tight voice-hotline latency and a high cost for unsupported or wrong automatic answers. We deploy a system that answers only from a closed set of verified QA units: it returns a retrieved unit verbatim, or routes to clarify, abstain, or handoff. The index is enriched offline by staged linguistic seeding (SLS): a human authors a per-unit world-grounded slot recipe, gpt-4.1-mini renders it into variants, and a light human gate filters them. One methodology is reused across both domains, so inference stays a single retrieval pass with no query-time generation. On held-out query variants from two industrial domains, SLS lifts hybrid R@1 to 0.881/0.930 (+0.27/+0.34), with gains across all five retrievers tested. At the same gpt-4.1-mini generation budget, SLS beats doc2query by +0.20/+0.32, while cross-provenance evaluation provides additional evidence of transfer across generated-query distributions. Verified-unit answering also removes free-form generation's unsupported-content surface (7-13% versus approximately 0%). We report this as an application study, including negative results.
- Abstract(参考訳): AIコンタクトセンタ(AICC)のカスタマサービスQAは、QAが見逃すデプロイメントの制約の下で動作します。
検証済みのQAユニットのクローズドなセットからのみ回答するシステムをデプロイします。
インデックスはステージド言語シード (SLS) によってオフラインで強化され、人間は単位単位ごとのワールドグラウンドのスロットレシピを作成、gpt-4.1-miniはそれを変種にレンダリングし、ライトヒューマンゲートはそれらをフィルタリングする。
1つの手法は両方のドメインで再利用されるため、推論はクエリ時間生成なしで1つの検索パスにとどまる。
SLSは2つの産業ドメインからの持久クエリの変種について、ハイブリッドR@1から0.881/0.930(+0.27/+0.34)にリフトし、5つのレトリバーをテストした。
同じgpt-4.1-mini生成予算では、SLSはdoc2queryを+0.20/+0.32で上回り、クロスプロファイナンス評価は生成されたクエリー分布間での転送のさらなる証拠を提供する。
検証単位の応答はまた、自由形式の生成がサポートされていない表面 (約0%に対して7-13%) を除去する。
陰性な結果を含む応用研究として報告する。
関連論文リスト
- ArguLens: An Open-Source System for Automated Essay Scoring and Label-Aware Feedback Generation [9.677955445684686]
ArguLensは、自動エッセイスコア(AES)を3つの分離されたコンポーネントに分解するオープンソースシステムである。
ラベル対応フィードバックジェネレータは、Qwen2.5-14BInstructバックボーンでvLLMを介して機能する。
Gradio Web UIはプラグイン可能な推論バックエンドを公開し、単一評価とバッチスコアをサポートする。
論文 参考訳(メタデータ) (2026-08-18T04:23:50Z) - Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact [0.0]
大規模言語モデルは、データベースに対する自然言語インターフェースを新たに信頼できるものにしたが、キャリブレーションされたテキストから集約されたシステムは、デプロイメントにおいて重要な方法で失敗している。
本稿では、生成シェルを持つ信頼カーネルである、そのようなシステムのためのアーキテクチャパターンを1つの不変量に基づいて提案する。
生成シェルは入力とフレーズの応答を解釈し、決定論的カーネルは、完全に指定された質問と解答可能な質問形状の有界集合とを一致させる。
この2つは、ユーザが何らかの値が計算される前に読む確認で一致し、カーネルが表現できない要求は、近似されるよりも減少する。
論文 参考訳(メタデータ) (2026-08-14T03:53:21Z) - MergeSE: Post-Hoc Model Merging for Software Engineering Tasks Without Retraining [9.757638656919832]
我々は、HFaceエンコーダチェックポイントのトレーニング不要モデルマージのためのオープンソースのCLIおよびWebツールである textbfMergeSE を提示する。
MergeSEは、9つのタスクタイプの組み込みレジストリを通じて、SE分類をより広くサポートする。
TIES、DARE-TIES、Wudi、PCB、平均の5つのマージアルゴリズムをサポートしている。
論文 参考訳(メタデータ) (2026-08-04T19:39:02Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles [5.647839536820347]
著者間の不一致構造を抽出し活用し,信頼度を良好に推定するフレームワークであるDiscoUQを紹介する。
DiscoUQ-LLM の平均 AUROC は 0.802 であり、最高のベースラインを上回っている。
学習した機能は、ほぼゼロに近いパフォーマンス劣化を伴うベンチマークで一般化される。
論文 参考訳(メタデータ) (2026-03-21T23:24:12Z) - Test-Time Strategies for More Efficient and Accurate Agentic RAG [58.44913384057518]
Retrieval-Augmented Generation (RAG) システムは複雑なマルチホップ問題に直面している。
このような手法は、以前に処理された情報の反復的な検索を含む非効率性を導入することができる。
本稿では,これらの問題を軽減するために,サーチ-R1パイプラインに対するテスト時間修正について検討する。
論文 参考訳(メタデータ) (2026-03-12T19:18:59Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Open-domain Question Answering via Chain of Reasoning over Heterogeneous
Knowledge [82.5582220249183]
異種知識ソース間のシングル/マルチホップ質問に応答する新しいオープンドメイン質問応答(ODQA)フレームワークを提案する。
分離された証拠を収集するためにレトリバーにのみ依存する従来の方法とは異なり、我々の仲介者は検索された集合に対する推論の連鎖を実行する。
本システムは,2つのODQAデータセットであるOTT-QAとNQに対して,Wikipediaの表や節に対する競合性能を実現する。
論文 参考訳(メタデータ) (2022-10-22T03:21:32Z) - Zero-Shot Dialogue State Tracking via Cross-Task Transfer [69.70718906395182]
我々は,ゼロショット対話状態追跡タスクに対して,一般質問応答(QA)コーパスからテキストクロスタスク知識を転送することを提案する。
具体的には,抽出QAと複数選択QAをシームレスに組み合わせた転送可能な生成QAモデルであるTransferQAを提案する。
さらに,否定的質問サンプリングと文脈トランケーションという,解決不可能な質問を構築するための2つの効果的な方法を紹介した。
論文 参考訳(メタデータ) (2021-09-10T03:57:56Z) - Generating Diverse and Consistent QA pairs from Contexts with
Information-Maximizing Hierarchical Conditional VAEs [62.71505254770827]
非構造化テキストを文脈として与えられたQAペアを生成するための条件付き変分オートエンコーダ(HCVAE)を提案する。
我々のモデルは、トレーニングにわずかなデータしか使わず、両方のタスクの全てのベースラインに対して印象的なパフォーマンス向上が得られる。
論文 参考訳(メタデータ) (2020-05-28T08:26:06Z) - Fluent Response Generation for Conversational Question Answering [15.826109118064716]
本稿では,SEQ2SEQ NLGアプローチで応答をシチュレートする手法を提案する。
我々は、エンドツーエンドシステムのトレーニングデータを生成するためにデータ拡張を使用します。
論文 参考訳(メタデータ) (2020-05-21T04:57:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。