論文の概要: The Prompt Is Not the Query: How Request State Evolves Across Multi-Turn AI Conversations
- arxiv url: http://arxiv.org/abs/2607.22392v1
- Date: Fri, 24 Jul 2026 15:16:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.163633
- Title: The Prompt Is Not the Query: How Request State Evolves Across Multi-Turn AI Conversations
- Title(参考訳): Promptはクエリではない - リクエスト状態がマルチターンAI会話間でどのように進化するか
- Authors: Benjamin Tannenbaum,
- Abstract要約: を観測可能な構成、会話条件の要求状態に置き換え、その状態がユーザターン間でどのように分散されているかを測定します。
この分析は、前回の会話研究の凍結ルールと統制されたコホートを再利用する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-search evaluation commonly treats a prompt as a stable query that can be counted, classified, and replayed in isolation. A conversation makes that unit of analysis questionable: each user turn can add a constraint, revise an assumption, request evidence, or refer to alternatives established earlier. We replace latent "intent" with an observable construct, conversation-conditioned request state, and measure how that state is distributed across user turns. The analysis reuses frozen rules and the governed cohort of a preceding conversation study: 670 English commercial multi-turn conversations in a discovery-replication design and 7,463 public PRISM conversations from 1,389 participants. In the commercial corpus, the final prompt contains a median 35.6% of the session's unique user-side content vocabulary; in PRISM, the median is 36.4%. The final prompt contains at most half of that vocabulary in 68.4% and 74.3% of conversations, respectively. More importantly, transparent rules detect at least one request-state dimension in history but not in the final prompt in 50.3% of commercial conversations and 44.8% of PRISM conversations. Among dimension-bearing conversations, the final prompt reproduces the full observed dimension set in only 26.1% and 26.2%. At the same time, the final prompt adds a previously unseen dimension in 17.9% and 19.3%, showing that the endpoint is neither a summary nor merely a reference: it is often another state update. Length-matched nulls show that low lexical coverage is largely a consequence of turn length, so vocabulary results are interpreted as information availability, not semantic drift. The categorical results support session-level measurement for AI search. They do not estimate the causal effect of history on model answers.
- Abstract(参考訳): AI-search評価は、プロンプトを、個別にカウント、分類、再生できる安定したクエリとして扱うのが一般的である。
各ユーザーターンは制約を追加したり、仮定を変更したり、エビデンスを要求したり、以前に確立された代替案を参照することができる。
を観測可能な構成、会話条件の要求状態に置き換え、その状態がユーザターン間でどのように分散されているかを測定します。
この分析は、凍結ルールと前回の会話研究のコホートを再利用する: 発見複製設計における670人のイングランドの商用マルチターン会話と、1,389人の参加者による7,463人の公開PRISM会話である。
商業コーパスでは、最終プロンプトはセッションのユニークなユーザー側コンテンツ語彙の35.6%を含み、PRISMでは36.4%である。
最後のプロンプトは、その語彙のほぼ半分を68.4%と74.3%の会話で含んでいる。
さらに重要なことは、透明なルールは、歴史において少なくとも1つの要求状態次元を検知するが、商業会話の50.3%とPRISM会話の44.8%の最終的なプロンプトには含まれない。
次元を持つ会話の中で、最後のプロンプトは26.1%と26.2%の完全な観測次元を再現する。
同時に、最終プロンプトは17.9%と19.3%の未確認次元を追加し、エンドポイントが要約でも単なる参照でもないことを示す。
長さマッチングされたヌルは、語彙範囲の低さがターン長の結果であることを示しているため、語彙の結果は意味的ドリフトではなく情報可用性として解釈される。
分類学的結果は、AI検索のセッションレベル測定をサポートする。
彼らは、モデル回答に対する履歴の因果効果を見積もってはいない。
関連論文リスト
- OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations [6.89645931986174]
大規模言語モデル (LLM) 対話システムは毎日数百万のマルチターン対話を処理する。
次クエリ予測は、先行するダイアログのみに基づいて、ユーザのその後のクエリを予測する。
OnePredは、トピック、未解決のニーズ、関心の変化をまたいだユーザの進化する意図の軌跡を追跡する。
論文 参考訳(メタデータ) (2026-05-22T14:16:21Z) - ProactBench: Beyond What The User Asked For [5.422521416406412]
ProactBenchは、textscEmergent、単一の公開アンカーからの推論、textscCritical、複数のアンカー間での合成、textscRecovery、タスク完了後の前方にある値の3つのフェーズ型に分解する。
我々の情報アシンメトリーは、スタイル強調スコア、漏洩、外部コンテキスト汚染、情報ダンプに対して防御します。
論文 参考訳(メタデータ) (2026-05-09T23:56:04Z) - Do LLMs Benefit From Their Own Words? [56.73014497206615]
先行するアシスタント応答の除去は,少数のターンにおいて応答品質に影響を与えないことがわかった。
アシスタント側コンテキストのオミッティングは、累積コンテキストの長さを最大10倍に減らすことができる。
本研究は, 記憶量削減を図り, アシスタント履歴を選択的に省略することで, 応答品質を向上できることを示唆する。
論文 参考訳(メタデータ) (2026-02-27T18:58:26Z) - SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents [70.08842857515141]
SpokenWOZは音声TODのための大規模音声テキストデータセットである。
SpokenWOZでは、クロスターンスロットと推論スロット検出が新たな課題である。
論文 参考訳(メタデータ) (2023-05-22T13:47:51Z) - Prediction of Listener Perception of Argumentative Speech in a
Crowdsourced Data Using (Psycho-)Linguistic and Fluency Features [24.14001104126045]
議論的発話のクラウドソースデータセットにおいてTEDトークスタイルの感情評価を予測することを目的としている。
本稿では,TEDトーク音声の大規模データセット上で事前学習したモデルを微調整することにより,これらのカテゴリを予測するための分類タスクに有効なアプローチを提案する。
論文 参考訳(メタデータ) (2021-11-13T15:07:13Z) - Multi-Stage Conversational Passage Retrieval: An Approach to Fusing Term
Importance Estimation and Neural Query Rewriting [56.268862325167575]
マルチステージアドホックIRシステムにクエリ再構成を組み込んだ会話経路検索(ConvPR)に取り組む。
本稿では,1項の重要度推定と2項のニューラルクエリ書き換えという2つの手法を提案する。
前者に対しては、周波数に基づく信号を用いて会話コンテキストから抽出した重要な用語を用いて会話クエリを拡張する。
後者では,会話クエリを,事前訓練されたシーケンス列列列モデルを用いて,自然な,スタンドアロンの,人間の理解可能なクエリに再構成する。
論文 参考訳(メタデータ) (2020-05-05T14:30:20Z) - Conversational Question Answering over Passages by Leveraging Word
Proximity Networks [33.59664244897881]
CROWNは、経路応答を持つ会話型QAのための教師なしかつ効果的なシステムである。
複数のターンにまたがる複数のコンテキストの伝搬をサポートする。
CROWNはTREC CAsTデータで評価され、ニューラルネットワークのプールにおいて上述の性能を達成した。
論文 参考訳(メタデータ) (2020-04-27T19:30:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。