論文の概要: Selective Elicitation as a Commercial Influence Channel: A Reproducible Synthetic Shopping-Agent Stress Test
- arxiv url: http://arxiv.org/abs/2609.36614v1
- Date: Tue, 29 Sep 2026 03:28:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.152854
- Title: Selective Elicitation as a Commercial Influence Channel: A Reproducible Synthetic Shopping-Agent Stress Test
- Title(参考訳): 商業効果チャネルとしての選択的励磁-再生可能な合成ショッピングエージェントストレステスト-
- Abstract要約: 我々はこの区別を、意図的に小さな合成環境で実験的に観察できるようにする。
我々は、中立的な質問、ソフトな商業的指示、およびスポンサーの利点を問うための明示的に敵対的な指示とを対比する。
目標とする命令は、スポンサー選択を0.30増加させ、中立的な質問に対して平均合成ユーティリティを0.0547削減する。
- 参考スコア(独自算出の注目度): 7.504639516424482
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A commercial incentive need not enter the final ranking algorithm to affect a shopping assistant's recommendation: it may instead influence which preference question the assistant asks. We make this distinction experimentally observable in a deliberately small, synthetic setting. Each task has two products, three verified numerical attributes, a price limit, and a private fixed preference vector. An honest simulated user answers one pairwise question. A separate recommender receives the products and this answer but not the sponsorship assignment. We contrast a neutral question, a soft commercial instruction, and an explicitly adversarial instruction to ask about the sponsor's advantage while omitting the rival's advantage. Across 40 held-out sponsorship-assignment cases (20 distinct catalog-preference contexts), the soft instruction changes no selections. The targeted instruction raises sponsored selection by 0.30 and reduces mean synthetic utility by 0.0547 relative to neutral questioning (95% context-bootstrap interval [-0.0828, -0.0291]) for one language-model recommender. A fixed Bayesian recommender shows a similar effect; a second model makes the same choices on all 120 frozen question-answer inputs. A terminal-answer consistency judge rates all 20 sampled targeted answers consistent, although five have synthetic regret above 0.05; a separate question-coverage dimension flags their one-sided elicitation. A robust partial-preference certificate remains valid under the stipulated synthetic utility but certifies only 16 of 40 targeted cases and is not better than asking a neutral question directly. These results establish neither typical behavior under advertising incentives nor effects on actual consumers.
- Abstract(参考訳): 商業的なインセンティブは、ショッピングアシスタントの推奨に影響を与える最終ランク付けアルゴリズムに入る必要はない。
我々はこの区別を、意図的に小さな合成環境で実験的に観察できるようにする。
各タスクには2つの積、3つの検証された数値属性、価格制限、プライベートな固定された優先ベクトルがある。
正直なシミュレートされたユーザは、一対の質問に答える。
別個のレコメンデータは製品とこの回答を受け取りますが、スポンサーの割り当ては受け取りません。
我々は、中立的な質問、ソフトな商業的指示、そして、相手の利点を軽視しながらスポンサーの利点を問う明示的な敵の指示とを対比する。
40人を超えるスポンサーシップ割り当てケース(20の異なるカタログ参照コンテキスト)では、ソフトインストラクションは選択を変更できない。
対象の命令は、0.30のスポンサー選択を高め、一方の言語モデルレコメンデータに対して、中立的な質問(95%のコンテキスト-ブートストラップ間隔 [-0.0828, -0.0291])に対して平均合成ユーティリティを0.0547削減する。
固定ベイズ推薦者は同様の効果を示し、第2のモデルは120個の凍結された質問応答入力に対して同じ選択をする。
終端回答の整合性判定は、20のサンプリング対象の回答を全て一貫した値で評価するが、5つは0.05以上の合成後悔を持つ。
厳密な部分参照証明書は、規定された合成ユーティリティの下では有効であるが、40件中16件のみを認証し、中立な質問を直接答えるよりはましではない。
これらの結果は、広告インセンティブの下での典型的な行動や、実際の消費者への影響を定めていない。
関連論文リスト
- GradeTrap: Authority Cues in Images Shift VLM Judgments Despite Explicit Instructions to Ignore Them [0.0]
そこで我々は,2つの社会的手がかりを直接衝突させる制御された評価手法であるGradeTrapを紹介した。
学生の回答はサイコファンティックな合意を惹きつけるべきであり、友人、教師、または公式の回答キーに起因する矛盾した回答は権威に基づく推論を引き付けるべきである。
我々は60の合成現実世界のトレードオフシナリオでモデルをテストする。
論文 参考訳(メタデータ) (2026-09-05T12:30:39Z) - One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies [49.067670811577045]
本稿では,孤立した質問品質ではなく,政策行動として明確化を評価するベンチマークであるRegretBenchを紹介する。
RegretBenchは、意図的な解決、相互作用コスト、非効率な明確化、後悔を計測する。
以上の結果から,有効な明確化には有望な質問以上のものが必要であることが示唆された。
論文 参考訳(メタデータ) (2026-07-23T10:22:11Z) - Who Owns the AI Recommendation? A Multi-Industry Empirical Map of Brand Category Ownership Across Large Language Models [0.0]
50のブランド、5つの業界、250のブランドなしカテゴリークエリにまたがる3,750の回答。
カテゴリー内の言及のシェアであるカテゴリー所有者指数(COI)、競合真空指数(CVI)、単一リーダを持たないカテゴリのフラグ付け、ブランド間の非対称置換の定量化である変位スコア(DS)の3つの探索指標を提案する。
論文 参考訳(メタデータ) (2026-06-22T09:10:54Z) - Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline [0.0]
購入者が質問をどう表現するかの小さな変更は、AIアシスタントとはかなり異なるブランドレコメンデーションを生み出している。
6000のパラフレーズランと6000の同じプロンプトリランコントロールでは、同じ購入意図の2つのパラフレーズの類似性は0.288である。
プロンプト文字列は、下層の買い手意図ではなく、ブランドが提示する主要なインプットである。
論文 参考訳(メタデータ) (2026-05-22T17:23:02Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines [0.0]
マルチエージェントLLMパイプラインは、チームの多様性がアウトプット品質を改善するかどうかという矛盾した証拠を生み出します。
多様性が役に立つか傷つくかを判断する選択ボトルネックを特定することで解決法を提案する。
この結果から, セレクタの品質は, 単ラウンドジェネレータ選択パイプラインにおけるジェネレータの多様性よりも, より影響の高い設計レバーである可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-20T00:50:53Z) - Abductive Preference Learning [2.83533907065442]
提案手法は,従来の条件を,応答が与えられたプロンプトよりも優先する学習によって逆転させる,微調整のパラダイムである。
標準手法は応答選択を改善し、帰納的手法は迅速な識別を改善し、マルチタスクの目的は両方を統一する。
論文 参考訳(メタデータ) (2025-10-10T21:55:26Z) - Not All Preference Pairs Are Created Equal: A Recipe for Annotation-Efficient Iterative Preference Learning [81.69044784288005]
反復的な選好学習には、オンラインの注釈付き選好ラベルが必要である。
コスト効率のよいアノテーションに対する応答対を選択するための戦略について検討する。
論文 参考訳(メタデータ) (2024-06-25T06:49:16Z) - A First Look at Selection Bias in Preference Elicitation for Recommendation [64.44255178199846]
選好選好における選好バイアスの影響について検討した。
大きなハードルは、好みの推論インタラクションを持つ公開データセットがないことです。
本稿では,トピックに基づく選好提案プロセスのシミュレーションを提案する。
論文 参考訳(メタデータ) (2024-05-01T14:56:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。