論文の概要: User Feedback Provides a Unique Signal that LLMs Can not Detect
- arxiv url: http://arxiv.org/abs/2609.02859v1
- Date: Wed, 02 Sep 2026 17:42:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.483225
- Title: User Feedback Provides a Unique Signal that LLMs Can not Detect
- Title(参考訳): LLMが検出できないユニークな信号を提供するユーザフィードバック
- Abstract要約: ユーザからのフィードバックが、改善のための非常に実用的なシグナルであることを実証します。
フィードバックインフォームドリビジョンでは,ベースラインリビジョンよりもはるかに高いレートで目標課題を解決できることが示されている。
- 参考スコア(独自算出の注目度): 25.849928795741672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Harnessing naturally occurring feedback from user interactions offers a promising learning signal for Large Language Models (LLMs). However, recent studies suggest this feedback is inherently noisy and difficult to leverage effectively. We challenge this conception by demonstrating that user feedback is a highly actionable signal for improvement, and that its perceived ineffectiveness stems from a systematic bias in current evaluation paradigms. To isolate the usefulness of feedback, we construct synthetic data with a definitive ground truth, alongside naturalistic data to validate that our findings hold in real-world scenarios. By comparing model revisions generated with and without access to feedback across both settings, we show that feedback-informed revisions resolve targeted issues at significantly higher rates than baseline revisions. Finally, we expose the root of the evaluation bias: when a model successfully fixes an issue exclusively due to feedback, LLM judges frequently fail to identify the genuinely corrected response, systematically preferring inferior baseline outputs instead.
- Abstract(参考訳): ユーザインタラクションから自然に発生するフィードバックのハーネス化は、Large Language Models(LLMs)に有望な学習信号を提供する。
しかし、近年の研究は、このフィードバックは本質的にうるさく、効果的に活用することが難しいことを示唆している。
我々は、ユーザフィードバックが改善のための非常に実用的なシグナルであること、そして、その認識された非効率性は、現在の評価パラダイムにおける体系的なバイアスに起因することを実証することによって、この概念に挑戦する。
フィードバックの有用性を分離するために,本研究は,本研究が実世界のシナリオで保持する自然主義的データとともに,決定的な根拠を持つ合成データを構築した。
両設定間のフィードバックを伴わずに生成したモデルリビジョンを比較することで,フィードバックインフォームド・リビジョンは,ベースラインリビジョンよりもはるかに高いレートで目標課題を解決していることを示す。
最後に、評価バイアスの根源を明らかにする:モデルがフィードバックによってのみ問題を修正するのに成功すると、LLMの判断は真に修正された応答の特定に失敗し、代わりに下位のベースライン出力を体系的に優先する。
関連論文リスト
- CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks [65.44788139573144]
我々は、スケーラブルで費用対効果の高い代替手段として、観察的報酬モデル(観察的ユーザフィードバックを伴う報酬モデル)を導入します。
CaulRMは、観察フィードバックから偏見のない報酬モデルを学ぶことを目指している。
実験では、CausalRMがノイズや偏りのある観測フィードバックから正確な報酬信号を効果的に学習することを検証する。
論文 参考訳(メタデータ) (2026-03-19T10:37:34Z) - CoNRec: Context-Discerning Negative Recommendation with LLMs [5.832474387562381]
ユーザのネガティブな嗜好に関する研究は、現代のレコメンデーションシステムにおいてますます重要になっている。
既存のアプローチのほとんどは、主に肯定的な推奨を強化する補助信号として負のフィードバックを使用している。
特殊設計した文脈認識モジュールを用いた負のフィードバックモデリングのための,最初の大規模言語モデルフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-22T07:46:18Z) - In-Place Feedback: A New Paradigm for Guiding LLMs in Multi-Turn Reasoning [10.138497038893096]
LLMの以前の応答を直接編集する新しいインタラクションパラダイムであるin-place feedbackを導入する。
推論集約型ベンチマークの実証評価により、インプレースフィードバックは従来のマルチターンフィードバックよりも優れたパフォーマンスが得られることが示された。
論文 参考訳(メタデータ) (2025-10-01T11:16:04Z) - Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers [63.99316853136304]
ミラー・クリティク(Mirror-Critique)は、情報的批評で検証者を訓練する枠組みである。
我々は、高品質な批判データを合成するために、小さな命令調整モデルを展開する。
結果として得られるミラー検証は、ソリューション毎に複数の批判を生成することで、候補ソリューションを評価するためにデプロイされる。
論文 参考訳(メタデータ) (2025-09-27T06:50:24Z) - WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback [36.06000681394939]
WildFeedbackは、大規模言語モデル(LLM)との会話中にユーザからのフィードバックをその場で活用して、好みのデータセットを自動的に作成する新しいフレームワークである。
実験の結果,WildFeedbackデータセットを微調整したLCMは,ユーザの好みに合わせて大幅に改善されていることがわかった。
論文 参考訳(メタデータ) (2024-08-28T05:53:46Z) - Is user feedback always informative? Retrieval Latent Defending for Semi-Supervised Domain Adaptation without Source Data [34.55109747972333]
本稿では,現実のアプリケーションで容易に利用できるユーザフィードバックを用いて,ソースモデルをターゲット環境に適用することを目的とする。
負バイアスフィードバック(NBF)と呼ばれる新しい概念を用いて、この現象を解析する。
スケーラブルな適応アプローチであるRetrieval Latent Defendingを提案する。
論文 参考訳(メタデータ) (2024-07-22T05:15:41Z) - Beyond Thumbs Up/Down: Untangling Challenges of Fine-Grained Feedback for Text-to-Image Generation [67.88747330066049]
きめ細かいフィードバックは、画像の品質と迅速な調整におけるニュアンスドの区別を捉えます。
粗いフィードバックに対する優位性を示すことは、自動ではないことを示す。
きめ細かいフィードバックを抽出し活用する上で重要な課題を特定します。
論文 参考訳(メタデータ) (2024-06-24T17:19:34Z) - Rethinking the Evaluation of Dialogue Systems: Effects of User Feedback on Crowdworkers and LLMs [57.16442740983528]
アドホック検索では、評価は暗黙のフィードバックを含むユーザーの行動に大きく依存する。
アノテータの会話知覚におけるターン評価におけるユーザフィードバックの役割はほとんど研究されていない。
本稿では,タスク指向対話システム(TDS)の評価が,ターンのフォローアップ発話を通じて提供されるユーザフィードバック,明示的あるいは暗黙的な評価にどのように影響するかに注目した。
論文 参考訳(メタデータ) (2024-04-19T16:45:50Z) - RLVF: Learning from Verbal Feedback without Overgeneralization [94.19501420241188]
本稿では,このような過度な一般化を伴わずに,言語フィードバックを取り入れることの課題について検討する。
制約付き選好最適化(C3PO)を用いた新しい文脈的批評手法を開発した。
提案手法は,他の文脈に対する既存行動を維持しながら,関連するシナリオに対して効果的な言語フィードバックを適用する。
論文 参考訳(メタデータ) (2024-02-16T18:50:24Z) - DPR: An Algorithm Mitigate Bias Accumulation in Recommendation feedback
loops [41.21024436158042]
フィードバックループと未知の露出メカニズムが推奨品質とユーザエクスペリエンスに与える影響について検討した。
本研究では,動的再重み付けを用いてクロスエフェクトを緩和する非バイアスアルゴリズムである動的パーソナライズランキング(textbfDPR)を提案する。
提案手法は,フィードバックループと未知の露出機構の負の効果を緩和するものである。
論文 参考訳(メタデータ) (2023-11-10T04:36:00Z) - Simulating Bandit Learning from User Feedback for Extractive Question
Answering [51.97943858898579]
教師付きデータを用いたフィードバックのシミュレーションにより,ユーザフィードバックからの学習を抽出的質問応答に適用する。
当初は少数の例でトレーニングしたシステムが,モデル予測された回答に対するユーザからのフィードバックを劇的に改善できることが示される。
論文 参考訳(メタデータ) (2022-03-18T17:47:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。