論文の概要: A Penny for Your Prompts: Experiments Detecting and Mitigating LLM Usage by Survey Respondents
- arxiv url: http://arxiv.org/abs/2607.00403v1
- Date: Wed, 01 Jul 2026 04:01:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.71003
- Title: A Penny for Your Prompts: Experiments Detecting and Mitigating LLM Usage by Survey Respondents
- Title(参考訳): プロンプットの1ペニー:調査応答によるLSM使用の検出と緩和実験
- Abstract要約: 大規模な言語モデルは,調査に回答する上で,クラウドソーシングプラットフォーム上で参加者によって使用されるものが増えています。
本研究の目的は,この行動の頻度を定量化し,その検出・防止方法を検討することである。
- 参考スコア(独自算出の注目度): 1.6643984790651822
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly used by participants on crowdsourcing platforms when responding to surveys, potentially undermining the validity of collected data. Our study aims to quantify the prevalence of this behavior and investigate methods to detect and prevent it. In a series of surveys (N = 250), we examined conditions such as platform choice, survey length, requests not to use AI, and disabling copy-paste functionality. We were able to identify distinct characteristics of LLM-assisted responses and found that their frequency varied widely, from under 10% on Prolific to over 80% on Mechanical Turk. Mitigation measures reduced LLM usage but did not necessarily improve data quality. No participants employed browser-use agents at the time of our survey, but we report on our own detection experiments. We recommend that researchers actively screen survey responses for LLM usage by recording and analyzing keystroke data and crafting instructions and questions aimed at AI.
- Abstract(参考訳): 大規模な言語モデルは、調査に答えるときにクラウドソーシングプラットフォーム上で参加者によってますます使われており、収集されたデータの妥当性を損なう可能性がある。
本研究の目的は,この行動の頻度を定量化し,その検出・防止方法を検討することである。
一連の調査(N = 250)において、プラットフォームの選択、調査期間、AIを使用しない要求、コピーペースト機能の無効化などの条件を検討した。
我々はLSM支援応答の異なる特徴を識別することができ、それらの周波数はProlificの10%以下からMechanical Turkの80%以上まで広範囲に変化した。
緩和策はLLMの使用を減らしたが、必ずしもデータ品質を改善できなかった。
調査時,ブラウザ利用エージェントは使用されなかったが,本調査では検出実験を報告した。
研究者は、キーストロークデータを記録・分析し、AIを対象とした指示や質問を作成することによって、LCMの使用に関する調査回答を積極的にスクリーニングすることを推奨する。
関連論文リスト
- Towards Detecting AI-Assisted Responses in Online Surveys [10.251117966654645]
我々はAI支援調査参加のための初期ベンチマークデータセットであるASURREを紹介した。
一方、回答者全員を模倣するペルソナグラウンドのエージェントは、検出性能を偶然に向上させる。
論文 参考訳(メタデータ) (2026-09-15T15:27:04Z) - Questionnaire meets LLM: A Benchmark and Empirical Study of Structural Skills for Understanding Questions and Responses [3.8293581919117123]
大規模言語モデル(LLM)は、オープンエンドテキストよりも数ショットの推論で優れている。
現在の検索および調査分析ツールは、典型的にはワークフロー内の人間のために設計されている。
回答検索,応答数,マルチホップ推論を含む6つの構造的スキルを探索するベンチマークであるQASUを紹介する。
実験により、有効なフォーマットを選択し、迅速な組み合わせを行うことで、最適以下のフォーマットに比べて最大8.8%の精度が向上することが示された。
論文 参考訳(メタデータ) (2025-10-30T08:18:37Z) - Learning from Convenience Samples: A Case Study on Fine-Tuning LLMs for Survey Non-response in the German Longitudinal Election Study [0.6104510780984732]
ランダムな非応答と体系的な非応答の両方で自己申告された投票選択をインプットするために、大きな言語モデルを微調整する。
LLMは、ゼロショットよりも正確に個人レベルの予測と人口レベルの分布を復元することができる。
このことは、微調整のLSMが、非確率的なサンプルや体系的な欠陥を扱う研究者に有望な戦略を提供することを示唆している。
論文 参考訳(メタデータ) (2025-09-29T17:12:18Z) - Prompt Perturbations Reveal Human-Like Biases in Large Language Model Survey Responses [2.3112192919085826]
大規模言語モデル (LLMs) は、社会科学調査において、人間の被験者のプロキシとしてますます使われている。
既知のヒトのような反応バイアスに対する信頼性と感受性は理解されていない。
本研究は, 標準調査文脈におけるLCMの応答ロバスト性について検討する。
論文 参考訳(メタデータ) (2025-07-09T18:01:50Z) - AIn't Nothing But a Survey? Using Large Language Models for Coding German Open-Ended Survey Responses on Survey Motivation [0.8437187555622164]
本研究は,他の文脈におけるオープンエンドサーベイ応答の符号化に,LLMがどの程度の精度で利用できるかを検討する。
我々は、最先端のLLMといくつかのプロンプトアプローチを比較し、人間の専門家による符号化を用いてLLMの性能を評価する。
本研究は, LLMを効率的に, 正確に, 確実に活用できる環境研究の進展に寄与する。
論文 参考訳(メタデータ) (2025-06-17T15:28:53Z) - Leveraging Interview-Informed LLMs to Model Survey Responses: Comparative Insights from AI-Generated and Human Data [4.774576759157642]
混合手法の研究は量的および質的なデータを統合するが、それらの異なる構造を整合させる際の課題に直面している。
本研究では,大規模言語モデル(LLM)が人間の調査応答を確実に予測できるかどうかを検討する。
論文 参考訳(メタデータ) (2025-05-28T05:57:26Z) - Information-Guided Identification of Training Data Imprint in (Proprietary) Large Language Models [52.439289085318634]
情報誘導プローブを用いて,プロプライエタリな大規模言語モデル (LLM) で知られているトレーニングデータを識別する方法を示す。
我々の研究は、重要な観察の上に成り立っている: 高次数テキストパスは、暗記プローブにとって良い検索材料である。
論文 参考訳(メタデータ) (2025-03-15T10:19:15Z) - Fostering Appropriate Reliance on Large Language Models: The Role of Explanations, Sources, and Inconsistencies [66.30619782227173]
大規模言語モデル(LLMs)は、流動的で説得力のある誤った応答を生成することができる。
ユーザの信頼を形作るLCM応答のいくつかの特徴を同定する。
説明は正しい応答と誤応答の両方に依存することが判明した。
情報源が提供された場合や説明が矛盾している場合の誤った応答への依存度は低い。
論文 参考訳(メタデータ) (2025-02-12T16:35:41Z) - Specializing Large Language Models to Simulate Survey Response Distributions for Global Populations [49.908708778200115]
我々は,調査応答分布をシミュレートする大規模言語モデル (LLM) を最初に開発した。
テストベッドとして、我々は2つの世界文化調査の国レベルの結果を使用します。
予測された応答分布と実際の応答分布のばらつきを最小限に抑えるために, ファースト・ツーケン確率に基づく微調整法を提案する。
論文 参考訳(メタデータ) (2025-02-10T21:59:27Z) - Dynamic Uncertainty Ranking: Enhancing Retrieval-Augmented In-Context Learning for Long-Tail Knowledge in LLMs [50.29035873837]
大規模言語モデル(LLM)は、事前訓練中に多様なドメインから膨大な量の知識を学習することができる。
専門ドメインからの長い尾の知識は、しばしば不足し、表現されていないため、モデルの記憶にはほとんど現れない。
ICLの強化学習に基づく動的不確実性ランキング手法を提案する。
論文 参考訳(メタデータ) (2024-10-31T03:42:17Z) - Get my drift? Catching LLM Task Drift with Activation Deltas [55.75645403965326]
タスクドリフトは攻撃者がデータを流出させたり、LLMの出力に影響を与えたりすることを可能にする。
そこで, 簡易線形分類器は, 分布外テストセット上で, ほぼ完全なLOC AUCでドリフトを検出することができることを示す。
このアプローチは、プロンプトインジェクション、ジェイルブレイク、悪意のある指示など、目に見えないタスクドメインに対して驚くほどうまく一般化する。
論文 参考訳(メタデータ) (2024-06-02T16:53:21Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。