論文の概要: Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance
- arxiv url: http://arxiv.org/abs/2608.11008v2
- Date: Wed, 12 Aug 2026 09:15:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.649111
- Title: Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance
- Title(参考訳): テンプレートか完全合成か? 筆記以外の政治的スタンスを測るコンファウンドとしての素早い構成
- Abstract要約: LLMにおける政治的スタンスの検出は、長い間、閉ざされた多票政治調査の質問に支配されてきた。
テンプレート化されたプロンプトは、特にオープンなタスクにおいて、実際のプロンプトのニュアンスを欠いていると我々は主張する。
そこで本研究では,種子として真にプロンプトを付加した詳細な指示の下で生成した完全合成プロンプト(LLM生成)の使用を提案する。
- 参考スコア(独自算出の注目度): 13.673455616267816
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Political stance detection in LLMs has long been dominated by closed-ended, multiple-choice political survey questions---originally designed for humans, and thus lacks the realism and nuance of human-AI interactions in the wild, while also being susceptible to sandbagging. The recent IssueBench framework substantially mitigates these limitations with templated prompts anchored in real-world chat logs. Given the rise in non-work-related use of GenAI assistants, we extend IssueBench beyond writing assistance to include two additional tasks, information seeking and opinion sharing. We argue that templated prompts still lack the nuance of real ones, especially for open-ended tasks, and remain recognisable as evaluation artefacts. We propose the use of fully synthetic (LLM-generated) prompts, produced under detailed instructions with real prompts as seeds. We assess the ecological validity of real, templated, and LLM-generated prompts in a small-scale study covering 3 highly contested policy issues and 3 recent geopolitical conflicts. Human and LLM annotators rank LLM-generated prompts as no less realistic than real ones and clearly more realistic than templated ones, and find that they carry their intended intent and stance more clearly; the LLMs separate templated prompts from the other two far more sharply than the humans do. In a case study, templated and LLM-generated prompts yield systematically different stance estimates for the same model, most visibly under neutral framings, where templated prompts overstate the model's leaning in the direction encoded by the topic-and-stance text (filler) slotted into their templates.
- Abstract(参考訳): LLMにおける政治的スタンスの検出は、長い間、閉ざされた多重選択の政治調査の質問が支配的であり、もともとは人間のために設計され、それゆえ、野生における人間とAIの相互作用の現実主義とニュアンスを欠いている。
最近の IssueBench フレームワークは、現実世界のチャットログに固定されたテンプレート付きプロンプトによって、これらの制限を大幅に緩和している。
GenAIアシスタントの非作業的利用の増加を踏まえ、IssageBenchは、追加の2つのタスク、情報検索、意見共有を含む補助書の執筆を超えて拡張する。
我々は、テンプレート化されたプロンプトは、特にオープンなタスクにおいて、実際のプロンプトのニュアンスに欠けており、評価アーチファクトとして認識可能であると主張している。
そこで本研究では,種子として真にプロンプトを付加した詳細な指示の下で生成した完全合成プロンプト(LLM生成)の使用を提案する。
近年の3つの政策課題と3つの地政学的対立を網羅した小規模研究において, 実, テンプレート, LLM生成プロンプトの生態学的妥当性を評価した。
人間とLLMアノテータは、LLM生成プロンプトを実際のプロンプトよりもリアルに、テンプレート化されたプロンプトよりも明らかにリアルにランク付けし、意図した意図と姿勢をより明確に表現している。
ケーススタディでは、テンプレート付きおよびLCM生成プロンプトは、同じモデルに対して、最も視覚的に中立なフレーミングの下で、同じモデルに対して体系的に異なるスタンス推定を生成する。
関連論文リスト
- Confirming Our Biases? Evaluating the Capabilities, Risks, and Societal Impact of Large Language Models [5.5881263948644175]
本研究は,大規模言語モデルが,プロンプトで表されるユーザのバイアスをいかに強化するかを考察する。
我々は、モデルが特定のポジションをサポートすることや、挑戦することを奨励する直接的かつ示唆的なプロンプトに対して、LLMがいかに影響を受けやすいかを評価する。
論文 参考訳(メタデータ) (2026-08-07T08:54:27Z) - ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models [32.099137908375546]
ClarifyMT-Benchは、大規模言語モデル(LLM)におけるマルチターン明確化のためのベンチマークである。
多様なあいまいさソースと相互作用パターンをキャプチャする6,120個のマルチターン対話を構築した。
textbfClarifyAgentは,認知,予測,追跡,計画に明確化を分解するエージェントアプローチである。
論文 参考訳(メタデータ) (2025-12-24T11:39:00Z) - What About the Scene with the Hitler Reference? HAUNT: A Framework to Probe LLMs' Self-consistency Via Adversarial Nudge [30.640398600941598]
幻覚は、大規模言語モデル(LLM)を高い領域に現実的に展開する上で重要な課題である。
本稿では, LLMにおける実力検査の枠組みについて述べる。
論文 参考訳(メタデータ) (2025-10-31T02:02:39Z) - Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts [79.1081247754018]
大規模言語モデル(LLM)は、推論、計画、意思決定のタスクに広くデプロイされている。
そこで我々は, 接触探索質問(CSQ)に基づく枠組みを提案し, 騙しの可能性を定量化する。
論文 参考訳(メタデータ) (2025-08-08T14:46:35Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - From Prompts to Templates: A Systematic Prompt Template Analysis for Real-world LLMapps [20.549178260624043]
大規模言語モデル(LLM)は、自然言語のプロンプトを通じて直感的なタスク実行を可能にすることで、人間とAIのインタラクションに革命をもたらした。
構造や単語の小さなバリエーションは、出力に大きな違いをもたらす可能性がある。
本稿では,実用LLMappにおけるプロンプトテンプレートの包括的解析について述べる。
論文 参考訳(メタデータ) (2025-04-02T18:20:06Z) - Revealing Fine-Grained Values and Opinions in Large Language Models [40.53709870111704]
政治コンパステスト(PCT)の62の命題に対する156kの応答のデータセットを,420の即時変動を用いて解析した。
微粒化解析のために, 応答のトポロジを同定することを提案する: 意味論的に類似したフレーズは, 異なるプロンプト間で繰り返し, 一貫性がある。
その結果,PCTの結果に有意な影響を与え,バイアスを反映し,クローズドフォームとオープンドメインの応答を誘発する際のテスト結果の相違が示唆された。
論文 参考訳(メタデータ) (2024-06-27T15:01:53Z) - WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia [59.96425443250666]
Retrieval-augmented Generation (RAG) は,大規模言語モデル(LLM)の限界を緩和する,有望なソリューションとして登場した。
本研究では,ウィキペディアからの矛盾文に基づく質問に対するLLM生成回答の総合評価を行う。
我々は、単一のパスを持つRAGと2つの矛盾するパスを持つRAGを含む、様々なQAシナリオ下で、クローズドおよびオープンソース両方のLSMをベンチマークする。
論文 参考訳(メタデータ) (2024-06-19T20:13:42Z) - Whose Side Are You On? Investigating the Political Stance of Large Language Models [56.883423489203786]
大規模言語モデル(LLM)の政治的指向性について,8つのトピックのスペクトルにわたって検討する。
我々の調査は、中絶からLGBTQ問題まで8つのトピックにまたがるLLMの政治的整合性について考察している。
この結果から,ユーザはクエリ作成時に留意すべきであり,中立的なプロンプト言語を選択する際には注意が必要であることが示唆された。
論文 参考訳(メタデータ) (2024-03-15T04:02:24Z) - AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations [52.43593893122206]
Alignedcotは、大規模言語モデルを呼び出すためのコンテキスト内学習技術である。
ゼロショットシナリオでは、一貫した正しいステップワイズプロンプトを達成する。
数学的推論とコモンセンス推論の実験を行う。
論文 参考訳(メタデータ) (2023-11-22T17:24:21Z) - LM-Polygraph: Uncertainty Estimation for Language Models [71.21409522341482]
不確実性推定(UE)手法は、大規模言語モデル(LLM)の安全性、責任性、効果的な利用のための1つの経路である。
テキスト生成タスクにおけるLLMの最先端UEメソッドのバッテリを実装したフレームワークであるLM-PolygraphをPythonで統一したプログラムインタフェースで導入する。
研究者によるUEテクニックの一貫した評価のための拡張可能なベンチマークと、信頼スコア付き標準チャットダイアログを強化するデモWebアプリケーションを導入している。
論文 参考訳(メタデータ) (2023-11-13T15:08:59Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。