論文の概要: Email in the Era of LLMs
- arxiv url: http://arxiv.org/abs/2603.20231v1
- Date: Fri, 06 Mar 2026 19:00:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 02:36:12.919153
- Title: Email in the Era of LLMs
- Title(参考訳): LLM時代のメール
- Abstract要約: メール通信は、ますます大きな言語モデル(LLM)を伴います。
HR Simulatorは、プレイヤーがヒューマンリソースのオフィサーとしてプレーし、社会的に困難な職場シナリオを解決するために電子メールを書くゲームである。
LLMs-as-judgeによる600以上の人的およびLLMメールの分析は、より大きなLLMがメールの品質判断においてより均質になる証拠を明らかにしている。
- 参考スコア(独自算出の注目度): 30.377594388420576
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Email communication increasingly involves large language models (LLMs), but we lack intuition on how they will read, write, and optimize for nuanced social goals. We introduce HR Simulator, a game where communication is the core mechanic: players play as a Human Resources officer and write emails to solve socially challenging workplace scenarios. An analysis of 600+ human and LLM emails with LLMs-as-judge reveals evidence for larger LLMs becoming more homogenous in their email quality judgments. Under LLM judges, humans underperform LLMs (e.g., 23.5% vs. 48-54% success rate), but a human+LLM approach can outperform LLM-only (e.g., from 40% to nearly 100% in one scenario). In cases where models' email preferences disagree, emergent tact is a plausible explanation: weaker models prefer less tactful strategies while stronger models prefer more tactful ones. Regarding tone, LLM emails are more formal and empathetic while human emails are more varied. LLM rewrites make human emails more formal and empathetic, but models still struggle to imitate human emails in the low empathy, low formality quadrant, which highlights a limitation of current post-training approaches. Our results demonstrate the efficacy of communication games as instruments to measure communication in the era of LLMs, and posit human-LLM co-writing as an effective form of communication in that future.
- Abstract(参考訳): メール通信は、ますます大きな言語モデル(LLM)を伴いますが、彼らの読み方、書き方、微妙な社会的目標への最適化に関する直感は欠如しています。
我々は人事シミュレーション(HR Simulator)という,コミュニケーションがコアメカニックであるゲームを紹介した。プレイヤーはヒューマンリソースのオフィサーとしてプレーし,社会的に困難な職場シナリオを解決するためにメールを書く。
LLMs-as-judgeによる600以上の人的メールとLLMメールの分析は、より大きなLLMがメールの品質判断においてより均質になる証拠を明らかにしている。
LLMの判断では、人間はLSM(例: 23.5% 対 48-54% の成功率)を過小評価しているが、人間+LLM のアプローチは LLM のみ(例: 40% から 100% 近く)より優れている。
弱いモデルはより現実的な戦略を好むが、強いモデルはより現実的な戦略を好む。
トーンに関しては、LLMメールはよりフォーマルで共感的であり、人間のメールはより多様である。
LLMの書き直しは、人間のメールをより形式的で共感的なものにしますが、モデルでは、現在のトレーニング後のアプローチの制限を浮き彫りにした、低い共感と低いフォーマルさの4分の1で、人間のメールを模倣することに苦慮しています。
本稿は,LLM時代のコミュニケーションを計測する手段としてのコミュニケーションゲームの有効性を実証し,将来におけるコミュニケーションの効果的な形態として人間とLLMのコライティングを実証するものである。
関連論文リスト
- "I understand your perspective": LLM Persuasion and Sycophancy through the Lens of Communicative Action Theory [6.227886907896225]
LLM(Large Language Models)は、高品質な議論を生成できるが、ニュアンスと説得力のあるコミュニケーション行動に関与する能力はほとんど探索されていない。
この研究は、Jrgen HabermasのCommunicative Action理論の枠組みを通して、LLMの説得可能性を探究する。
論文 参考訳(メタデータ) (2026-06-06T09:54:31Z) - Large Language Models are overconfident and amplify human bias [1.014221700787766]
我々は,大規模言語モデル(LLM)が最も広く普及している人間のバイアスの1つ、過信を継承するかどうかを評価する。
私たちが研究している5つのLCMは、すべて過信であり、答えが20%から60%の間正しい確率を過信しています。
人間はより高度なLSMと同様の精度を持つが、過信ははるかに低い。
論文 参考訳(メタデータ) (2025-05-04T15:21:34Z) - Shaping Shared Languages: Human and Large Language Models' Inductive Biases in Emergent Communication [0.09999629695552195]
ヒトと大言語モデル(LLM)の帰納バイアスに最適化された人工言語がどのように進化するかを検討する。
我々は、人間が協力しても、あらゆる状況において信頼できるコミュニケーションを可能にする、参照接頭辞が出現することを示します。
論文 参考訳(メタデータ) (2025-03-06T12:47:54Z) - Real or Robotic? Assessing Whether LLMs Accurately Simulate Qualities of Human Responses in Dialogue [25.89926022671521]
我々はWildChatデータセットから10万対のLLM-LLMと人間-LLM対話の大規模データセットを生成する。
シミュレーションと人間のインタラクションの間には比較的低いアライメントが見られ、複数のテキストの性質に沿って体系的な相違が示される。
論文 参考訳(メタデータ) (2024-09-12T18:00:18Z) - ReMoDetect: Reward Models Recognize Aligned LLM's Generations [55.06804460642062]
大型言語モデル (LLM) は人間の好むテキストを生成する。
本稿では,これらのモデルで共有される共通特性について述べる。
報奨モデルの検出能力をさらに向上する2つのトレーニング手法を提案する。
論文 参考訳(メタデータ) (2024-05-27T17:38:33Z) - AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations [52.43593893122206]
Alignedcotは、大規模言語モデルを呼び出すためのコンテキスト内学習技術である。
ゼロショットシナリオでは、一貫した正しいステップワイズプロンプトを達成する。
数学的推論とコモンセンス推論の実験を行う。
論文 参考訳(メタデータ) (2023-11-22T17:24:21Z) - Think Before You Speak: Cultivating Communication Skills of Large Language Models via Inner Monologue [73.69510478736483]
大規模言語モデル(LLM)は、流動的で一貫性があり多様な応答を生成する。
しかし、それらは重要な能力、コミュニケーションスキルを欠いている。
本稿は,内的モノローグによるLLMのコミュニケーション能力向上を目的としている。
実験の結果,提案したCSIM戦略はバックボーンモデルを改善し,ベースラインよりも優れていた。
論文 参考訳(メタデータ) (2023-11-13T16:19:42Z) - Zero-Shot Goal-Directed Dialogue via RL on Imagined Conversations [70.7884839812069]
大規模言語モデル(LLM)は、多くの自然言語タスクに対する強力で一般的な解決策として登場した。
しかしながら、言語生成の最も重要なアプリケーションの多くは対話的であり、エージェントは望ましい結果に達するために相手と話し合わなければならない。
本研究では,そのような目標指向対話に対して,RLでLLMを適応させる新しい手法について検討する。
論文 参考訳(メタデータ) (2023-11-09T18:45:16Z) - Do LLMs exhibit human-like response biases? A case study in survey
design [66.1850490474361]
大規模言語モデル(LLM)が人間の反応バイアスをどの程度反映しているかについて検討する。
アンケート調査では, LLMが人間のような応答バイアスを示すかどうかを評価するためのデータセットとフレームワークを設計した。
9つのモデルに対する総合的な評価は、一般のオープンかつ商用のLCMは、一般的に人間のような振る舞いを反映しないことを示している。
論文 参考訳(メタデータ) (2023-11-07T15:40:43Z) - Emotionally Numb or Empathetic? Evaluating How LLMs Feel Using EmotionBench [83.41621219298489]
心理学からの感情評価理論を用いて,Large Language Models (LLMs) の人為的能力を評価する。
我々は、研究の中心となる8つの感情を引き出すのに有効な400以上の状況を含むデータセットを収集した。
我々は世界中の1200人以上の被験者を対象に人間による評価を行った。
論文 参考訳(メタデータ) (2023-08-07T15:18:30Z) - Can Large Language Models Transform Computational Social Science? [79.62471267510963]
大規模言語モデル(LLM)は、(トレーニングデータなしで)ゼロショットで多くの言語処理タスクを実行することができる
この研究は、計算社会科学ツールとしてLLMを使用するためのロードマップを提供する。
論文 参考訳(メタデータ) (2023-04-12T17:33:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。