論文の概要: Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext
- arxiv url: http://arxiv.org/abs/2604.05273v1
- Date: Tue, 07 Apr 2026 00:14:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.544071
- Title: Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext
- Title(参考訳): 表面のベネター: LLMsがテキストでコミュニケーションできる能力を探る
- Authors: Kabir Ahuja, Yuxuan Li, Andrew Kyle Lampinen,
- Abstract要約: 言語モデルがコミュニケーション設定でサブテキストを利用できるかどうかを体系的に研究する。
評価設定は、アレーゴリーの書き書きや解釈からマルチエージェントゲームやマルチモーダルゲームまで様々である。
- 参考スコア(独自算出の注目度): 14.367312995215393
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human communication is fundamentally creative, and often makes use of subtext -- implied meaning that goes beyond the literal content of the text. Here, we systematically study whether language models can use subtext in communicative settings, and introduce four new evaluation suites to assess these capabilities. Our evaluation settings range from writing & interpreting allegories to playing multi-agent and multi-modal games inspired by the rules of board games like Dixit. We find that frontier models generally exhibit a strong bias towards overly literal, explicit communication, and thereby fail to account for nuanced constraints -- even the best performing models generate literal clues 60% of times in one of our environments -- Visual Allusions. However, we find that some models can sometimes make use of common ground with another party to help them communicate with subtext, achieving 30%-50% reduction in overly literal clues; but they struggle at inferring presence of a common ground when not explicitly stated. For allegory understanding, we find paratextual and persona conditions to significantly shift the interpretation of subtext. Overall, our work provides quantifiable measures for an inherently complex and subjective phenomenon like subtext and reveals many weaknesses and idiosyncrasies of current LLMs. We hope this research to inspire future work towards socially grounded creative communication and reasoning.
- Abstract(参考訳): 人間のコミュニケーションは基本的に創造的であり、テキストのリテラルコンテンツを超えた意味を暗示するサブテキストを使うことが多い。
本稿では,言語モデルがサブテキストをコミュニケーション的設定で利用できるかどうかを体系的に検討し,これらの機能を評価するために4つの新しい評価スイートを導入する。
評価設定は、ディクシットのようなボードゲームのルールにインスパイアされたマルチエージェントゲームやマルチモーダルゲームなど、多岐にわたる。
私たちは、フロンティアモデルが一般的に、過度にリテラルで明示的なコミュニケーションに対する強いバイアスを示しており、その結果、ニュアンスのある制約を考慮できないことに気付きました。
しかし、あるモデルでは、時々他のモデルと共通基盤を利用して、それらがサブテキストと通信し、過剰にリテラルな手がかりを30%-50%削減することを発見したが、明示されていない場合、共通基盤の存在を推測するのに苦労している。
偏見的理解においては、パラテクストとペルソナの条件がサブテキストの解釈を著しく変える。
全体として、本研究は、サブテキストのような本質的に複雑で主観的な現象を定量的に測定し、現在のLLMの多くの弱点と慣用性を明らかにする。
この研究は、社会的基盤を持つ創造的なコミュニケーションと推論に向けた今後の研究を促すことを願っている。
関連論文リスト
- Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models [37.44286562901589]
本研究では,空間推論の多様な側面をカバーする新しいベンチマークであるSpatialEvalを提案する。
我々は、競合する言語と視覚言語モデルを総合的に評価する。
文献で見過ごされてきたいくつかの反直感的な洞察が明らかとなった。
論文 参考訳(メタデータ) (2024-06-21T03:53:37Z) - ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models [92.60282074937305]
テキストリッチな画像に対して文脈に敏感な推論を必要とする人為的な命令を特徴とする新しいデータセットであるConTextualを紹介した。
そこで本研究では,14の基盤モデルの性能評価実験を行い,人為的な性能基準を確立する。
GPT-4Vとヒトのパフォーマンスの30.8%の有意な性能差を観察した。
論文 参考訳(メタデータ) (2024-01-24T09:07:11Z) - OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models [122.27878464009181]
テキスト関連視覚タスクにおいて, GPT4V や Gemini などの大規模マルチモーダルモデルの包括的評価を行った。
OCRBenchには29のデータセットがあり、最も包括的なOCR評価ベンチマークが利用できる。
論文 参考訳(メタデータ) (2023-05-13T11:28:37Z) - The Goldilocks of Pragmatic Understanding: Fine-Tuning Strategy Matters
for Implicature Resolution by LLMs [26.118193748582197]
我々は、広く使われている最先端モデルの4つのカテゴリを評価する。
2進推論を必要とする発話のみを評価するにもかかわらず、3つのカテゴリのモデルはランダムに近い性能を示す。
これらの結果は、特定の微調整戦略がモデルにおける実用的理解を誘導する上ではるかに優れていることを示唆している。
論文 参考訳(メタデータ) (2022-10-26T19:04:23Z) - Testing the Ability of Language Models to Interpret Figurative Language [69.59943454934799]
比喩的・比喩的な言語は言論において一般的である。
現代の言語モデルが非リテラルなフレーズをどの程度解釈できるかについては、未解決の疑問が残る。
ウィノグラードスタイルの非文字言語理解タスクであるFig-QAを紹介する。
論文 参考訳(メタデータ) (2022-04-26T23:42:22Z) - Emergent Communication of Generalizations [13.14792537601313]
共有された視覚的コンテキストにおける1つのオブジェクトのコミュニケーションは、過度に適合する傾向があり、具体的な参照を超えて、言語が役に立つことを奨励しない、と我々は主張する。
抽象的な視覚概念を表すオブジェクトの集合上での通信一般化を必要とするゲームを提案する。
これらのゲームは学習言語の体系性と解釈可能性を大幅に向上させる。
論文 参考訳(メタデータ) (2021-06-04T19:02:18Z) - Reading and Acting while Blindfolded: The Need for Semantics in Text
Game Agents [18.743819704859703]
人工エージェントがテキストのセマンティック理解をどのように利用するかは、まだ不明である。
表現空間を正規化し,探索を促す逆ダイナミクスデコーダを提案する。
将来のエージェントの設計における我々の発見の意義を、より強い意味論的理解で議論する。
論文 参考訳(メタデータ) (2021-03-25T01:35:27Z) - Interpretable Multi-Head Self-Attention model for Sarcasm Detection in
social media [0.0]
sarcastic expressionの曖昧さは、sarcasmの発見を非常に困難にしている。
マルチヘッドセルフアテンションとゲートリカレントユニットを用いた解釈可能なディープラーニングモデルを開発する。
本稿では,複数のデータセットで最新の結果を得る手法の有効性を示す。
論文 参考訳(メタデータ) (2021-01-14T21:39:35Z) - A Benchmark for Systematic Generalization in Grounded Language
Understanding [61.432407738682635]
人間は慣れ親しんだ部分から成り立つ不慣れな状況を記述する表現を容易に解釈する。
対照的に、現代のニューラルネットワークは、新しい構成を理解するのに苦労している。
位置言語理解における合成一般化を評価するための新しいベンチマークであるgSCANを導入する。
論文 参考訳(メタデータ) (2020-03-11T08:40:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。