論文の概要: A Formal Limitation on Learning Human Language From Textual Corpora
- arxiv url: http://arxiv.org/abs/2608.28560v1
- Date: Fri, 28 Aug 2026 17:38:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.422074
- Title: A Formal Limitation on Learning Human Language From Textual Corpora
- Title(参考訳): テキストコーパスによる言語学習の形式的限界
- Abstract要約: 我々は,デコーダが発話の表現から話者の意図した意味を回復する確率に基づいて,上位境界を導出する。
人工言語、マンダリンゼロ代名詞分解、色基準の実験は、この理論を支持する実証的な証拠を提供する。
- 参考スコア(独自算出の注目度): 54.22186267212778
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Can a listener recover what a speaker means from the form of an utterance alone? We answer this question information-theoretically, and for a listener given by any featurizer of text, including the hidden states of contemporary large language models. Modeling language use as a joint distribution over meanings, contexts, and utterances, we derive upper bounds on the probability that a decoder recovers a speaker's intended meaning from a representation of the utterance. The bounds are governed by the uncertainty that form leaves about meaning, which splits into an irreducible part and a part that only (extralinguistic) context, but never the utterance alone, can resolve. Because these quantities are intrinsic to language, no representation, however much text or supervision produced it, can surpass them; the bounds hold whether the space of meanings is discrete or continuous. Experiments on artificial languages, Mandarin zero-pronoun resolution, and color reference provide empirical evidence in support of the theory.
- Abstract(参考訳): リスナーは、発話のみの形式から話者の意味を回復できるのか?
我々は、この質問に情報理論で答え、現代の大言語モデルの隠された状態を含む、テキストの偉業者から与えられたリスナーに対して答える。
意味, 文脈, 発話に対する共同分布としての言語の使用をモデル化し, 発話の表現からデコーダが話者の意図した意味を回復する確率の上限を導出する。
境界は意味に関する残余を形成する不確実性によって支配され、それは既約部分と(排他的)文脈のみに分裂するが、発話だけでは解決できない部分に分けられる。
これらの量は言語に固有のものであるため、表現は、多くのテキストや監督が生成されているが、それらを超えることはできず、境界は意味の空間が離散的であるか連続的であるかを保持する。
人工言語、マンダリンゼロ代名詞分解、色基準の実験は、この理論を支持する実証的な証拠を提供する。
関連論文リスト
- Generating in the Limit with Infinitely Many Hallucinations [86.48063079851867]
最近導入された言語生成のフレームワークは、学習者がターゲット言語から有効で見えない文字列を生成する必要がある。
我々は、新しい精度の概念を導入し、この問題を古典的なリコール精度トレードオフとして再考する。
この緩和は、敵が標的言語の大部分を永久に保持すると、リコールを厳密に増加させる可能性があることを示す。
論文 参考訳(メタデータ) (2026-06-08T09:58:13Z) - Pixel Sentence Representation Learning [67.4775296225521]
本研究では,視覚表現学習プロセスとして,文レベルのテキスト意味論の学習を概念化する。
タイポスや単語順シャッフルのような視覚的に接地されたテキスト摂動法を採用し、人間の認知パターンに共鳴し、摂動を連続的に認識できるようにする。
我々のアプローチは、大規模に教師なしのトピックアライメントトレーニングと自然言語推論監督によってさらに強化されている。
論文 参考訳(メタデータ) (2024-02-13T02:46:45Z) - Multilingual Text Representation [3.4447129363520337]
現代のNLPのブレークスルーには、100以上の言語でタスクを実行できる大規模な多言語モデルが含まれている。
最先端の言語モデルは、単語の単純な1ホット表現から始まり、長い道のりを歩んだ。
我々は、言語民主化の潜在能力が、既知の限界を超えてどのように得られるかについて論じる。
論文 参考訳(メタデータ) (2023-09-02T14:21:22Z) - Natural Language Decompositions of Implicit Content Enable Better Text Representations [52.992875653864076]
本稿では,暗黙的に伝達されたコンテンツを明示的に考慮したテキスト分析手法を提案する。
我々は大きな言語モデルを用いて、観察されたテキストと推論的に関係する命題の集合を生成する。
本研究は,NLPにおいて,文字のみではなく,観察された言語の背景にある意味をモデル化することが重要であることを示唆する。
論文 参考訳(メタデータ) (2023-05-23T23:45:20Z) - Learning an Artificial Language for Knowledge-Sharing in Multilingual
Translation [15.32063273544696]
コードブック内のエントリにエンコーダ状態を割り当てることで,多言語モデルの潜伏空間を識別する。
我々は,現実的なデータ量と領域を用いた大規模実験へのアプローチを検証する。
また、学習した人工言語を用いてモデル行動を分析し、類似のブリッジ言語を使用することで、残りの言語間での知識共有が向上することを発見した。
論文 参考訳(メタデータ) (2022-11-02T17:14:42Z) - Entailment Semantics Can Be Extracted from an Ideal Language Model [32.5500309433108]
文間の係り受け判断が理想的な言語モデルから抽出できることを実証する。
また,これらのデータに基づいて学習した言語モデルの予測から,包含判断を復号化できることを示す。
論文 参考訳(メタデータ) (2022-09-26T04:16:02Z) - Testing the Ability of Language Models to Interpret Figurative Language [69.59943454934799]
比喩的・比喩的な言語は言論において一般的である。
現代の言語モデルが非リテラルなフレーズをどの程度解釈できるかについては、未解決の疑問が残る。
ウィノグラードスタイルの非文字言語理解タスクであるFig-QAを紹介する。
論文 参考訳(メタデータ) (2022-04-26T23:42:22Z) - Provable Limitations of Acquiring Meaning from Ungrounded Form: What
will Future Language Models Understand? [87.20342701232869]
未知のシステムが意味を習得する能力について検討する。
アサーションによってシステムが等価性のような意味関係を保存する表現をエミュレートできるかどうか検討する。
言語内のすべての表現が参照的に透明であれば,アサーションによってセマンティックエミュレーションが可能になる。
しかし、言語が変数バインディングのような非透過的なパターンを使用する場合、エミュレーションは計算不能な問題になる可能性がある。
論文 参考訳(メタデータ) (2021-04-22T01:00:17Z) - On the Optimality of Vagueness: "Around", "Between", and the Gricean
Maxims [0.0]
曖昧な表現を使うことは、真実性と情報性の間の最適なトレードオフをもたらすことができると我々は主張する。
意味的に曖昧な「アラウンド」のような近似の表現に焦点を当てる。
つまり、曖昧な文は、正確な文よりもより情報的になる。
論文 参考訳(メタデータ) (2020-08-26T21:57:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。