論文の概要: Where Should Language Sit in a Multimodal Model? Lessons from What Language Does to Human Perception and Cognition
- arxiv url: http://arxiv.org/abs/2609.07474v3
- Date: Tue, 15 Sep 2026 12:40:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.046157
- Title: Where Should Language Sit in a Multimodal Model? Lessons from What Language Does to Human Perception and Cognition
- Title(参考訳): マルチモーダルモデルにおける言語はどこに置くべきか : 人間の知覚と認知に対する言語の役割から学ぶ
- Abstract要約: 我々は、言語が人間の知覚、脳、思考にどんな影響を及ぼすかをレビューする。
人間では、圧縮は測定可能であり、コードブックの学習は感覚を再編成し、思考は言語喪失を生き延びる。
トークンベースのシステムには7つの意味があります。
- 参考スコア(独自算出の注目度): 3.732244093761483
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models compute over tokens: language is their input, their output, and increasingly their internal representation. Whether language should keep all of these positions depends on what language does to the system that uses it. The one system with a century of data on that question is the human. We review what language does to human perception, the brain, and thought, and read the same evidence against multimodal models and language models. Throughout, we treat language as a compressor that runs on a shared codebook: a word is an index, the content is in the receiver, and a community maintains the codebook. In humans the compression is measurable, learning the codebook reorganizes the senses, and thought survives the loss of language. We then measure the rule that models apply when two cues disagree, with cue-conflict experiments on six vision-language models and two robot policies. Surviving cues are weighted in the order their reliabilities prescribe, at 11 to 82\% of the ideal observer's slope, and many answers copy the text. One policy family drops a cue that adds no information beyond the others rather than down-weighting it, another keeps it at a weight that fails when the cues conflict, and a visual cue that identifies the task in every training frame is never learned, because the language pathway already fits the data. Language models are the best current models of the human language network, and they have entered the human speech community, shifting word frequencies while alignment narrows their conceptual diversity. We close with seven implications for token-based systems. Language belongs at a model's boundary and in the shared codebook, as in the brain, not as its internal representation; the price of leaving the codebook inside is auditability.
- Abstract(参考訳): 言語モデルはトークンよりも計算する: 言語は彼らの入力、出力、そしてますます内部表現である。
言語がこれらの位置を維持すべきかどうかは、それを使用するシステムにどのような言語が作用するかに依存します。
その問題に関する1世紀のデータを持つ1つのシステムは、人間です。
我々は、言語が人間の知覚、脳、思考にどんな影響を及ぼすかをレビューし、マルチモーダルモデルや言語モデルに対して同じ証拠を読む。
全体として、言語を共有コードブック上で動作する圧縮機として扱う:単語はインデックスであり、コンテンツは受信機にあり、コミュニティはコードブックを維持している。
人間では、圧縮は測定可能であり、コードブックの学習は感覚を再編成し、思考は言語喪失を生き延びる。
次に、6つの視覚言語モデルと2つのロボットポリシーに関するキュー・コンフリクトな実験で、2つのキューが一致しない場合、モデルが適用できるルールを計測する。
生き残る手がかりは、その信頼度が規定する順に重み付けされ、理想的なオブザーバーの傾斜の11から82倍となり、多くの答えがテキストをコピーする。
あるポリシーファミリは、重み付けではなく、他の情報を付加するキューを落とし、別のポリシファミリは、キューの競合時に失敗する重みを保ち、また、言語パスがすでにデータに適合しているため、トレーニングフレーム毎にタスクを識別する視覚キューは、決して学習されない。
言語モデルは、人間の言語ネットワークの最良のモデルであり、人間の言語コミュニティに入り、単語の周波数をシフトさせながら、その概念的多様性を狭めている。
トークンベースのシステムには7つの意味があります。
言語はモデルのバウンダリと共有コードブックに含まれており、内部表現としてではなく、脳内にある。
関連論文リスト
- A Primer on Computational Semantics for Artificial Intelligence Systems [0.7783842564949857]
トランスフォーマーに基づく言語モデルがどのように学習し、言語の意味を表現するかを知ることは重要である。
この文書は、科学的・哲学的な異なる分野から言語的意味がどのようにアプローチされているのかを読者が理解するための試みである。
論文 参考訳(メタデータ) (2026-08-25T18:10:04Z) - Language Specific Knowledge: Do Models Know Better in X than in English? [9.923619418000488]
コードスイッチングは、異なる言語間で同じ発話、思考、会話を交互に行う一般的な現象である。
我々はこの現象を表すために言語特化知識(LSK)という用語を作った。
英語以外の言語でチェーン・オブ・シークレット・推論を用いることで,言語モデルの性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-21T00:31:13Z) - From Language to Cognition: How LLMs Outgrow the Human Language Network [21.08557980312889]
大規模言語モデル(LLM)は、人間の言語ネットワークにおける神経活動と著しく類似している。
我々は8つのモデルサイズにまたがる300Bトークンにまたがる34のトレーニングチェックポイントをベンチマークし、脳のアライメントが言語能力とどのように関連しているかを分析した。
論文 参考訳(メタデータ) (2025-03-03T18:54:19Z) - The Role of Language Imbalance in Cross-lingual Generalisation: Insights from Cloned Language Experiments [57.273662221547056]
本研究では,言語間一般化の非直感的な新規ドライバである言語不均衡について検討する。
学習中に支配的な言語が存在することが、あまり頻度の低い言語の性能を高めることを観察する。
分析を実言語に拡張するにつれ、頻繁な言語は依然として恩恵を受けていますが、言語不均衡が言語間の一般化を引き起こすかどうかは決定的ではありません。
論文 参考訳(メタデータ) (2024-04-11T17:58:05Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - Causal Graph in Language Model Rediscovers Cortical Hierarchy in Human
Narrative Processing [0.0]
これまでの研究では、言語モデルの特徴がfMRI脳活動にマッピングできることが示されている。
これは、言語モデルにおける情報処理と人間の脳の間に共通点があるのだろうか?
言語モデルにおける情報フローパターンを推定するために,異なる層間の因果関係について検討した。
論文 参考訳(メタデータ) (2023-11-17T10:09:12Z) - Learning to Model the World with Language [100.76069091703505]
人間と対話し、世界で行動するためには、エージェントは人々が使用する言語の範囲を理解し、それを視覚の世界に関連付ける必要がある。
私たちのキーとなるアイデアは、エージェントが将来を予測するのに役立つ信号として、このような多様な言語を解釈すべきである、ということです。
我々は、将来のテキストや画像表現を予測するマルチモーダル世界モデルを学ぶエージェントであるDynalangでこれをインスタンス化する。
論文 参考訳(メタデータ) (2023-07-31T17:57:49Z) - Norm Participation Grounds Language [16.726800816202033]
私は、どのような基礎言語が規範的な性質であるのかという考え方を、異なる、より広範に提案します。
物事を正しく行うための基準があり、これらの標準は公然と権威があり、同時に権威の受容が議論され、交渉される。
言語がどのような基盤となるかは、言語ユーザーがそれを利用する決定的な方法であり、それが根底にあるのは、言語利用者のコミュニティである。
論文 参考訳(メタデータ) (2022-06-06T20:21:59Z) - Towards Zero-shot Language Modeling [90.80124496312274]
人間の言語学習に誘導的に偏りを持つニューラルモデルを構築した。
類型的に多様な訓練言語のサンプルからこの分布を推測する。
我々は、保留言語に対する遠隔監視として、追加の言語固有の側情報を利用する。
論文 参考訳(メタデータ) (2021-08-06T23:49:18Z) - Read Like Humans: Autonomous, Bidirectional and Iterative Language
Modeling for Scene Text Recognition [80.446770909975]
言語知識はシーンのテキスト認識に非常に有益である。
エンドツーエンドのディープネットワークで言語規則を効果的にモデル化する方法はまだ研究の課題です。
シーンテキスト認識のための自律的双方向反復型ABINetを提案する。
論文 参考訳(メタデータ) (2021-03-11T06:47:45Z) - Vokenization: Improving Language Understanding with Contextualized,
Visual-Grounded Supervision [110.66085917826648]
我々は,言語トークンを関連画像に文脈的にマッピングすることで,言語のみのデータに対するマルチモーダルアライメントを補間する手法を開発した。
語彙化」は比較的小さな画像キャプションデータセットに基づいて訓練され、それを大規模言語コーパスのための語彙生成に適用する。
これらの文脈的に生成された語彙を用いて学習し、視覚的に制御された言語モデルにより、複数の純粋言語タスクにおいて、自己教師による代替よりも一貫した改善が示される。
論文 参考訳(メタデータ) (2020-10-14T02:11:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。