論文の概要: Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do
- arxiv url: http://arxiv.org/abs/2607.26015v1
- Date: Tue, 28 Jul 2026 17:27:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.948978
- Title: Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do
- Title(参考訳): 人よりも人的シンタクスを局所的に活用するインストラクション・チューニングモデル
- Abstract要約: 本研究では、16のオープンウェイトLlamaおよびGemmaモデルにおける文脈自由文法規則のターンアジャセント再利用を測定する。
命令調整された各モデルは、置換した人間の反応よりも実際の素数との自然な出力の重なりが大きかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Syntactic convergence (the tendency of speakers to adapt in language towards the grammatical profiles of their interlocutors) is a well-documented feature of human dialogue widely considered to operate below conscious awareness. Whether large language models exhibit analogous syntactic convergence toward human users relative to human baselines and across a broad range of syntactic constructions remains an open question. Using substitution-paradigm data in which model generations replace one speaker's turns in pre-existing human dialogues, this study measures turn-adjacent reuse of context-free grammar (CFG) rules across sixteen open-weight Llama and Gemma models (1B-70B, pretrained and instruction-tuned) at 1,901 matched positions per model. Every model showed greater CFG-rule overlap with the preceding human turn than with a sampled unrelated human prime, and in every model this actual-versus-random difference was larger for lower-frequency rules. Each instruction-tuned model also showed greater natural-output overlap with the actual prime than the human response it replaced, and all eight matched architecture pairs exhibited greater actual-prime overlap after instruction tuning. However, relative to pretrained variants, instruction-tuned outputs overlapped more with unrelated primes, showed a smaller actual-versus-random increment, and had lower conditional rule-reuse odds once target rule-set size was held constant. In exploratory analyses, each model exhibited greater mean lexical and semantic similarity to the preceding turn than the matched human responses did. Instruction-tuned models additionally produced responses with greater mean semantic similarity than their pretrained counterparts in all eight architecture pairs, whereas the lexical similarity results were more heterogeneous.
- Abstract(参考訳): 統語的収束(英語: Syntactic convergence, 話者が言語で文法的プロファイルに適応する傾向)は、意識的認識以下で活動すると考えられる人間の対話の特徴である。
大規模言語モデルが人間のベースラインと幅広い構文構造に対して類似した構文収束を示すか否かは、未解決の問題である。
従来の対話における話者のターンをモデル世代が置き換える代用パラダイムデータを用いて、16個のオープンウェイトLlamaモデルとGemmaモデル(1B-70B, 事前訓練および指導訓練)を1,901個の一致した位置で、文脈自由文法(CFG)規則をターンアジャセントで再利用する。
各モデルでは, サンプル化した無関係な素数よりも, CFGルルと先行する人間ターンとの重なりが強く, 実逆ランダム差は低周波規則では大きいことがわかった。
命令調整された各モデルは、置換した人間の反応よりも実際の素数との自然な出力重なりが強く、8つの一致したアーキテクチャペアは、命令チューニング後の実際の素数重なりが大きかった。
しかし、事前訓練された変種と比較して、命令調整された出力は無関係な素数と重なり合い、実際の逆乱数の増加が小さく、目標のルールセットサイズが一定に保たれた場合、条件付き規則再利用確率が低い。
探索分析では,各モデルの平均語彙的および意味的類似性は,一致したヒトの反応よりも高かった。
命令調整されたモデルでは、8つのアーキテクチャペアで事前訓練されたものよりも平均的なセマンティックな類似性を持つ応答が生成されたが、語彙的類似性の結果はより異質であった。
関連論文リスト
- How Unlikely Is "Unlikely"? Assessing Verbal Probability Perception Across Large Language Models [1.435579512127234]
確立された人間のベンチマークに基づいて,単語から数字へのマッピングタスクを用いて,系統的なクロスモデル評価を行う。
11個の不確実性表現を2つの条件下で19個のモデルに提示した。
モデルは「不可能」や「不可能」のような否定的な表現に対して体系的に上向きの偏見を示す」
論文 参考訳(メタデータ) (2026-08-26T19:00:41Z) - Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond) [90.45301024940329]
言語モデル(LM)は、多様で人間らしい創造的コンテンツを生成するのに苦労することが多い。
Infinity-Chatは26万の多様な実世界のオープンエンドユーザクエリからなる大規模データセットである。
本研究では, LMのモード崩壊について大規模に検討し, 人工Hivemind効果が明らかとなった。
論文 参考訳(メタデータ) (2025-10-27T03:16:21Z) - Do language models accommodate their users? A study of linguistic convergence [15.958711524171362]
モデルは会話のスタイルに強く収束し、しばしば人間のベースラインに対してかなり過度に適合する。
モデル設定間の収束の連続的な変化を観察し、事前訓練されたモデルよりも少ない精度で収束する命令調整および大規模モデルについて考察する。
論文 参考訳(メタデータ) (2025-08-05T09:55:40Z) - Prediction-Powered Ranking of Large Language Models [13.25325920774249]
大規模な言語モデルは、しばしば人間の好みに合わせてランク付けされる。
このギャップを埋める統計フレームワークを開発します。
ペアワイズ比較のみを用いて構築されたランクセットは、人間のペアワイズ選好と(分布の)矛盾することが多いことを示す。
論文 参考訳(メタデータ) (2024-02-27T19:00:01Z) - Frequency Explains the Inverse Correlation of Large Language Models'
Size, Training Data Amount, and Surprisal's Fit to Reading Times [15.738530737312335]
近年の研究では、トランスフォーマーに基づく言語モデルが大きくなり、非常に大量のデータで訓練されているため、その推定結果が自然主義的な人間の読解時間に適合していることが示されている。
本稿では,これら2つの傾向の根底にある説明要因として,単語頻度が重要であることを示す一連の分析結果を示す。
その結果,トランスフォーマーをベースとした言語モデルによる推定は,稀な単語を予測するために学習する超人的に複雑な関連性から,人間の期待から逸脱していることがわかった。
論文 参考訳(メタデータ) (2024-02-03T20:22:54Z) - Training Trajectories of Language Models Across Scales [99.38721327771208]
言語モデルのスケールアップは、前例のないパフォーマンス向上につながった。
異なるサイズの言語モデルは事前学習中にどのように学習するか?
より大きな言語モデルはなぜ望ましい振る舞いを示すのか?
論文 参考訳(メタデータ) (2022-12-19T19:16:29Z) - A Targeted Assessment of Incremental Processing in Neural LanguageModels
and Humans [2.7624021966289605]
本稿では,人間とニューラル言語モデルにおけるインクリメンタル処理のスケールアップ比較について述べる。
データはInterpolated Maze Taskと呼ばれる新しいオンライン実験パラダイムに由来する。
人間と言語モデルの両方が、非文法的な文領域における処理困難を増大させていることが判明した。
論文 参考訳(メタデータ) (2021-06-06T20:04:39Z) - A comprehensive comparative evaluation and analysis of Distributional
Semantic Models [61.41800660636555]
我々は、静的DSMによって生成されたり、BERTによって生成された文脈化されたベクトルを平均化して得られるような、型分布ベクトルの包括的評価を行う。
その結果、予測ベースモデルの優越性は現実よりも明らかであり、ユビキタスではないことが明らかとなった。
我々は認知神経科学からRepresentational similarity Analysis(RSA)の方法論を借りて、分布モデルによって生成された意味空間を検査する。
論文 参考訳(メタデータ) (2021-05-20T15:18:06Z) - High-order Semantic Role Labeling [86.29371274587146]
本稿では,ニューラルセマンティックロールラベリングモデルのための高階グラフ構造を提案する。
これにより、モデルは孤立述語-引数対だけでなく、述語-引数対間の相互作用も明示的に考慮することができる。
CoNLL-2009ベンチマークの7つの言語に対する実験結果から、高次構造学習技術は強力なSRLモデルに有益であることが示された。
論文 参考訳(メタデータ) (2020-10-09T15:33:54Z) - Mechanisms for Handling Nested Dependencies in Neural-Network Language
Models and Humans [75.15855405318855]
我々は,「深層学習」手法で訓練された現代人工ニューラルネットワークが,人間の文処理の中心的な側面を模倣するかどうかを検討した。
ネットワークは、大きなコーパスで次の単語を予測するためにのみ訓練されたが、分析の結果、局所的および長距離の構文合意をうまく処理する特別なユニットが出現した。
我々は,複数の名詞の単数/複数状態における体系的な変化を伴う文中の数一致の違反を人間が検出する行動実験において,モデルの予測を検証した。
論文 参考訳(メタデータ) (2020-06-19T12:00:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。