論文の概要: The Illusion of Replacement: Rethinking Specialized Machine Learning Models in the Foundation Model Era
- arxiv url: http://arxiv.org/abs/2608.28980v2
- Date: Wed, 02 Sep 2026 04:57:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.740387
- Title: The Illusion of Replacement: Rethinking Specialized Machine Learning Models in the Foundation Model Era
- Title(参考訳): 代替のイリュージョン:基礎モデル時代における特化機械学習モデルの再考
- Authors: Kiyan Rezaee,
- Abstract要約: 9つのモードにわたる機械学習に関する159の論文のレビュー
構造化データモデルの一般的なアーキテクチャ置換の証拠はない。
言語ベースのモデルは非常に競争力があるが、構造を意識したアーキテクチャとのギャップを最終的に排除できるかどうかはまだ検証されていない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Can the specialized architectures that machine learning has traditionally built for structured data be replaced by language-based models? This question is examined through a review of 159 papers (2016--2026) across nine modalities, with predictive accuracy considered alongside structural representation and computation. A distinction is made between performing a task and preserving and computing the structure that makes the task tractable, and existing approaches are organized into eight representational regimes, ranging from language-only systems to fully specialized architectures. Language-mediated models are found to be highly competitive in specific settings, including extreme few-shot prediction, discretized symbolic tasks, textually annotated knowledge graphs, and large-scale single-modality pretraining. However, whenever structural representation or computation is directly evaluated rather than accuracy alone, no evidence of general architectural replacement is found. Instead, a recurring pattern is observed across independent research communities: when language alone is insufficient, the missing structure is reintroduced through a graph module, structural tokens, specialized attention, or another non-linguistic component. In this sense, specialization more often relocates than disappears. Moreover, although performance of language-based models is improved by scaling, whether the gap to a structure-aware architecture can eventually be eliminated remains untested. The official repository for this work is available at https://github.com/kiyan-rezaee/language-vs-structure.
- Abstract(参考訳): 機械学習が伝統的に構造化データのために構築した特殊なアーキテクチャは、言語ベースのモデルに置き換えられるだろうか?
この質問は、構造表現と計算と共に予測精度を考慮し、9つのモダリティにわたる159の論文(2016-2026)のレビューを通して検討する。
タスクの実行とタスクのトラクタブルな構造の保存と計算の区別が行われ、既存のアプローチは言語のみのシステムから完全に専門的なアーキテクチャまで、8つの表現体系に分けられる。
言語に依存したモデルは、極端な数ショットの予測、識別されたシンボルタスク、テキストで注釈付けされた知識グラフ、大規模単一モダリティ事前学習など、特定の環境で非常に競争力がある。
しかし、構造表現や計算が精度のみではなく直接評価される場合、一般的なアーキテクチャ代替の証拠は見つからない。
言語単独が不十分な場合には、グラフモジュール、構造トークン、特別な注意、あるいは他の非言語的コンポーネントを通じて、欠落した構造を再導入する。
この意味では、特殊化は消滅するよりも多く移転する。
さらに,拡張によって言語モデルの性能が向上するが,構造認識アーキテクチャとのギャップを最終的に排除できるかどうかは未検証のままである。
この作業の公式リポジトリはhttps://github.com/kiyan-rezaee/lang-vs-structureで公開されている。
関連論文リスト
- Graph Property Inference in Small Language Models: Effects of Representation and Inference Strategy [0.48302896549293584]
これらの構造がテキスト形式で提示されるとき、リレーショナル構造の形式的性質を効果的に推測できるかは不明だ。
小型言語モデルにおけるグラフ理論的特性推定の体系的研究を行う。
構造的性能は関係情報の整理方法に非常に敏感であることがわかった。
論文 参考訳(メタデータ) (2026-02-24T13:46:35Z) - Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures [49.19753720526998]
合成データセット上でのニューラルネットワーク性能に関する理論的スケーリング法則を導出する。
局所性と重み共有によって生成過程の構造が整った畳み込みネットワークは、性能の高速化を享受できることを示す。
この発見は、ニューラルネットワークのスケーリング法則に基づくアーキテクチャ上のバイアスを明らかにし、モデルアーキテクチャとデータの統計的性質の間の相互作用によって表現学習がどのように形成されるかを強調している。
論文 参考訳(メタデータ) (2025-05-11T17:44:14Z) - Punctuation Restoration Improves Structure Understanding Without Supervision [5.925894224649895]
学習目的としての句読点復元が構造関連タスクの性能を向上させることを示す。
その結果,句読点復元は構造理解を向上する効果的な学習目標であることが示唆された。
論文 参考訳(メタデータ) (2024-02-13T11:22:52Z) - SLOG: A Structural Generalization Benchmark for Semantic Parsing [68.19511282584304]
合成一般化ベンチマークの目的は、モデルがいかにして新しい複雑な言語表現に一般化するかを評価することである。
既存のベンチマークは、しばしば語彙一般化に焦点を当て、訓練に精通した構文構造における新しい語彙項目の解釈は、しばしば不足している。
SLOGは,COGSを拡張したセマンティック解析データセットである。
論文 参考訳(メタデータ) (2023-10-23T15:39:09Z) - Physics of Language Models: Part 1, Learning Hierarchical Language Structures [51.68385617116854]
トランスフォーマーベースの言語モデルは効率的だが複雑であり、内部の動作や推論メカニズムを理解することは大きな課題である。
本稿では,長文を生成可能な階層規則を生成する合成CFGのファミリーを紹介する。
我々は、GPTのような生成モデルがCFG定義階層を正確に学習し、推論し、それに基づいて文を生成することを実証する。
論文 参考訳(メタデータ) (2023-05-23T04:28:16Z) - Autoregressive Structured Prediction with Language Models [73.11519625765301]
本稿では, PLM を用いた自己回帰的手法を用いて, モデル構造を行動列として記述する。
我々のアプローチは、私たちが見てきた全ての構造化予測タスクにおいて、新しい最先端を実現する。
論文 参考訳(メタデータ) (2022-10-26T13:27:26Z) - Interpretable Mixture of Experts [71.55701784196253]
Interpretable Mixture of Experts (IME)は本質的に解釈可能なモデリングフレームワークである。
IMEは単一の解釈可能なモデルよりも正確であることが示され、既存の最先端のDeep Neural Networks(DNN)と正確に比較できる。
IMEの説明は、ユーザスタディを通じて一般的に使われているポストホックな説明法と比較される。
論文 参考訳(メタデータ) (2022-06-05T06:40:15Z) - DeepStruct: Pretraining of Language Models for Structure Prediction [64.84144849119554]
テキストから構造を生成するために,タスクに依存しないコーパスの集合上で言語モデルを事前訓練する。
我々の構造事前学習は、モデルが構造タスクについて持っている学習知識のゼロショット転送を可能にする。
10Bパラメータ言語モデルがほとんどのタスクに非自明に転送し、28のデータセットのうち21の最先端のパフォーマンスを得ることを示す。
論文 参考訳(メタデータ) (2022-05-21T00:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。