論文の概要: Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks
- arxiv url: http://arxiv.org/abs/2607.17624v1
- Date: Mon, 20 Jul 2026 07:26:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.535339
- Title: Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks
- Title(参考訳): トランスフォーマーは本当に全部できるのか? タスク間のインダクティブビアーゼの適合性について
- Authors: Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey,
- Abstract要約: 与えられたデータセットに対してトランスフォーマーアーキテクチャを最適化する手法を提案する。
アルゴリズムトイタスクでは,学習速度が劇的に向上した新しいアーキテクチャを同定する。
コードと言語モデリングデータセットでは、一貫性のある、しかしより小さな改善のアーキテクチャも見つけます。
- 参考スコア(独自算出の注目度): 40.69942772369657
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers are remarkably versatile and their design is largely consistent across a variety of applications. But are they optimal for any given task or dataset? The answer may be key for pushing AI beyond merely scaling current designs. *Method.* We present a method to optimize a transformer architecture for a given dataset, which we use as a tool to study optimal task-specific inductive biases. This method replaces the most important non-linearities (GeLUs,;softmax) with functions learned on held-out data. We then train the resulting architectures on other datasets, as a way to evaluate the compatibility between pairs of tasks. Findings. On algorithmic toy tasks, we identify new architectures with dramatic improvements in learning speed, in- and out-of-distribution generalization, and stability across seeds. The new designs prove very task-specific however, and indicate that these tasks require inductive biases very different from those of standard transformers. On code and language modeling datasets, we also find architectures with consistent, yet smaller improvements. These designs transfer much better across datasets and domains (English & computer code). Implications. Our results show that standard transformers are rarely a local optimum in the space of architectures. Simple alternatives can perform much better but sacrifice universality. This suggests that there may be room for improved architectures that better support multiple capabilities simultaneously, such as fluency and robust reasoning.
- Abstract(参考訳): トランスフォーマーは驚くほど多用途であり、その設計は様々なアプリケーションでほぼ一致している。
しかし、それらは特定のタスクやデータセットに最適なのでしょうか?
この答えは、AIを単に現在の設計をスケールするだけでなく、推進するための鍵となるかもしれない。
※方法。
※ 与えられたデータセットに対して変換器アーキテクチャを最適化する手法を提案する。
この方法は、最も重要な非線形性(GeLUs,;softmax)をホールドアウトデータで学習した関数に置き換える。
次に、タスクのペア間の互換性を評価する手段として、結果のアーキテクチャを他のデータセットでトレーニングします。
発見。
アルゴリズム的な玩具タスクでは、学習速度、分布内および分布外一般化、種子間の安定性を劇的に改善した新しいアーキテクチャを同定する。
しかし、新しい設計はタスク固有のことを証明しており、これらのタスクは標準変換器と非常に異なる帰納的バイアスを必要とすることを示している。
コードと言語モデリングデータセットでは、一貫性のある、しかしより小さな改善のアーキテクチャも見つけます。
これらの設計は、データセットとドメイン(英語とコンピュータコード)間でずっと良く転送される。
意味。
以上の結果から,標準変圧器はアーキテクチャの領域において,局所的な最適化となることは滅多にない。
単純な代替手段は、はるかに優れた性能を発揮するが、普遍性を犠牲にする。
これは、フルーエンシやロバストな推論など、複数の機能を同時にサポートするアーキテクチャを改善する余地があることを示唆している。
関連論文リスト
- AsCAN: Asymmetric Convolution-Attention Networks for Efficient Recognition and Generation [48.82264764771652]
本稿では,畳み込みブロックと変圧器ブロックを組み合わせたハイブリッドアーキテクチャAsCANを紹介する。
AsCANは、認識、セグメンテーション、クラス条件画像生成など、さまざまなタスクをサポートしている。
次に、同じアーキテクチャをスケールして、大規模なテキスト・イメージタスクを解決し、最先端のパフォーマンスを示す。
論文 参考訳(メタデータ) (2024-11-07T18:43:17Z) - Faster Convergence for Transformer Fine-tuning with Line Search Methods [6.138522679357102]
本研究では,新しいトランスフォーマーアーキテクチャとデータセットドメインへの行探索手法の拡張に成功した。
我々の作業はpythonパッケージとして公開されており、任意のネットワークアーキテクチャと互換性のある超自由勾配のpytorchを提供する。
論文 参考訳(メタデータ) (2024-03-27T12:35:23Z) - Full Stack Optimization of Transformer Inference: a Survey [58.55475772110702]
トランスフォーマーモデルは広範囲のアプリケーションにまたがって優れた精度を実現する。
最近のTransformerモデルの推測に必要な計算量と帯域幅は、かなり増加しています。
Transformerモデルをより効率的にすることに注力している。
論文 参考訳(メタデータ) (2023-02-27T18:18:13Z) - Vision Transformer Architecture Search [64.73920718915282]
現在の視覚変換器(ViT)は、自然言語処理(NLP)タスクから単純に継承される。
ハードウェア予算に類似した最適アーキテクチャを探索するために,ViTASと呼ばれるアーキテクチャ探索手法を提案する。
検索したアーキテクチャは、ImageNetで74.7%の精度で、現在のベースラインのViTアーキテクチャよりも2.5%高い。
論文 参考訳(メタデータ) (2021-06-25T15:39:08Z) - Towards Accurate and Compact Architectures via Neural Architecture
Transformer [95.4514639013144]
計算コストを増すことなくパフォーマンスを向上させるために、アーキテクチャ内の操作を最適化する必要がある。
我々は最適化問題をマルコフ決定プロセス(MDP)にキャストするニューラルアーキテクチャ変換器(NAT)法を提案している。
NAT++(Neural Architecture Transformer++)メソッドを提案し、アーキテクチャ最適化のパフォーマンスを改善するために、候補遷移のセットをさらに拡大する。
論文 参考訳(メタデータ) (2021-02-20T09:38:10Z) - Optimizing Deeper Transformers on Small Datasets: An Application on
Text-to-SQL Semantic Parsing [23.280034406077757]
超深層変圧器の利点は, 強固な構造予測タスクに引き継がれることが示されている。
特に,意味解析タスクのために48層のトランスフォーマーをトレーニングすることに成功している。
論文 参考訳(メタデータ) (2020-12-30T22:53:49Z) - MetaPerturb: Transferable Regularizer for Heterogeneous Tasks and
Architectures [61.73533544385352]
本稿ではメタパーターブ(MetaPerturb)というトランスファー可能な摂動モデルを提案する。
MetaPerturbは、レイヤやタスクにまたがる多様な分散を訓練したセット関数であるため、異種タスクやアーキテクチャを一般化することができる。
論文 参考訳(メタデータ) (2020-06-13T02:54:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。