論文の概要: Tevatron-Elastic: A Unified Abstraction for Training Elastic Retrievers and Rerankers
- arxiv url: http://arxiv.org/abs/2608.08809v1
- Date: Sun, 09 Aug 2026 16:45:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.958848
- Title: Tevatron-Elastic: A Unified Abstraction for Training Elastic Retrievers and Rerankers
- Title(参考訳): Tevatron-Elastic: エラスティックリトリバーとリランカをトレーニングするための統一抽象化
- Abstract要約: トランスベースのモデルは、3つの方法で小さくすることができる。
単一のオブジェクトがモデルの実行可能なサイズを指定し、短いスケジュールでトレーニング対象のサイズをリストアップする。
同じ抽象化は、レトリバーとリランカの両方と、エンコーダとデコーダの両方をカバーしている。
- 参考スコア(独自算出の注目度): 71.99661189378442
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A single model scale challenges the flexibility of a production retrieval system: some settings need it faster, others need a smaller index, and the right trade-off changes with the workload. In the context of information retrieval (IR), a transformer-based model can be made smaller in three ways---using fewer layers, passing fewer tokens through the upper layers, or producing a shorter embedding---and each way saves a different compute resource. These options have been studied one at a time, each as its own method with its own code and training setup, which makes them hard to combine or adapt to a new model. We present~\ours to bring all three under one simple abstraction: a single object names any size the model can run at, and a short schedule lists the sizes to train. Training then produces one checkpoint that serves all of those sizes, and at deployment the user picks any of them. The same abstraction covers both retrievers and rerankers and both encoder and decoder models, as it works through interfaces that Hugging Face transformers already expose; a new backbone is a configuration change, not new modeling code. Prior methods---Matryoshka embeddings, early exit, 2D~Matryoshka (e.g., Starbucks), and layerwise token compression---become special cases of our unified abstraction. The same interface also enables Matryoshka~LTC (MLTC), which jointly trains several token-compression ratios in one retriever checkpoint. To validate our framework, we train 20 checkpoints across three backbones and two tasks: the quality curves are smooth, one checkpoint costs little over a model trained for a single size, and a controlled study confirms the wallclock speedups. We release the framework and all checkpoints as a resource for building elastic retrieval systems.
- Abstract(参考訳): 単一のモデルスケールは、プロダクション検索システムの柔軟性に挑戦する。いくつかの設定では、より高速で、他の設定では、より小さなインデックスが必要で、ワークロードによる適切なトレードオフ変更が必要になる。
情報検索(IR)の文脈では、トランスフォーマーベースのモデルを3つの方法で小さくすることができる。
これらのオプションは、それぞれが独自のコードとトレーニングのセットアップを持つ独自のメソッドとして、一度に一度に研究されている。
1つのオブジェクトがモデルの実行可能な任意のサイズを指定し、短いスケジュールでトレーニング対象のサイズをリストアップします。
トレーニングでは,これらすべてのサイズに対応するひとつのチェックポイントを生成して,デプロイ時に任意のチェックポイントを選択する。
同じ抽象化は、レトリバーとリランカの両方と、Hugging Face Transformerがすでに公開しているインターフェースを通じて動作するエンコーダとデコーダの両方をカバーしている。
Matryoshkaの埋め込み、アーリーエグジット、2D~Matryoshka(eg、Starbucks)、レイヤワイドトークン圧縮--統合された抽象化の特別なケースになります。
同じインターフェースでは、Metryoshka~LTC (MLTC) も利用可能で、1つのレトリバーチェックポイントでいくつかのトークン圧縮比を共同でトレーニングできる。
フレームワークを検証するために、我々は3つのバックボーンと2つのタスクで20のチェックポイントをトレーニングする: 品質曲線は滑らかで、1つのチェックポイントは1つのサイズでトレーニングされたモデルよりもほとんどコストがかかりません。
弾力性のある検索システムを構築するためのリソースとして,フレームワークとすべてのチェックポイントをリリースする。
関連論文リスト
- Update Your Transformer to the Latest Release: Re-Basin of Task Vectors [27.63078324151366]
ファウンデーションモデルは、微調整によって開発された多数の特殊モデルのバックボーンとして機能する。
基礎となる事前訓練されたモデルを更新または再訓練すると、微調整されたモデルは時代遅れになる。
モデルの新しいリリースに微調整を転送することは可能ですか?
本研究では,データフリーで再学習することなく,新たなチェックポイントに微調整を移す方法について検討する。
論文 参考訳(メタデータ) (2025-05-28T13:55:12Z) - POA: Pre-training Once for Models of All Sizes [33.72644336390202]
我々はPOA(Pre-Treating Once for All)と呼ばれる新しい三枝型自己教師型トレーニングフレームワークを提案する。
我々のアプローチは、革新的な弾性的な学生分岐を近代的な自己蒸留パラダイムに導入する。
ViT、Swin Transformer、ResNetのバックボーンを使って最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-08-02T06:13:29Z) - CerberusDet: Unified Multi-Dataset Object Detection [0.0]
CerberusDetは、複数のオブジェクト検出タスクを処理するために設計されたマルチヘッドモデルを持つフレームワークである。
提案されたモデルはYOLOアーキテクチャ上に構築され、バックボーンとネックコンポーネントの両方から視覚的特徴を効率的に共有する。
CerberusDetは36%の推論時間で最先端の結果を得た。
論文 参考訳(メタデータ) (2024-07-17T15:00:35Z) - MatFormer: Nested Transformer for Elastic Inference [91.45687988953435]
MatFormerは、多様なデプロイメント制約にまたがる弾性推論を提供するように設計された、新しいTransformerアーキテクチャである。
MatFormerは、標準的なTransformerモデルにネストフィードフォワードネットワーク(FFN)ブロック構造を組み込むことで、これを実現している。
8億5000万デコーダのみのMatFormer言語モデル(MatLM)により,5億2200万から8億5千万のパラメータにまたがる複数の小さなモデルを抽出できることを示す。
論文 参考訳(メタデータ) (2023-10-11T17:57:14Z) - $\Delta$-Patching: A Framework for Rapid Adaptation of Pre-trained
Convolutional Networks without Base Performance Loss [71.46601663956521]
大規模なデータセットで事前トレーニングされたモデルはしばしば、時間とともにやってくる新しいタスクやデータセットをサポートするように微調整される。
モデルコピーを格納することなく、効率よく微調整ニューラルネットワークモデルに$Delta$-Patchingを提案する。
我々の実験によると、$Delta$-Networksは、トレーニングされるパラメータのごく一部しか必要とせず、初期のモデルパッチ作業より優れています。
論文 参考訳(メタデータ) (2023-03-26T16:39:44Z) - AdaPoinTr: Diverse Point Cloud Completion with Adaptive Geometry-Aware
Transformers [94.11915008006483]
本稿では,ポイントクラウドの完了をセット・ツー・セットの翻訳問題として再定義する手法を提案する。
我々は、ポイントクラウド補完のためにTransformerエンコーダデコーダアーキテクチャを採用したPoinTrと呼ばれる新しいモデルを設計する。
本手法は,PCNで6.53 CD,ShapeNet-55で0.81 CD,現実世界のKITTIで0.392 MMDを実現する。
論文 参考訳(メタデータ) (2023-01-11T16:14:12Z) - Cross-Modal Adapter for Vision-Language Retrieval [60.59577149733934]
パラメータ効率の伝達学習のためのクロスモーダル適応器を提案する。
アダプタベースの手法にインスパイアされ、いくつかのパラメータ化レイヤで事前訓練されたモデルを調整します。
提案手法には,(1)微調整パラメータの大部分の削減,(2)トレーニング時間の短縮,(3)事前学習パラメータの修正,という3つの特長がある。
論文 参考訳(メタデータ) (2022-11-17T16:15:30Z) - AdaMix: Mixture-of-Adapter for Parameter-efficient Tuning of Large
Language Models [119.7093605087114]
大規模なトレーニング済み言語モデルをダウンストリームタスクに微調整するには、数億のパラメータを更新する必要がある。
これにより、各タスクのモデルの重みの大量コピーを格納するためのサービスコストが増大するだけでなく、数発のタスク適応中に不安定を示す。
パラメータや計算コストを2つの重要な手法で増大させることなく、アダプタ容量を改善するための新しいメカニズムを導入する。
論文 参考訳(メタデータ) (2022-05-24T23:41:22Z) - Structural Dropout for Model Width Compression [1.52292571922932]
既存のMLモデルは高度に過度にパラメータ化され、与えられたタスクに必要なリソースよりもはるかに多くのリソースを使用することが知られている。
本稿では,オリジナルのモデルと圧縮モデルのセットに対して,1つのトレーニングセッションのみを必要とする手法を提案する。
提案したアプローチは"構造的"なドロップアウトであり、ランダムに選択されたインデックスの上に隠された状態のすべての要素をプルークし、モデルにその特徴に対する重要な順序を学習させる。
論文 参考訳(メタデータ) (2022-05-13T21:50:57Z) - A Fast Post-Training Pruning Framework for Transformers [74.59556951906468]
プルーニングは、大きなTransformerモデルの巨大な推論コストを削減する効果的な方法である。
モデルプルーニングの以前の作業では、モデルの再トレーニングが必要だった。
本稿では,再学習を必要としないトランスフォーマーのための高速な訓練後プルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2022-03-29T07:41:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。