論文の概要: BitNet Text Embeddings
- arxiv url: http://arxiv.org/abs/2606.25674v1
- Date: Wed, 24 Jun 2026 10:37:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.311134
- Title: BitNet Text Embeddings
- Title(参考訳): BitNetのテキスト埋め込み
- Authors: Zhen Li, Xin Huang, Liang Wang, Nan Yang, Ting Song, Yan Xia, Xun Wu, Shaohan Huang, Huishuai Zhang, Furu Wei, Dongyan Zhao,
- Abstract要約: BITEMBEDは,符号化効率とベクトル記憶を両立させるLLMベースのテキスト埋め込みのための極低ビットフレームワークである。
BITEMBEDは、トレーニング済みのLLMバックボーンを3次重み、量子化アクティベーション、軽量な正規化改善を備えたBitNetスタイルの埋め込みエンコーダに変換する。
Qwen3-0.6B と Gemma703-2M を用いた MMTEB (eng) の実験では、BITEMBED は完全精度の教師埋め込み器とほぼ同等であることが示された。
- 参考スコア(独自算出の注目度): 104.29781473344813
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based text embedders have substantially improved retrieval and semantic representation quality, but their deployment remains costly: large backbone models slow down embedding inference, while high-dimensional full-precision embeddings impose substantial storage and bandwidth overhead on large-scale indexes. In this paper, we present BITEMBED, an extreme low-bit framework for LLM-based text embedding that jointly targets encoding efficiency and vector storage. BITEMBED converts pretrained LLM backbones into BitNet-style embedding encoders with ternary weights, quantized activations, and lightweight normalization refinement. The converted model is adapted to representation learning through continual contrastive pre-training, followed by supervised contrastive fine-tuning with both similarity-distribution distillation and attention-relation distillation from a full-precision teacher. Beyond quantizing the backbone, BITEMBED further trains output embeddings to support multiple storage precisions meeting different storage needs in various scenarios. Experiments on MMTEB (eng, v2) with Qwen3-0.6B and Gemma3-270M show that BITEMBED is largely comparable to full precision teacher embedders. Moreover, BITEMBED flexibly obtains text embeddings of various precisions, achieving a trade-off between performance and storage cost.
- Abstract(参考訳): LLMベースのテキスト埋め込みは、検索とセマンティック表現の質を大幅に向上させたが、その展開にはコストがかかる: 大きなバックボーンモデルは、埋め込み推論を遅くする一方、高次元のフル精度埋め込みは、大規模なインデックスにかなりのストレージと帯域幅のオーバーヘッドをもたらす。
本稿では,エンコーディング効率とベクトル記憶を両立させるLLMベースのテキスト埋め込みのための極低ビットフレームワークBITEMBEDを提案する。
BITEMBEDは、トレーニング済みのLLMバックボーンを3次重み、量子化アクティベーション、軽量な正規化改善を備えたBitNetスタイルの埋め込みエンコーダに変換する。
変換されたモデルは、連続的なコントラスト事前学習による表現学習に適応し、その後、類似度分布蒸留とフル精度教師による注意関係蒸留の両方で教師付きコントラスト微調整を行う。
バックボーンの定量化以外にも、BITEMBEDは様々なシナリオで異なるストレージニーズを満たす複数のストレージ精度をサポートするために、出力埋め込みをトレーニングしている。
Qwen3-0.6B と Gemma3-270M を用いた MMTEB (eng, v2) の実験では、BITEMBED は完全精度の教師埋め込み器とほぼ同等であることが示された。
さらに、BITEMBEDは、様々な精度のテキスト埋め込みを柔軟に取得し、性能とストレージコストのトレードオフを実現する。
関連論文リスト
- Multi-Bitwidth Quantization for LLMs Using Additive Codebooks [12.237109162791091]
大規模言語モデル(LLM)は、リソース制約の異なる異種ハードウェアに徐々に展開されている。
本研究では,1つのトレーニングモデルからLLM重みの推測時間精度制御を可能にする,新しい学習後量子化フレームワークであるDrop-by-Dropを提案する。
論文 参考訳(メタデータ) (2026-06-11T04:06:02Z) - MemDLM: Memory-Enhanced DLM Training [56.40248490616793]
Diffusion Language Models (DLM)は、Auto-Regressive (AR)モデルよりも優れた利点を提供する。
彼らは列車の干渉ミスマッチに悩まされている。
本稿では,模擬復調処理をトレーニングに組み込んだメモリ拡張DLMを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:39:56Z) - Fine-tuning MLLMs Without Forgetting Is Easier Than You Think [72.59321247529975]
分布内および分布外画像およびテキスト入力のモデル性能を評価するための2x2実験フレームワークを設計する。
その結果、トレーニング可能なパラメータの数を制限したり、低学習率を採用するなど、適切な正規化が、アウト・オブ・ディストリビューション・イメージを扱う際の忘れを効果的に防止できることが示唆された。
我々は、このことをタスク固有のオーバーフィッティングとみなし、データハイブリッドトレーニング戦略を導入することでこの問題に対処する。
論文 参考訳(メタデータ) (2026-03-15T17:16:19Z) - TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs [14.030784220154151]
本研究では,大規模視覚言語モデルに対するTABED(Test-time Adaptive Batched Ensemble Drafting)を提案する。
TABEDは、SD設定で利用可能な過去の真実からの逸脱を利用して、バッチ推論によって得られた複数のドラフトをアンサンブルする。
自動回帰復号法よりも1.74倍のロバストなウォールタイム・スピードアップを実現し、単一起草法よりも5%改善した。
論文 参考訳(メタデータ) (2026-01-28T08:16:57Z) - ReMatch: Boosting Representation through Matching for Multimodal Retrieval [29.610030065465793]
ReMatchはマルチモーダル検索にMLLMの生成強度を利用するフレームワークである。
組込みMLLMをチャット形式の生成マッチングステージで訓練する。
実験では, 5つのデータセットに対して, 特に強いゼロショット一般化結果を示した。
論文 参考訳(メタデータ) (2025-11-24T16:28:49Z) - Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression [57.54335545892155]
本稿では,各重みの群に独自の格子コードブックを割り当てるGLVQ(Grouped Lattice Vector Quantization)フレームワークを紹介する。
提案手法は,既存のトレーニング後の量子化ベースラインと比較して,モデルサイズと精度のトレードオフが良好である。
論文 参考訳(メタデータ) (2025-10-23T20:19:48Z) - SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension [77.93156509994994]
本研究では,検索性能を向上させるために,より広いコンテキストウインドウに条件付きで短いチャンクを表現する方法を示す。
既存の埋め込みモデルは、そのような場所のコンテキストを効果的にエンコードするのに十分な装備がない。
我々の手法は、最先端の埋め込みモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-08-03T23:59:31Z) - Binary Embedding-based Retrieval at Tencent [30.44247353560061]
大規模埋め込み型検索 (EBR) は, 検索関連産業アプリケーションの基礎となっている。
本稿では,2進二進化アルゴリズムを組み込んだ2進埋め込み型検索エンジンを提案する。
私たちは、導入したBEBRをSogou、Tencent Video、QQ Worldなど、Tencent製品にうまく採用しました。
論文 参考訳(メタデータ) (2023-02-17T06:10:02Z) - Adapted Multimodal BERT with Layer-wise Fusion for Sentiment Analysis [84.12658971655253]
本稿では,マルチモーダルタスクのためのBERTベースのアーキテクチャであるAdapted Multimodal BERTを提案する。
アダプタはタスクの事前訓練された言語モデルを手動で調整し、融合層はタスク固有の層ワイドな音声視覚情報とテキストBERT表現を融合させる。
われわれは、このアプローチがより効率的なモデルにつながり、微調整されたモデルよりも優れ、ノイズの入力に堅牢であることを示した。
論文 参考訳(メタデータ) (2022-12-01T17:31:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。