論文の概要: NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference
- arxiv url: http://arxiv.org/abs/2609.01657v1
- Date: Mon, 31 Aug 2026 13:08:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.643849
- Title: NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference
- Title(参考訳): NeoMME: 効率的なファインチューニングと推論のためのシングルTowerマルチモーダル-Native Multilingual Foundation Encoder
- Abstract要約: 260Mと800Mのマルチモーダルおよび双方向の多言語文書エンコーダであるNeoMMEを紹介する。
どちらのモデルも、マスク付き離散拡散テキストの目的によって、ゼロから事前訓練されている。
ViDoRe v3ベンチマークでは、結果のNeoMME-Retriever 260Mが0.523 nDCG@10で評価されたモデルを上回っている。
NVIDIA L40Sの2048x2048画像入力サイズで、NeoMME-260MはColModernVBERTの2倍のスループットでページをエンコードする。
- 参考スコア(独自算出の注目度): 1.3961509337714324
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal models often build on architectures designed for generative vision-language modeling, typically combining separately pretrained vision encoders with causal language models. Visual document retrievers such as ColPali repurpose these models as encoders, carrying over the parameter and compute overhead of a VLM for a non-generative task. We introduce NeoMME, a family of 260M and 800M-parameter Multimodal and Multilingual bidirectional Encoders that process multilingual text and raw image patches in a single bidirectional Transformer encoder. Both models are pretrained from scratch with a masked discrete-diffusion text objective, conditioned on visible image patches for multimodal examples. Both support a 16,384-token context, enough to encode up to two standard 4K UHD images. To demonstrate its downstream capabilities, we fine-tune NeoMME with jointly trained dense and late-interaction heads. On the ViDoRe v3 benchmark, the resulting NeoMME-Retriever 260M outperforms all evaluated models strictly below 800M parameters with 0.523 nDCG@10, while NeoMME-Retriever 800M reaches 0.556. At a matched 2048x2048 image input size on an NVIDIA L40S, NeoMME-260M encodes pages with about 2x the throughput of ColModernVBERT. Hierarchical token pooling and asymmetric quantization compress late-interaction multimodal document embeddings by 255x while preserving over 95% of baseline nDCG@10. We contribute NeoMME to Hugging Face Transformers and release the pretrained backbone and retrieval-compatible checkpoints under Apache 2.0 at https://hf.co/collections/Hcompany/neomme.
- Abstract(参考訳): マルチモーダルモデルは、しばしば生成的な視覚言語モデリングのために設計されたアーキテクチャに基づいて構築され、通常、訓練済みの視覚エンコーダと因果言語モデルとを個別に組み合わせる。
ColPaliのようなビジュアルドキュメントレトリバーは、これらのモデルをエンコーダとして再利用し、非生成タスクのためのVLMのパラメータと計算オーバーヘッドを運ぶ。
260Mと800Mパラメータのマルチモーダルおよび多言語双方向エンコーダのファミリーであるNeoMMEを導入し,多言語テキストおよび原画像パッチを双方向トランスフォーマーエンコーダで処理する。
どちらのモデルも、マスク付き離散拡散テキストオブジェクトでスクラッチから事前訓練され、マルチモーダル例のための可視像パッチに条件付けされている。
どちらも16,384のコンテクストをサポートし、標準の4K UHDイメージを最大2枚エンコードできる。
下流の能力を示すために、我々は密集度と遅発度を共に訓練したNeoMMEを微調整した。
ViDoRe v3ベンチマークでは、結果のNeoMME-Retriever 260Mが800Mパラメータ以下で0.523 nDCG@10、NeoMME-Retriever 800Mが0.556と、すべての評価モデルでパフォーマンスが向上した。
NVIDIA L40Sの2048x2048画像入力サイズで、NeoMME-260MはColModernVBERTの2倍のスループットでページをエンコードする。
階層的トークンプーリングと非対称量子化は、ベースラインnDCG@10の95%以上を保持しながら、遅延相互作用多モード文書の埋め込みを255倍に圧縮する。
我々は、NeoMMEをHugging Face Transformersにコントリビュートし、Apache 2.0の下でトレーニング済みのバックボーンと検索互換のチェックポイントをhttps://hf.co/collections/Hcompany/neomme.comでリリースします。
関連論文リスト
- Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model [52.79436545460808]
本稿では,人中心生成のためのオープンソースオーディオビデオ生成基盤モデルdaVinci-MagiHumanを紹介する。
DaVinci-MagiHumanは、単一ストリームトランスフォーマーを使用して、同期ビデオとオーディオを共同で生成する。
中国語(マンダリン語とカントン語)、英語、日本語、韓国語、ドイツ語、フランス語の多言語音声生成をサポートする。
論文 参考訳(メタデータ) (2026-03-23T13:49:06Z) - Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation [66.53544128707817]
Cheersは、パッチレベルの詳細をセマンティック表現から切り離す、統一されたマルチモーダルモデルである。
チェアは視覚的理解と生成の両方において、高度なUMMと一致または超えます。
論文 参考訳(メタデータ) (2026-03-13T08:55:27Z) - Balancing Understanding and Generation in Discrete Diffusion Models [58.62235340638143]
Masked Diffusion Language Models (MDLM) は意味理解とゼロショットの一般化に優れる。
UDLM(Uniform-Noise Diffusion Language Models)は、強力な数ステップ生成品質を実現する。
定常雑音カーネルを介して2つのパラダイムをブリッジするXDLMを提案する。
論文 参考訳(メタデータ) (2026-02-01T18:00:35Z) - Native LLM and MLLM Inference at Scale on Apple Silicon [0.8122270502556375]
MLX をネイティブに構築した Apple Silicon 上で,効率的な LLM と MLLM 推論のためのフレームワーク vllm-mlx を提案する。
テキストモデルでは、Qwen3-0.6BからNemotron-30Bまでの範囲で、ラマよりも21%から87%高いスループットを達成する。
マルチモーダルモデルでは,入力形式によらず,同一画像をコンテンツハッシュで識別することで,冗長な視覚符号化を不要とするコンテンツベースキャッシングを導入する。
論文 参考訳(メタデータ) (2026-01-27T03:11:02Z) - Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models [92.18057318458528]
Token-ShuffleはTransformerにおける画像トークンの数を減らす新しい方法である。
我々の戦略は、事前訓練されたテキストエンコーダを必要とせず、MLLMが超高解像度画像合成をサポートできるようにする。
GenAIベンチマークでは、2.7Bモデルがハードプロンプトで0.77点、ARモデルLlamaGenが0.18点、拡散モデルLDMが0.15点である。
論文 参考訳(メタデータ) (2025-04-24T17:59:56Z) - OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models [36.0400717590138]
線形構造に基づく最初のマルチモーダル生成モデルであるOmniMambaを提案する。
テキストと画像の両方を、統合された次世代の予測パラダイムで生成する。
JanusFlowと競合し、ベンチマークでShow-oを上回っている。
論文 参考訳(メタデータ) (2025-03-11T17:59:46Z) - Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling [4.293921765264583]
バイト言語モデル(BLM)はトークン化を克服するために登場したが、バイトストリームの過剰な長さは新しいアーキテクチャパラダイムを必要としている。
モデルに依存しない階層型デコーダスタックであるMultiscale Byte Language Model (MBLM)を提案する。
論文 参考訳(メタデータ) (2025-02-20T13:31:50Z) - CMC-Bench: Towards a New Paradigm of Visual Signal Compression [85.1839779884282]
本稿では,画像圧縮のための画像間テキスト(I2T)モデルとテキスト間画像(T2I)モデルの協調性能のベンチマークであるCMC-Benchを紹介する。
超低速では、いくつかのI2TモデルとT2Iモデルの組み合わせが、最も先進的な視覚信号プロトコルを超えたことが証明されている。
論文 参考訳(メタデータ) (2024-06-13T17:41:37Z) - BridgeTower: Building Bridges Between Encoders in Vision-Language Representation Learning [91.93547262073213]
近年,2towerアーキテクチャを用いた視覚言語モデル(VL)が視覚表現学習を支配している。
そこで,BridgeTowerを提案する。このBridgeTowerは,ユニモーダルエンコーダの上位層とクロスモーダルエンコーダの各層との間の接続を構築する複数のブリッジ層を提供する。
BridgeTowerは78.73%の精度を達成し、以前の最先端モデルであるMETERを1.09%上回った。
論文 参考訳(メタデータ) (2022-06-17T09:42:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。