論文の概要: TESSERA v2: Scaling Pixel-wise Earth Foundation Models
- arxiv url: http://arxiv.org/abs/2607.03949v1
- Date: Sat, 04 Jul 2026 16:52:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.770632
- Title: TESSERA v2: Scaling Pixel-wise Earth Foundation Models
- Title(参考訳): TESSERA v2: Pixel-wise Earth Foundation Modelのスケーリング
- Authors: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, Andrew Blake, David Coomes, Anil Madhavapeddy, Srinivasan Keshav,
- Abstract要約: 本稿では,地球観測画素単位の基礎モデルについて,これまでで最大規模で評価したスケーリングモデルについて述べる。
395のトレーニングは1024GH200スーパーチップ上で、固定画素ワイドのバーロウツインズファミリー内で実行される。
埋め込み・データ配置のためのコンパクトな学生に画素単位のモデルを蒸留する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pixel-wise Earth-observation (EO) foundation models are now achieving state-of-the-art performance via generated spatial embeddings. However, how these models scale and how best to spend a pretraining budget remain poorly understood. We present the largest controlled scaling study for EO to date: 395 training runs on 1,024 GH200 superchips within a fixed pixel-wise Barlow Twins family, each evaluated on 15 downstream tasks. We find that pretraining loss barely predicts downstream performance (|Pearson r| < 0.2), so selecting models by loss wastes a large share of the compute. We also find that, as the training budget grows, the encoder and the data should grow together while the projector stays fixed, which gives a simple rule for allocating compute. Using this rule, we train a family of pixel-wise models (0.5B and 1B, with a 2B model in training) and distill them into compact students for embeddings-as-data deployment. The 21-million-parameter distilled TESSERA v2-1B-M in aggregate outperforms all open and proprietary models tested, some of which are orders of magnitude larger. These students produce Matryoshka representations that are inexpensive to serve: a 16-dimensional prefix keeps 92% of the full 128-dimensional performance at 1/8 of the storage. Upon completion of training we plan to release v2 global embeddings covering 2017-2025. Together, these results give a concrete, empirically grounded recipe for scaling pixel-wise EO foundation models: train large encoders, select by downstream performance, and distil into flexible student models. All code will be released at https://github.com/ucam-eo/tessera.
- Abstract(参考訳): 画素単位の地球観測(EO)ファンデーションモデルは現在、生成された空間埋め込みによって最先端のパフォーマンスを実現している。
しかし、これらのモデルがどのようにスケールし、事前訓練された予算を最大限に活用するかは、まだよく分かっていない。
395のトレーニングは1024GH200スーパーチップ上で、それぞれ15の下流タスクで評価される固定画素ワイドのBarlow Twinsファミリー内で実行される。
事前学習損失はダウンストリーム性能 (|Pearson r| < 0.2) をほとんど予測できないため、損失によるモデルの選択は計算の大部分を無駄にする。
また、トレーニング予算が増加するにつれて、エンコーダとデータは一緒に成長し、プロジェクタは固定され続け、計算を割り当てるための単純なルールが得られます。
このルールを用いて、画素単位のモデル群(0.5Bと1B、トレーニング時に2Bモデル)を訓練し、それをコンパクトな学生に蒸留して埋め込み・データ展開を行う。
21万パラメートル蒸留されたTESSERA v2-1B-Mは、試験された全てのオープンモデルとプロプライエタリモデルより優れており、そのうちのいくつかは桁違いに大きい。
16次元の接頭辞は、記憶の1/8で128次元の完全なパフォーマンスの92%を保っている。
トレーニングが完了すると、2017-2025年をカバーするv2グローバルな埋め込みをリリースする予定です。
これらの結果は、大きなエンコーダのトレーニング、下流のパフォーマンスの選択、フレキシブルな学生モデルへの変換など、ピクセル単位のEOファンデーションモデルをスケールするための具体的、経験的に根ざしたレシピを提供する。
すべてのコードはhttps://github.com/ucam-eo/tessera.comでリリースされる。
関連論文リスト
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion [0.0]
SeFi-Imageはセマンティックファースト拡散に基づいて構築されたテキスト・ツー・イメージの基礎モデルである。
我々は,SeFi-Imageを3つのモデルスケール,1B,2B,5Bパラメータでインスタンス化する。
SeFi-ImageはGenEval, DPG, LongTextBench, OneIG, DMDG-2Kなど,幅広いベンチマークで高いパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-06-21T16:10:22Z) - Compute-Optimal Scaling for Value-Based Deep RL [99.680827753493]
オンライン価値ベースディープRLの計算スケーリングについて検討する。
解析の結果,モデルサイズ,バッチサイズ,UTD間の微妙な相互作用が明らかになった。
この現象を理解するためのメンタルモデルを提供し、バッチサイズとUTDを選択するためのガイドラインを構築します。
論文 参考訳(メタデータ) (2025-08-20T17:54:21Z) - Training and Inference Efficiency of Encoder-Decoder Speech Models [25.031622057759492]
我々は効率角に焦点を合わせ、これらの音声モデルを効率的に訓練しているかどうかを問う。
ミニバッチサンプリングにおける無視は、パディングに50%以上費やされていることを示す。
モデルアーキテクチャを調整してデコーダからエンコーダにモデルパラメータを転送すると、3倍の推論速度が得られます。
論文 参考訳(メタデータ) (2025-03-07T20:57:43Z) - OmniBal: Towards Fast Instruction-Tuning for Vision-Language Models via Omniverse Computation Balance [67.37017498784748]
視覚言語命令チューニングモデルにおける大規模3D並列トレーニングは、異なるデバイス間で不均衡な計算負荷をもたらす。
我々は、データ、モデル、メモリの観点から計算負荷を再均衡させ、デバイス間でよりバランスのとれた計算を実現する。
提案手法の有効性と一般化性は,様々なモデルやデータセットにまたがってさらに検証される。
論文 参考訳(メタデータ) (2024-07-30T12:02:58Z) - DINOv2: Learning Robust Visual Features without Supervision [75.42921276202522]
この研究は、既存の事前学習手法、特に自己教師付き手法が、多様なソースから十分なキュレートされたデータで訓練すれば、そのような特徴を生み出すことができることを示している。
技術的な貢献の多くは、大規模なトレーニングを加速し、安定化することを目的としています。
データの観点からは、自己組織化されていないデータではなく、専用で多様でキュレートされた画像データセットを構築するための自動パイプラインを提案する。
論文 参考訳(メタデータ) (2023-04-14T15:12:19Z) - TinyMIM: An Empirical Study of Distilling MIM Pre-trained Models [31.16595289223858]
マスク付き画像モデリング(MIM)は、事前学習大型視覚変換器(ViT)に強く貢献する
しかし、現実世界のアプリケーションにとって重要な小さなモデルは、この事前学習アプローチの恩恵を受けることはできない。
我々は,MIMをベースとした大規模プレトレーニングモデルの成功を,より小さなモデルに伝達する蒸留技術について検討する。
論文 参考訳(メタデータ) (2023-01-03T18:59:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。