論文の概要: A Holistic Assessment of the Carbon Footprint of Noor, a Very Large Arabic Language Model
- arxiv url: http://arxiv.org/abs/2610.00223v1
- Date: Tue, 22 Sep 2026 11:25:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.577384
- Title: A Holistic Assessment of the Carbon Footprint of Noor, a Very Large Arabic Language Model
- Title(参考訳): 極大アラビア語モデルNoorのカーボンフットプリントの全体的評価
- Abstract要約: 極大規模言語モデルであるNoorのフットプリントの全体的評価を提案する。
Noorは、最大のマルチタスク・アラビア語モデルを開発するために進行中のプロジェクトである。
- 参考スコア(独自算出の注目度): 3.19567317580511
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As ever larger language models grow more ubiquitous, it is crucial to consider their environmental impact. Characterised by extreme size and resource use, recent generations of models have been criticised for their voracious appetite for compute, and thus significant carbon footprint. Although reporting of carbon impact has grown more common in machine learning papers, this reporting is usually limited to compute resources used strictly for training. In this work, we propose a holistic assessment of the footprint of an extreme-scale language model, Noor. Noor is an ongoing project aiming to develop the largest multi-task Arabic language models -- with up to 13B parameters -- leveraging zero-shot generalisation to enable a wide range of downstream tasks via natural language instructions. We assess the total carbon bill of the entire project: starting with data collection and storage costs, including research and development budgets, pretraining costs, future serving estimates, and other exogenous costs necessary for this international cooperation. Notably, we find that inference costs and exogenous factors can have a significant impact on total budget. Finally, we discuss pathways to reduce the carbon footprint of extreme-scale models.
- Abstract(参考訳): より大きな言語モデルがよりユビキタスに成長するにつれて、その環境への影響を考慮することが不可欠である。
極端なサイズと資源使用によって特徴づけられる、最近の世代のモデルは、計算に対する豪華な食欲と、その結果炭素フットプリントが著しく批判されている。
機械学習論文では、カーボンインパクトの報告が一般的になっているが、このレポートは通常、トレーニングに厳密に使用されるリソースに限られている。
本研究では,超大規模言語モデルNoorのフットプリントの全体的評価を提案する。
Noorは、最大13Bパラメータを持つ最大規模のマルチタスクアラビア語言語モデルの開発を目的とした、進行中のプロジェクトである。ゼロショットの一般化を活用して、自然言語命令を通じて幅広いダウンストリームタスクを可能にする。
まず、研究・開発予算、事前訓練コスト、将来のサービス見積、その他の国際協力に必要な外因性コストなど、データ収集・保管コストから始める。
特に,推定コストと外因性要因が総予算に重大な影響を与えることが判明した。
最後に,極大規模モデルの炭素フットプリントを低減する経路について論じる。
関連論文リスト
- Hugging Carbon: Quantifying the Training Carbon Emissions of AI Models at Scale [24.552090932103294]
Hugging Face (HF) は、炭素会計のための大規模で、一般公開され、監査可能なコーパスである。
我々は,HFオープンソースモデルの集合的トレーニングエミッションを推定するFLOPsベースのフレームワークを提案する。
我々の結果は、最も人気のあるオープンソースモデルのトレーニングの結果、約5.8タイムs104$の二酸化炭素排出量が得られたことを示している。
論文 参考訳(メタデータ) (2026-05-02T17:32:56Z) - The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining [59.27959962602072]
Olmo 3は70億と32億のパラメータモデルからなるファミリーである。
モデル開発プロセスでは,12.3GWhのデータセンターエネルギーを消費し,4,251tCO2eqを放出し,15,887kLの水を消費した。
論文 参考訳(メタデータ) (2026-05-01T23:24:23Z) - AI-CARE: Carbon-Aware Reporting Evaluation Metric for AI Models [2.7946918847372277]
本稿では,AI-CARE,エネルギー消費評価ツール,および機械学習モデルの炭素排出量について述べる。
理論的解析と実証的検証を通じて、炭素認識ベンチマークがモデルの相対的なランキングを変えることを実証する。
本提案は,研究コミュニティを透明で多目的な評価に転換し,MLの進歩をグローバルなサステナビリティ目標に合わせることを目的としている。
論文 参考訳(メタデータ) (2026-02-17T21:52:48Z) - Generative AI for Low-Carbon Artificial Intelligence of Things with Large Language Models [67.0243099823109]
ジェネレーティブAI(GAI)は、AIoT(Artificial Intelligence of Things)の二酸化炭素排出量を減らす大きな可能性を秘めている
本稿では, 炭素排出量削減のためのGAIの可能性について検討し, 低炭素AIoTのための新しいGAI対応ソリューションを提案する。
本稿では,Large Language Model (LLM) を利用したCO_2排出最適化フレームワークを提案し,このフレームワークにより,プラグ可能なLLMとRetrieval Augmented Generation (RAG) モジュールを設計する。
論文 参考訳(メタデータ) (2024-04-28T05:46:28Z) - Counting Carbon: A Survey of Factors Influencing the Emissions of
Machine Learning [77.62876532784759]
機械学習(ML)は、モデルトレーニングプロセス中に計算を実行するためにエネルギーを使用する必要がある。
このエネルギーの生成には、使用量やエネルギー源によって、温室効果ガスの排出という観点からの環境コストが伴う。
本稿では,自然言語処理とコンピュータビジョンにおいて,95のMLモデルの炭素排出量の時間的および異なるタスクに関する調査を行う。
論文 参考訳(メタデータ) (2023-02-16T18:35:00Z) - Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language
Model [72.65502770895417]
176ビリオンパラメータ言語モデルBLOOMの炭素フットプリントを,そのライフサイクルにわたって定量化する。
BLOOMの最終訓練で約24.7トンのカルボネックが放出されたと推定する。
本稿では,機械学習モデルの炭素フットプリントを正確に推定することの難しさについて論じる。
論文 参考訳(メタデータ) (2022-11-03T17:13:48Z) - Measuring the Carbon Intensity of AI in Cloud Instances [91.28501520271972]
我々は,ソフトウェアの炭素強度を測定するための枠組みを提供し,運転中の炭素排出量を測定することを提案する。
私たちは、Microsoft Azureクラウドコンピューティングプラットフォームにおける排出削減のための一連のアプローチを評価します。
論文 参考訳(メタデータ) (2022-06-10T17:04:04Z) - Curb Your Carbon Emissions: Benchmarking Carbon Emissions in Machine
Translation [0.0]
本研究では, 炭素効率について検討し, トレーニングモデルによる環境影響の低減のための代替策を提案する。
本研究では,機械翻訳モデルの性能を複数の言語対で評価する。
これらのモデルの様々なコンポーネントを調べ、これらの二酸化炭素排出量を減らすために最適化できるパイプラインの側面を分析します。
論文 参考訳(メタデータ) (2021-09-26T12:30:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。