論文の概要: Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- arxiv url: http://arxiv.org/abs/2507.06261v2
- Date: Fri, 11 Jul 2025 11:03:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-07-14 11:58:22.342889
- Title: Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Title(参考訳): Gemini 2.5: 高度な推論,マルチモーダリティ,長期コンテキスト,次世代エージェント機能を備えたフロンティアの推進
- Abstract要約: Gemini 2.5 Proは私たちの最も有能なモデルであり、フロンティアコーディングと推論ベンチマークでSoTAのパフォーマンスを実現しています。
Gemini 2.5 Flashは計算とレイテンシの要求のごく一部で優れた推論機能を提供する。
Gemini 2.0 FlashとFlash-Liteは低レイテンシと低コストでハイパフォーマンスを提供する。
- 参考スコア(独自算出の注目度): 1562.0318474764724
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this report, we introduce the Gemini 2.X model family: Gemini 2.5 Pro and Gemini 2.5 Flash, as well as our earlier Gemini 2.0 Flash and Flash-Lite models. Gemini 2.5 Pro is our most capable model yet, achieving SoTA performance on frontier coding and reasoning benchmarks. In addition to its incredible coding and reasoning skills, Gemini 2.5 Pro is a thinking model that excels at multimodal understanding and it is now able to process up to 3 hours of video content. Its unique combination of long context, multimodal and reasoning capabilities can be combined to unlock new agentic workflows. Gemini 2.5 Flash provides excellent reasoning abilities at a fraction of the compute and latency requirements and Gemini 2.0 Flash and Flash-Lite provide high performance at low latency and cost. Taken together, the Gemini 2.X model generation spans the full Pareto frontier of model capability vs cost, allowing users to explore the boundaries of what is possible with complex agentic problem solving.
- Abstract(参考訳): 本稿では、Gemini 2.XモデルファミリであるGemini 2.5 ProとGemini 2.5 Flashと、以前のGemini 2.0 FlashとFlash-Liteモデルを紹介します。
Gemini 2.5 Proは私たちの最も有能なモデルであり、フロンティアコーディングと推論ベンチマークでSoTAのパフォーマンスを実現しています。
Gemini 2.5 Proは、その驚くべきコーディングと推論のスキルに加えて、マルチモーダル理解の優れた思考モデルであり、最大3時間のビデオコンテンツを処理できるようになった。
長いコンテキスト、マルチモーダル、推論のユニークな組み合わせは、新しいエージェントワークフローをアンロックするために組み合わせることができる。
Gemini 2.5 Flashは計算とレイテンシの要件のごく一部で優れた推論能力を提供し、Gemini 2.0 FlashとFlash-Liteは低レイテンシとコストで高いパフォーマンスを提供する。
Gemini 2.Xモデル生成は、モデル能力とコストの完全なParetoフロンティアにまたがる。
関連論文リスト
- NVIDIA Nemotron 3: Efficient and Open Intelligence [227.47413816066845]
ネモトロン3シリーズは強力なエージェント、推論、会話能力を提供する。
ネモトロン3モデルは、推論を可能にするマルチ環境強化学習、多段階ツールの使用、きめ細かい推論予算制御のサポートを用いて、後から訓練される。
Nemotron 3ファミリは、Mixture-of-ExpertsハイブリッドのMamba-Transformerアーキテクチャを使用して、最高レベルのスループットと最大100万トークンのコンテキスト長を提供する。
論文 参考訳(メタデータ) (2025-12-24T00:24:05Z) - Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models [55.267193180769794]
Mini-Geminiはマルチモーダルビジョン言語モデル(VLM)を強化するフレームワーク
Mini-Gemini は 2B から 34B までの一連の高密度および高密度な MoE 言語モデル (LLM) をサポートしている。
いくつかのゼロショットベンチマークで主要なパフォーマンスを達成でき、開発済みのプライベートモデルを超えている。
論文 参考訳(メタデータ) (2024-03-27T17:59:04Z) - Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context [666.1866258670091]
本稿では,次世代の計算効率の高いマルチモーダルモデルであるGemini 1.5モデルについて紹介する。
ファミリーには2つの新しいモデルが含まれている: (1) アップデートされたGemini 1.5 Proは、機能とベンチマークの大部分で2月バージョンを超え、(2) Gemini 1.5 Flashは、品質の最小限の回帰で効率よく設計された、より軽量な派生型である。
論文 参考訳(メタデータ) (2024-03-08T18:54:20Z) - Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language
Models [14.30980373935713]
Googleは、マルチモーダル統合に特化した最先端のMLLMであるGeminiを発表した。
その進歩にもかかわらず、予備ベンチマークは、ジェミニが常識的推論タスクにおいてGPTモデルに遅れていることを示している。
本研究は,複雑な推論タスクにおけるジェミニのパフォーマンスを徹底的に評価する。
論文 参考訳(メタデータ) (2023-12-29T15:57:49Z) - A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise [78.54563675327198]
GeminiはGoogleの最新かつ最も有能なMLLMで、マルチモダリティのためにゼロから構築されています。
Geminiはマルチモーダル学習におけるGPT-4Vのリードポジションに挑戦できるか?
Gemini Proと最先端のGPT-4Vを比較して、最新のオープンソースMLLMであるSphinxとともに、その上限を評価する。
論文 参考訳(メタデータ) (2023-12-19T18:59:22Z) - Gemini: A Family of Highly Capable Multimodal Models [629.0150653235353]
マルチモーダルモデルの新たなファミリーであるGeminiは、画像、オーディオ、ビデオ、テキスト理解にまたがる優れた機能を示している。
GeminiファミリーはUltra、Pro、Nanoサイズで構成されており、複雑な推論タスクからオンデバイスメモリ制約のユースケースまで幅広い用途に適している。
論文 参考訳(メタデータ) (2023-12-19T02:39:27Z) - An In-depth Look at Gemini's Language Abilities [49.897870833250494]
OpenAI GPTとGoogle Geminiモデルの能力を比較する。
この分析は、さまざまな言語能力をテストする10のデータセットに対して実施します。
Gemini Pro は GPT 3.5 Turbo よりも近いがわずかに劣る精度を実現している。
論文 参考訳(メタデータ) (2023-12-18T18:47:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。