論文の概要: Kimi K2.5: Visual Agentic Intelligence
- arxiv url: http://arxiv.org/abs/2602.02276v1
- Date: Mon, 02 Feb 2026 16:17:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-03 19:28:34.283651
- Title: Kimi K2.5: Visual Agentic Intelligence
- Title(参考訳): K2.5:ビジュアルエージェントインテリジェンス
- Abstract要約: Kimi K2.5は、汎用エージェントインテリジェンスを促進するために設計されたオープンソースのマルチモーダルエージェントモデルである。
このマルチモーダル基盤の上に構築されたK2.5では、セルフ指向の並列エージェントオーケストレーションフレームワークであるAgent Swarmが導入されている。
- 参考スコア(独自算出の注目度): 236.05020914831047
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We introduce Kimi K2.5, an open-source multimodal agentic model designed to advance general agentic intelligence. K2.5 emphasizes the joint optimization of text and vision so that two modalities enhance each other. This includes a series of techniques such as joint text-vision pre-training, zero-vision SFT, and joint text-vision reinforcement learning. Building on this multimodal foundation, K2.5 introduces Agent Swarm, a self-directed parallel agent orchestration framework that dynamically decomposes complex tasks into heterogeneous sub-problems and executes them concurrently. Extensive evaluations show that Kimi K2.5 achieves state-of-the-art results across various domains including coding, vision, reasoning, and agentic tasks. Agent Swarm also reduces latency by up to $4.5\times$ over single-agent baselines. We release the post-trained Kimi K2.5 model checkpoint to facilitate future research and real-world applications of agentic intelligence.
- Abstract(参考訳): 我々は,汎用エージェントインテリジェンスを促進するために設計された,オープンソースのマルチモーダルエージェントモデルであるKimi K2.5を紹介する。
K2.5はテキストと視覚の共同最適化を強調しており、2つのモダリティが互いに強化されている。
これには、ジョイントテキストビジョン事前学習、ゼロビジョンSFT、ジョイントテキストビジョン強化学習などの一連のテクニックが含まれる。
このマルチモーダル基盤の上に構築されたK2.5では,Agent Swarmという,複雑なタスクをヘテロジニアスなサブプロブレムに動的に分解し,並列に実行する,セルフ指向の並列エージェントオーケストレーションフレームワークが導入されている。
大規模な評価では、Kimi K2.5はコーディング、ビジョン、推論、エージェントタスクなど、さまざまな領域で最先端の結果を達成している。
Agent Swarmは、単一エージェントのベースラインよりも最大4.5\times$のレイテンシも低減します。
我々は,エージェント・インテリジェンスの将来的な研究および実世界の応用を促進するために,ポストトレーニング後のKim K2.5モデルチェックポイントをリリースする。
関連論文リスト
- TopoDIM: One-shot Topology Generation of Diverse Interaction Modes for Multi-Agent Systems [13.061151798272933]
TopoDIMは、双方向インタラクションモードを用いたワンショットトポロジー生成のためのフレームワークである。
トークン効率が向上し、タスクパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-01-15T07:05:04Z) - Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search [56.78490647843876]
エージェント検索は、大規模言語モデル(LLM)が推論とツールの使用をインターリーブできるようにすることによって、複雑な情報を探すための有望なパラダイムとして登場した。
本稿では,bfM-ASKを提案する。bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK。
論文 参考訳(メタデータ) (2026-01-08T08:13:27Z) - Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents [43.20918899874477]
大規模言語モデル(LLM)は、ソフトウェア工学(SWE)にますます適用されつつある
我々はまず、Agentlessトレーニングレシピをキュレートし、SWE-bench Verified上で60.4%を達成したオープンソースのSWE LLMであるKim-Devを提示する。
5kの公用軌道にSFTを付加することで、Kim-DevはClaude 3.5 Sonnetと同等の48.6%のpass@1にSWE-Agentsをパワーアップする。
論文 参考訳(メタデータ) (2025-09-27T01:49:13Z) - Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL [41.847359443133776]
CoA(Chain-of-Agents)は、大規模言語モデル(LLM)推論の新しいパラダイムであり、ネイティブなエンドツーエンドの複雑な問題解決を可能にする。
我々は, エージェント制御微調整のための多エージェント蒸留フレームワークを導入し, 最先端のマルチエージェントシステムをチェーン・オブ・エージェント・トラジェクトリに蒸留する。
次に、検証可能なエージェントタスクに対するエージェント強化学習を用いて、チェーン・オブ・エージェントの問題解決におけるモデルの能力をさらに向上する。
論文 参考訳(メタデータ) (2025-08-06T17:01:02Z) - Kimi K2: Open Agentic Intelligence [118.78600121345099]
Kimi K2は32億の活性化パラメータと1兆の総パラメータを持つ大きな言語モデルである。
MuonClipに基づいて、K2は15.5兆のトークンで事前訓練され、損失のスパイクはゼロだった。
Kimi K2は、オープンソース非思考モデルの間で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-28T05:35:43Z) - AnyMAC: Cascading Flexible Multi-Agent Collaboration via Next-Agent Prediction [77.62279834617475]
本稿では,グラフ構造ではなくシーケンシャル構造を用いて,マルチエージェント協調を再考するフレームワークを提案する。
提案手法は,(1)各ステップで最も適したエージェントロールを選択するNext-Agent Predictionと,(2)各エージェントが前ステップから関連する情報にアクセスできるようにするNext-Context Selectionの2つの重要な方向に焦点を当てる。
論文 参考訳(メタデータ) (2025-06-21T18:34:43Z) - GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning [9.24980723036746]
GAM-Agentは、視覚言語推論を強化するためのゲーム理論のマルチエージェントフレームワークである。
基本エージェント間の非ゼロサムゲームとして推論過程を定式化し、視覚的知覚サブタスクを専門とするゲームと、論理的一貫性と事実的正確性を検証する重要なエージェントを定式化する。
我々のアプローチはモジュール化され、スケーラブルで、一般化可能であり、信頼性と説明可能なマルチエージェントのマルチモーダル推論への道筋を提供する。
論文 参考訳(メタデータ) (2025-05-29T12:37:34Z) - Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning [29.580108004844856]
大規模言語モデル(LLM)上に構築されたマルチエージェントシステム(MAS)は、複雑で現実的なタスクを解決するための有望な道を提供する。
テストタイムスケーリング(TTS)の最近の進歩は、難解な推論タスクにおいて、シングルエージェントのパフォーマンスを大幅に改善した。
モデルレベルのトレーニングとシステムレベルの調整の両方を通じて協調推論を強化するために設計された適応型マルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-14T00:27:45Z) - Qwen2.5 Technical Report [122.13958993185952]
Qwen2.5は多種多様なニーズに対応するように設計された大規模言語モデル(LLM)の包括的シリーズである。
以前のイテレーションと比較して、Qwen 2.5はトレーニング前とトレーニング後の両方で大幅に改善されている。
オープンウェイト製品には、ベースモデルと命令チューニングモデルが含まれており、量子化されたバージョンが利用可能である。
ホスト型ソリューションでは、現在プロプライエタリなモデルには、Qwen2.5-TurboとQwen2.5-Plusの2つの混合型(MoE)が含まれている。
論文 参考訳(メタデータ) (2024-12-19T17:56:09Z) - xLAM: A Family of Large Action Models to Empower AI Agent Systems [111.5719694445345]
AIエージェントタスク用に設計された大規模なアクションモデルであるxLAMをリリースする。
xLAMは、複数のエージェント能力ベンチマークで例外的なパフォーマンスを提供する。
論文 参考訳(メタデータ) (2024-09-05T03:22:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。