論文の概要: An Independent Safety Evaluation of Kimi K2.5
- arxiv url: http://arxiv.org/abs/2604.03121v1
- Date: Fri, 03 Apr 2026 15:45:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.518167
- Title: An Independent Safety Evaluation of Kimi K2.5
- Title(参考訳): K2.5の独立安全性評価
- Authors: Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen,
- Abstract要約: Kimi K2.5 は、コーディング、マルチモーダル、エージェントベンチマークにまたがるクローズドモデルと競合するオープンウェイト LLM である。
我々は,CBRNE誤用リスク,サイバーセキュリティリスク,不正調整,政治的検閲,偏見,無害感のモデルを評価する。
- 参考スコア(独自算出の注目度): 6.912584512861226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Kimi K2.5 is an open-weight LLM that rivals closed models across coding, multimodal, and agentic benchmarks, but was released without an accompanying safety evaluation. In this work, we conduct a preliminary safety assessment of Kimi K2.5 focusing on risks likely to be exacerbated by powerful open-weight models. Specifically, we evaluate the model for CBRNE misuse risk, cybersecurity risk, misalignment, political censorship, bias, and harmlessness, in both agentic and non-agentic settings. We find that Kimi K2.5 shows similar dual-use capabilities to GPT 5.2 and Claude Opus 4.5, but with significantly fewer refusals on CBRNE-related requests, suggesting it may uplift malicious actors in weapon creation. On cyber-related tasks, we find that Kimi K2.5 demonstrates competitive cybersecurity performance, but it does not appear to possess frontier-level autonomous cyberoffensive capabilities such as vulnerability discovery and exploitation. We further find that Kimi K2.5 shows concerning levels of sabotage ability and self-replication propensity, although it does not appear to have long-term malicious goals. In addition, Kimi K2.5 exhibits narrow censorship and political bias, especially in Chinese, and is more compliant with harmful requests related to spreading disinformation and copyright infringement. Finally, we find the model refuses to engage in user delusions and generally has low over-refusal rates. While preliminary, our findings highlight how safety risks exist in frontier open-weight models and may be amplified by the scale and accessibility of open-weight releases. Therefore, we strongly urge open-weight model developers to conduct and release more systematic safety evaluations required for responsible deployment.
- Abstract(参考訳): Kimi K2.5 は、コーディング、マルチモーダル、エージェントベンチマークでクローズドモデルと競合するオープンウェイト LLM である。
本研究では,強力なオープンウェイトモデルにより悪化する可能性のあるリスクに着目したK2.5の予備的安全性評価を行う。
具体的には, CBRNEの誤用リスク, サイバーセキュリティリスク, 不正調整, 政治的検閲, 偏見, 無害性のモデルについて, エージェントと非エージェントの両方で評価する。
K2.5 は GPT 5.2 や Claude Opus 4.5 と同様の二重使用能力を示すが、CBRNE 関連の要求に対する拒絶は著しく少なく、凶器作成において悪意あるアクターを興奮させる可能性があることを示唆している。
サイバー関連のタスクでは、Kimi K2.5は競争力のあるサイバーセキュリティ性能を示すが、脆弱性発見やエクスプロイトのようなフロンティアレベルの自律サイバー攻撃能力を持っていない。
さらに,K2.5は長期の有害な目標を持たないものの,サボタージュ能力と自己複製の妥当性のレベルを示す。
さらに、K2.5は、特に中国語での検閲や政治的偏見が狭く、偽情報の拡散や著作権侵害に関する有害な要求に適合している。
最後に、このモデルはユーザーの妄想への関与を拒み、通常、過剰な拒絶率を低くする。
予備的な調査では、フロンティアのオープンウェイトモデルに安全リスクがいかに存在し、オープンウェイトリリースの規模とアクセシビリティによって増幅される可能性があるかを強調した。
そのため、我々はオープンウェイトモデル開発者に、責任あるデプロイメントに必要なよりシステマティックな安全性評価の実施とリリースを強く促します。
関連論文リスト
- How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition [48.32744727426218]
LLMベースのエージェントは、電子メール、ドキュメント、コードリポジトリなどの外部データソースを処理する高利得設定にますますデプロイされている。
これにより間接的なプロンプトインジェクション攻撃が発生し、外部コンテンツに埋め込まれた敵の命令は、ユーザの意識なしにエージェントの動作を操作できる。
この2つの目的を3つのエージェント設定で評価した。
論文 参考訳(メタデータ) (2026-03-16T14:49:36Z) - Kimi K2.5: Visual Agentic Intelligence [236.05020914831047]
Kimi K2.5は、汎用エージェントインテリジェンスを促進するために設計されたオープンソースのマルチモーダルエージェントモデルである。
このマルチモーダル基盤の上に構築されたK2.5では、セルフ指向の並列エージェントオーケストレーションフレームワークであるAgent Swarmが導入されている。
論文 参考訳(メタデータ) (2026-02-02T16:17:38Z) - PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach [49.14349403242654]
我々は、リスクを伴う行動に関わるモデルの確率を評価する新しいベンチマークフレームワークであるtextbfPropensityBench$を提示する。
私たちのフレームワークには,サイバーセキュリティ,自己増殖,バイオセキュリティ,化学セキュリティという,リスクの高い4つのドメインにまたがる6,648のツールを備えた,5,874のシナリオが含まれています。
オープンソースとプロプライエタリなフロンティアモデル全体で、私たちは9つの不確実性の兆候を発見しました。
論文 参考訳(メタデータ) (2025-11-24T18:46:44Z) - Kimi K2: Open Agentic Intelligence [118.78600121345099]
Kimi K2は32億の活性化パラメータと1兆の総パラメータを持つ大きな言語モデルである。
MuonClipに基づいて、K2は15.5兆のトークンで事前訓練され、損失のスパイクはゼロだった。
Kimi K2は、オープンソース非思考モデルの間で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-28T05:35:43Z) - The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models [5.984437476321095]
我々は,最先端のオープンウェイトモデルの安全性ギャップを推定するツールキットをオープンソースとして公開した。
生物化学的, サイバー的能力, 拒絶率, モデル生成品質を2つの家系で評価した。
実験の結果,モデルスケールの増大とともに安全ギャップが拡大し,安全ガードを取り外すと有効危険能力が著しく増大することがわかった。
論文 参考訳(メタデータ) (2025-07-08T23:58:01Z) - Intrinsic Model Weaknesses: How Priming Attacks Unveil Vulnerabilities in Large Language Models [40.180771969531456]
大規模言語モデル(LLM)は、様々な産業に大きな影響を与えているが、重大な欠陥、有害なコンテンツを生成する可能性に悩まされている。
我々は、不適切なコンテンツを生成する際の脆弱性を明らかにするために、LLMの新たな攻撃戦略を開発し、テストした。
論文 参考訳(メタデータ) (2025-02-23T08:09:23Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。