論文の概要: Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis
- arxiv url: http://arxiv.org/abs/2607.20216v1
- Date: Wed, 22 Jul 2026 14:36:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.114135
- Title: Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis
- Title(参考訳): 小, 自由, 有効: オープンウェイトな小言語モデルをオーケストレーションして, マルウェア解析のための単一LLMの性能を向上する
- Abstract要約: 大規模言語モデル(LLM)は、技術的アーティファクト解釈の優れた能力を示している。
多くのオープンウェイトモデルは大規模で、重要な計算資源を必要とし、非自明なホスティングコストを発生させる。
本稿では,小言語モデル (SLM) のオーケストレーションアンサンブルが単一LLM性能に適合するか否かを検討する。
- 参考スコア(独自算出の注目度): 2.549390156222399
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Malware analysis demands rapid interpretation of complex detonation reports spanning filesystem, network, and process behaviours. While large language models (LLMs) demonstrate impressive capabilities for technical artifact interpretation, the opacity and escalating API costs of closed-weight frontier models motivate exploration of open-weight alternatives. However, many open-weight models are large, demanding significant compute resources and incurring non-trivial hosting costs that place them beyond reach for resource-constrained deployments. This paper investigates whether orchestrated ensembles of small language models (SLMs) can match or exceed single LLM performance on structured questions about malware detonation reports. We established baselines by testing eleven open-weight SLMs, three cyber security pre-trained models, and six frontier LLMs on Meta's CyberSecEval Malware Analysis benchmark. We then designed and evaluated four orchestration architectures: (i) a multi-agent pipeline that decomposes analysis into structured evidence-collection and reasoning stages, (ii) an adversarial debate framework in which two agents iteratively critique each other's reasoning, (iii) a hierarchical consultation system that pairs a general-purpose SLM with a cyber-specialised expert model, and (iv) a hybrid architecture that combines evidence-grounded pipelines with adversarial debate reasoning. The hybrid system (Qwen3-4B with Foundation-Sec-8B) achieved 35.30% overall accuracy, exceeding the strongest cyber-specialised baseline (22.54%) and the strongest ungrounded frontier baseline (34.77%); when given the same evidence pipeline, grounded Gemini remained the strongest configuration at 38.22%. These findings show that evidence-grounded orchestration can substantially improve the performance of collaborative SLMs for supporting interpretation of malware detonation reports.
- Abstract(参考訳): マルウェア解析は、ファイルシステム、ネットワーク、プロセス動作にまたがる複雑な爆発報告の迅速な解釈を要求する。
大きな言語モデル(LLM)は、技術的アーティファクト解釈の素晴らしい能力を示しているが、クローズドウェイトフロンティアモデルの不透明さとエスカレーションAPIコストは、オープンウェイト代替品の探索を動機付けている。
しかし、多くのオープンウェイトモデルは大規模で、重要な計算リソースを必要とし、リソース制限されたデプロイメントに到達できないような、自明なホスティングコストを発生させる。
本稿では,小言語モデル (SLM) の編成されたアンサンブルが,マルウェア爆発報告に関する構造化された質問に対して,単一のLLM性能に適合するか否かを検討する。
我々は,MetaのCyberSecEval Malware Analysisベンチマークで,11個のオープンウェイトSLM,3つのサイバーセキュリティ事前訓練モデル,および6つのフロンティアLSMを試験して,ベースラインを確立した。
その後、私たちは4つのオーケストレーションアーキテクチャを設計、評価しました。
一 分析を構造化された証拠収集及び推論段階に分解する多エージェントパイプライン
二 相互の理屈を反復的に批判する敵討議の枠組み
三 汎用SLMとサイバー特化専門家モデルを組み合わせた階層的相談システム
(iv)エビデンスに基づくパイプラインと敵対的議論の推論を組み合わせたハイブリッドアーキテクチャ。
ハイブリッドシステム(Qwen3-4BとFoundation-Sec-8B)は、サイバー特殊化された最強のベースライン(22.54%)と最強のアングラウンドフロンティアベースライン(34.77%)を35.30%の精度で達成した。
これらの結果から,エビデンス・グラウンドド・オーケストレーションは,マルウェア爆発報告の解釈を支援するため,協調的なSLMの性能を大幅に向上させることができることが示唆された。
関連論文リスト
- RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants [48.63201300674347]
マルチモーダル産業異常検査アシスタントは,次世代スマートファクトリの重要な構成要素である。
MSLMはデプロイ可能な代替手段を提供するが、包括的な堅牢性分析の欠如によって進歩は制限されている。
我々はロバストMADを開発し、多様なオープンエンドクエリによるモデルロバスト性を評価する。
論文 参考訳(メタデータ) (2026-06-26T09:15:07Z) - SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks [65.14594927081983]
SciOrchは、科学的な推論のためにフロンティアLSMを編成する軽量8Bモデルを訓練するフレームワークである。
SGI-ReasoningとScientificsの最初の試験にまたがる240回の試験セットでは、SciOrchの平均精度は56.66%に達した。
また、一般的なマルチエージェントメソッドのAPIコストの半分未満で、SGIとSFEの両方で最高の精度を実現する。
論文 参考訳(メタデータ) (2026-06-14T15:45:34Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Feedback-Driven Execution for LLM-Based Binary Analysis [6.612857121548629]
本稿では,LLMに基づく解析をフィードバック駆動実行プロセスとして再考するシステムFOGEを提案する。
FORGEは推論-動作-観測ループを介して推論とツール相互作用をインターリーブする。
実世界3,457のファームウェアバイナリ上でFOGEを評価した。
論文 参考訳(メタデータ) (2026-04-16T15:15:58Z) - SALLIE: Safeguarding Against Latent Language & Image Exploits [1.6440434996206623]
本稿では,機械的解釈可能性に根ざした軽量ランタイム検出フレームワークであるSALLIEを紹介する。
SALLIEはモデルの内部アクティベーションから直接堅牢な信号を抽出する。
推測すると、SALLIEは3段階アーキテクチャで防御する。
論文 参考訳(メタデータ) (2026-04-06T16:29:05Z) - Box Maze: A Process-Control Architecture for Reliable LLM Reasoning [0.0]
本稿では,大規模言語モデルをメモリグラウンディング,構造化推論,境界強制という3つの明示的なレイヤに分解する概念的プロセス制御アーキテクチャを提案する。
予備的な結果から,プロセスレベルの制御は,大規模言語モデル推論における信頼性向上に有望な方向を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-19T17:41:18Z) - AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents [75.67445299298949]
AgentCPM-Exploreは、知識密度と強力な探索能力を備えたコンパクトな4Bエージェントモデルである。
本稿では,パラメータ空間モデルの融合,報酬信号の復調,文脈情報の改良を特徴とする総合的なトレーニングフレームワークを提案する。
AgentCPM-Exploreは4つのベンチマークで8BクラスのSOTAモデルにマッチまたは超え、また5つのベンチマークでClaude-4.5-SonnetやDeepSeek-v3.2のような大規模モデルよりも優れている。
論文 参考訳(メタデータ) (2026-02-06T08:24:59Z) - RHINO: Guided Reasoning for Mapping Network Logs to Adversarial Tactics and Techniques with Large Language Models [9.065322387043546]
人間の推論を反映した3つの解釈可能なフェーズに大言語モデルを分解するフレームワークであるRHINOを紹介する。
RHINOは、構造的推論による出力信頼性を改善しながら、低レベルの観測と反対方向のセマンティックギャップを橋渡しする。
以上の結果から,RHINOは脅威解析の解釈可能性やスケーラビリティを著しく向上させ,LLMを運用上のセキュリティ設定にデプロイするための青写真を提供することが示された。
論文 参考訳(メタデータ) (2025-10-16T02:25:46Z) - Benefits and Limitations of Communication in Multi-Agent Reasoning [11.788489289062312]
マルチエージェントシステムの表現性を解析するための理論的枠組みを提案する。
i) タスクを正確に解くために必要なエージェントの数, (ii) エージェント間通信の量と構造, (iii) 達成可能なスピードアップを問題サイズとコンテキストスケールとして導出する。
本研究は,コミュニケーションが有益である状況を特定し,エージェント数と帯域幅のトレードオフを明確化し,いずれのリソースにも制約がある場合の本質的な制約を明らかにする。
論文 参考訳(メタデータ) (2025-10-14T20:04:27Z) - mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning [74.97363626515236]
textbfSkill ベースの textbfCommonsense textbfReasoning (textbfmSCoRe) のための textbfMultilingual と Scalable Benchmark を提案する。
本ベンチマークでは,LLMの推論能力を体系的に評価するための3つの重要な要素を取り入れた。
本研究は,多言語多言語一般と文化的共通点に直面する場合,そのような推論強化モデルの限界を明らかにするものである。
論文 参考訳(メタデータ) (2025-08-13T18:59:02Z) - T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models [88.63040835652902]
テキストからビデオモデルへの攻撃はジェイルブレイク攻撃に弱いため、特別な方法で安全メカニズムをバイパスし、有害または安全でないコンテンツの生成につながる。
我々は、ジェイルブレイクの脅威からテキストからビデオモデルを守るために設計された包括的でモデルに依存しない防衛フレームワークであるT2VShieldを提案する。
本手法は,既存の防御の限界を特定するために,入力,モデル,出力の段階を体系的に解析する。
論文 参考訳(メタデータ) (2025-04-22T01:18:42Z) - Why Do Multi-Agent LLM Systems Fail? [87.90075668488434]
MAST-Dataは7つの人気のあるMASフレームワークで収集された1600以上の注釈付きトレースの包括的なデータセットである。
我々はMAST(Multi-Agent System Failure Taxonomy)を初めて構築する。
MASTとMAST-Dataを利用して、モデル(GPT4、Claude 3、Qwen2.5、CodeLlama)とタスク(コーディング、数学、汎用エージェント)の障害パターンを分析します。
論文 参考訳(メタデータ) (2025-03-17T19:04:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。