論文の概要: Benchmarking LLMs on File System Design and Implementation
- arxiv url: http://arxiv.org/abs/2608.00280v2
- Date: Tue, 04 Aug 2026 05:00:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.66071
- Title: Benchmarking LLMs on File System Design and Implementation
- Title(参考訳): ファイルシステム設計と実装におけるLCMのベンチマーク
- Authors: Yuqi Xue, Daixuan Li, Jian Huang,
- Abstract要約: 本稿では、fs固有のタスクのためのLLMベンチマークフレームワークである-Benchを紹介する。
基本的な理解,基本的な実装,パフォーマンスモデリング,デバッグ,最適化,新機能開発という,6種類のタスクを開発しています。
オープンソース(DeepSeek-V4-Flash, GLM-5.1, MiniMax-M2.7)とプロプライエタリ(Claude-Opus-4.7, GPT-5.2, Gemini-3.1-Pro)の両方で505タスクを実行する。
本研究は, 異なるタスクに対するモデル効率, 失敗の原因を明らかにする。
- 参考スコア(独自算出の注目度): 3.7335834184334415
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large Language Models (LLMs) are fundamentally transforming computer system research and development. As we employ LLMs in file system (fs) development, it is essential to understand their capabilities, limitations, and operational efficiency for domain-specific tasks. We present φ-Bench, an LLM benchmarking framework for fs-specific tasks. To facilitate benchmarking, we develop six types of tasks in φ-Bench: basic understanding, basic implementation, performance modeling, debugging, optimization, and new feature development. Each type emphasizes different LLM capabilities: instruction following, knowledge recall, reasoning, or coding. To create high-quality tasks while achieving broad coverage with minimal human effort, we develop a new AI-assisted task generation pipeline in addition to expert-written and textbook-adapted tasks. With 505 tasks in φ-Bench, we conduct an empirical study with both open source (DeepSeek-V4-Flash, GLM-5.1, and MiniMax-M2.7) and proprietary (Claude-Opus-4.7, GPT-5.2, and Gemini-3.1-Pro) LLMs. Our study discloses the model efficiency for different tasks, causes of failed fs tasks, and techniques for mitigating LLM failures. We will open source φ-Bench to facilitate public research on using LLMs for fs development.
- Abstract(参考訳): 大規模言語モデル(LLM)は、コンピュータシステムの研究と開発を根本的に変えるものである。
ファイルシステム(fs)開発にLLMを採用するため、ドメイン固有のタスクの能力、制限、運用効率を理解することが不可欠である。
φ-Bench は fs 固有のタスクのための LLM ベンチマークフレームワークである。
ベンチマークを容易にするため,φ-Benchの基本的な理解,基本実装,パフォーマンスモデリング,デバッグ,最適化,新機能開発という,6種類のタスクを開発した。
各型は、命令追従、知識リコール、推論、コーディングといった異なるLLM機能を強調している。
人的労力を最小限に抑えながら、高品質なタスクを作成するために、専門家が書き込んだ、教科書に適応したタスクに加えて、AI支援タスク生成パイプラインを新たに開発する。
φ-Benchで505タスクを実行すると、オープンソース(DeepSeek-V4-Flash、GLM-5.1、MiniMax-M2.7)とプロプライエタリ(Claude-Opus-4.7、GPT-5.2、Gemini-3.1-Pro)の両方で実証的研究を行う。
本研究は、異なるタスクに対するモデル効率、失敗fsタスクの原因、LCM故障の軽減技術を明らかにする。
fs 開発における LLM の利用に関する公開研究を促進するため,我々は φ-Bench をオープンソースとして公開する。
関連論文リスト
- Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem [9.994953049271892]
大規模言語モデル(LLM)は、ローコードおよびノーコード自動化プラットフォームで急速に採用されている。
ローコード自動化プラットフォームにおけるLLMエージェントの大規模実証研究について紹介する。
論文 参考訳(メタデータ) (2026-06-27T23:57:01Z) - Benchmarking Large Language Models for Multi-Language Software Vulnerability Detection [15.026084450436976]
本稿では,ソフトウェア脆弱性検出タスクにおいて,大規模言語モデル(LLM)の性能を評価する。
Pythonで8,260の脆弱な関数、Javaで7,505、JavaScriptで28,983のデータセットをコンパイルしました。
これらのLSMは、5つの微調整された小さな言語モデルと2つのオープンソースの静的アプリケーションセキュリティテストツールに対してベンチマークされる。
論文 参考訳(メタデータ) (2025-03-03T11:56:00Z) - On the Evaluation of Large Language Models in Unit Test Generation [16.447000441006814]
単体テストは、ソフトウェアコンポーネントの正しさを検証するために、ソフトウェア開発において不可欠な活動である。
LLM(Large Language Models)の出現は、ユニットテスト生成を自動化するための新しい方向性を提供する。
論文 参考訳(メタデータ) (2024-06-26T08:57:03Z) - BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions [72.56339136017759]
BigCodeBenchは、大規模言語モデル(LLM)に対して、139のライブラリと7つのドメインから1140のきめ細かいタスクに対して、複数の関数呼び出しをツールとして呼び出すためのベンチマークである。
評価の結果,LLMは機能コールを正確に使用するための複雑な指示に従うことができず,スコアは最大60%,人的性能は97%と極めて低いことがわかった。
そこで本研究では,BigCodeBench-Instructという自然言語指向の変種を提案する。
論文 参考訳(メタデータ) (2024-06-22T15:52:04Z) - Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning [53.6472920229013]
大規模言語モデル(LLM)は多くの自然言語タスクにおいて印象的な能力を示している。
LLMは多段階推論を行う際にエラー、幻覚、矛盾する文を生成する傾向がある。
本稿では,LLMの復号化過程を検討計画で導くためのフレームワークであるQ*を紹介する。
論文 参考訳(メタデータ) (2024-06-20T13:08:09Z) - Small LLMs Are Weak Tool Learners: A Multi-LLM Agent [73.54562551341454]
大規模言語モデル(LLM)エージェントはスタンドアロンのLLMの機能を大幅に拡張する。
本稿では、上記の機能をプランナー、呼び出し元、要約器に分解する新しい手法を提案する。
このモジュール化されたフレームワークは、個々の更新と、それぞれの機能を構築するための小さなLLMの潜在的な使用を容易にする。
論文 参考訳(メタデータ) (2024-01-14T16:17:07Z) - ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code [76.84199699772903]
ML-Benchは、既存のコードリポジトリを利用してタスクを実行する現実世界のプログラミングアプリケーションに根ざしたベンチマークである。
LLM(Large Language Model)とAIエージェントの両方を評価するために、事前に定義されたデプロイメント環境でLLMのテキスト-コード変換を評価するML-LLM-Benchと、Linuxサンドボックス環境でエンドツーエンドのタスク実行で自律エージェントをテストするML-Agent-Benchの2つの設定が採用されている。
論文 参考訳(メタデータ) (2023-11-16T12:03:21Z) - How Effective are Large Language Models in Generating Software Specifications? [14.170320751508502]
大規模言語モデル(LLM)は多くのソフトウェア工学(SE)タスクにうまく適用されている。
ソフトウェアコメントやドキュメンテーションからソフトウェア仕様を生成するためのLCMの能力を評価するための、最初の実証的研究を行う。
論文 参考訳(メタデータ) (2023-06-06T00:28:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。