論文の概要: LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.23367v1
- Date: Sun, 20 Sep 2026 05:25:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.787303
- Title: LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning
- Title(参考訳): 検証駆動ファインチューニングによるLLM型フォームコード生成
- Abstract要約: FORMは、粒子物理学で広く使われているドメイン固有の記号操作言語である。
精度理論物理学において中心的な役割を担っているにもかかわらず、我々の知識には人工知能ツールが存在しない。
数十億のパラメータを持つフロンティアモデルを含む,現代の大規模言語モデル(LLM)が,ゼロパーセントの実行パス率を達成することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: FORM is a domain-specific symbolic manipulation language widely used in particle physics for processing the very large algebraic expressions arising from multi-loop Feynman diagram calculations. Despite its central role in precision theoretical physics, no artificial-intelligence tooling exists, to our knowledge, for assisting physicists in writing FORM code. We show that contemporary large language models (LLMs), including frontier models with hundreds of billions of parameters, achieve a zero-percent execution pass rate on our instruction-following and tutorial-style FORM tasks without documentation in a single attempt, establishing FORM as a genuine zero-shot language for LLMs at the time of writing. We then present a verification-driven data generation pipeline that uses the FORM binary itself as an execution oracle to produce and validate a corpus of 4,633 training examples spanning deterministic computations, open-ended programs, tutorial code, and knowledge question-answer pairs. Fine-tuning a compact open-weights model (Qwen3-8B) with quantized low-rank adaptation (QLoRA) yields a specialist that, evaluated on four complementary benchmarks (840 tasks, single attempt each), decisively outperforms frontier models with up to 756B parameters in execution rate and in strict, FORM-verified output matching on the larger benchmarks, and remains statistically indistinguishable from them on the smaller, harder ones. General reasoning and coding capabilities are preserved within 2.6 percentage points.
- Abstract(参考訳): FORMは、多ループファインマン図形計算から生じる非常に大きな代数的表現を処理するために、粒子物理学で広く使われているドメイン固有な記号操作言語である。
精度理論物理学において中心的な役割を担っているにもかかわらず、我々の知識には人工知能ツールが存在しない。
数十億のパラメータを持つフロンティアモデルを含む同時代の大規模言語モデル (LLM) は,1回の試行で文書化せずに命令追従およびチュートリアルスタイルの形式タスクに対してゼロパーセントの実行パス率を達成し,書面時LSMの真のゼロショット言語としてFORMを確立した。
次に、FORMバイナリ自体を実行オラクルとして使用して、決定論的計算、オープンエンドプログラム、チュートリアルコード、知識問合せペアにまたがる4,633のトレーニング例を作成し、検証する検証駆動データ生成パイプラインを提案する。
量子化低ランク適応 (QLoRA) によるコンパクトなオープンウェイトモデル (Qwen3-8B) を微調整すると、4つの補完ベンチマーク (840タスク、1回の試行) で評価され、実行速度で756Bのパラメータを持つフロンティアモデルを決定的に上回り、より大きいベンチマークで厳密な形式検証された出力が一致する。
一般的な推論と符号化能力は2.6ポイント以内に保持される。
関連論文リスト
- The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis [50.473217152006875]
MIMICは、データ合成を推論するための厳密な媒体として実行可能なコードを活用するフレームワークである。
MIMICは、ナラティブ融合、コード誘導テスト合成、動的コードインスツルメンテーションを通じて、アルゴリズムを検証可能な推論軌道に変換する。
提案手法は, 一般的な推論, 複雑な数学的ベンチマーク, きめ細かい決定論的タスクにおいて, 精度を著しく向上させる。
論文 参考訳(メタデータ) (2026-09-13T17:04:16Z) - Benchmarking LLMs for Verilog Design Flows [6.24010225101442]
大規模言語モデル(LLM)は、コード生成において有望であるが、正しい合成可能なハードウェア記述言語(HDL)コードを生成する能力は、まだ適切にベンチマークされている。
本稿では,Verilog RTL 生成におけるオープンソース LLM の評価を行う再現可能なベンチマークプラットフォームを提案する。
このパイプラインは構文の妥当性を0%から70.43%に改善し、シミュレーションパスレートは3つのオープンソースモデルで51.8%に向上した。
論文 参考訳(メタデータ) (2026-07-23T21:00:38Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes [16.171581449458582]
大規模言語モデル(LLM)は有望な代替手段であるが、この領域におけるそれらの有効性は未解明のままである。
CrypFormBench (C.F.B) は,5つのコアLLM機能を評価するために,シンボル的および計算的セキュリティを共同でカバーするベンチマークである。
677のスキームにまたがる700のインスタンス、7つの主要な形式検証言語、160のセキュリティプロパティで構成されている。
クロード3.5は100点中48.7点で最高得点を記録した。
論文 参考訳(メタデータ) (2026-06-24T08:37:38Z) - Evaluating Prompting and Execution-Based Methods for Deterministic Computation in LLMs [1.2957535240267326]
大規模言語モデル(LLM)は、自然言語の理解と推論において強力な能力を示している。
CoT(Chain-of-Thought)、Last-to-Most(Least-to-Most)、Program-of-Thought(PoT)、Self-Consistency(SC)など、複数のプロンプト戦略を体系的に評価する。
提案手法は, 逐次的タスクにおいて, 適度な精度しか達成できないことを示す。
論文 参考訳(メタデータ) (2026-05-04T23:32:37Z) - Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation [3.225273674498579]
我々は,大言語モデルがコンパイルフェーズ中に実行可能なコードアーティファクトを生成するパラダイムであるコンパイルAIについて研究し,その後,さらなるモデル実行を必要とせずに決定的に実行する。
当社のコントリビューションは、ハイテイクなランタイムエンタープライズへの適用に関するシステム指向の研究です。
論文 参考訳(メタデータ) (2026-04-06T20:25:20Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - EfficientQAT: Efficient Quantization-Aware Training for Large Language Models [50.525259103219256]
量子化対応トレーニング(QAT)は、低ビット表現によるメモリ消費を最小限の精度で削減することで、ソリューションを提供する。
より有効なQATアルゴリズムであるEfficient QAT(Efficient Quantization-Aware Training)を提案する。
効率的なQATは、全てのパラメータのブロックワイドトレーニング(Block-AP)と量子化パラメータのエンドツーエンドトレーニング(E2E-QP)の2つのフェーズを含む。
論文 参考訳(メタデータ) (2024-07-10T17:53:30Z) - LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit [55.73370804397226]
鍵圧縮技術である量子化は、大きな言語モデルを圧縮し、加速することにより、これらの要求を効果的に軽減することができる。
本稿では,プラグアンドプレイ圧縮ツールキットであるLLMCについて,量子化の影響を公平かつ体系的に検討する。
この汎用ツールキットによって、我々のベンチマークはキャリブレーションデータ、アルゴリズム(3つの戦略)、データフォーマットの3つの重要な側面をカバーしています。
論文 参考訳(メタデータ) (2024-05-09T11:49:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。