論文の概要: Which Algorithm Specification Formats Help Language Models Implement Machine Learning Algorithms?
- arxiv url: http://arxiv.org/abs/2607.03158v1
- Date: Fri, 03 Jul 2026 09:58:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.536523
- Title: Which Algorithm Specification Formats Help Language Models Implement Machine Learning Algorithms?
- Title(参考訳): 機械学習アルゴリズムを実装する言語モデルを支援するアルゴリズムの仕様
- Abstract要約: 大規模な言語モデル(LLM)は研究用原稿のアルゴリズムの実装にますます使われている。
本研究では,仕様書の書式がファーストパス精度にどのように影響するかを検討する。
- 参考スコア(独自算出の注目度): 5.457279006229211
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models (LLMs) are increasingly used to implement algorithms from research manuscripts, but papers often leave implementation choices implicit. This study examines how the written format of an algorithm specification affects first-pass LLM implementation accuracy. We compare ordinary prose, LaTeX algorithm-style pseudocode, PDF-like extracted pseudocode, Markdown fields, YAML-like specifications, JSON-like specifications, and Python code stubs across five machine learning tasks, three models, and four experimental settings, yielding 4,020 generated implementations. Hidden tests evaluate details that often determine correctness, including tie-breaking, array shapes, numerical rules, return structures, and invalid-input behavior. Under the core-information setting, LaTeX algorithm-style pseudocode has the largest average format effect, with YAML-like specifications and ordinary prose close behind. Under complete information, GPT-5.4 mini shows no format differences in the matched comparisons, whereas Gemma 3 4B and Llama 3.2 3B still do. Code stubs do not consistently improve correctness despite specifying the function signature. The results support a writing recommendation: authors should state the interface, computation steps, numerical rules, and boundary-case behavior explicitly, instead of relying on a particular surface format to carry those details.
- Abstract(参考訳): 大規模な言語モデル (LLM) は研究用原稿のアルゴリズムの実装にますます使われているが、論文は実装選択を暗黙的に残すことが多い。
本研究では,アルゴリズム仕様書の書式がLLMの実装精度にどのように影響するかを検討する。
通常の散文、LaTeXアルゴリズムスタイルの擬似コード、PDFライクな抽出擬似コード、Markdownフィールド、YAMLライクな仕様、JSONライクな仕様、Pythonコードスタブを5つの機械学習タスク、3つのモデル、4つの実験的な設定で比較し、4,020の実装を生成しました。
隠れたテストは、ネクタイブレーク、配列の形状、数値ルール、戻り構造、無効な入力動作など、しばしば正確性を決定する詳細を評価する。
コア情報設定の下では、LaTeXアルゴリズムスタイルの擬似コードは、YAMLのような仕様と通常の散文が後方にある、最大の平均フォーマット効果を持つ。
完全な情報では、GPT-5.4 miniは一致した比較にフォーマットの違いは示さないが、Gemma 3 4B と Llama 3.2 3B は依然として可能である。
関数シグネチャを指定するにもかかわらず、コードスタブは一貫して正確性を改善しない。
著者は、インターフェース、計算ステップ、数値ルール、境界ケースの振る舞いを、詳細を運ぶために特定のサーフェスフォーマットに頼るのではなく、明示的に記述する必要がある。
関連論文リスト
- Assertion-Aware Test Code Summarization with Large Language Models [0.0]
単体テストは、テスト意図を伝える簡潔な要約を欠くことが多い。
本稿では,開発者による要約と組み合わせた実世界のJavaテストケース91のベンチマークを示す。
論文 参考訳(メタデータ) (2025-11-09T04:58:32Z) - GPT-4.1 Sets the Standard in Automated Experiment Design Using Novel Python Libraries [0.649540541957527]
大規模言語モデル(LLM)は、科学研究におけるコード生成を自動化するツールとして急速に進歩してきた。
本研究では,関数型Pythonコードを生成する上で,最先端のLLMの選択を体系的にベンチマークする。
結果は、モデルの小さなサブセットだけが一貫して正しい実行可能なコードを生成することを示している。
論文 参考訳(メタデータ) (2025-07-30T13:11:29Z) - Do Large Language Models Truly Grasp Addition? A Rule-Focused Diagnostic Using Two-Integer Arithmetic [21.014229380679975]
大規模言語モデル(LLM)は高度な数学のベンチマークでは印象的な結果を得るが、基本的な算術的なタスクでは失敗することがある。
基本演算規則を真に把握したのか、それとも単にパターンマッチングに依存しているのかを考察する。
モデルでは高い数値精度を達成できるが、これらの診断は体系的に失敗する。
論文 参考訳(メタデータ) (2025-04-07T16:57:10Z) - Lost in Space: Finding the Right Tokens for Structured Output [3.5757761767474876]
LLMシステムは構造化出力をますますサポートし、文法に従ってトークンをサンプリングすることでフォーマットを強制する。
意味的に(しばしば視覚的に)人間に似ている文法の間に体系的な違いはあるか?
我々は4つの共通NLPベンチマークで5つの出力形式を持つ4つの一般的なモデルファミリをテストする。
複数選択の文字や数値予測のための実数など,コンベンションを尊重する形式をガイドした場合には,すべてのモデルが最も正確であることがわかった。
論文 参考訳(メタデータ) (2025-02-20T19:06:18Z) - From Language Models over Tokens to Language Models over Characters [54.123846188068384]
現代の言語モデルは、$itcharacter$ stringsではなく$ittoken$ strings上の内部的、数学的に...分布である。
本稿では,トークンレベル言語モデルから文字レベル言語への変換アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-12-04T21:19:20Z) - Can Language Models Explain Their Own Classification Behavior? [1.8177391253202122]
大規模言語モデル(LLM)は、無数のタスクでうまく機能するが、このパフォーマンスの背後にあるプロセスを説明することは困難である。
本稿では,LLMが内部プロセスの忠実な高レベルな説明を行えるかどうかを考察する。
私たちはデータセットであるArticulateRulesをリリースし、コンテキスト内または微調整によってトレーニングされたLLMの自己説明をテストするために使用します。
論文 参考訳(メタデータ) (2024-05-13T02:31:08Z) - Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data? [49.688233418425995]
Struc-Benchは、大きな言語モデル(LLM)を特徴とする包括的なベンチマークである。
Pスコア(Prompting Score)とHスコア(Heuristical Score)の2つの革新的な指標を提案する。
実験の結果,LLaMA-7Bに構造認識の微調整を適用すると,性能が大幅に向上することがわかった。
論文 参考訳(メタデータ) (2023-09-16T11:31:58Z) - Reducing Sequence Length by Predicting Edit Operations with Large
Language Models [50.66922361766939]
本稿では,ローカルなシーケンス変換タスクに対して,ソーステキストの編集スパンを予測することを提案する。
編集スパンの監督データに大規模言語モデルに対する命令チューニングを適用する。
実験の結果,提案手法は4つのタスクにおいて,ベースラインに匹敵する性能を発揮することがわかった。
論文 参考訳(メタデータ) (2023-05-19T17:51:05Z) - LeTI: Learning to Generate from Textual Interactions [60.425769582343506]
本稿では,テキストインタラクション(LETI)から学習するLMの可能性を,バイナリラベルによる正当性をチェックするだけでなく,テキストフィードバックを通じて出力中のエラーをピンポイントし,説明する。
私たちの焦点はコード生成タスクであり、そこではモデルが自然言語命令に基づいてコードを生成する。
LETIは、目的のLMを用いて、自然言語命令、LM生成プログラム、テキストフィードバックの結合に基づいて、モデルを反復的に微調整する。
論文 参考訳(メタデータ) (2023-05-17T15:53:31Z) - Stealing the Decoding Algorithms of Language Models [56.369946232765656]
現代の言語モデル(LM)からテキストを生成する重要な要素は、復号アルゴリズムの選択とチューニングである。
本研究では,LMに典型的なAPIアクセスを持つ敵が,その復号アルゴリズムの型とハイパーパラメータを盗むことができることを示す。
我々の攻撃は、GPT-2、GPT-3、GPT-Neoなどのテキスト生成APIで使われる一般的なLMに対して効果的である。
論文 参考訳(メタデータ) (2023-03-08T17:15:58Z) - Syntax-Aware On-the-Fly Code Completion [13.268277642411974]
我々はPyCoderを提案する。トークン型は軽量な構文情報の一種である。
私たちのPyCoderはトークンレベルの予測に対して77.12%の精度でCodeXGLUEのリーダーボードで1位を獲得しました。
論文 参考訳(メタデータ) (2022-11-09T04:24:18Z) - Interactive Code Generation via Test-Driven User-Intent Formalization [60.90035204567797]
大きな言語モデル(LLM)は、非公式な自然言語(NL)の意図からコードを生成する。
自然言語は曖昧であり、形式的な意味論が欠けているため、正確性の概念を定義するのは難しい。
言語に依存しない抽象アルゴリズムと具体的な実装TiCoderについて述べる。
論文 参考訳(メタデータ) (2022-08-11T17:41:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。