論文の概要: Spaghetti Architect: A Contamination-Resistant, By-Construction-Labelled, Multi-Language Code Dataset Generator
- arxiv url: http://arxiv.org/abs/2607.18642v1
- Date: Tue, 21 Jul 2026 02:23:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.29579
- Title: Spaghetti Architect: A Contamination-Resistant, By-Construction-Labelled, Multi-Language Code Dataset Generator
- Title(参考訳): Spaghetti Architect: 汚染に抵抗し、バイコンストラクションをラベル付け、マルチランゲージなコードデータセットジェネレータ
- Abstract要約: Spaghetti Architectはクリーンで言語に依存しない中間表現を、意図的に冗長で完全にフラットなプログラムにマップする。
各プログラムは、参照するオラクルに対してコンパイル、実行、チェックされるので、各インスタンスは、構成によって正しい。
4モデルオープンラグのレポートベースライン: 正確な一致はスケールとともに上昇し、本質的なノブは最強モデルの算術的集約精度をゼロに崩壊させる。
- 参考スコア(独自算出の注目度): 4.010371060637209
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mined code corpora are abundant but uncontrolled: a snippet's semantics, surface "messiness," and difficulty are whatever the wild contained; there is no known-optimal reference to grade against; and any public sample may already sit in a model's training set. We present Spaghetti Architect, a tool that mints code datasets with the control such corpora lack. An anti-optimization transpiler maps a clean, language-agnostic JSON intermediate representation to deliberately redundant, fully-flattened programs in five languages (Python, JavaScript, Go, Java, C++); every program is compiled, run, and checked against a reference oracle, so each instance is correct by construction. The clean IR is a known-optimal reference, messiness is dialed by strictly-nested anti-pattern profiles, each instance is labelled along two orthogonal difficulty axes, intrinsic (problem size) and incidental (presentation at fixed semantics), and contamination is resisted by minting fresh variants from a private held-out seed. We give construct-validity evidence that the quality order moves established complexity and readability metrics, and report baselines on a four-model open ladder: exact match rises with scale, and the intrinsic knob collapses arithmetic-aggregation accuracy of even the strongest model to zero. Further, development-set scores equal freshly re-minted held-out counterparts within $|Δ|\le 0.012$ (comprehension) and $\le 0.011$ (refactoring); on identical programs, refactoring equivalence ($0.73 \rightarrow 0.99$) is scale-invariant while output prediction collapses; and ablating the generator's self-annotations shows they inflate the weakest model an order of magnitude more than the strongest ($-0.173$ vs $-0.017$): the annotated ladder resolves one of three adjacent pairs where the unannotated resolves all three. Open source (MIT), dependency-free, archived under a persistent DOI.
- Abstract(参考訳): マイニングされたコードコーパスは豊富だが、制御されていない。スニペットのセマンティクス、表面の「メッセージ性」、難易度は、どんな野生のものであれ、グレードに対する既知の最適参照はなく、どのパブリックサンプルも既にモデルのトレーニングセットに置かれている。
Spaghetti Architectは、コーパスの欠如をコントロールして、コードデータセットをミントするツールです。
反最適化トランスパイラは、クリーンで言語に依存しないJSON中間表現を、5つの言語(Python、JavaScript、Go、Java、C++)で意図的に冗長に完全にフラット化されたプログラムにマッピングする。
クリーンIRは、既知の最適参照であり、難易度は厳格にネストされたアンチパターンプロファイルによってダイアルされ、各インスタンスは、2つの直交困難軸、内在的(プロブレムサイズ)および偶発的(固定意味論における表現)に沿ってラベル付けされ、汚染は、プライベートな保留種子から新しい変種をマイニングすることによって抑制される。
提案手法は, 品質順序が確立された複雑性と可読性指標を移動し, 4モデルオープンラグのベースラインを報告し, 正確な一致はスケールとともに上昇し, 固有ノブは最強モデルの算術的集合精度をゼロに崩壊させることを示す。
さらに、開発セットのスコアは、$|Δ|\le 0.012$(包括的)と$\le 0.011$(リファクタリング的)で、同じプログラム上では、リファクタリング等価性(0.73 \rightarrow 0.99$)は、出力予測の崩壊中にスケール不変である。
オープンソース(MIT) 依存性のない、永続的なDOIの下でアーカイブされる。
関連論文リスト
- SSTQ:Privacy-Preserving Vector Quantization via Subsampled Stochastic TurboQuant [79.24089819400126]
Subsampled TurboQuant (SSTQ) は、オーバーコンプリートな等幅のタイトフレーム、座標サブサンプリング、プライバシ対応量子化を組み合わせたフレームワークである。
SSTQは平均2乗誤差スケーリングを実現し、クライアントあたり$lceil log N il + b$ bitsを使用する。
また、コードブックに依存したMSEスケーリングを$O(4b)$から$O(2b)$に削減する、プライバシを意識したコードブックの目的も導出します。
論文 参考訳(メタデータ) (2026-08-05T17:51:25Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization [0.21485350418225238]
不均一なNLPタスクに展開される微調整エンコーダは、3つの複合的な問題に直面している。
textbfsurgellmは、専用の軽量モジュールでそれぞれに対処する統合トランスフォーマーフレームワークである。
論文 参考訳(メタデータ) (2026-06-23T07:47:21Z) - SILAGE: Memory-Efficient, Full-Gradient-Free Nonconvex Optimization for Nested Finite Sums [51.49970814177172]
データセットに対する経験的リスクは、自然に$N=nm$全サンプルに類似性を示す。
我々は悲観的な収束分析を避ける分析を提供する。
我々の成果は、既存の最先端の体制を改善した。
論文 参考訳(メタデータ) (2026-06-14T14:11:07Z) - A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints [6.057587531186626]
目的指向エージェントが生成し、破壊し、交換する価値は、情報と同じカテゴリの法的構造量であることを示す。
価格がフレームに依存していない間、価値はフレーム相対的であり、そのリソースをプールし、その知覚を融合する艦隊が天井を継承する。
論文 参考訳(メタデータ) (2026-06-10T16:11:04Z) - SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers [55.39407031861402]
本稿では,スマートコントラクトデコンパイルのためのデータセットとベンチマーク手法であるSCDBenchを紹介する。
データセットには600の現実のSolidityコントラクトと、ペア化されたバイトコード入力、地味なソースコード、再生可能なセマンティックチェックポイントが含まれている。
我々は,GLM-5の変種を含むゼロショット逆コンパイル設定において,Claude Opus 4.7,GPT-5.3-Codex,GLM-5を評価した。
論文 参考訳(メタデータ) (2026-05-27T20:08:47Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Guiding Diffusion Models with Semantically Degraded Conditions [19.061619300086875]
条件劣化誘導(CDG)を提案する。
CDGはnullプロンプトを戦略的に劣化した条件である$boldsymbolc_textdeg$に置き換える。
軽量でプラグアンドプレイのモジュールとして、CDGは構成精度とテキストイメージのアライメントを大幅に改善する。
論文 参考訳(メタデータ) (2026-03-11T13:54:35Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - Reliability, Embeddedness, and Agency: A Utility-Driven Mathematical Framework for Agent-Centric AI Adoption [0.0]
我々は,マルチステップタスクを実行するエージェント中心のAIシステムの採用を継続するための3つの公理を定式化する。
我々は、崩壊するノベルティ用語と成長するユーティリティ用語の和として、採用をモデル化する。
論文 参考訳(メタデータ) (2025-08-18T12:53:38Z) - Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls [83.89771461061903]
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
意味論的に等価なコンテンツを持つ冗長な状態による$textitover-Exploration$と、検証器のスコアリングにおける高いばらつきに起因する$textitunder-Exploration$である。
各種木探索アルゴリズムに適合するフレキシブルなプラグアンドプレイシステムであるFETCHを提案する。
論文 参考訳(メタデータ) (2025-02-16T16:12:01Z) - LINC: A Neurosymbolic Approach for Logical Reasoning by Combining
Language Models with First-Order Logic Provers [60.009969929857704]
論理的推論は、科学、数学、社会に潜在的影響を与える可能性のある人工知能にとって重要なタスクである。
本研究では、LINCと呼ばれるモジュール型ニューロシンボリックプログラミングのようなタスクを再構成する。
我々は,FOLIOとProofWriterのバランスの取れたサブセットに対して,ほぼすべての実験条件下で,3つの異なるモデルに対して顕著な性能向上を観察した。
論文 参考訳(メタデータ) (2023-10-23T17:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。