論文の概要: Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions
- arxiv url: http://arxiv.org/abs/2607.04072v1
- Date: Sun, 05 Jul 2026 01:16:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.812453
- Title: Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions
- Title(参考訳): LLM生成量子コードにおける逐次SDKバージョン間のベンチマークAPIドリフト
- Abstract要約: 大規模言語モデルは、プラウシブルな量子コードを生成することができるが、ユーザが要求する特定のソフトウェア開発キット(SDK)バージョンを確実にターゲットできるかどうかは不明である。
本稿では,バージョン忠実度測定のベンチマークであるquantum-api-driftを紹介する。
Qiskitは、v0.43、v1.3、v2.0でかなりのインターフェース変更が行われた代表的量子SDKである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models can generate plausible quantum code, but it is unclear whether they can reliably target the specific software development kit (SDK) version requested by the user. We study this problem as API drift and introduce quantum-api-drift, a benchmark for measuring version fidelity, defined here as execution success on the requested SDK version, cross-version compatibility, failure modes, and documentation-guided repair in LLM-generated quantum SDK code. We instantiate the benchmark with Qiskit, a representative quantum SDK that underwent substantial interface changes across v0.43, v1.3, and v2.0. We evaluate 17 models on 50 tasks with 3 samples per prompt, yielding 450 generated samples and 1,350 executions per model. Sixteen models are tested in a matched REST API setting with a 1024-token output cap, while GPT-5.4 (Codex CLI) is reported separately as a reference configuration. Across the 16 matched REST models, diagonal Pass@1 ranges from 0.02 to 0.85. Claude Opus 4.7 is strongest on v0.43 and v2.0, while Grok 4.20 is strongest on v1.3 at 0.513. Error profiles differ systematically by model strength: weaker models fail mainly with broken imports, while stronger models more often reach deprecation-level failures. Documentation-guided repair succeeds for 0.19 to 0.59 of repair attempts overall and is consistently much more effective for migration to v2.0 than to v1.3. The benchmark artifacts are publicly available at https://github.com/arasyi/quantum-api-drift. These results show that version alignment is a distinct evaluation axis for quantum code generation and that API drift remains only partly recoverable even with migration guidance.
- Abstract(参考訳): 大規模言語モデルは、プラウシブルな量子コードを生成することができるが、ユーザが要求する特定のソフトウェア開発キット(SDK)バージョンを確実にターゲットできるかどうかは不明である。
ここでは、要求されたSDKバージョンの実行成功、クロスバージョン互換性、障害モード、LCM生成した量子SDKコードでのドキュメント誘導修復として定義されている。
Qiskitは、v0.43、v1.3、v2.0でかなりのインターフェース変更が行われた代表的量子SDKである。
我々は,50のタスクに対して17のモデルを評価し,各プロンプト毎に3つのサンプルを生成し,450個の生成サンプルと1,350個の実行結果を得た。
一方、GPT-5.4(Codex CLI)は参照設定として別々に報告されている。
一致するRESTモデルでは、対角パス@1は0.02から0.85の範囲である。
Claude Opus 4.7 は v0.43 と v2.0 で最強、Grok 4.20 は v1.3 で0.513 で最強である。
より弱いモデルは、主に壊れた輸入で失敗するが、強いモデルは、しばしば非推奨レベルの失敗に達する。
ドキュメンテーション誘導修理は0.19から0.59回の修理試験で成功し、v2.0への移行にはv1.3よりもずっと効果的である。
ベンチマークアーティファクトはhttps://github.com/arasyi/quantum-api-drift.comで公開されている。
これらの結果から,バージョンアライメントは量子コード生成の異なる評価軸であり,APIドリフトはマイグレーションガイダンスにおいても部分的に回復可能であることが示唆された。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - Broken on Arrival: Silently Defective LLM Artifacts in Public Model Registries and How to Catch Them [0.0]
我々は公式のOllamaライブラリから量子化されたコード対応モデルアーティファクトを実行し、8GB以下で15のモデルラインを、HuggingFace上で最もダウンロードされたコミュニティリポジトリから22のモデルラインで実行します。
それぞれが15タスクのスモークスイートを実行して、健康なアーティファクトが通過するのに失敗し、容疑者は164タスクの完全な評価、第2のバックエンド、独立したテンプレートによる同じモデルの変換、およびレフェリーとしての量子化に直面した。
公式ライブラリには、サイレントに欠陥のある5つのアーティファクト、Qwen2.5-Coder-3B変換のバッチと1つのphiが含まれている。
論文 参考訳(メタデータ) (2026-09-05T05:05:51Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance [4.342406076796542]
3つのモデル(DeepSeek V4, Doubao 2.0, Qwen 3.7 Max)で制御実験を行う。
エージェントが過剰なスコープで実行する、フォーマット誤用という、明確な障害メカニズムを特定します。
本稿では, モデル固有の戦略, ツールデザインの原則を提案し, エージェント自身のステップに形式的セマンティクスを制約する。
論文 参考訳(メタデータ) (2026-07-23T10:18:42Z) - SieveFL: Hierarchical Runtime-Aware Pruning for Scalable LLM-Based Fault Localization [0.0]
自動障害ローカライゼーションは、観測されたテスト失敗を数千の候補にわたる責任あるメソッドに接続する必要がある。
攻撃的なLLM前フィルタリングによってこの緊張を解消する5段階階層型フレームワークであるSieveFLを提案する。
論文 参考訳(メタデータ) (2026-05-13T13:16:41Z) - Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions [52.50730821321986]
大規模言語モデル(LLM)におけるバージョンレベルのリスクの大規模評価を初めて行った。
我々は1000のStack OverflowプログラミングタスクのベンチマークであるPinTrace上で10のLLMを評価した。
LLM バージョン選択は LLM ベース開発における第1級, 以前は見落とされたリスクサーフェスとして確認された。
論文 参考訳(メタデータ) (2026-05-07T13:52:59Z) - When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models [2.064923532131528]
デプロイされた言語モデルは、正しいものとフォーマットに準拠した出力を生成する必要がある。
本稿では,GSM8KとMATHという2つの数学的ベンチマークを用いて,この構造化出力信頼性ギャップについて検討する。
対象モデルへのブラックボックスAPIアクセスのみを必要とする反復的なシステムプロンプトであるAloLabを開発した。
論文 参考訳(メタデータ) (2026-05-04T09:07:44Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend [0.40611352512781873]
我々は、NVIDIA GH200 576 GBハードウェア上の単一のReact Nativeアプリケーション生成タスクにおいて、最先端のオープンウェイトコーディング言語モデルとして、Kim-K2.5(Q3およびQ4量子化)、GLM-5.1、Qwen3-Coder-480B、DeepSeek-V3.2の5つを評価した。
SWE-Benchランキングはタスク性能を予測できない。
論文 参考訳(メタデータ) (2026-04-19T01:21:02Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - Balancing Understanding and Generation in Discrete Diffusion Models [58.62235340638143]
Masked Diffusion Language Models (MDLM) は意味理解とゼロショットの一般化に優れる。
UDLM(Uniform-Noise Diffusion Language Models)は、強力な数ステップ生成品質を実現する。
定常雑音カーネルを介して2つのパラダイムをブリッジするXDLMを提案する。
論文 参考訳(メタデータ) (2026-02-01T18:00:35Z) - Reliable Audio Deepfake Detection in Variable Conditions via Quantum-Kernel SVMs [0.0]
音響ディープフェイク検出において量子カーネルを用いることで,モデルサイズを増大させることなく偽陽性率を低減できることを示す。
量子カーネルSVMと従来のSVMを同一のメル-スペクトログラム前処理を用いて比較する。
QSVMは、ASVspoof 5(2024年)で0.183対0.299、ADD23で0.081対0.188、ASVspoof 2019で0.346対0.399、In-the-Wildで0.355対0.413である。
論文 参考訳(メタデータ) (2025-12-21T16:31:05Z) - Model Equality Testing: Which Model Is This API Serving? [59.005869726179455]
APIプロバイダは、基本モデルの定量化、透かし、微調整を行い、出力分布を変更することができる。
モデル平等テスト(Model Equality Testing)は,2サンプルテスト問題である。
単純な文字列カーネル上に構築されたテストは、歪みの範囲に対して77.4%の中央値を達成する。
論文 参考訳(メタデータ) (2024-10-26T18:34:53Z) - Disentangle Your Dense Object Detector [82.22771433419727]
深層学習に基づく高密度物体検出器はここ数年で大きな成功を収め、ビデオ理解などのマルチメディアアプリケーションにも応用されてきた。
しかし、現在の高密度検出器の訓練パイプラインは、保持できない多くの接続に妥協されている。
そこで本研究では, 簡易かつ効果的な遠心分離機構を設計し, 現在の最先端検出器に統合するDED(Disentangled Dense Object Detector)を提案する。
論文 参考訳(メタデータ) (2021-07-07T00:52:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。