論文の概要: IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
- arxiv url: http://arxiv.org/abs/2609.10539v1
- Date: Wed, 09 Sep 2026 17:59:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:09.143508
- Title: IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
- Title(参考訳): IdeaAMBIG:リサーチ・イデア仕様における実装批判的なギャップのベンチマーク
- Abstract要約: 研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
IdeaAMBIGは660のエビデンス基底インスタンスのベンチマークで、レポートとGitHubの問題から163の現実世界のギャップと、コーディフィケーション対応のリファレンスに注入される合成ギャップを497のコントロールで管理する。
- 参考スコア(独自算出の注目度): 52.570108663867046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A research idea may be novel, coherent, and scientifically plausible, yet its proposed method may remain insufficiently specified for faithful implementation. We study the codification readiness of implementation-facing research-method specifications, defined by whether they provide sufficient methodological information for a competent implementer or coding agent to construct the intended method without unsupported assumptions. We construct evidence-grounded specifications and their supported resolutions from papers, codebases, issue threads, and reproduction artifacts. We introduce IdeaAMBIG, a benchmark of 660 evidence-grounded instances: 163 real-world gaps from reproducibility reports and GitHub issues, and 497 controlled synthetic gaps injected into codification-ready references. IdeaAMBIG evaluates three capabilities: codification-readiness assessment, defect localization, and clarification action generation. Defect localization receives only the specification, whereas clarification additionally receives the annotated defect. Across 13 LLMs, the best model achieves 9.6% Macro Defect Recovery Rate on real-world instances but 80.6% Macro Clarification Action Success Rate when given the defect. In an oracle study, supplying the gold resolution raises the downstream codification-ready rate from 14% to 98%. Across all evaluated models, defect localization is the main bottleneck, with stronger clarification given the defect.
- Abstract(参考訳): 研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
論文、コードベース、発行スレッド、再生アーティファクトからのエビデンスベースの仕様とそのサポートされた解決を構築します。
再現性レポートとGitHubの問題から163の現実的なギャップと、コーデフィケーション対応のリファレンスに注入された497の制御された合成的ギャップだ。
IdeaAMBIGは、コーディフィケーション・レディネスアセスメント、欠陥ローカライゼーション、明確化アクション生成の3つの機能を評価する。
欠陥ローカライゼーションは仕様のみを受け取り、明確化は注釈付き欠陥も受け取ります。
13 LLM全体では、最良のモデルは現実世界のインスタンスで9.6%のマクロ欠陥回復率を達成するが、欠陥が与えられた場合、80.6%のマクロ修正アクション成功率を達成する。
オラクルによる研究では、金の分解能の供給により、下流の凝固速度は14%から98%に上昇する。
評価されたすべてのモデルにおいて、欠陥の局所化が主なボトルネックであり、欠陥を考慮すればより強く明確化される。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models [1.9873319610438742]
SciCodeは、言語モデルの科学的コーディング能力の標準尺度である。
人工知能インテリジェンス指数(Artificial Analysis Intelligence Index)の略。
最先端のモデルは、SciCodeが示唆しているよりも科学的コーディングにはるかに熟練している。
論文 参考訳(メタデータ) (2026-08-05T15:45:55Z) - Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes [19.68865985432786]
本稿では,損失検証法によって誘導される分布の原理的解析について述べる。
一見異なる多くのアプローチが表面的にのみ異なることを示し、トラルニケーションに基づく検証と協調的な検証の2つのカテゴリに分類できる。
論文 参考訳(メタデータ) (2026-07-29T08:54:27Z) - Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text [3.2712318205295907]
財務情報開示には、数値的なクレーム、時間的ステートメント、エンティティ参照、ポリシーのコミットメント、そして質的に異なる方法で衝突する可能性のあるリスク記述が含まれる。
我々はこの問題をきめ細かい矛盾として研究する。
微調整された300Mエンコーダの精度は61.9%、ロラ適応型Qwen3.5-9Bモデルでは61.5%、GPT適応型生成モデルでは61.3%である。
論文 参考訳(メタデータ) (2026-07-29T01:03:53Z) - Agentic Proving for Program Verification [44.663012714194025]
エージェントシステムは、形式数学における自動定理証明のための最先端のアプローチとして登場した。
検証可能なコード生成のためのLean 4ベンチマークであるCLEVERのエージェント証明フレームワークでClaude Codeを評価した。
論文 参考訳(メタデータ) (2026-05-22T15:41:27Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Are We Evaluating the Edit Locality of LLM Model Editing Properly? [68.441768731381]
この目的のために既存の特異性評価プロトコルは不十分であることがわかった。
既存の特異度指標は特異度正規化器の強度と弱い相関関係にある。
また、現在のメトリクスには十分な感度が欠けており、異なるメソッドの特異性性能の区別に効果がないこともわかりました。
論文 参考訳(メタデータ) (2026-01-24T07:07:21Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Specification-Guided Repair of Arithmetic Errors in Dafny Programs using LLMs [79.74676890436174]
本稿では,障害の局所化と修復のためのオラクルとして形式仕様を用いたDafny用のAPRツールを提案する。
プログラム内の各ステートメントの状態を決定するために、Hoareロジックの使用を含む一連のステップを通じて、障害をローカライズします。
また, GPT-4o miniが74.18%と高い修理成功率を示した。
論文 参考訳(メタデータ) (2025-07-04T15:36:12Z) - AttributionBench: How Hard is Automatic Attribution Evaluation? [19.872081697282002]
AttributionBenchは、様々な既存の属性データセットからコンパイルされた包括的なベンチマークである。
実験の結果,微調整GPT-3.5でさえ,二項分類法で約80%のマクロF1しか達成できないことがわかった。
300以上のエラーケースの詳細な分析では、失敗の大部分は、ナンスされた情報を処理できないことに起因する。
論文 参考訳(メタデータ) (2024-02-23T04:23:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。