論文の概要: ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models
- arxiv url: http://arxiv.org/abs/2607.29431v1
- Date: Fri, 31 Jul 2026 13:55:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 16:35:22.233509
- Title: ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models
- Title(参考訳): ModelEquivBench: LLM生成最適化モデルのマルチリレーショナル評価認定
- Authors: Penglin Zhu, Jungang Xu,
- Abstract要約: マルチリレーショナル評価システムであるModelEquivBenchを提案する。
それぞれのエントリは、E0--E1、正のE2--E6結論の正確な有理証明のための関係適切なトレースまたは明示的なマップを持っている。
結果として得られるプロファイルは、粗いベースラインが表現しない区別を明らかにする。
- 参考スコア(独自算出の注目度): 6.820882579439242
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models increasingly generate optimization models from natural language, but existing evaluation often reduces a generated model and its ground truth to a single equivalent/not-equivalent verdict or an execution-success rate--labels that are neither independently checkable nor faithful to the multiple distinct senses in which two formulations can agree. We present ModelEquivBench, a certifying, multi-relational evaluation system that reports a per-pair semantic profile E0--E6: model construction and exact ingestion (E0), verified representation alignment (E1), same-space and projected feasible-set relations (E2, E3), objective-order equivalence (E4), optimal-value equality (E5), and optimizer-set equivalence (E6). Each decided entry carries relation-appropriate, independently re-checkable evidence: replayable traces or explicit maps for E0--E1, exact-rational certificates for positive E2--E6 conclusions, and explicit witnesses for supported negatives. Incomplete mapping search, unsupported structure, and resource limits produce typed UNKNOWN or N/A outcomes rather than guesses, while unmet prerequisites are reported as ABSENT. Using ModelEquivBench to evaluate three model snapshots--GPT-5.4, Claude Sonnet 4.6, and Qwen3.5-397B-A17B--on the same frozen cohort of 173 base problems (346 cells per model) under a no-repair protocol, the resulting profiles expose distinctions that coarse baselines do not represent: 49, 35, and 25 cells contain executable candidates that are nevertheless certified negative on at least one supported relation, and 25, 8, and 18 structural rejections occur on pairs for which E2 certifies mapped feasible-set equality under a verified map. The three model snapshots fail at different stages of the profile and therefore cannot be meaningfully reduced to a single accuracy score.
- Abstract(参考訳): 大規模言語モデルは、自然言語から最適化モデルを生成する傾向にあるが、既存の評価では、生成されたモデルとその基礎的真理を、独立にチェック不可能で、2つの定式化が合意できる複数の異なる感覚に忠実でない単一の等価/等価な評定や実行-成功率-ラベルに還元することが多い。
E0--E6:モデル構築と正確な取り込み(E0)、検証された表現アライメント(E1)、同空間および投影可能集合関係(E2,E3)、客観的順序同値(E4)、最適値同値(E5)、最適値同値(E6)。
E0--E1のリプレイ可能なトレースまたは明示的なマップ、正のE2--E6の結論のための正のE2--E6の正確な合理的な証明、支持された負の証明の明示的な目撃者。不完全なマッピング検索、サポートされた構造、リソース制限は、推測よりも型付けされたUNKNOWNまたはN/Aの結果を生成する。一方、未完成の前提条件は、ABSENTとして報告される。ModelEquivBenchを使用して、3つのモデルスナップショット--GPT-5.4、Claude Sonnet 4.6、Qwen3.5-397B-A17B--onの凍結されたコホート(norepair)の下で173のベース問題(346セル)が同じであり、その結果、ベースラインの区別は、少なくとも25のセルを含む。
3つのモデルスナップショットはプロファイルの異なる段階でフェールするため、単一の精度スコアに意味的に還元することはできない。
関連論文リスト
- DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation [4.131782714245991]
TriAdReviewは2つの独立したレビュアーモデルを採用している三角形の逆レビューアーキテクチャである。
3つの構成を用いて5つのベンチマークタスクのTriAdReviewを評価する。
論文 参考訳(メタデータ) (2026-06-13T03:03:21Z) - Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization [54.749573452394664]
定式化自体が単純である場合でも、インスタンスデータが大きくなるにつれて精度が低下する。
我々は, 数値データを構造化ファイルに外部化する単純な推論時アプローチであるBINDを用いて, モデルがプロンプトプロンプトからではなく, データをバインドする。
我々は,モデルのみをバインディングのみに微調整することで仮説を検証し,3つの構造的に異なる最適化カテゴリにおいて,エンドツーエンドのSFTおよびRLよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-20T21:25:41Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents [1.06378109904813]
VAREXは政府形態からの構造化データ抽出を評価するためのベンチマークである。
ベンチマークは、1,777の文書と1,771のユニークな文書から成っており、3相品質保証を通じて真理を検証している。
結果は、4Bパラメータ以下では、コンプライアンス出力 -- 抽出能力ではなく -- が主要なボトルネックであることを示している。
論文 参考訳(メタデータ) (2026-03-16T11:15:56Z) - ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces [3.151184728006369]
本稿では,聴覚条件下でのマルチモデルオーケストレーションのための測定フレームワークACARを提案する。
ACARは、N=3プローブサンプルから計算した自己整合分散(sigma)を使用して、単一モデル、2モデル、3モデル実行モードでタスクをルーティングする。
我々は4つのベンチマークにまたがる1,510のタスクに対してACARを評価し、7,550以上の監査可能な実行を生成した。
論文 参考訳(メタデータ) (2026-02-06T23:27:17Z) - Reliable Decision Support with LLMs: A Framework for Evaluating Consistency in Binary Text Classification Applications [0.7124971549479361]
本研究では,大言語モデル(LLM)のバイナリテキスト分類における一貫性を評価するフレームワークを提案する。
我々は,サンプルサイズ要件を定め,不適切な応答の指標を開発し,レータ内およびレータ間信頼性を評価する。
論文 参考訳(メタデータ) (2025-05-20T21:12:58Z) - Language Model Preference Evaluation with Multiple Weak Evaluators [89.90733463933431]
PGEDは,複数のモデルに基づく評価器を用いて嗜好グラフを構築し,非循環的非競合性評価結果に対してこれらのグラフをアンサンブルし,デノテーズする手法である。
1)評価のためのモデルランキング、2)テスト時間スケーリングのための応答選択、3)モデル微調整のためのデータ選択である。
論文 参考訳(メタデータ) (2024-10-14T01:57:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。