論文の概要: FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training
- arxiv url: http://arxiv.org/abs/2608.20574v2
- Date: Wed, 26 Aug 2026 20:41:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.504678
- Title: FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training
- Title(参考訳): FlavourBench: 言語モデル評価とポストトライニングのための実行可能なクリーナーリワードマップ
- Authors: Josef Chen, Erim Hayretci,
- Abstract要約: オープンエンド言語モデル評価は、欠落した応答キーに対して、他のモデルや小さな選好パネルの代わりに行われることが多い。
FlavourBenchを導入し、バージョン付き料理環境から高密度な回答マップをコンパイルする。
同じ534の置換、ペアリング、制約タスク上で27のフロンティアエンドポイントを評価し、14,418の完全なモデルタスク観測結果を得た。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open-ended language-model evaluation often substitutes another model or a small preference panel for a missing answer key. We introduce FlavourBench, which instead compiles dense answer maps from a versioned culinary environment. Each task asks for a three-ingredient portfolio from eight candidates; before inference, Epicure scores all 56 portfolios. We evaluate 27 frontier endpoints on the same 534 substitution, pairing, and constraint tasks, yielding 14,418 complete model-task observations. Anchor-cluster bootstraps and multiplicity-controlled paired tests resolve 101 of 351 model contrasts. Grok 4.6 has the largest point estimate at 65.1, but the corrected evidence does not identify a unique best endpoint. The ranking replicates across independently compiled panels and remains similar under alternative metrics, task filters, family weights, and three public Epicure checkpoints. We then run a preregistered, three-seed post-training study. LoRA SFT of a pinned Qwen3-0.6B checkpoint on 270 Epicure-optimal answers improves its score on 84 anchor-disjoint maps by 13.30 points over a format- and label-matched control (95% CI 6.52 to 20.29, p = 0.000170), and the effect replicates on all 534 public maps. The replication gain is 11.73 points (95% CI 8.98 to 14.54). On the primary split, both trained arms parse every response while the format control does not improve on the base model. The release contains prompts, exhaustive reward maps, raw responses, training and evaluation manifests, statistical plans, code, and an offline verifier.
- Abstract(参考訳): オープンエンド言語モデル評価は、欠落した応答キーに対して、他のモデルや小さな選好パネルの代わりに行われることが多い。
FlavourBenchを導入し、代わりにバージョン付き料理環境から高密度な回答マップをコンパイルする。
それぞれのタスクは8つの候補から3段階のポートフォリオを要求され、推測の前にEpicureは56のポートフォリオすべてにスコアを付けます。
同じ534の置換、ペアリング、制約タスク上で27のフロンティアエンドポイントを評価し、14,418の完全なモデルタスク観測結果を得た。
アンカークラスタブートストラップと多重性制御ペアテストは、351モデルのコントラストの101を解消する。
Grok 4.6 は 65.1 で最大の点推定値を持つが、補正された証拠は唯一の最高の終点を特定できない。
ランキングは独立してコンパイルされたパネル間で複製され、代替のメトリクス、タスクフィルタ、家族の重み付け、3つの公開Epicureチェックポイントで類似している。
次に、事前登録された3種ポストトレーニング研究を実施します。
ピン付き Qwen3-0.6B チェックポイント 270 の Epicure-optimal answer の LoRA SFT は、フォーマットとラベルにマッチしたコントロール (95% CI 6.52 - 20.29, p = 0.000170) で84のアンカー・ディジョイント・マップのスコアを13.30ポイント改善し、すべての 534 の公開マップに再現する。
再現率は11.73ポイント(95% CI 8.98 - 14.54)である。
一次分割では、両方の訓練されたアームが全ての応答を解析するが、フォーマット制御はベースモデルでは改善されない。
リリースにはプロンプト、徹底的な報酬マップ、生のレスポンス、トレーニングと評価のマニフェスト、統計計画、コード、オフライン検証が含まれている。
関連論文リスト
- TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation [74.69068352546073]
TRACE-Benchは、多様な芸術的スタイルと現実世界の主題にまたがるマルチ参照画像の評価ツールである。
631の定式テンプレートと、様々な芸術様式と現実世界の主題にまたがる約4,000の参照画像で構成されている。
その公式構造は、演算子整合性評価プロトコルを駆動し、可視性スコアリングと診断木解析を行う。
論文 参考訳(メタデータ) (2026-08-17T16:15:50Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models [0.0]
マルチモデルLPMシステムは単一モデルの精度を上回ります。
彼らの利益は、ほとんど報告されない量で占められていることを示す。
論文 参考訳(メタデータ) (2026-06-25T17:06:06Z) - You Don't Need to Run Every Eval [14.183605234187624]
全133ベンチマークのモデルスコアは、2つの数字で決定される。
スコアマトリックス、BenchPressコード、任意のベンチマークで任意のモデルのスコアを予測するインタラクティブツールをリリースします。
論文 参考訳(メタデータ) (2026-06-22T23:54:00Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks [0.0]
MathCheckのパラフレーズ品質検査では, 19群で4つの意味的不正確なパラフレーズが検出された。
GPT-4oは2位から4位へと降格し、クロード・ハイクとディープ・シークV3が上昇する。
論文 参考訳(メタデータ) (2026-05-27T18:59:18Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。