論文の概要: HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases
- arxiv url: http://arxiv.org/abs/2609.30571v1
- Date: Thu, 24 Sep 2026 21:33:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.146599
- Title: HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases
- Title(参考訳): HARDEN: より硬く保存された評価事例の進化的検索
- Abstract要約: HARDENは、既存の評価事例の入力をより困難な変種に適応させる、制約付き進化的探索法である。
FinQA、PubMedQA、ContractNLI、および3つのQwen3.5モデルスケールにおいて、HARDENはタスクモデルの精度を平均で22.7%、シングルパスベースラインに対して49.9%削減する。
- 参考スコア(独自算出の注目度): 2.9490560350642414
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are often evaluated on curated benchmarks that underrepresent the complexity of enterprise deployments. We introduce HARDEN, a constrained evolutionary search method to adapt the input of existing evaluation cases into more challenging variants while keeping their expected outputs fixed. HARDEN searches along generated domain-specific complexity axes while enforcing feasibility constraints such as preserving task semantics, realism, and execution validity. Across FinQA, PubMedQA, and ContractNLI and three Qwen3.5 model scales (35B-A3B, 122B-A10B, and 397B-A17B), HARDEN reduces task-model accuracy by 22.7% on average and by up to 49.9% relative to single-pass baselines using the same feasibility checks. These results show that evolutionary search can produce substantially harder valid evaluation cases.
- Abstract(参考訳): 言語モデルは、しばしば、エンタープライズデプロイメントの複雑さを過小評価するキュレートされたベンチマークで評価される。
本稿では,既存の評価事例の入力を予測出力を固定しつつ,より困難な変種に適応させる,制約付き進化探索手法であるHARDENを紹介する。
HARDENは生成されたドメイン固有の複雑性軸に沿って検索し、タスクのセマンティクス、リアリズム、実行の妥当性などの実行可能性制約を強制する。
FinQA、PubMedQA、ContractNLI、および3つのQwen3.5モデルスケール(35B-A3B、122B-A10B、および397B-A17B)を通じて、HARDENはタスクモデルの精度を平均22.7%、同じ実現可能性チェックを使用してシングルパスベースラインに対して最大49.9%削減する。
これらの結果から, 進化的探索により, 極めて難しい評価結果が得られることが示唆された。
関連論文リスト
- Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection [51.39973047614183]
本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
$textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTaskは、情報的タスクの選択と、部分的な評価からフルセットのパフォーマンスの推定という2つの課題に対処することで、ハーネスでバリデーションタスクを共進化させる。
論文 参考訳(メタデータ) (2026-08-20T15:24:54Z) - Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation [9.49271066699806]
エンタープライズビジネスシナリオの複雑さは、エージェントシステムにおける長いSKILLドキュメントの普及を促進する。
SkillCDGは,長期のSKILLコンプライアンス検出のためのグラフベースのフレームワークである。
その結果,SkillCDGは検出F1スコアにおいて,最大12.8ポイントの基準値よりも優れていた。
論文 参考訳(メタデータ) (2026-08-08T14:10:51Z) - Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints [24.33065543278173]
大規模な言語モデルの 徹底的な探索能力の評価は パラドックスに悩まされています
完全性を検証するには完全な基底真理が必要ですが、高エントロピー列挙タスクは、そのような基底真理を人間が作るのを不可能にします。
本稿では,計算不能制約の原理に基づくフレームワークであるVERITASを紹介する。
論文 参考訳(メタデータ) (2026-06-22T02:45:01Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data [0.6278186810520364]
大規模言語モデル(LLM)は、様々なタスクにおいて顕著なパフォーマンスを示している。
既存の評価ベンチマークは、しばしば静的で、その堅牢性と一般化を十分に評価するのに不十分である。
本稿では,質問応答などのクローズドなタスクのための進化型評価フレームワークであるAutoEvoEvalを提案する。
論文 参考訳(メタデータ) (2025-06-30T11:18:56Z) - On Pitfalls of Test-Time Adaptation [82.8392232222119]
TTA(Test-Time Adaptation)は、分散シフトの下で堅牢性に取り組むための有望なアプローチとして登場した。
TTABは,10の最先端アルゴリズム,多種多様な分散シフト,および2つの評価プロトコルを含むテスト時間適応ベンチマークである。
論文 参考訳(メタデータ) (2023-06-06T09:35:29Z) - Tokenization Consistency Matters for Generative Models on Extractive NLP
Tasks [54.306234256074255]
生成モデルの訓練において一般的に無視されるトークン化の不整合の問題を特定する。
この問題は、入力と出力が無矛盾にトークン化されると、これらのタスクの抽出特性を損なう。
一貫性のあるトークン化では、ドメイン内のデータセットとドメイン外のデータセットの両方で、モデルのパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2022-12-19T23:33:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。