論文の概要: When Verifiable Counts Depend on Wording: Auditing Wording Robustness in Instruction Following
- arxiv url: http://arxiv.org/abs/2610.05278v1
- Date: Sun, 04 Oct 2026 14:55:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 22:03:56.42669
- Title: When Verifiable Counts Depend on Wording: Auditing Wording Robustness in Instruction Following
- Title(参考訳): 検証可能な数字が単語に依存する時--教育における単語のロバストさの検証
- Abstract要約: WISEは一致した評価スイートであり、正確な単語数、キーワードのインクルージョンを正確に1回、包括的に8~12ワードの範囲でインスタンス化する。
100以上のタスクが一致し、7つのプロバイダから最大13のモデルが生成され、完全な可視出力に対して繰り返し生成される。
- 参考スコア(独自算出の注目度): 8.34325372182861
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Verifiable instruction-following benchmarks often express each constraint through one fixed template. We test whether scores remain stable when the operational requirement is unchanged but its wording varies. We introduce WISE, a matched evaluation suite and reporting protocol instantiated on exact word count, keyword inclusion exactly once, and an inclusive 8--12 word range. Across 100 matched tasks, up to thirteen models from seven providers, and repeated generations scored over the complete visible output, wording alone produces substantial compliance shifts. In an avoidance-family panel, five avoidance and exclusion forms fall below the positive baseline, while constructional controls also shift compliance substantially: in the nine-model control panel, compliance is 54.9% for the original positive form, 48.2% for a longer positive form, 36.7% when the target appears later, and 33.8% for AVOID1. A strict JSON-structure probe shows wording sensitivity beyond counting, with a different direction of effect. Effect sizes, failure directions, weakest forms, and model rankings vary across realizations. Under the most disruptive exclusion form, the top-ranked model changes and 24.1% of strictly ordered model pairs reverse. Human validation further shows that unanimous agreement on an exact-count interpretation can coexist with substantially different model behavior. WISE supplements conventional scores with mean and worst-form compliance, wording gaps, failure profiles, and ranking stability.
- Abstract(参考訳): 検証可能な命令追従ベンチマークは、しばしば1つの固定テンプレートを通して各制約を表現する。
動作条件が変わらず, 単語が変化しても, スコアが安定しているかどうかを検証する。
WISE、一致した評価スイート、正確な単語数に基づいてインスタンス化された報告プロトコル、キーワードを正確に1回だけ含んでいること、包括的8~12ワード範囲について紹介する。
100以上のタスクが一致し、7つのプロバイダから最大13のモデルが生成され、完全な可視出力に対して繰り返し生成される。
回避ファミリーパネルでは、5つの回避・排除フォームが正の基準線以下に該当する一方、建設制御パネルは、コンプライアンスを実質的にシフトする。9モデル制御パネルでは、コンプライアンスは元の正の形式で54.9%、より長い正の形で48.2%、ターゲットが後で現れるときに36.7%、AVOID1で33.8%である。
厳密なJSON構造プローブは、カウント以上の単語の感度を異なる方向で示す。
影響の大きさ、障害方向、最も弱いフォーム、モデルランキングは、実現度によって異なる。
最も破壊的な排除形式の下では、上位モデルが変更され、厳密に順序付けられたモデルペアの24.1%が逆転する。
人間の検証は、正確な数の解釈に関する一対一の合意が、実質的に異なるモデルの振る舞いと共存できることをさらに示している。
WISEは、平均および最悪の形式のコンプライアンス、言葉のギャップ、障害プロファイル、ランキング安定性で従来のスコアを補完する。
関連論文リスト
- PDE-OBS: Controlled Evaluation Across Observation Patterns [40.0520743676604]
本稿では,数値データ生成,モデルトレーニング,推論と評価を対象とするベンチマークプラットフォームであるPDE-OBSを紹介する。
7つの偏微分方程式系からの560,000の場と軌道を観測作用素と組み合わせている。
テストパターン毎にトレーニングされた参照を使用して、同じテスト観測とターゲットのモデルを比較する。
論文 参考訳(メタデータ) (2026-09-29T02:13:36Z) - What Would Falsify It? A Variable Specific Evidence Standard for Mechanistic Claims About Self Explanation [0.0]
言語モデルがすでに与えられた答えを説明するとき、その答えを生成した計算を再利用するか、あるいは回答からのみストーリーを再構築するかを示します。
検証された変数の同一性を除去する変数固有nullと、それぞれ正の統計量とをペアリングするエビデンス標準を提案する。
論文 参考訳(メタデータ) (2026-09-26T14:26:14Z) - Persuaded, Not Informed: Incentive-Misaligned Witnesses Defeat In-Context Grounding [0.0]
より強力なモデルで対処されていない障害モードを特定します。
文脈が楽観主義へのインセンティブを持つ当事者による主張を含む場合、モデルはこの主張を証拠として扱い、明確化は会社の記録を容認できないとみなす。
論文 参考訳(メタデータ) (2026-09-23T23:52:24Z) - The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure [42.25959731143407]
本稿では,ベンチマークと結論について検討し,概念的および評価的ミス・スペクテーションに大きく影響していることを示す。
厳格なNLI標準の下では、グループAのインスタンスの76%は、決定を明示的に除外していない。
イベントセマンティックなNLIを多段階推論問題として定式化し、中間的意味決定と最終的な予測の両方を評価する。
論文 参考訳(メタデータ) (2026-08-25T18:00:18Z) - Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark [0.0]
本研究では,仕様の形式的セマンティックブロックモデルと,仕様品質を評価するための実行基準ベンチマークを導入する。
仕様は、セマンティックブロック、依存関係の関係、ブロック所有ルール、決定ポイント、明示的にオープンな質問からなる構造として表現される。
ベンチマークは実装者のパネルを固定し、必須の非仕様管理アームを含み、決定論的実行ジャッジとして16と実動のOracleインスタンスを使用する。
論文 参考訳(メタデータ) (2026-08-19T22:17:31Z) - What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals [1.7006003864727406]
我々はこの欠落したクレーム・リプレイ層を凍結基板Dを介して形式化する。
次に、機械的に許容できる124の検査Evalsユニットを、ピン留めされたコミットで調査します。
論文 参考訳(メタデータ) (2026-08-18T14:32:50Z) - Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency [0.025718125188898048]
我々は,現時点のタスクを個別に保持するプロセスベンチトレースに対して,擬似アラームを計測する。
完了した監査 -> モデルのコンテキストにすでにある修復エピソードは、15のモデルxワードの組み合わせのうち15の偽のアラームを低くする。
論文 参考訳(メタデータ) (2026-08-17T01:41:43Z) - Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds [43.5891705224868]
自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
論文 参考訳(メタデータ) (2026-07-31T04:02:51Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。