論文の概要: Stable Within, Unidentified Across: Endpoint-Typed Identification in Benchmark Evaluation
- arxiv url: http://arxiv.org/abs/2608.19269v2
- Date: Fri, 21 Aug 2026 04:31:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:31.888125
- Title: Stable Within, Unidentified Across: Endpoint-Typed Identification in Benchmark Evaluation
- Title(参考訳): 安定な一元化アクロス: ベンチマーク評価におけるエンドポイント型同定
- Abstract要約: 宣言されたセマンティックファミリーとは何か?
我々は、この質問を定式化し、成果、効果、ランキングのクレームを個別に定式化し、予測する。
エンドポイント型識別セットと再利用可能な監査レコードを,それぞれの結論をエンドポイント,セマンティックファミリー,推論ライセンス,サンプリング設計にバインドする。
- 参考スコア(独自算出の注目度): 1.7006003864727406
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Over what declared semantic family is a typed benchmark claim identified? We formalize this question while holding artifacts and predictions fixed and auditing score, effect, and ranking claims separately. Sampling precision varies samples at fixed evaluator semantics; semantic identification varies substantively live meanings at a fixed evaluation substrate, so the former cannot license the latter. In task-disjoint TraceElephant, two jointly frozen contrast-comparable terminal treatments make every PageRank-minus-Earliest adoption contrast exactly zero, with [0,0] task-cluster intervals, so the effect is identified over the contrast-comparable domain. Absolute scores and weak rankings nevertheless vary over the corresponding point-specification family. Adding the original one-sided terminal treatment yields effects from -40.76 to -43.03 percentage points; factorial deletion attributes the entire disagreement to one-sided terminal-candidate deletion. Orthogonally, on 217 fixed-support rows, changing only empty-family credit shifts the effect from -7.72 to -3.46 percentage points and removes cellwise crossing. We give endpoint-typed identified sets and a reusable audit record binding each conclusion to its endpoint, semantic family, inference license, and sampling design.
- Abstract(参考訳): 宣言されたセマンティックファミリーとは何か?
我々は、この質問を定式化し、成果、効果、ランキングのクレームを個別に定式化し、予測する。
サンプリング精度は、固定評価器のセマンティクスのサンプルによって異なり、セマンティクスの識別は、固定された評価基板における実質的な生きた意味によって変化するため、前者は後者のライセンスを取得できない。
タスク非結合のTraceElephantでは、2つの共同凍結されたコントラスト比較端末処理は、PageRank-minus-Earliest のすべての採用コントラストを[0,0]タスククラスタ間隔で正確にゼロとし、コントラスト比較可能な領域でその効果を識別する。
絶対スコアと弱いランキングは、それにもかかわらず、対応するポイント特定ファミリによって異なる。
元の片側終末処理を加えると、-40.76から-43.03パーセンテージの効果が得られる。
直交的に、217行の固定支持行では、空家クレジットのみが-7.72ポイントから-3.46ポイントに変化し、細胞交差を除去する。
エンドポイント型識別セットと再利用可能な監査レコードを,それぞれの結論をエンドポイント,セマンティックファミリー,推論ライセンス,サンプリング設計にバインドする。
関連論文リスト
- VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - ClaimReceipt: Verifying Evidence Sufficiency and Coverage in Agent Evaluations [0.39287497907611874]
ClaimReceiptは、型付きトランザクションエビデンスを署名された実験マニフェストにバインドし、クレーム毎にPASS、INVALID、INCONCLUSIVEを返す。
1,392の歴史的買い手-売り手記録では、CR-2検証者は手動でラベル付けされた監査の評定を全て再現し、600の決定論的および762のポストジェネレーションレコードを正確に再生する。
推論の前に30のアサインがコミットされ、端末のレシートが署名され、連鎖され、監査人のためにプライベートエビデンスが暗号化される。
論文 参考訳(メタデータ) (2026-09-02T02:00:02Z) - Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification [11.991995412984503]
この設定を用いて、構造化中間出力の実証監査プロトコルを開発する。
480サンプルの合成開発セットは、当初は状態に構造化されたプロンプトバンドルから大きな利益が得られたことを示唆していた。
このセットでは、4つの状態定義を公開することで精度が向上するが、分離された明示的な状態出力フィールドはポリシーの精度を著しく改善しない。
論文 参考訳(メタデータ) (2026-08-18T01:04:45Z) - Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models [0.0]
ClosurePairsは、繰り返し発生する障害を伴う互換性のあるマイクロステートを横断します。
ソースの属性は確実に回復する。
非線形相互作用ベンチマークにおける等予算分解誤差を低減する。
論文 参考訳(メタデータ) (2026-08-01T11:07:24Z) - A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models [1.0602247913671219]
Reasoning Answer Faithfulness Score (RAFS) は、出力された数学的トレースが局所的に信頼できるかどうかの基準自由なインスタンスレベルの診断である。
RAFSは、ステップの妥当性、解答の推論と反ファクトの感度、解答のコンセンサス、条件付き推論安定性を組み合わせている。
RAFSは、数学的な解答精度を、サイレント推論の失敗と解答の誤りに対する監査可能な警告信号で補完することを目的としている。
論文 参考訳(メタデータ) (2026-07-28T07:28:38Z) - TwistedMerge: Certified Higher-Order Diagnostics and Abstention for Model Merging [0.48086260459837454]
我々は、チェックポイントが局所対象、アライメントマップが遷移、サイクル積が残留する有限降下問題としてマージを定式化する。
提案手法は, 定数エッジのNo-go結果, フリーズ・コンプレックスの3方向およびプレファミリーの誤差制御定理, 比較・複雑感度の精査試験である。
訓練された低ランク適応型監査では, 平均化係数は選択したGLr代表に依存するが, 大域的因子同期と高密度デルタSVDは安定である。
論文 参考訳(メタデータ) (2026-07-23T03:24:50Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric [0.0]
ベンダーニュートラルでランナブルな計器は、評価妥当性の指標として再構成可能性を示すものはない。
本稿では,8つの意思決定クラスに対する特性レベルの再構成可能性指標を提案する。
論文 参考訳(メタデータ) (2026-07-14T07:54:37Z) - Byzantine Accountability Without Consensus: Strong Eventual Consistency for Non-Associative, Stochastic, Robust Aggregation [0.0]
ACFAは、署名されたコントリビューションのコンテンツ適応OR-Setと、自己認証等式証明の成長のみのセットを複製する。
プロトタイプ(10ノード、3ビザンティン)は16/16のファルシフィケーションチェックをパスします。
論文 参考訳(メタデータ) (2026-07-11T13:23:06Z) - Metric-Dependent Annotation Saturation for Learning from Label Distributions [0.0]
我々は,ChaosNLIをサブサンプルとしたラベル分布のNLIモデルを微調整する。
3クラス NLI では、エントロピー相関は N 20-50 のアノテータを収束させる必要がある。
ソフトラベルは、ラベルの平滑化が再現できないアイテム固有の信号を運ぶ。
論文 参考訳(メタデータ) (2026-05-28T11:46:51Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - Semantic F1 Scores: Fair Evaluation Under Fuzzy Class Boundaries [65.89202599399252]
本稿では,主観的,ファジィなマルチラベル分類のための新しい評価指標であるセマンティックF1スコアを提案する。
セマンティックF1は意味的に関連があるが、識別できないラベルに部分クレジットを与えることで、人間の不一致やファジィ圏の境界によって特徴付けられる領域の現実をよりよく反映する。
論文 参考訳(メタデータ) (2025-09-25T21:48:48Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Contrastive Learning to Improve Retrieval for Real-world Fact Checking [84.57583869042791]
ファクト・チェッキング・リランカ(Contrastive Fact-Checking Reranker, CFR)を提案する。
我々はAVeriTeCデータセットを活用し、証拠文書からの人間による回答とクレームのサブクエストを注釈付けする。
データセットの精度は6%向上した。
論文 参考訳(メタデータ) (2024-10-07T00:09:50Z) - ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning [63.77667876176978]
大規模言語モデルでは、最終回答を正当化するためにステップバイステップの推論を生成するように促された場合、ダウンストリームタスクの解釈可能性が改善されている。
これらの推論ステップは、モデルの解釈可能性と検証を大幅に改善するが、客観的にそれらの正確性を研究することは困難である。
本稿では、従来のテキスト生成評価指標を改善し拡張する、解釈可能な教師なし自動スコアのスイートであるROSを提案する。
論文 参考訳(メタデータ) (2022-12-15T15:52:39Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。