論文の概要: Auditing Bayesian Graph Alignment: Diagnostic Comparisons and Reference Failure
- arxiv url: http://arxiv.org/abs/2609.23232v2
- Date: Thu, 24 Sep 2026 01:58:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.288912
- Title: Auditing Bayesian Graph Alignment: Diagnostic Comparisons and Reference Failure
- Title(参考訳): ベイジアングラフのアライメント : 診断的比較と基準的失敗
- Abstract要約: 3つのサンプルとスコア,限界,指標,カテゴリー,分類器に基づく診断を比較した。
また, 誤差が967に近づいたにもかかわらず, ほぼゼロに一致しない共通開始鎖も示している。
これらの結果は、有限予算の限界、診断ランク、基準合意を精度の証拠として識別しながら、割当感性監査を支援する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bayesian graph alignment estimates correspondence probabilities, but convergence of an alignment-score trace need not imply accurate correspondence marginals. We audit this gap on 240 new exact graph pairs from four source families, 240 larger pairs with 20-100 vertices, and a separate 60-case exact implementation check. Under an explicit edge-flip likelihood, we compare three samplers and score, marginal, indicator, categorical, and classifier-based diagnostics. Marginal disagreement improves error discrimination over score R-hat for the exact informed sampler, but its improvement for vanilla local sampling is uncertain. Assignment-based R* and short indicator panels are competitive; no diagnostic dominates across samplers and endpoints. At larger sizes, diagnostics predict subsequent marginal changes, not posterior error, and classification performance depends on the drift threshold. Disjoint-window and held-out-chain checks attenuate but preserve positive associations. Only 22 of 240 original reference sets pass an agreement screen. On forty failure-selected cases, eightfold SMC particle escalation does not resolve disagreement, whereas additional rejuvenation helps. Longer informed runs remain unstable. An elementary feasible-alignment bound demonstrates severely unrepresentative SMC and informed-chain scores in concentrated 100-vertex cases, independently of approximate reference consensus. We also exhibit common-start chains with near-zero disagreement despite exact marginal error near .967. These results support assignment-sensitive auditing while identifying limits of finite budgets, diagnostic rankings, and reference agreement as evidence of accuracy.
- Abstract(参考訳): ベイズグラフアライメントは対応確率を推定するが、アライメントスコアトレースの収束は正確な対応限界を含まない。
このギャップを、4つのソースファミリーから240の新しい正確なグラフペア、20-100頂点を持つ240の大きいペア、60ケースの正確な実装チェックで評価する。
明確なエッジフリップの確率で、3つのサンプルとスコア、限界、指標、カテゴリー、分類器に基づく診断を比較した。
マージナルな不一致は、正確なインフォームドサンプリングのスコアR-hatに対する誤り判定を改善するが、バニラ局所サンプリングに対する改善は不確かである。
割り当てベースのR*とショートインジケータパネルは競合する。
より大きなサイズでは、診断は後続の限界変化を予測し、後続の誤差ではなく、分類性能はドリフト閾値に依存する。
Disjoint-window と hold-out-chain check は減衰するが、肯定的な関連を維持する。
240のオリジナルの参照セットのうち22のみが合意画面を通過する。
40件の故障選択例では、8倍のSMC粒子エスカレーションは不一致を解消しないが、さらなる再活性化は有効である。
より長い報せは不安定のままである。
基本実現可能アライメント境界は、近似基準コンセンサスとは無関係に、100頂点集中の場合において、非常に非表現的なSMCとインフォメーションチェーンスコアを示す。
我々はまた、.967に近い正確な限界誤差にもかかわらず、ほぼゼロの不一致を持つ共通開始鎖を示す。
これらの結果は、有限予算の限界、診断ランク、基準合意を精度の証拠として識別しながら、割当感性監査を支援する。
関連論文リスト
- Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead [9.25138311822007]
コーディングエージェントのリーダーボードにおける小さな違いは、しばしばシステムの順序付けとして読まれる。
モデルを実行せずに4分割で254件のSWE-benchを提出し,この読解をサポートするかどうかを検証した。
パーティションと5段階の監査プロトコルをリリースし、共有結果のプロファイリング、ペアの違いのテスト、感度の報告、解決に必要なインスタンス予算の見積を行います。
論文 参考訳(メタデータ) (2026-09-15T16:29:12Z) - Symmetry-Aware Likelihood-Orbit Aggregation for Selective Left-Right Claim Verification [14.108900142001628]
クローズド形式のコントラストであるRelation-Orbitを導入する。
VSRとGQAの4つの凍結された視覚言語モデルでは、Relation-Orbitは10%選択リスクキャリブレーションターゲットで平均テストカバレッジを高くする。
論文 参考訳(メタデータ) (2026-09-15T11:19:03Z) - CARD: Calibration via Agreement in Reverse Diffusion for Out-of-Domain MRI Segmentation [14.844162865265673]
そこで我々は,不一致の時間的集合を全クラスにわたって1ピクセルあたりの温度場にマッピングし,セグメント化ができない間に信頼度が変化するようにCARDを提案する。
心臓、前立腺、脳のMRIシフトによって、CARDは各設定において最強のベースラインと比較した場合、49の45のキャリブレーション誤差を低下させる。
論文 参考訳(メタデータ) (2026-08-26T07:23:08Z) - Conformalized Large Language Models under Configuration Shift [46.502741608809174]
コンフォーマル予測は不確実性定量化のための分布のないフレームワークである。
非整合性スコアは、単に固定モデルではなく、推論パイプラインによって引き起こされることが多い。
構成シフトがCPの妥当性を損なうことを示す。
論文 参考訳(メタデータ) (2026-08-02T19:34:41Z) - KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models [0.0]
KAISENは、サブグループの成層、不均質の測定、メカニズム診断、ポストホック緩和、ドリフトモニタリングを含む5段階の監査パイプラインである。
すべての結果は、既知の根拠の真実と共に合成され、臨床的妥当性が確立されない。
論文 参考訳(メタデータ) (2026-07-30T17:57:18Z) - CausalGuard: Conformal Inference under Graph Uncertainty [41.621090965517524]
CausalGuardは、グラフ条件が二重に頑健な擬似アウトカムを集約した後、校正する構造重共役フレームワークである。
直接評価可能な目標に対して、名目90%以上の範囲を達成し、グラフに依存しない共形ベースラインが大きなパディングを必要とする場合、幅を小さくする。
論文 参考訳(メタデータ) (2026-05-21T02:56:46Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs [20.96410413299322]
CXR-ContraBenchは、内部のReXVQAスライスと外部のOpenIおよびCheXpertプロトコルにまたがる診断ベンチマークである。
我々は,この失敗を,視覚的証拠と疑問の両方に矛盾する場合でも,否定的回答オプションにモデルを引き付けるという,否定的選択の誘因として研究する。
論文 参考訳(メタデータ) (2026-05-07T07:46:17Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。