論文の概要: The Calibration Floor: Format Repair Can Masquerade as Self-Correction at Small-to-Mid Scale
- arxiv url: http://arxiv.org/abs/2608.04355v1
- Date: Wed, 05 Aug 2026 01:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.688419
- Title: The Calibration Floor: Format Repair Can Masquerade as Self-Correction at Small-to-Mid Scale
- Title(参考訳): 校正フロア:小型から中規模でマスクレードを自己補正できるフォーマト修復
- Authors: Mingguang Chen, Bo Qu, Licheng Wang,
- Abstract要約: 言語モデルによる自己修正後の精度の変化は通常、推論の変化として解釈される。
回答抽出境界で失敗する可能性を示し、観察のみでなく因果的に失敗をテストする。
- 参考スコア(独自算出の注目度): 7.159691098846351
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accuracy changes after language-model self-revision are usually interpreted as changes in reasoning. We show this can fail at the answer-extraction boundary, and test the failure causally rather than only observationally. Across Qwen3.5 (0.8B-9B), Gemma-4-12B, and two frontier models via API (Tencent Hy3, Nvidia Nemotron-3-Ultra-550B) in 29 primary cells plus a frontier arm, we decompose the always-revise accuracy shift into a content margin (both answers parseable) and format-recovery/loss margins (parseability changes). On 12 cells with meaningful unparseable-answer rates, format effects exceed content effects (Wilcoxon p=1.7e-3). To test this causally, we force already-generated reasoning through grammar-constrained decoding so every answer is parseable by construction: across 14 cells this closes a median 71% of the gap between the naive total effect and the content-margin estimate, with two cells converging exactly and a residual on the two largest-effect cells reported rather than dismissed. A clustered model confirms floor-scale (0.8B/2B) models have far higher odds of content-level change and harm than capable-scale models (p<1e-7). Replicating a cited confidence-gating protocol verbatim on Qwen3.5 does not reproduce its reported gain and shows the same near-zero content margin. A frontier check on much larger models shows format-dominance intensifying with scale: content margin is exactly zero in all 5 cells despite total effects up to +0.275, though this arm is lower-powered. The calibration-floor criterion on the content margin reveals a squeeze: floor-scale cells have headroom but insufficient signal, capable-scale cells have signal but little headroom; only one cell is marginally viable, with negligible sealed-holdout gain. Content is a minority share of what the field has measured as self-correction. We release the instrument, code, and derived results.
- Abstract(参考訳): 言語モデルによる自己修正後の精度の変化は通常、推論の変化として解釈される。
回答抽出境界で失敗する可能性を示し、観察のみでなく因果的に失敗をテストする。
Qwen3.5 (0.8B-9B), Gemma-4-12B, API (Tencent Hy3, Nvidia Nemotron-3-Ultra-550B) とフロンティアアームの2つのフロンティアモデルにまたがって, 常に修正された精度をコンテンツマージン(どちらも解析可能)とフォーマットリカバリ/ロスマージン(パースビリティの変更)に分解する。
有意義な問合せができない12の細胞では、フォーマット効果は内容効果を超える(Wilcoxon p=1.7e-3)。
この因果関係をテストするために、我々は文法制約付き復号化を通じて既に生成した推論を強制し、全ての解答は構成によって解析可能である:14個の細胞で、これは、単純全効果とコンテンツマージン推定の間のギャップの中央値71%を閉じ、二つの細胞が正確に収束し、デジェクトではなく報告された2つの大きな効果を持つ細胞に残基が残基となる。
クラスタ化モデルでは,フロアスケール (0.8B/2B) モデルの方がコンテントレベルの変化や害の確率が,有能なモデルよりもはるかに高いことが確認されている(p<1e-7)。
Qwen3.5で引用された信頼度保証プロトコルを冗長に複製しても、報告された利益は再現されず、ほぼゼロに近い内容のマージンを示す。
コンテントマージンは、合計で0.275までの効果があるにもかかわらず、全5細胞で完全にゼロであるが、この腕は低出力である。
フロアスケールの細胞にはヘッドルームがあるが信号が不十分で、能力のある細胞には信号があるがヘッドルームは少ない。
コンテンツは、フィールドが自己補正として測定したものの少数を占める。
楽器、コード、および導出した結果をリリースします。
関連論文リスト
- Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings [0.0]
本稿では、このチェックをルールベースのフォークツイン対策ゲートに配置する。
SkogestadのカラムAでは、はしごはPIDのみ(C0)、リニアMPC(C1)、アンゲートエージェント(C2)、ゲートエージェント(C3)である。
論文 参考訳(メタデータ) (2026-07-30T08:26:53Z) - Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics [8.465978346858842]
CLIPのような基盤モデルは、視覚言語的類似性を通じて新しいカテゴリに一般化するオープン語彙オブジェクト検出器を可能にした。
スケールバイアスの発見は2つの効果の偏りのある混合であることを示す。
これらの結果から,画像レベルの基礎モデルを領域レベルの検出タスクに適用する上での基本的限界が明らかとなった。
論文 参考訳(メタデータ) (2026-07-13T01:33:18Z) - Score Distributions, Not Cells: Evaluating Single-Cell Perturbations Under Class Overlap [0.09558392439655013]
2つの摂動によって異なる細胞の集団が生成され、同時に個々の細胞がどちらの細胞に属しているかが重なり合う。
セル毎の精度はモデルの品質よりもこの重複を測定する。
この修正は、細胞によってではなく、全人口の摂動を評価することである。
論文 参考訳(メタデータ) (2026-07-06T01:47:02Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - Output Vector Editing for Memorization Mitigation in Large Language Models [68.30351930772788]
大規模な言語モデルは、トレーニングデータからシーケンスを記憶し、再現し、プライバシ、著作権、セキュリティリスクを生み出す。
既存のニューロンレベルの緩和方法は、ニューロンの活性化をゼロにすることで編集を等しくするが、活性化はニューロンが関与するかどうかのみを制御する。
記憶継続に責任を負うニューロンの小さな集合を探索する制約最適化編集である出力ベクトル編集を提案する。
論文 参考訳(メタデータ) (2026-06-17T07:29:18Z) - On the Entropy Calibration of Language Models [52.47557449370603]
本研究では,言語モデルのエントロピーが人間のテキスト上でのログ損失と一致しているかを問うエントロピーキャリブレーションの問題について検討する。
観測されたスケーリングの挙動は、単純化された設定によって予測されるものと類似していることがわかった。
将来的なテキストのエントロピーを予測するために,モデルに適合するブラックボックスへのアクセスを前提にすれば,それが可能であることが証明できる。
論文 参考訳(メタデータ) (2025-11-15T00:33:03Z) - MeCaMIL: Causality-Aware Multiple Instance Learning for Fair and Interpretable Whole Slide Image Diagnosis [40.3028468133626]
MIL(Multiple Case Learning)は、コンピュータ病理学における全スライド画像(WSI)解析の主流パラダイムとして登場した。
因果関係を意識したMILフレームワークである textbfMeCaMIL は、構造化因果グラフを通じて、階層的共同創設者を明示的にモデル化する。
MeCaMILは優れた公正性を達成する -- 人口格差の分散は、属性全体の平均で65%以上減少する。
論文 参考訳(メタデータ) (2025-11-14T06:47:21Z) - HyFormer-Net: A Synergistic CNN-Transformer with Interpretable Multi-Scale Fusion for Breast Lesion Segmentation and Classification in Ultrasound Images [0.0]
HyFormer-Netは、本質的に解釈可能な同時セグメンテーションと分類のためのハイブリッドCNN変換器である。
BUSIデータセットでは、HyFormer-NetがDice Score 0.761 +/-0.072と精度93.2%を獲得し、U-Net、Attention U-Net、TransUNetを上回っている。
乳房超音波におけるハイブリッドCNN変換器のクロスデータセット一般化研究を初めて行った。
論文 参考訳(メタデータ) (2025-11-02T17:06:12Z) - Confidence-Based Model Selection: When to Take Shortcuts for
Subpopulation Shifts [119.22672589020394]
モデル信頼度がモデル選択を効果的に導くことができるConfidence-based Model Selection (CosMoS)を提案する。
我々はCosMoSを,データ分散シフトのレベルが異なる複数のテストセットを持つ4つのデータセットで評価した。
論文 参考訳(メタデータ) (2023-06-19T18:48:15Z) - Semi-Supervised Learning with Pseudo-Negative Labels for Image
Classification [14.100569951592417]
擬陰性ラベルに基づく相互学習フレームワークを提案する。
擬似負ラベルの予測確率を下げることにより、二重モデルは予測能力を向上させることができる。
我々のフレームワークは、いくつかの主要なベンチマークで最先端の結果を達成する。
論文 参考訳(メタデータ) (2023-01-10T14:15:17Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。