論文の概要: Detection Without Correction: A Two-Parameter Decomposition of Multi-Stage LLM Pipelines
- arxiv url: http://arxiv.org/abs/2605.27559v1
- Date: Tue, 26 May 2026 18:26:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.403889
- Title: Detection Without Correction: A Two-Parameter Decomposition of Multi-Stage LLM Pipelines
- Title(参考訳): 補正なし検出:多段LLMパイプラインの2パラメータ分解
- Authors: Prashanti Nilayam, Kiran Ramanna, Prashil Tumbade,
- Abstract要約: 本稿では,マルチエージェントの議論,本質的な自己補正,検索強化検証パイプラインについて検討する。
条件付き誤り訂正率は一貫して支配的である。
検出しきい値を安定モデル/プロトコールレベルの正則性として特徴付ける。
- 参考スコア(独自算出の注目度): 0.764671395172401
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-stage LLM pipelines that perform multi-agent debate, intrinsic self-correction, or retrieval-augmented verification exhibit puzzling aggregate behaviors: accuracy plateaus and reversals across rounds, non-replication of debate gains on contemporary frontier models, intrinsic self-correction degradation, and qualitative cross-provider divergence in debate dynamics. Downstream agent response can be operationalized as two coupled decisions: detection (whether to treat upstream content as authoritative) and conditional generation (what to produce if not). This decomposition yields four observable response regimes, of which detection-without-correction is the load-bearing failure mode. Across a nine-cell empirical grid spanning four model families, four benchmarks (GSM8K, MATH-500, GPQA-Diamond, AIME), and two methods (multi-agent debate, intrinsic self-correction), we find that the conditional miscorrection rate is consistently dominant (53-94% across cohorts) while detection rate varies contextually by more than an order of magnitude. The framework unifies the four phenomena above as signatures of a common mechanism and characterizes detection threshold as a stable model/protocol-level regularity that persists across methods at matched benchmark difficulty.
- Abstract(参考訳): 多段階のLLMパイプラインは、マルチエージェントの議論、本質的な自己補正、または検索強化された検証を行うが、これは、ラウンド間の精度のプラトーとリバーサル、現代のフロンティアモデルにおける議論の重複の非レプリケーション、本質的な自己補正の劣化、議論力学における定性的なクロスプロビデンス(英語版)の分岐を示す。
ダウンストリームエージェントの応答は、検出(上流のコンテンツを権威として扱うかどうか)と条件生成(生成しないかどうか)という2つの複合的な決定として操作できる。
この分解は4つの観測可能な応答レギュレーションをもたらし、そのうちの1つは、検出・無補正が負荷を伴わない障害モードである。
4つのモデルファミリーにまたがる9セルの実証格子,4つのベンチマーク (GSM8K, MATH-500, GPQA-Diamond, AIME) と2つの方法 (複数エージェントの議論, 内在的自己補正) にまたがって, 条件付き誤り訂正率は一貫した支配的(コホート全体で53~94%) であり, 検出率は1桁以上で文脈的に変化する。
このフレームワークは、上記の4つの現象を共通のメカニズムのシグネチャとして統一し、検出しきい値を、一致したベンチマーク困難時にメソッド間で持続する安定したモデル/プロトコールレベルの規則性として特徴付ける。
関連論文リスト
- IV-ICL: Bounding Causal Effects with Instrumental Variables via In-Context Learning [11.804716294874018]
IV-ICLは、因果効果の限界後部分布を直接学習し、その量子化として境界を導出するアモータイズされたベイズ内文脈学習法である。
合成および半合成IVベンチマーク上でIV-ICLを評価し,より信頼性が高く,より情報性の高い間隔を生成することを示す。
論文 参考訳(メタデータ) (2026-05-13T03:00:08Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - TRIAGE: Type-Routed Interventions via Aleatoric-Epistemic Gated Estimation in Robotic Manipulation and Adaptive Perception -- Don't Treat All Uncertainty the Same [2.755751829139168]
ほとんどの不確実性を認識したロボットシステムは、予測の不確実性を単一のスカラースコアに分解し、それを使って一様に修正された応答をトリガーする。
このアグリゲーションは、破損した観測結果から不確実性が生じるか、あるいは学習されたモデルと真のシステム力学とのミスマッチから生じるのかを曖昧にしている。
本研究では,不確かさを動脈およびてんかん成分に分解する軽量なポストホックフレームワークを導入し,これらの信号を用いて推論時のシステム応答を調節する。
論文 参考訳(メタデータ) (2026-03-09T09:07:43Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - Unsupervised Anomaly Detection in Multi-Agent Trajectory Prediction via Transformer-Based Models [45.08545174556591]
マルチエージェントトランスを用いた教師なし異常検出フレームワークを提案する。
検出安定性と物理的アライメントの両方を評価するための二重評価手法が提案されている。
本フレームワークでは,時間対衝突および統計ベースラインに欠落した388個の特異な異常を同定する。
論文 参考訳(メタデータ) (2026-01-28T08:33:10Z) - Prompt Injection Evaluations: Refusal Boundary Instability and Artifact-Dependent Compliance in GPT-4-Series Models [0.0]
GPT-4.1 と GPT-4o の2つのモデルを評価する。
アーティファクトタイプは摂動スタイルよりも断裂の予測が強いことが分かりました。
断熱挙動は安定な二元性というよりは確率的であり, 人工物に依存した境界現象である。
論文 参考訳(メタデータ) (2026-01-25T17:14:33Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Identification of Causal Direction under an Arbitrary Number of Latent Confounders [54.76982125821112]
実世界のシナリオでは、観測された変数は複数の潜伏変数によって同時に影響を受けることがある。
我々は,特定の方法で構築された観測変数の高次累積行列を併用する。
これらの高次累積行列の階数不足特性から,2つの観測変数間の因果非対称性が直接観察可能であることを示す。
論文 参考訳(メタデータ) (2025-10-26T15:10:00Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z) - Information Directed Sampling for Linear Partial Monitoring [112.05623123909895]
線形報酬と観測構造を持つ部分的監視のための情報指向サンプリング(IDS)を導入する。
IDSは、ゲームの正確な可観測性条件に依存する適応的な最悪の後悔率を達成する。
結果がコンテキストおよびカーネル化設定にまで拡張され、アプリケーションの範囲が大幅に増加する。
論文 参考訳(メタデータ) (2020-02-25T21:30:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。