論文の概要: Relational Response Fields: A General Theory of Black-Box LLM Response Consistency and Recovery
- arxiv url: http://arxiv.org/abs/2608.04552v1
- Date: Wed, 05 Aug 2026 07:43:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.77581
- Title: Relational Response Fields: A General Theory of Black-Box LLM Response Consistency and Recovery
- Title(参考訳): リレーショナル応答場:ブラックボックスLDM応答一貫性と回復の一般理論
- Authors: Song Zichen,
- Abstract要約: ブラックボックス言語モデルの信頼性は、サンプリング、プロンプト、投票、検証、または個別の回答の反復的な修正によって追求される。
我々は、クエリの型変換に対する応答を、エンフレレーション応答場(RRF)として表現する。
アンカーは、パラフレーズ、スケーリング、分解、その他のタスク対称性の下で、有効なレスポンスがどのように変化するかをエンコードする。
リレーショナル演算子$D$、アンカー演算子$A$、最大で$k$の応答ノードに対して、ブラックボックス応答回復の本質的な難しさとして$_k(D,A)$を識別する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Black-box language-model reliability is commonly pursued by sampling, prompting, voting, verifying, or iteratively revising individual answers. We ask a prior question: \emph{what determines whether a collection of black-box responses is recoverable at all?} We represent responses to typed transformations of a query as a \emph{relational response field} (RRF). Edge transports encode how valid responses must change under paraphrase, scaling, decomposition, refactoring, or other task symmetries; anchors encode independently trusted evidence such as execution or a verifier. For relation operator $D$, anchor operator $A$, and at most $k$ corrupted response nodes, we identify $γ_k(D,A)$ as the intrinsic difficulty of black-box response recovery. It is positive exactly when every $k$-node corruption is identifiable; it gives a deterministic stability bound proportional to $1/γ_k$; and a matching two-point minimax lower bound shows that no estimator can improve this dependence. Thus consistency is not truth: relation-only methods are blind to null directions, including shared hallucinations. We derive sparse field-repair algorithms while separating information-theoretic identifiability from the stronger null-space conditions required by convex optimization. Controlled theorem tests and black-box mathematics/code experiments evaluate four theory-fixed consequences: consistency--truth separation, anchor phase transitions, redundancy saturation, and cross-model, cross-task prediction of repair difficulty. The results support $γ_k(D,A)$ as a measurable property of a response-recovery instance, rather than a score attached to one repair heuristic.
- Abstract(参考訳): ブラックボックス言語モデルの信頼性は、サンプリング、プロンプト、投票、検証、または個別の回答の反復的な修正によって追求される。
先程の質問をしよう: \emph{Whatは、ブラックボックスのレスポンスの集合が回復可能であるかどうかを判断する。
} クエリの型変換に対する応答を \emph{relational response field} (RRF) として表現する。
エッジトランスポートは、パラフレーズ、スケーリング、分解、リファクタリング、その他のタスク対称性の下で、有効なレスポンスをどのように変更する必要があるかをエンコードする。
リレーショナル演算子$D$、アンカー演算子$A$、最大で$k$の応答ノードに対して、ブラックボックス応答回復の本質的な難しさとして$γ_k(D,A)$を識別する。
1/γ_k$に比例する決定論的安定性を与え、一致する2点のミニマックス下限は、推定者がこの依存を改善することができないことを示す。
したがって、一貫性は真実ではない:関係のみのメソッドは、共有幻覚を含むnull方向に対して盲目である。
凸最適化で要求されるより強いヌル空間条件から情報理論的識別性を分離しながら、スパースフィールド修復アルゴリズムを導出する。
制御された定理テストとブラックボックス数学/コード実験は、一貫性-トラス分離、アンカー位相遷移、冗長飽和、およびクロスモデル、クロスタスク予測の4つの理論固定結果を評価する。
結果は、1つの修復ヒューリスティックに付随するスコアではなく、応答回復インスタンスの測定可能なプロパティとして$γ_k(D,A)$をサポートする。
関連論文リスト
- Which Model Is Actually Serving You? IRIS: Budgeted Black-Box Auditing of Model Substitution and Routing Dilution in LLM Gateways [6.964275075635626]
返却されたテキストのみを必要とする監査である$mathrmIRIS$を提示します。
安価なパイロットは指数的なクエリエラーの崩壊に適合し、疑わしいクエリが発行される前にその予算を凍結する。
$mathrmIRIS$ match or beats detection on shared task, and adapt allocationss the matched-budget target-hit rate from 7,3$% to 8,7$%。
論文 参考訳(メタデータ) (2026-07-23T02:32:08Z) - The Representation-Rationalizability Tradeoff in Reward Learning [24.1466886968784]
社会的選択問題としてRLHFを訓練するが、各プロンプトに対して予め列挙された有限な応答を仮定する。
現代のパイプラインは、スカラーヘッドの前に学習した表現$(x,y)$でレスポンスをスコアするので、$はどのレスポンスが区別可能な代替品として扱われるかを決定する。
我々は、$$で構築された報酬の余剰エントロピー損失が、正確に表現項に分解され、よりリッチな$$が縮小し、よりリッチな$$が拡大する集約項に分解されることを示した。
論文 参考訳(メタデータ) (2026-05-29T19:22:41Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - The Last Word Often Wins: A Format Confound in Chain-of-Thought Corruption Studies [0.0]
補正研究は、どのステップが計算上重要なのかを、ステップが破損した場合の精度損失から推定する。
ベンチマークチェーンが明確な終端応答ラインに終止符を打つと、これらのテストは中間計算を行う場所ではなく、主に空腹者の配置を計測する。
論文 参考訳(メタデータ) (2026-05-11T16:26:50Z) - BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence [22.315546054051143]
大規模言語モデルのバイアス監査は、EU AI Actなどのガバナンスフレームワーク内で運用されている。
このプロトコルでは、各バイアススコアを2つの軸上での信頼性推定とともに報告する。
論文 参考訳(メタデータ) (2026-05-09T16:26:49Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Tight Convergence Rates for Online Distributed Linear Estimation with Adversarial Measurements [66.94250413799232]
分散パラメータ-サーバ-ワーカー設定における乱数ベクトル$X$の推定について検討する。
主な課題は、敵の計測と非同期である。
その結果, 分散線形推定におけるロバスト性, 識別性, 統計的効率の統一的有限時間評価が得られた。
論文 参考訳(メタデータ) (2026-04-07T11:45:55Z) - Reinforcement Learning from Multi-Source Imperfect Preferences: Best-of-Both-Regimes Regret [71.69884486156359]
我々は, 累積的不完全化予算を用いて, エンフルティソースの不完全性選好からエピソードRLを考察した。
我々は,最良な登録行動を示す,後悔$tildeO(sqrtK/M+)$の統一アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:34:53Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。