論文の概要: Knowing When Not to Answer: Cross-Domain and Multi-Turn Generalization of Latent Underspecification Signals
- arxiv url: http://arxiv.org/abs/2610.08413v1
- Date: Tue, 06 Oct 2026 14:18:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.035451
- Title: Knowing When Not to Answer: Cross-Domain and Multi-Turn Generalization of Latent Underspecification Signals
- Title(参考訳): 答えるべきでないことを知る:潜時不特定信号のクロスドメインおよびマルチTurn一般化
- Abstract要約: 解答不可能性は隠蔽状態から線形に退避可能であるが、どの形が表現を共有し、その信号が対話で有用であるかは定かではない。
我々は,ターンラベル付きマルチターンベンチマーク(会話423件,ラベル付きターンステート1,661件)と,明確な質問に答える模擬ユーザによる評価手法を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models routinely answer questions that cannot be answered from the information given, and in dialogue they answer before enough has been said. Unanswerability is linearly decodable from hidden states, but it is unclear which of its forms share a representation and whether the signal is useful in dialogue. We contribute a turn-labeled multi-turn benchmark (423 conversations, 1,661 labeled turn-states) and an evaluation harness with a simulated user who answers clarifying questions, and use them with six datasets and six open-weight LLMs to test how far probes for unanswerability carry. Probes transfer robustly between datasets that share a ground of unanswerability: missing information in math (AUROC 0.77-0.97) and in a passage (SQuAD 2.0<->MuSiQue, 0.77-0.90). Probes for epistemic "known-unknowns" transfer poorly to math, but this separation weakens under lexical controls and changes with layer and coordinate system, so it remains unresolved. Single-turn probes fail zero-shot to detect when a conversation becomes answerable; in-structure probes recover it, but no better than a bag-of-words classifier. A gate on the calibrated probe, with no model fine-tuning, fires on underspecified turns far more precisely than chance, and its end-task success comes within 0.08 of a gate given the true labels. Yet across four models it does not reliably beat vanilla generation or prompted consolidation. The remaining gap lies mostly in how models use a clarification, not in detection.
- Abstract(参考訳): 大きな言語モデルは、与えられた情報から答えられない質問に定期的に答える。
解答不可能性は隠蔽状態から線形に退避可能であるが、どの形が表現を共有し、その信号が対話で有用であるかは定かではない。
我々は、ターンラベル付きマルチターンベンチマーク(423の会話、1,661のラベル付きターンステート)と、明確な質問に答えるシミュレートされたユーザによる評価ハーネスを提供し、それらを6つのデータセットと6つのオープンウェイトLDMで使用して、未解決のプローブがどれだけ遠くまで行くかをテストする。
AUROC 0.77-0.97) と、SQuAD 2.0<->MuSiQue, 0.77-0.90) の節にある。
しかし、この分離は語彙制御の下で弱まり、層や座標系によって変化するため、未解決のままである。
シングルターンプローブはゼロショットに失敗し、会話が応答可能になったときを検出する。
キャリブレーションされたプローブのゲートは、モデルが微調整されていないため、未指定の点火は偶然よりもはるかに正確になり、そのエンドタスクの成功は、真のラベルが与えられたゲートの0.08以内となる。
しかし、4つのモデルでバニラ世代を確実に打ち負かしたり、統合を促したりしない。
残りのギャップは、主にモデルが検出においてではなく、明確化を使用する方法にある。
関連論文リスト
- Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself [1.43494686131174]
セマンティックエントロピーは,小モデルの誤りを確実に識別し,ランダムエスカレーションよりも経路精度を向上させることを示す。
また、AUROC 0.908から確率レベル0.518までの崩壊を正確に予測することで、新しいデータセットで機能するかどうかの予測方法も示しています。
論文 参考訳(メタデータ) (2026-10-05T20:22:34Z) - Relevance Is Not Sufficient Evidence: Detecting Evidence Gaps Before Generation in RAG [2.164748306809488]
Retrieval-augmented Generationは、外部ソースで大きな言語モデルを構築する。
12個の発電機が40.0-99.3%の証拠不十分な質問に答えている。
質問のすべての部分がカバーされているか、どの文が答えを提供するのか、そして、その文を一緒に読んでいる小さな言語モデルで十分な判断を下すか、という3つの信号を組み合わせてRINSEを紹介する。
論文 参考訳(メタデータ) (2026-09-27T17:39:51Z) - Do LiDAR Language Models Really Understand Spatio-temporal Relationships? [62.56505727364142]
ベンチマークと診断プロトコルであるLiDAR-Halluを150 nusのシーンで紹介する。
提案プロトコルは,固定回答と候補コンテンツ制御,クロスシーンペアを同一のプロンプトで組み合わせるが,参照応答は逆で,リレーショナルなリコールを行う。
記録された10万の応答の分析は、集合的空間精度によって隠された失敗を明らかにする。
論文 参考訳(メタデータ) (2026-09-21T11:59:07Z) - Legible Failures: Detecting and Repairing In-Context Binding Errors [0.0]
間違った答えは、モデルが必要な情報を欠いているか、保持していたかを示していない。
16の公的なチェックポイントで、それぞれが3つのシードで評価される頻度を測定します。
インコンテキストバインディングは、プローブが動作可能な設定であることに気付きました。
論文 参考訳(メタデータ) (2026-09-10T08:20:15Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - Eliciting Latent Knowledge from Quirky Language Models [1.8035046415192353]
潜在知識の排除は、世界の本当の状態を確実に追跡する能力のあるニューラルネットワークのアクティベーションのパターンを見つけることを目的としている。
12のデータセットと、質問に答える際の体系的なエラーを微調整した「奇抜な」言語モデル(LM)スイートを導入します。
特に中層では、線形プローブは通常、LMが出力するものとは無関係に、LMの知識を報告する。
論文 参考訳(メタデータ) (2023-12-02T05:47:22Z) - R-Tuning: Instructing Large Language Models to Say `I Don't Know' [66.11375475253007]
大きな言語モデル(LLM)は、優れたパフォーマンスで多くのドメインに革命をもたらしたが、それでもその課題に直面している。
事前の指導チューニング方法は、モデルが知識を知っているかどうかに関わらず、モデルに文章を完成させるよう強制する。
我々はRefusal-Aware Instruction Tuning (R-Tuning)と呼ばれる新しいアプローチを提案する。
実験の結果、R-Tuningは、既知の質問に答えたり、未知の質問に答えるのを控えるモデルの能力を効果的に改善することを示した。
論文 参考訳(メタデータ) (2023-11-16T08:45:44Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。