論文の概要: Text Corpora as Concept Fields: Black-Box Hallucination and Novelty Measurement
- arxiv url: http://arxiv.org/abs/2605.05103v1
- Date: Wed, 06 May 2026 16:38:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.936933
- Title: Text Corpora as Concept Fields: Black-Box Hallucination and Novelty Measurement
- Title(参考訳): コンセプトフィールドとしてのテキストコーパス:ブラックボックスの幻覚とノベルティ測定
- Abstract要約: テキストコーパスの**Concept Field**は、連続する文間のデルタから推定される文埋め込み空間において、不確実な局所的ドリフト場である。
我々は、観測されたデルタとフィールドの局所ガウス推定の間の平均的な絶対的なz-距離である$で、フィールドとの合意を採点する。
スコアはブラックボックス(モデル内部は含まない)、コーパス属性(全てのスコアは近くのコーパス文に痕跡がある)で、直接の読み取りを許可する。
- 参考スコア(独自算出の注目度): 3.035872403903575
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce the **Concept Field** of a text corpus: a local drift field with pointwise uncertainty, estimated in sentence-embedding space from the deltas between consecutive sentences. Given a candidate sentence transition, we score its agreement with the field by $ζ$, the mean absolute z-distance between the observed delta and the field's local Gaussian estimate. The score is black-box (no model internals), corpus-attributable (every score traces to nearby corpus sentences), and admits a direct probabilistic reading. We support the computation with the introduction of a **Vector Sequence Database (VSDB)** that stores embeddings together with sequence-position and next-delta metadata. We evaluate this approach on two large-scale settings: hallucination-style groundedness detection over the U.S. Code of Federal Regulations, and novelty detection over Project Gutenberg. Using controlled LLM-generated rewrites, Concept Fields achieve strong selective classification performance under a grounded / ungrounded / unsure triage policy, which unlike retrieval-centric baselines have similar coverage-risk behavior across both domains, supporting a probability-based interpretation that transfers across domains. We also sketch how divergence and curl of the Concept Field, computed on dense clusters, surface qualitatively meaningful semantic patterns (logic sources, sinks, and implicit topics), which we offer as hypothesis-generating rather than as a quantitative result. Concept Fields provide a fast, lightweight, and interpretable signal for groundedness and novelty, complementary to LLM-as-judge and white-box detectors.
- Abstract(参考訳): テキストコーパスの**Concept Field**は、連続する文間のデルタから推定される文埋め込み空間において、不確実な局所的ドリフト場である。
候補の文遷移が与えられたとき、観測されたデルタとフィールドの局所ガウス推定の間の平均的な絶対的なz距離である$=$のフィールドとの一致をスコア付けする。
スコアはブラックボックス(モデル内部は含まない)、コーパス属性(全てのスコアは近くのコーパス文に遡る)で、直接確率的読み上げが認められる。
我々は、**Vector Sequence Database (VSDB)*を導入して、埋め込みをシーケンスポジションと次のデルタメタデータと共に保存する計算をサポートする。
我々は,このアプローチを,米国連邦規則法における幻覚型基底性検出と,プロジェクト・グーテンベルクにおける新規性検出の2つの大規模環境で評価した。
制御された LLM 生成の書き直しを用いて、コンセプションフィールドは、検索中心のベースラインがドメイン間で同様のカバレッジリスクの振る舞いを持ち、ドメイン間で転送される確率ベースの解釈をサポートするような、接地/アングラウンド/アングラウンド/アングラウンドトリアージポリシーの下で、強力な選択的分類性能を達成する。
また、高密度クラスタ、表面定性的に意味のあるセマンティックパターン(論理的ソース、シンク、暗黙的なトピック)に基づいて計算されたコンセプトフィールドのばらつきとカールを、定量的結果ではなく仮説生成として提供する方法についてもスケッチする。
コンセプトフィールドは、LLM-as-judgeとホワイトボックス検出器を補完する、接地性と新規性のための高速で軽量で解釈可能な信号を提供する。
関連論文リスト
- Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach [58.15427952222424]
汎用的なテキスト埋め込みはそのようなタスクに広くデプロイされているが、意味的類似性は意味的に似ているがタスク固有の例を示すことができる。
本稿では,凍結したテキスト埋め込み上に構築された幾何正規化モジュールであるPGCL(Prototype-Guided Contrastive Learning)を紹介する。
論文 参考訳(メタデータ) (2026-08-15T13:19:25Z) - Reference-Induced Consensus for Selective Posed-Reference Visual Localization [11.166886974945806]
RIC-Locは、シーントレーニングなしのポーズ参照ローカライザである。
主推定器では、SfM-point-map-freeである。
論文 参考訳(メタデータ) (2026-07-06T06:48:34Z) - When Do Local Score Models Extrapolate Across Size? A Diagnostic Theory and Benchmark [0.0]
アーキテクチャの局所性だけでは、安定したサイズ外挿が保証されないことを示す。
我々はこの機構を定式化し、局所限界に対する大きさと一様の比較定理を証明した。
実験により,空間混合,平滑なスコア準局所性,およびモデル受容場間の相互作用を検証する。
論文 参考訳(メタデータ) (2026-06-08T16:24:31Z) - CIEC: Coupling Implicit and Explicit Cues for Multimodal Weakly Supervised Manipulation Localization [25.78477436147408]
Implicit と Explicit Cues (CIEC) の結合は、画像とテキストのペアに対するマルチモーダルな弱い教師付き操作のローカライゼーションを実現することを目的としている。
視覚とテキストの両方の観点から偽造の手がかりを統合し、空間的先行によって助けられた疑わしい領域にロックする。
後者では、意味のあるコンテンツワードに焦点を当て、相対的な視覚バイアスを利用してトークンのローカライゼーションを支援する。
論文 参考訳(メタデータ) (2026-02-02T14:46:38Z) - TOPol: Capturing and Explaining Multidimensional Semantic Polarity Fields and Vectors [0.0]
ToPolは多次元の物語の極性場を再構成し、解釈するためのフレームワークである。
このフレームワークは、Transformer-based large language model (tLLM)を使用してドキュメントを埋め込む。
我々はTOPolを2つのコーパスで評価する: (i)米国中央銀行のマクロ経済的なブレークポイントに関するスピーチ、(ii)Amazonの製品レビュー。
論文 参考訳(メタデータ) (2025-10-29T01:14:21Z) - Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - CPR++: Object Localization via Single Coarse Point Supervision [55.8671776333499]
粗い点修正(CPR)は、アルゴリズムの観点からの意味的分散を緩和する最初の試みである。
CPRは、アノテートされた最初のポイントを置き換えるために、近隣地域のセマンティックセンターポイントを選択することで意味のばらつきを減らす。
CPR++は、スケール情報を取得し、グローバル領域における意味的分散をさらに低減することができる。
論文 参考訳(メタデータ) (2024-01-30T17:38:48Z) - Divide and Contrast: Source-free Domain Adaptation via Adaptive
Contrastive Learning [122.62311703151215]
Divide and Contrast (DaC) は、それぞれの制限を回避しつつ、両方の世界の善良な端を接続することを目的としている。
DaCは、ターゲットデータをソースライクなサンプルとターゲット固有なサンプルに分割する。
さらに、ソースライクなドメインと、メモリバンクベースの最大平均離散性(MMD)損失を用いて、ターゲット固有のサンプルとを整合させて、分散ミスマッチを低減する。
論文 参考訳(メタデータ) (2022-11-12T09:21:49Z) - Contextual information integration for stance detection via
cross-attention [59.662413798388485]
スタンス検出は、著者の目標に対する姿勢を特定することを扱う。
既存のスタンス検出モデルの多くは、関連するコンテキスト情報を考慮していないため、制限されている。
文脈情報をテキストとして統合する手法を提案する。
論文 参考訳(メタデータ) (2022-11-03T15:04:29Z) - Concrete Score Matching: Generalized Score Matching for Discrete Data [109.12439278055213]
コンクレトスコア(Concrete score)とは、個別の設定のためのスコア(ステイン)の一般化である。
コンクレトスコアマッチング(Concrete Score Matching)は、サンプルからこのようなスコアを学習するフレームワークである。
論文 参考訳(メタデータ) (2022-11-02T00:41:37Z) - Contextualized Semantic Distance between Highly Overlapped Texts [85.1541170468617]
テキスト編集や意味的類似性評価といった自然言語処理タスクにおいて、ペア化されたテキストに重複が頻繁に発生する。
本稿では,マスク・アンド・予測戦略を用いてこの問題に対処することを目的とする。
本稿では,最も長い単語列の単語を隣接する単語とみなし,その位置の分布を予測するためにマスク付き言語モデリング(MLM)を用いる。
セマンティックテキスト類似性の実験では、NDDは様々な意味的差異、特に高い重なり合うペアテキストに対してより敏感であることが示されている。
論文 参考訳(メタデータ) (2021-10-04T03:59:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。