論文の概要: Noēsis: Deterministic-First Retrieval with Two-Tier Context Hydration for Factuality-Critical Queries on Small Local Models
- arxiv url: http://arxiv.org/abs/2609.07663v1
- Date: Mon, 07 Sep 2026 15:49:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.461148
- Title: Noēsis: Deterministic-First Retrieval with Two-Tier Context Hydration for Factuality-Critical Queries on Small Local Models
- Title(参考訳): Noēsis:小さな局所モデル上でのファクチュアリティクリティカルなクエリのための2層コンテキストハイドレーションによる決定論的第一検索
- Abstract要約: 我々は、Noesisアーキテクチャの決定論的第一のクエリプレーンであるNoesisを提示する。
ノイズは生成前にすべての決定論的判断を下す。
報告されたすべての値は、その正確なソースと構築による位置にトレース可能である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A wrong number is worse than no answer. Across factuality-critical domains -- audience metrics, scheduling and rights in media; dosages and lab values in healthcare; figures and citations in finance and legal -- a confident but fabricated value is more damaging than an honest admission of uncertainty. Yet this is the dominant failure mode we observe on small local language models: even when correct evidence is present in context, models fabricate plausible numbers and timestamps. Recent work characterizes a real limit of this regime: below 7B parameters, the bottleneck of retrieval-augmented generation (RAG) is not retrieval quality but context utilization. We present Noesis, the deterministic-first query plane of the Noesis architecture, which makes every deterministic judgment before generation. Its mechanisms follow from the ingestion architecture (subject of a separate patent application): (a) a producer-side fact layer rendering precomputed metric facts verbatim without ranking; (b) positional addressing with deterministic cross-source alignment, resolved ahead of query time at zero LLM cost; (c) provenance scoping as an attribution constraint with multi-tier named-reference routing; and (d) two-tier context with model-triggered verbatim hydration. Across four ablations, a 2B model reaches parity with a 35B model on factual integrity (exact values in all runs; zero confabulated numbers on absent-entity traps); structured retrieval beats flat RAG by +11.4 points at 2B; skeleton-only context preserves quantitative answers at 20-30% smaller prompts; and hydration recovers verbatim narrative in ~8s versus ~29s. Two properties matter for regulated domains: each query resolves in a single generation call, and every reported value is traceable to its exact source and position by construction.
- Abstract(参考訳): 間違った数字は答えがないより悪い。
事実性に批判的な領域 — メディアにおける聴衆のメトリクス、スケジュール、権利 — 、医療における服従と検査の価値観 — 全体にわたって、財務と法的な数字と引用 -- は、自信はあるものの、製造された価値は、不確実性を正直に認めるよりも、より有害である。
たとえ正しい証拠がコンテキストに存在するとしても、モデルは可算数やタイムスタンプを作成します。
7Bパラメータ以下では、検索強化生成(RAG)のボトルネックは、検索品質ではなく、コンテキスト利用である。
Noesisアーキテクチャにおける決定論的第一のクエリプレーンであるNoesisについて述べる。
その機構は、摂取アーキテクチャ(別個の特許出願の目的)から従う。
(a) 生産者側の事実層が、事前計算された計量事実を格付けせずに口頭で表現すること。
b) LLMコストゼロでクエリ時間に先立って解決された決定論的クロスソースアライメントによる位置アドレッシング
(c)複数階層の命名参照ルーティングによる帰属制約としての証明スコーピング
(d)2段階の文脈とモデルトリガーによる口蓋水和反応
4つのアブレーションの中で、2Bモデルが35Bモデルと現実の整合性(実測値:全ランで0個の不一致トラップ)で一致し、構造化された検索は2Bで+11.4ポイント、スケルトンのみコンテキストは20~30%小さいプロンプトで定量的回答を保存し、ヒドラクションは8s対29sで動詞の物語を復元する。
各クエリは単一の世代コールで解決し、報告されたすべての値は、その正確なソースと構築による位置にトレース可能である。
関連論文リスト
- SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data [2.998247765202193]
コーパスレベルのモデルに依存しない汚染信号は生成モデルへのアクセスを必要とせず、生成履歴も合成ラベルも不要である。
我々は,小型オープンウェイト発生器が汚染したコーパスと,アウト・ワン・ジェネレータ・アウトプロトコルに基づく命令調整オープンウェイト・モデルについて検討した。
スコアは、ジェネレータファミリー全体が持ち出されるときにほとんど損失のない重大さでコーパスをランク付けする。
論文 参考訳(メタデータ) (2026-09-11T02:25:18Z) - Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact [0.0]
大規模言語モデルは、データベースに対する自然言語インターフェースを新たに信頼できるものにしたが、キャリブレーションされたテキストから集約されたシステムは、デプロイメントにおいて重要な方法で失敗している。
本稿では、生成シェルを持つ信頼カーネルである、そのようなシステムのためのアーキテクチャパターンを1つの不変量に基づいて提案する。
生成シェルは入力とフレーズの応答を解釈し、決定論的カーネルは、完全に指定された質問と解答可能な質問形状の有界集合とを一致させる。
この2つは、ユーザが何らかの値が計算される前に読む確認で一致し、カーネルが表現できない要求は、近似されるよりも減少する。
論文 参考訳(メタデータ) (2026-08-14T03:53:21Z) - DiagLoop: A Counterfactual Data Flywheel with Stage-Localized Reinforcement for Diagnostic LLMs [5.241146164724621]
DiagLoopは、認知された物理的関係や臨床ガイドラインをトレーニングの監督に変換する、反ファクト的なデータフライホイールである。
訓練のみの教師は様々な原因、文脈、観察によって反現実の世界を提案し、一方独立したハイブリッドチェッカーは有効な世界しか認めない。
非終端障害に対しては、境界付き修復プローブが下流のコンピテンスを探索し、その結果の弱点プロファイルがその後のデータ生成を導く。
論文 参考訳(メタデータ) (2026-08-04T13:49:41Z) - Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness [8.98920719663984]
Gamutは、長文生成における事実完全性のベンチマークである。
10の異なる領域にまたがって、実際のウェアラブル画像に基づく1,813の質問を作成します。
論文 参考訳(メタデータ) (2026-07-21T17:42:50Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction [0.0]
合成画像検索(CIR)は、コーパスに参照画像と修正方法を記述するテキストを検索する。
本稿では,CIRRの休眠補助アノテーションと対話アノテーションを復活させる,ベンチマークおよび人間検証型ユーザシミュレータであるAmbiCIRを紹介する。
論文 参考訳(メタデータ) (2026-05-23T15:49:16Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - On Reference (In-)Determinacy in Natural Language Inference [62.904689974282334]
我々は、自然言語推論(NLI)タスクにおける基準決定性(RD)仮定を再考する。
我々は、現在のNLIモデルは、入力前提と仮説が異なるコンテキストを参照できる事実検証のような下流アプリケーションでは失敗するのを観察する。
NLI例における参照曖昧性を特定するための診断ベンチマークであるRefNLIを紹介する。
論文 参考訳(メタデータ) (2025-02-09T06:58:13Z) - Fine-tuning Language Models for Factuality [96.5203774943198]
大規模な事前訓練型言語モデル(LLM)は、しばしば伝統的な検索エンジンの代替として、広く使われるようになった。
しかし、言語モデルは説得力のあるが事実的に不正確な主張をしがちである(しばしば「幻覚」と呼ばれる)。
本研究では,人間のラベル付けなしに,より現実的な言語モデルを微調整する。
論文 参考訳(メタデータ) (2023-11-14T18:59:15Z) - Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。
FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。
その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文 参考訳(メタデータ) (2023-07-13T17:14:38Z) - WiCE: Real-World Entailment for Claims in Wikipedia [63.234352061821625]
We propose WiCE, a new fine-fine textual entailment dataset built on natural claim and evidence pairs from Wikipedia。
標準クレームレベルのエンターメントに加えて、WiCEはクレームのサブ文単位に対するエンターメント判断を提供する。
我々のデータセットの真のクレームは、既存のモデルで対処できない検証と検索の問題に挑戦することを含んでいる。
論文 参考訳(メタデータ) (2023-03-02T17:45:32Z) - Factual Error Correction for Abstractive Summaries Using Entity
Retrieval [57.01193722520597]
本稿では,エンティティ検索後処理に基づく効率的な事実誤り訂正システムRFECを提案する。
RFECは、原文と対象要約とを比較して、原文から証拠文を検索する。
次に、RFECは、エビデンス文を考慮し、要約中のエンティティレベルのエラーを検出し、エビデンス文から正確なエンティティに置換する。
論文 参考訳(メタデータ) (2022-04-18T11:35:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。