論文の概要: The Copy Ceiling: An Input-Exposure Control for Ontology-Grounded Generation over Curated Corpora
- arxiv url: http://arxiv.org/abs/2609.24885v2
- Date: Tue, 29 Sep 2026 10:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.516653
- Title: The Copy Ceiling: An Input-Exposure Control for Ontology-Grounded Generation over Curated Corpora
- Title(参考訳): Copy Ceiling: 硬化コーパスを用いたオントロジー生成のための入力露光制御
- Abstract要約: 我々は、維持されたコーパスに置換可能な言語モデルを基盤とするノードを構築し、その成功した外観評価がサポートできるかどうかを尋ねました。
10台のモデルで目標名リコールが0.265から0.92に引き上げられた。
コピーベースライン、表示されたコンテキストの冗長コピーのリコールは、既に達成され、0.964でスコアされ、すべてのモデルは0.022から0.067の下に位置する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We built a node that grounds a replaceable language model in a maintained ontology corpus, then asked what its successful-looking evaluation could support. Across ten models, grounding raised target-name recall from 0.265 unaided to about 0.92. A copy baseline, the recall a verbatim copy of the shown context already achieves, scores 0.964, and every model sits 0.022 to 0.067 below it. Copying therefore scores higher on this limited recall measure, which does not assess whether answers are better. The comparison tests what a recall score establishes; it does not test whether reasoning occurred, because a reasoned answer and a copy score alike when the answer name is already in context. We report exposure accounting (four counts classifying each gold item by whether the context exposed it and the answer recovered it) and a model-judged audit of 423 sampled item observations. A separate paired production study found a model-judged quality gain of +0.27 [+0.11, +0.45] on a 0-5 scale. Operational studies found failures that recall alone would not show: rephrasing questions out of the graph's vocabulary cut exposure from 0.964 to 0.328, yet the absence-keyed fallback would have fired on only 2 of 506; and inserting extracted facts degraded judged pages in every arm, so that step was disabled. Five-arm controls show that any well-formed on-corpus block beats no context but do not establish that the specific content matters, and no matched comparison against flat-text retrieval was run. The corpus is public and largely LLM-generated, which establishes neither training exposure nor novelty. Each study has its own outcome measure. Where gold derives from the injected corpus, we recommend reporting the accounting beside quality judgements, not in place of them.
- Abstract(参考訳): 私たちは、保守オントロジーコーパスに置換可能な言語モデルを構築するノードを構築しました。
10台のモデルで目標名リコールが0.265から0.92に引き上げられた。
コピーベースライン、表示されたコンテキストの冗長コピーのリコールは、既に達成され、0.964でスコアされ、すべてのモデルは0.022から0.067の下に位置する。
したがって、この限られたリコール尺度では、解答が良いかどうかを評価できないため、コピーはより高いスコアを得る。
理由付けされた答えとコピースコアは、既に応答名がコンテキストにあるときと同様であるからである。
本報告では, 調査対象品目423点について, 調査対象品目4点, 調査対象品目4点, 調査対象品目423点, 調査対象品目4点を報告した。
別のペア生産研究では、0-5スケールで0.27[+0.11, +0.45]のモデルジャッジ品質が上昇した。
グラフの語彙から質問を言い換えると、0.964から0.328への露出が減ったが、鍵のないフォールバックは506のうち2つしか発火しなかった。
ファイブアーム制御は、よく整形されたオンコーパスブロックがコンテキストに反することはないが、特定のコンテンツが重要であることを確証せず、フラットテキスト検索と一致した比較が実行されなかったことを示す。
コーパスは公開されており、ほとんどLLM生成であり、トレーニング露光も新規性も確立していない。
各研究には独自の結果指標がある。
金が注入されたコーパスに由来する場合、我々はそれらの代わりではなく、品質判断の横で会計を報告することを推奨する。
関連論文リスト
- CARRE: Counterfactual Action Retrieval and Reason Evaluation for Explainable Churn Prescription [5.823033362443801]
CARREは,検索強化候補生成,費用対効果評価,大規模言語モデル(LLM)推論を組み合わせた3段階のフレームワークである。
IBM Telco Customer Churnデータセットでは、CARREは通常のSHAPベースラインよりも79.8%高い平均モデル予測リスク削減を実現している。
論文 参考訳(メタデータ) (2026-09-09T06:08:02Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - The Exclusion Ratchet: False-Positive Suppression Accumulates and Persists in Detection Rule Repositories [0.0]
ルールがあまりにも多くの誤報を発生させた場合、アナリストは除外を加える。
近年の縦断作業では、キュレーションは収束しないが、後に回復したリビジョンのためにのみ回復時間を計測した。
9年と8,234回のSigmaHQ corpusの改訂を行い、意味論的に抑制を検出し、ブラインドハンドラベリングに対して検証した。
論文 参考訳(メタデータ) (2026-08-31T16:40:24Z) - Invocation-Level Reliability of Tool-Using Agents [0.7874708385247353]
クリーンな教師強化コンテキストと,モデル独自のフリーランニングコンテキストの両方の下で,その2つを分離する,正しい起動率を測定する。
深さ6では、モデル自身のクリーンコンテキスト能力の約70%が、以前の失敗に失われる。
論文 参考訳(メタデータ) (2026-08-23T09:04:59Z) - Phantom Gains: Auditing Self-Improvement Against a Measured Null [10.74609430659738]
我々は、Qwen3-8Bで32ドル(約2万2000円)のLoRA自己訓練を行い、同じパイプラインを通り抜ける凍結制御を行った。
我々は7つの測定失敗を識別し、それぞれが、その制御が欠如しているときに報告された発見を逆転させる。
論文 参考訳(メタデータ) (2026-08-20T17:30:14Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。