論文の概要: Verdicts Without Annotated Evidence: Rejection Sampling or Label-Only Post-Training for Evidence Recovery?
- arxiv url: http://arxiv.org/abs/2610.06962v1
- Date: Sat, 03 Oct 2026 17:01:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.480574
- Title: Verdicts Without Annotated Evidence: Rejection Sampling or Label-Only Post-Training for Evidence Recovery?
- Title(参考訳): 注釈付きエビデンスのない評定:証拠回収のための拒絶サンプリングかラベルのみの検査か?
- Abstract要約: 最小判定のラベルのみのトレーニングは精度0.896、F10.564に達する。
リジェクションサンプリングは、その判定がレコードと一致する場合にのみ生成されたトレースを保持し、その後、自動的なソースグラウンドスコアで1つを選択する。
1つのコーパス上の1つのシードは、どの方法が良いかを言うことはできないが、どちらも注釈を付けずに証拠を改善する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In many review workflows the verdict is the only thing retained. The passages behind it are not marked, because that annotation costs far more than recording the decision. We measure how much of that evidence a small language model can recover when it is post-trained on the verdicts alone, with no human evidence labels at any stage. On ContractNLI the human evidence spans are held out until evaluation. Matching the recorded verdict and agreeing with those spans are not the same thing: across six systems the two scores are only weakly related and rank the systems differently, so accuracy is a poor guide when the citations have to be reviewable. Label-only training on the bare verdict reaches accuracy 0.896 and span F1 0.564. Rejection sampling, which keeps a generated trace only when its verdict matches the record and then picks one by an automatic source-grounding score, reaches 0.797 and 0.556, against 0.747 and 0.493 before training. Verbatim citation rises from 0.597 to 0.729 under label-only training and to 0.701 under rejection sampling. One seed on one corpus cannot say which method is better, but both improve the evidence without anyone annotating it.
- Abstract(参考訳): 多くのレビューワークフローでは、評決が唯一の保持事項である。
なぜなら、このアノテーションは決定を記録するよりもはるかにコストがかかるからです。
その証拠のどれ程を、小さな言語モデルが、判決のみで訓練された後に回復できるかを計測し、いかなる段階においても人間による証拠ラベルも示さない。
ContractNLIでは、人間のエビデンスの範囲は評価まで保たれる。
6つのシステムにおいて、2つのスコアは弱い関係にあり、システムが異なるランク付けをするだけなので、引用をレビューする必要がある場合、精度は低いガイドとなります。
最小判定のラベルのみのトレーニングは精度0.896、F10.564に達する。
リジェクションサンプリング(rejection sample)は、その判定がレコードと一致したときのみ生成したトレースを保持し、その後、自動ソースグラウンドスコアで1つを選び、トレーニング前の0.747と0.493に対して0.797と0.556に達する。
ラベルのみのトレーニングでは0.597から0.729に、拒絶サンプリングでは0.701に上昇する。
1つのコーパス上の1つのシードは、どの方法が良いかを言うことはできないが、どちらも注釈を付けずに証拠を改善する。
関連論文リスト
- Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents [20.695725508890806]
コーディングエージェントは必要な振る舞いを省略する可塑性パッチを返すことができる。
3つのエージェントと101の制御されたケースからの411個の実行ラベル付きトレースについて検討した。
公式な実行証拠は、決定的なチェックが利用可能になったときの弱いレビューの可能性を示している。
論文 参考訳(メタデータ) (2026-10-01T04:10:59Z) - GroundedGEO: Auditing the Evidence Gap in Generative Search Rankings [4.058849693424635]
ジェネレーティブ検索システムは、製品とサービスを連続的な決定のためにランク付けする。
テキストのみのランク付けと防御は、作り出された細部から正直な詳細な内容を切り離すことはできない。
その結果,有望な変種では,清潔な候補よりも有意な正規化ランクが得られた。
論文 参考訳(メタデータ) (2026-09-21T17:07:10Z) - The Copy Ceiling: An Input-Exposure Control for Ontology-Grounded Generation over Curated Corpora [0.0]
我々は、維持されたコーパスに置換可能な言語モデルを基盤とするノードを構築し、その成功した外観評価がサポートできるかどうかを尋ねました。
10台のモデルで目標名リコールが0.265から0.92に引き上げられた。
コピーベースライン、表示されたコンテキストの冗長コピーのリコールは、既に達成され、0.964でスコアされ、すべてのモデルは0.022から0.067の下に位置する。
論文 参考訳(メタデータ) (2026-09-21T16:53:00Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation [41.01488608247856]
アウトカム検証器は、完了した推論トレースをスコアするが、中間トークンにクレジットを割り当てない。
原始的な自己蒸留は、モデル自身のロールアウトをトレーニング専用の情報で再現することで、このギャップを埋めようとする。
スコアがより良い行動を追跡するか、フィードバック構築が比較対象を変えるか、トレーニング損失が強化されるか、という3つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-10T08:18:48Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges [4.167333498582309]
言語モデルをそれ自身の参照なし判断に対して訓練することは、モデルが答えの正しさを判断することを前提にしている。
候補者に条件付きで、裁判官は正当性ではなく妥当性をスコアし、政策が悪用することを学習する偽陽性の盆地を残す。
論文 参考訳(メタデータ) (2026-07-07T06:59:30Z) - Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation [0.0]
大規模に言語モデルエージェントを評価することは、自動判断として第2の言語モデルに依存している。
このような裁判官は、信用できるかどうかにかかっているが、既存の裁判官はG-Evalのようにスコアリングのルーリックを手書きするか、審査員の重みを微調整するかのいずれかであり、どちらも成功として流動的だが失敗に終わった軌跡を信用する傾向がある。
本稿では,ラベル付きトラジェクトリに対する反射的進化により判断ルージェリクスを進化させ,環境報酬との一致を最大化し,凍結し,環境アクセスのない1つのモデルコールにおける保留トラジェリクスに適用するForgeForgeを提案する。
論文 参考訳(メタデータ) (2026-06-25T03:58:31Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News [47.03825808787752]
人間は、ニュース記事が人によって書かれたか、あるいは大きな言語モデル(LLM)によって書かれたかを知ることができますか?
本稿では,人間対機械(人間対機械)と正当性判定(正当性対偽判定)を連続的なスケールで測定する研究プラットフォームであるJiceGPTを用いて,この問題を考察する。
筆者らは,(1) 被験者が人文テキストから機械生成物を確実に識別できないこと,(2) 認知疲労による約30回の連続的な評価の後,その精度が低下すること,の5つを報告した。
論文 参考訳(メタデータ) (2026-04-04T15:03:42Z) - Non-Contrastive Self-Supervised Learning of Utterance-Level Speech
Representations [37.665503758394934]
本稿では, 発話レベルの埋め込みを学習するために, ラベル付き音声コーパスに対して, 非コントラスト型自己教師学習法を適用した。
対照的な方法とは異なり、DINOは負のサンプリングを必要としない。
これらの埋め込みは話者の検証と感情認識に基づいて評価された。
論文 参考訳(メタデータ) (2022-08-10T16:04:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。