論文の概要: When Does a Second Model Help? Cross-Model Review in LLM Verification
- arxiv url: http://arxiv.org/abs/2610.01471v2
- Date: Tue, 06 Oct 2026 01:50:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.2578
- Title: When Does a Second Model Help? Cross-Model Review in LLM Verification
- Title(参考訳): 2番目のモデルはいつ役に立つか? LLM検証におけるクロスモデルレビュー
- Abstract要約: 大規模言語モデルを用いた制御実験において,モデル独立性を検証した。
最上位のクロスモデルレビュアは、新しいセッションで同じモデルレビューと大きく異なるものではない。
軽量なクロスモデルレビュアーは、同じモデルレビュー以上のスコアを得ない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models now generate code, documentation, and analyses, and are increasingly used to review such output. We ask when a second review by a different model helps. Building on the author's earlier preprints, which varied context, repetition, and role structure within one model, we test model independence in a controlled experiment: 30 artifacts with 150 planted errors, 10 review conditions, and 900 review sessions with three reviewer models from two developers. In this experiment, (1) a top-tier cross-model reviewer is not significantly different in F1 from same-model review in a fresh session (CCR), which does not establish equivalence; (2) the two find partly different errors (Jaccard 41.2%); and (3) at two review calls, one CCR plus one cross-model review matches more planted errors than two CCR reviews (56.7% vs. 42.7%; Holm-adjusted p=.006), but not significantly more than two reviews by the top-tier cross-model reviewer, so model difference and reviewer capability are not separated. A lightweight cross-model reviewer scores no higher than same-model review. Withholding requirements from the reviewer raises F1 for the two lower tiers but not the top tier, in untested point estimates whose pattern depends on how failed sessions are scored. Before analysis we audited all session records, excluding one baseline run of uncertain provenance and 14 failed calls; results with all sessions are also reported. A partial check on public detector outputs from another benchmark neither replicates nor contradicts the main comparison. Records, artifacts, and scripts are available from the author on request.
- Abstract(参考訳): 大規模な言語モデルは、コード、ドキュメント、分析を生成するようになり、そのアウトプットをレビューするのにますます使われています。
私たちは、異なるモデルによる2つ目のレビューがいつ役に立つか尋ねる。
著者の以前のプレプリントに基づいて、1つのモデル内でコンテキスト、反復、ロール構造が変化し、制御された実験でモデル独立性をテストする。
本実験では,(1) 最上位のクロスモデルレビュアとF1の同モデルレビュー(CCR)とでは等価性を確立しない新セッション(CCR)と,(2) 部分的に異なるエラー(Jaccard 41.2%),(3) 2回のレビューコールでは,CCR+1つのクロスモデルレビュアが2回のCCRレビュー(56.7% vs. 42.7%),ホルム調整p=.006)よりも植込みエラーに一致しているが,上位のクロスモデルレビュアによる2回以上のレビューでは,モデル差とレビュア能力は分離されない。
軽量なクロスモデルレビュアーは、同じモデルレビュー以上のスコアを得ない。
レビューアからの要求を無視すると、2つの下位層に対してF1が上昇するが、上位層ではない。
分析の前に、不確実性のある1つのベースライン実行と14のコールの失敗を除いて、すべてのセッション記録を監査しました。
別のベンチマークから出力された公開検出器の部分的なチェックは、メインの比較を再現も矛盾もしない。
レコード、アーティファクト、スクリプトは、要求に応じて作者から入手できる。
関連論文リスト
- Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding [65.85599131866623]
私たちはJevとContractNLIの9つの言語モデルを比較します。
制御された比較は、仮説の可視性、要求された出力、および出力順序によって異なる。
Jevは、評価された構成の中で、最低コストと中央値のレスポンス時間を持っています。
論文 参考訳(メタデータ) (2026-09-23T10:53:01Z) - More Criticism Does Not Make a Better Review: EquiReview-R [5.8331781561663645]
我々は、AI支援レビューを、構造化された関心事セットのエビデンスガイダンスによる洗練として再考した。
EquiReview-Rを導入し、局所的な証拠に対する既存の懸念を解決する。
未確認論文の凍結コホート上では、EquiReview-R は未定の非不等式基準を満たす。
論文 参考訳(メタデータ) (2026-09-03T14:49:24Z) - Reviewer Capability Governs Rejection Targeting, Not Repair Skill: Evidence from LLM Execute-Review-Revise Pipelines [0.0]
マルチエージェントのLLMパイプラインは、実行と検証を含む役割を、異なる機能階層のモデルに割り当てる傾向にある。
以前の文献では、検証段階は必ずしも有益であるとは限らないが、実行者に対してほぼ固定されたレビュアー能力を有していることが確認されている。
我々は、レビュアーを能力の範囲を全く解決できないモデルに置き換え、個々の拒絶の結果を計測する。
論文 参考訳(メタデータ) (2026-09-02T19:21:49Z) - Certifying Compressed Language Models: An Audit and a Statistical Toolkit [0.0]
正解率は, 正解率の約5倍であり, 正解率と正解率は同一であり, 個々の項目では相変わらず一致しない。
誰も有望な数値等価マージンを示しておらず、タスクマッチングされた各イテム出力はリリースしない。
欠落した機器: 宣言されたマージンでペア同値テストを行い、認定表に評価要求を与えます。
論文 参考訳(メタデータ) (2026-08-15T05:15:35Z) - More Rounds, More Noise: Why Multi-Turn Review Fails to Improve Cross-Context Verification [0.0]
マルチターンレビューでは、リビューアがフォローアップ質問をしたり、著者からの回答を受け取り、再レビューを行うことができる。
制御実験では,シングルパスCCRベースラインに対して4種類のD-CCR変異体を試験した。
問題はレビュアーが見ているものではありませんが、そのレビューは再びノイズを招きます。
論文 参考訳(メタデータ) (2026-03-17T08:29:29Z) - Cross-Context Review: Improving LLM Output Quality by Separating Production and Review Sessions [0.0]
本稿では,CCR(Cross-Context Review)について紹介する。
30のアーティファクト(コード、テクニカルドキュメント、プレゼンテーションスクリプト)に150のエラーがあり、同じセッションの自己レビュー(SR)、繰り返しの自己レビュー(SR2)、コンテキスト対応のサブエージェントレビュー(SA)、CCRの4つのレビュー条件の下でテストされました。
CCRはどんなモデルでも動作し、インフラストラクチャを必要としない。
論文 参考訳(メタデータ) (2026-03-12T16:26:38Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - Towards Personalized Review Summarization by Modeling Historical Reviews
from Customer and Product Separately [59.61932899841944]
レビュー要約(review summarization)は、Eコマースのウェブサイトで製品レビューのメインの考え方を要約することを目的とした、簡単ではないタスクである。
Heterogeneous Historical Review aware Review Summarization Model (HHRRS)を提案する。
我々は、レビュー感情分類と要約を共同で行うマルチタスクフレームワークを採用している。
論文 参考訳(メタデータ) (2023-01-27T12:32:55Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。