論文の概要: SearchJev: A Fast and Calibrated System-1 Model for Search Agents
- arxiv url: http://arxiv.org/abs/2610.05107v1
- Date: Sun, 04 Oct 2026 10:30:40 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:32:50.699129
- Title: SearchJev: A Fast and Calibrated System-1 Model for Search Agents
- Title(参考訳): SearchJev: 検索エージェントのための高速で校正されたSystem-1モデル
- Abstract要約: 本稿では,検索決定をシステム2の推論と生成から分離する,高速で校正されたSystem-1モデルであるSearchJevを提案する。
SearchDecision-Benchでは、SearchJevは、同じサイズのQwen3.5自動回帰モデルよりも意思決定品質を改善し、5.2-5.3倍の高速な判定を実現し、平均的なキャリブレーション誤差を41-74%削減する。
BrowseComp-Plusでは、二重システムエージェントはアクティブ検索時間の3.7-4.7倍の高速化を実現し、回答精度は45%から54%に向上した。
- 参考スコア(独自算出の注目度): 17.905919656039636
- License:
- Abstract: Search agents repeatedly make short decisions about relevance, evidence sufficiency, and search actions. Using generative language models for these decisions introduces latency and unreliable confidence. We present SearchJev, a fast and calibrated System-1 model that separates search decisions from System-2 reasoning and generation. Given a search state and a decision schema, SearchJev directly scores legal options without autoregressive output generation. We propose Soft-Label Learning for Calibrated Decisions (SLCD) to learn decision probabilities from uncertain supervision and calibrate their confidence. In a dual-system search agent, SearchJev handles short decisions and delegates uncertain judgments to System 2, which retains planning, query generation, and answer composition. We also introduce SearchDecision-Bench, a benchmark unifying six types of search decisions for training and evaluation. On SearchDecision-Bench, SEARCHJEV improves decision quality over same-size Qwen3.5 autoregressive models, achieves 5.2-5.3 times faster decisions, and reduces average expected calibration error by 41-74%. On BrowseComp-Plus, the dual-system agents achieve a 3.7-4.7 times speedup in active search time while improving answer accuracy from 45% to up to 54%.
- Abstract(参考訳): 検索エージェントは、関連性、証拠不十分性、検索アクションについて、短い判断を繰り返します。
これらの決定に生成言語モデルを使用することで、レイテンシと信頼できない信頼性が導入される。
本稿では,検索決定をシステム2の推論と生成から分離する,高速で校正されたSystem-1モデルであるSearchJevを提案する。
検索状態と決定スキーマが与えられた場合、SearchJevは自動回帰出力生成なしで法的オプションを直接得点する。
我々は,不確実な監視から意思決定確率を学習し,信頼性を校正するために,SLCD(Soft-Label Learning for Calibrated Decisions)を提案する。
二重システム検索エージェントでは、検索Jevは短い判断を処理し、不確実な判断をシステム2に委譲する。
また、トレーニングと評価のための6種類の検索判断を統一するベンチマークであるSearchDecision-Benchを紹介した。
SearchDecision-Benchでは、SEARCHJEVは、同一サイズのQwen3.5自動回帰モデルよりも意思決定品質を改善し、5.2-5.3倍の高速な判定を実現し、平均的なキャリブレーション誤差を41-74%削減する。
BrowseComp-Plusでは、二重システムエージェントはアクティブ検索時間の3.7-4.7倍の高速化を実現し、回答精度は45%から54%に向上した。
関連論文リスト
- VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks [56.74345405508208]
LLMエージェントはますます複雑で長期のタスクをこなし、そのアウトプットを検証することがますます困難になっている。
本研究では, 基準応答へのアクセスや試験時の潤滑油の分解を行わずに, 固定ベースモデルで検証能力を強化する方法について検討する。
コンセンサスによってエラーを隠蔽できる一方で、不一致はしばしば正しい代替手段を公開することに気付きました。
これらの観察はVeriHarnessを動機付け、ジェネレータが使用する基礎となるLLMを、ワークスペース、エビデンスツール、再利用可能な検証スキルを与えることによって、エージェント検証器に変える。
論文 参考訳(メタデータ) (2026-10-01T03:02:17Z) - StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams [0.0]
言語モデルは、新しいものが到着するまで、最新の回答を適用するアプリケーションにおいて、ますますリアルタイムな決定をする。
遅れた答えは、顧客がカードの詳細を読み出している間、コールレコーダーがまだ実行されているなど、古い決定を延ばすことができる。
StreamDecisionBench(SDB)は、4つのアプリケーションファミリで8つのストリーミングシナリオのデータセットで、パブリックルールから導かれる参照決定を実行可能なものにします。
論文 参考訳(メタデータ) (2026-09-29T22:15:49Z) - Benchmarking System One decision models against trained classifiers and language models for automated decision gates [1.089614199781423]
小さな訓練された分類器は意図に対して最も正確である。
微調整された決定チェックポイントは、修正されていないバックボーンに対して意図的な精度を得る。
意図的に訓練された第1ステージがJevにエスカレートされ、その正確さは、全グラフィックスプロセッサ使用時のコストの0.43と一致する。
論文 参考訳(メタデータ) (2026-09-29T19:57:59Z) - Calibrated Decision Models for Autonomous Penetration-Testing Harnesses: JEV and Laya as System One Decision Layers for LLM-Driven Pentest Agents [0.0]
システム1決定モデルが自律的な浸透テストハーネスをどのようにサポートするかを検討する。
本稿では,TypeSafe System One (Jev) とそれのないものと13の脆弱性を含むWebターゲットとを比較した探索的NeuroSploitケーススタディを提案する。
ドメイン適応型System OneモデルであるRaveを提案し、そのトレーニングデータ、評価プロトコル、およびハーネス保証に対する潜在的影響について概説する。
論文 参考訳(メタデータ) (2026-09-24T02:47:20Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention [61.82680155643223]
我々は,不整合決定境界の根本原因を同定し,蓄積した情報が回答するのに十分であるかどうかをしきい値に判定する。
これにより、過剰探索(十分な知識にもかかわらず冗長探索)と過度探索(早期終了)が誤った答えをもたらす。
まず,境界誤差を識別する因果的介入に基づく診断手法を提案する。
第2に,Deep Search Agent(DAS)のための決定境界アライメントを開発する。
我々のDAS法はこれらの境界を効果的に校正し、オーバーサーチとアンダーサーチの両方を緩和し、精度と効率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-02-03T09:29:06Z) - SmartSearch: Process Reward-Guided Query Refinement for Search Agents [63.46067892354375]
大言語モデル(LLM)に基づく検索エージェントは、知識集約的な問題に対処するために有望であることが証明されている。
既存の研究は主に、検索エージェントの推論パラダイムの最適化に重点を置いているが、推論中の中間的な検索クエリの品質は見過ごされ続けている。
この問題を緩和する2つの主要なメカニズムの上に構築されたフレームワークであるSmartSearchを紹介します。
論文 参考訳(メタデータ) (2026-01-08T12:39:05Z) - Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty [21.96443267949563]
エージェント検索型Augmented Generation (RAG) システムは,動的かつ多段階の推論と情報検索を可能にし,Large Language Models (LLM) を強化する。
これらのシステムは、オーバーサーチ(冗長な情報を取得する)やアンダーサーチ(必要な情報を取得するのに失敗する)のような準最適探索行動を示すことが多い。
この研究は、これらの振る舞いを公式に定義し、定量化し、複数のQAデータセットとエージェントRAGシステムにまたがるそれらの頻度を明らかにする。
論文 参考訳(メタデータ) (2025-05-22T20:57:56Z) - V-STaR: Training Verifiers for Self-Taught Reasoners [71.53113558733227]
V-STaR はモデル生成解の正しさを判断する DPO を用いて検証器を訓練する。
複数のイテレーションでV-STaRを実行すると、徐々により良い推論器と検証器が得られる。
論文 参考訳(メタデータ) (2024-02-09T15:02:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。