論文の概要: InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost
- arxiv url: http://arxiv.org/abs/2607.05968v1
- Date: Tue, 07 Jul 2026 08:04:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.439624
- Title: InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost
- Title(参考訳): InfluMatch: 4BモデルでFrontier-Quality KOL検索
- Abstract要約: 私たちは、小さなオープンウェイトモデルで作られた安価な3段階のカスケード -- 検索$rightarrow$rerank$rightarrow$ reason -- を提示します。
このカスケードはコストのために設計されており、フィルターされたトップ10ハーフのトークンを、50点以上のトークンを推論するのに対して、14点以上のトークンを推論する。
その結果、フロンティアサービスコストのごく一部で、デプロイ可能で説明可能なKOLサーチシステムとなった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Matching influencers (KOLs) to free-form, multi-part Thai marketing criteria is today served either by keyword search over structured profiles, which misses semantic fit, or by prompting frontier LLMs over every candidate, which is accurate but slow and expensive. We present InfluMatch, a low-cost three-stage cascade -- retrieval $\rightarrow$ rerank $\rightarrow$ reason -- built entirely from small open-weight models: dense retrieval returns 50 candidates, a 4B pointwise reranker scores each by the log-probability of a single Yes token and keeps 10, and a 4B reasoner grades the shortlist per criterion on a rubric with a Thai rationale. The cascade is designed for cost: reasoning over a filtered top-10 halves token spend versus reasoning over all 50 while scoring 14 points higher. End-to-end against human relevance labels on an 11-query set with all 50 candidates labeled, the full cascade reaches 94.1% P@5, versus a retrieval-only baseline near random; it matches the frontier model Kimi-K2.6 (91.8%) while emitting ${\sim}35\times$ fewer output tokens and serving a 50-KOL query in ${\sim}20$ s on one A100. Notably, the only fine-tuning that pays off is pairwise: a SimPO-tuned reranker matches the frontier baseline's best-pick accuracy (78.0 EM), whereas fine-tuning the reasoner on pointwise per-criterion labels improves offline scores yet degrades end-to-end ranking -- an inversion we trace to the design of the absolute labeling task -- leaving the untuned base model as the strongest deployed reasoner. The result is a deployable, explainable KOL search system at a small fraction of frontier serving cost.
- Abstract(参考訳): 自由形式のタイのマーケティング基準にマッチするインフルエンサー(KOL)は、現在、構造化プロファイル上のキーワード検索によって提供されており、セマンティック適合を見逃している。
InfluMatchは低コストの3段階カスケードで、検索$\rightarrow$ rerank $\rightarrow$ reason -- 完全に小さなオープンウェイトモデルから構築されている: 密集した検索は50の候補を返却し、4Bのポイントワイズ・リランカは1つのYesトークンのログ確率でそれぞれスコアを取得し、10を保持し、4Bの理性はルーブリックの基準値当たりのショートリストを負の論理値で評価する。
このカスケードはコストがかかるよう設計されており、フィルターされたトップ10ハーフのトークンを、50点以上のトークンを推論するのに対して、14点以上のトークンを推論する。
1つのA100で${\sim}35\times$より少ない出力トークンと${\sim}20$ sで${\sim}20$50-KOLクエリを提供するとともに、フロンティアモデルのKim-K2.6 (91.8%)と一致する。
SimPOで調整されたリランカはフロンティアベースラインのベストピック精度(78.0 EM)にマッチするが、ポイント単位のラベルを微調整するとオフラインスコアが向上するが、エンドツーエンドのランキングは低下する。
その結果、フロンティアサービスコストのごく一部で、デプロイ可能で説明可能なKOLサーチシステムとなった。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Are Near-Tied LLM Rankings Robust to Family-DIF-Guided Benchmark Recomposition? [0.0]
小さなリーダーボードギャップは、ある言語モデルが他の言語よりも優れているという証拠として解釈されることが多いが、その兆候はどのベンチマーク項目が含まれているかによって異なるかもしれない。
5つのベンチマークからの項目レベルの応答と、多次元アイテム応答理論に対する家族ラベルのないスペクトル近似を用いてこれを検証する。
論文 参考訳(メタデータ) (2026-08-31T23:29:50Z) - Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance [2.8543100656957883]
共有作業空間に対する管理作業者の足場の影響について検討する。
監督のオプス5は1回のパスで91%の得点を記録した。
マネジャーの実行はトークンの請求書を3倍にしますが、より大きなモデルに移行するよりも、より安価で精度が得られます。
論文 参考訳(メタデータ) (2026-08-27T00:11:41Z) - InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - Operadic consistency: a label-free signal for compositional reasoning failures in LLMs [11.547457355495903]
我々は、このアイデアを操作整合性(OC)として、要求ごとの信号としてインスタンス化する。
OCは各データセットの精度と強く相関している。
モデル自身の思考連鎖から分解が抽出される5つのフロンティア思考モデルにおいて、同じ同コスト比較は正の選択的予測点推定リフトを与える。
論文 参考訳(メタデータ) (2026-06-11T17:50:40Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - Correcting Selection Bias in Sparse User Feedback for Large Language Model Quality Estimation: A Multi-Agent Hierarchical Bayesian Approach [0.9558392439655014]
本研究では, 個別の相互作用に対して, 地絡ラベルを必要としない3次元階層型ベイズパイプラインを提案する。
フィードバックチャネル(典型的には正のフィードバック率と負のフィードバック比)の軽度先行は、バイアス比が一掃されるにつれて階層的インフォームドは4-13 pp of $Qstar$ に留まる。
チャネル側の先行がなければ、すべての弱いプライオリティは、22-33 pp.で$Qstar$を逃す。
論文 参考訳(メタデータ) (2026-05-12T14:22:06Z) - Sharp Capacity Thresholds in Linear Associative Memory: From Winner-Take-All to Listwise Retrieval [59.859592671274704]
$dtimes d$ リニアメモリストアはいくつのキー値アソシエーションが可能ですか?
この答えは、メモリマトリックスの$d2$自由度だけでなく、検索基準にも依存する。
論文 参考訳(メタデータ) (2026-05-06T17:53:20Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - BLITZRANK: Principled Zero-shot Ranking Agents with Tournament Graphs [14.085089126904101]
我々は、$k$-wiseランキングの原則となる基盤を提供するトーナメントグラフフレームワークを導入する。
それぞれ$k$-item比較すると、$binomk2$の完全なトーナメントがペアワイズで表示される。
我々は、アイテムのランクが確実に決定されたときを形式化し、情報ゲインを最大化する欲求クエリスケジュールを設計する。
論文 参考訳(メタデータ) (2026-02-05T08:41:00Z) - HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions [50.61510609116118]
HuggingR$4$は、Reasoning、Retrieval、Refinement、Reflectionを組み合わせて効率的にモデルを選択する新しいフレームワークである。
作業性率は92.03%、理性率は82.46%に達し、それぞれ26.51%、33.25%を超える。
論文 参考訳(メタデータ) (2025-11-24T03:13:45Z) - Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting [65.00288634420812]
Pairwise Ranking Prompting (PRP)は、大規模言語モデル(LLM)の負担を大幅に軽減する手法である。
本研究は,中等級のオープンソースLCMを用いた標準ベンチマークにおいて,最先端のランク付け性能を達成した文献としては初めてである。
論文 参考訳(メタデータ) (2023-06-30T11:32:25Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。