論文の概要: TriAgent: Divergence-Aware Multi-Agent Committees for Cost-Efficient Financial Sentiment Analysis
- arxiv url: http://arxiv.org/abs/2607.19794v1
- Date: Wed, 22 Jul 2026 06:20:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.991
- Title: TriAgent: Divergence-Aware Multi-Agent Committees for Cost-Efficient Financial Sentiment Analysis
- Title(参考訳): TriAgent: 費用効率のよい金融センチメント分析のための多様性を意識したマルチエージェント委員会
- Abstract要約: TriAgentは、コンテキストの粒度によって成文化されたマルチエージェント委員会である。
3方向のディバージェンス指数は粒度の不一致を測る。
コード、レキシコン、SCDがリリースされる。
- 参考スコア(独自算出の注目度): 0.9861185030860833
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Production LLM-based financial sentiment analysis faces a structural cost trap: most queries are trivially classifiable, yet expensive cloud reasoners process them all, and the bill scales linearly with user count. We present TriAgent, a multi-agent committee stratified by contextual granularity -- a word-level lexicon (VADER), a sentence-level domain transformer (FinBERT), and a cross-sentence reasoner (Qwen2.5, 0.5B-14B-4bit, with Mistral-7B and Phi-3.5-mini cross-family checks). A three-way Semantic Divergence Index (SDI) measures pairwise disagreement across granularities and routes each query accordingly. Our central finding is the critic plateau: when the LLM is re-tasked as a critic over the smaller agents' outputs, F1 plateaus at ~0.87 across 1.5B-7B Qwen (bootstrap 95% CIs overlap), while a same-size 3-persona vote drops to F1=0.66, which is driven by granularity-stratified diversity. Three corollaries follow from the same SDI signal: (i) a Shared Consensus Dictionary on multilingual sentence-BERT answers 95% of Chinese queries from an English cache at F1=0.99 -- cross-border canonicalization at zero marginal cost; (ii) SDI doubles as a post-hoc LLM-hallucination detector at AUC=0.90; (iii) the SDI single-stage strategy attains the best risk-adjusted return (Sharpe=3.50) on a 20-ticker back-test, dominating both always-FinBERT (1.36) and always-LLM (0.11). At 10M-user scale, TriAgent saves $9.3M/year vs. a GPT-4o-mini baseline. Code, lexicons, and the SCD are released.
- Abstract(参考訳): ほとんどのクエリは自明に分類可能であるが、高価なクラウド推論者はそれらを全て処理し、請求書はユーザ数と線形にスケールする。
本稿では,単語レベルの語彙(VADER),文レベルのドメイン変換器(FinBERT),および文間推論器(Qwen2.5,0.5B-14B-4bit,Mistral-7B,Phi-3.5-miniクロスファミリーチェック)によって階層化されたマルチエージェント委員会であるTriAgentについて述べる。
3方向のSemantic Divergence Index(SDI)は、粒度をまたいだペアワイズ不一致を測定し、それに従ってクエリをルーティングする。
LLMがより小さなエージェントの出力に対する批判として再テークされたとき、F1高原は1.5B-7B Qwen (bootstrap 95% CIs overlap) で、同じ大きさの3人の投票はF1=0.66に減少し、粒度に定型化された多様性によって引き起こされる。
3つの行は、同じSDI信号から続く。
(i)多言語文の共有合意辞書(BERT)は、F1=0.99の英語キャッシュから中国語クエリの95%を回答する。
(II)SDIは、AUC=0.90におけるLLM幻覚後検出器として二重化する。
3)SDIシングルステージ戦略は、20ティンカーバックテストで最高のリスク調整リターン(シャープ=3.50)を獲得し、常にFinBERT (1.36) と常LLM (0.11) の両方を独占する。
10万ユーザ規模のTriAgentは、GPT-4o-miniベースラインに対して年間9.3Mを節約している。
コード、レキシコン、SCDがリリースされる。
関連論文リスト
- Your Retriever Already Knows: Distribution-Shape QPP for RAG Retrieval Sufficiency [0.0]
チェコの核レギュレータの展開を動機として,RAGにおける検索効率向上のためのクエリ性能予測(QPP)パラダイムを3つ比較した。
我々の24の非語彙機能は、古典的なQPP文学プールの前に、クエリあたり2msで0.856の重み付き平均AUROCに達する。
LLM判定を1つの特徴(ハイブリッド)として加えると、ViDoRe(0.863)ではS1と一致するが、SJBでは統計的に有意なエッジが得られる。
論文 参考訳(メタデータ) (2026-09-10T14:52:16Z) - Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations [0.0]
3つのオープンエージェントトレースベンチマークで、エージェントのメインエフェクトが各データセットとチェックタイプにおける全分散の3%未満を占めていることを示す。
3つの推定器に適合する4面の一般化可能性理論の分散分解を通してこれを達成する。
これをデプロイ決定信頼性(DDR:Deployment Decision Reliability)という,分散コンポーネントテーブルを企業購入者が防御できる5つの決定に変換する,ワンページレポートの規律にパッケージ化します。
論文 参考訳(メタデータ) (2026-08-11T18:16:51Z) - InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - AgentFairBench: Do LLM Agents Discriminate When They Act? [2.3004655342211078]
AgentFairBenchは、LLMエージェントの動作における人口格差に対する、安価で再現可能なマルチドメインベンチマークである。
これは、雇用、貸与、医療トリアージという、規制対象の3つの領域にまたがっている。
NumPyのみのハーネスは、反ファクト的なフリップ率、平均絶対スコア差(MASD)、アクションレートの相違、ツール起動の相違を計算する。
論文 参考訳(メタデータ) (2026-06-15T13:50:26Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - Attributing Emergence in Million-Agent Systems [68.53670424791751]
大規模言語モデル(LLM)は、個々のエージェントにおける人間のような推論と意思決定をシミュレートすることができる。
このような研究は、個々のエージェントにマクロな出現をもたらす必要がある。
Aumann--Shapley path-integral attribution to LLM-powered MAS at million-agent scale。
論文 参考訳(メタデータ) (2026-05-12T01:49:41Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Between the Layers Lies the Truth: Uncertainty Estimation in LLMs Using Intra-Layer Local Information Scores [36.86032736109853]
大きな言語モデル(LLM)は、しばしば自信を持って間違っているため、確実な不確実性推定(UE)が不可欠である。
本稿では,1つのフォワードパスを用いて内部表現における層間パターンをスコアリングする,コンパクトでインスタンスごとのUE手法を提案する。
論文 参考訳(メタデータ) (2026-03-17T08:35:14Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Identity-Link IRT for Label-Free LLM Evaluation: Preserving Additivity in TVD-MI Scores [3.959606869996232]
本報告では,TVD-MIの2次試行平均値が,非線形リンク関数を使わずに項目応答理論(IRT)に適合する付加的構造で中心確率スコアを得ることを示す。
Giniエントロピーからこのクリップ付き線形評価を導出し、境界飽和を扱うボックス制約最小二乗の定式化を導出する。
論文 参考訳(メタデータ) (2025-10-16T17:59:25Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。