論文の概要: CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs
- arxiv url: http://arxiv.org/abs/2609.01195v1
- Date: Tue, 01 Sep 2026 13:05:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.671916
- Title: CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs
- Title(参考訳): CaRL-EM:LCMを用いたエンティティマッチングのためのコスト認識強化学習
- Authors: Chaohui Guo, Michel Klein, Zhisheng Huang,
- Abstract要約: CaRL-EMは、タスクの複雑さに基づいて、安価で高価な演算子の使用を動的に計画することを学ぶ。
強力なLCMベースのベースラインよりも優れた品質とコストのトレードオフを実現している。
- 参考スコア(独自算出の注目度): 1.3673052804154124
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Entity matching (EM) requires fine-grained contextual understanding and domain knowledge. Recent work shows that large language models (LLMs) can serve as strong matchers across domains, but most methods either make independent pairwise decisions or rely on manually designed composite pipelines, thus lacking flexibility in realistic multi-candidate settings. At the same time, they typically ignore inference cost at scale. We formulate LLM-based EM with candidates as a cost-aware sequential decision problem and propose CaRL-EM, a reinforcement learning controller that manages LLM operations. Given the state of an anchor record, its candidate set, and the cost, CaRL-EM adaptively chooses among different operators (Match/Compare/Select/Decide) and model capacities to maximize a quality-cost objective. The policy interacts with abstract operators, allowing the same controller to be reused with different underlying LLM backends at inference time without retraining. Experiments on 7 benchmarks show that CaRL-EM (i) learns to dynamically plan the usage of inexpensive and expensive operators based on task complexity, (ii) achieves robust zero-shot transfer across diverse datasets and domains, and (iii) consistently achieves a better quality-cost trade-off than strong LLM-based baselines and manually designed pipelines, yielding a lower inference cost at comparable or higher quality.
- Abstract(参考訳): エンティティマッチング(EM)には、きめ細かいコンテキスト理解とドメイン知識が必要です。
最近の研究は、大きな言語モデル(LLM)がドメイン間の強力なマッチングとして機能することを示しているが、ほとんどのメソッドは独立したペアワイズ決定を行うか、手動で設計された複合パイプラインに依存しているため、現実的なマルチ候補設定では柔軟性に欠ける。
同時に、彼らは通常、大規模な推論コストを無視します。
LLMに基づくEMをコストを考慮した逐次決定問題として定式化し、LLM操作を管理する強化学習制御系であるCaRL-EMを提案する。
アンカーレコードの状態、その候補セット、コストから、CaRL-EMは異なる演算子(Match/Compare/Select/Decide)とモデル容量を選択して、品質コストの目標を最大化する。
このポリシーは抽象演算子と相互作用し、同じコントローラを推論時に異なるLLMバックエンドで再トレーニングすることなく再利用することができる。
7つのベンチマークによるCaRL-EMの実験
(i)タスクの複雑さに基づいて、安価で高価なオペレータの使用を動的に計画することを学ぶ。
(ii)多様なデータセットやドメイン間で堅牢なゼロショット転送を実現し、
3)強いLCMベースのベースラインや手動設計のパイプラインよりも優れた品質とコストのトレードオフを一貫して達成し、同等あるいはより高い品質で推論コストを低減します。
関連論文リスト
- Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs [16.64366862436724]
MLLM(Multimodal Large Language Models)は先日,視覚言語タスク間での強力なパフォーマンスを実証した。
大量の入力された視覚トークンと大規模言語モデル(LLM)の重い計算の両方から生じる高い推論コストは、実用的デプロイメントにおける重要な障壁である。
本稿では,視覚トークン数とモデル計算能力を協調的に制御する統合適応型推論フレームワークSmartVLを提案する。
論文 参考訳(メタデータ) (2026-07-22T16:43:27Z) - Controlling Performance and Budget of a Centralized Multi-agent LLM System with Reinforcement Learning [53.57360296655208]
大規模言語モデル(LLM)は、ドメイン間で補完的な強みを示し、様々な推論コストが伴う。
既存のアプローチは分散化されたフレームワークに依存しており、入力毎に複数のLSMを呼び出すため、実質的で制御されていない推論コストが発生する。
我々は,LLMコントローラが,コスト効率とコスト制御が可能な方法で,専門家モデルのプールを選択的にコーディネートする,集中型マルチLLMフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-04T17:35:17Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Cost-Aware Contrastive Routing for LLMs [57.30288453580456]
我々は、プロンプトとモデルの両方を共有埋め込み空間にマッピングする軽量フレームワークであるコストスペクトルコントラストルーティング(CSCR)を紹介します。
CSCRはベースラインを一貫して上回り、精度とコストのトレードオフを最大25%改善した。
論文 参考訳(メタデータ) (2025-08-17T20:16:44Z) - OmniRouter: Budget and Performance Controllable Multi-LLM Routing [31.60019342381251]
大規模言語モデル(LLM)は優れた性能を提供するが、かなりの計算資源を必要とし、比較的低効率で運用する。
マルチLLMサービスのための制御可能なルーティングフレームワークであるOmniを紹介する。
実験の結果、Omniは応答精度を最大6.30%改善し、同時に計算コストを少なくとも10.15%削減した。
論文 参考訳(メタデータ) (2025-02-27T22:35:31Z) - MixLLM: Dynamic Routing in Mixed Large Language Models [57.309520357563215]
大規模言語モデル(LLM)は、最近、人工知能の可能性を秘めている。
問合せ-LLM代入のための動的コンテキスト帯域ベースのルーティングシステムであるMixLLMを開発した。
論文 参考訳(メタデータ) (2025-02-09T02:26:15Z) - PickLLM: Context-Aware RL-Assisted Large Language Model Routing [0.5325390073522079]
PickLLMは、RL(Reinforcement Learning)を使用してオンザフライクエリを利用可能なモデルにルーティングする軽量フレームワークである。
学習速度の違いに対する収束の速度と,クエリ毎のコストや全体の応答遅延といったハードメトリクスの改善を実証する。
論文 参考訳(メタデータ) (2024-12-12T06:27:12Z) - Cost-Effective Online Multi-LLM Selection with Versatile Reward Models [30.892090566736652]
大規模言語モデル (LLM) を選択・使用するためのオンラインモデルである textitC2MAB-V を導入する。
textitC2MAB-Vは、様々な報酬モデルを持つ様々な協調タスクタイプに特化している。
textitC2MAB-Vは,3つのアプリケーションシナリオに対して,性能とコスト効率を9つのLLMと効果的にバランスさせることを示す。
論文 参考訳(メタデータ) (2024-05-26T14:38:24Z) - From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning [52.257422715393574]
本稿では,Large Language Models (LLMs) の自己誘導手法を導入し,オープンソースデータセットからサクラサンプルを自動識別し,選択する。
我々の重要な革新である命令追従困難度(IFD)メトリックは、モデルが期待する応答と本質的な生成能力の相違を識別するための重要な指標として現れます。
論文 参考訳(メタデータ) (2023-08-23T09:45:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。