論文の概要: From Confusion to Clarity: Confusion-Aware Retrieval and Knowledge Injection for Text Classification
- arxiv url: http://arxiv.org/abs/2609.01564v1
- Date: Tue, 01 Sep 2026 17:31:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.893712
- Title: From Confusion to Clarity: Confusion-Aware Retrieval and Knowledge Injection for Text Classification
- Title(参考訳): コンフュージョンから明瞭さへ:テキスト分類のためのコンフュージョン・アウェア検索と知識注入
- Authors: Manish Gupta, Chaitanya Giri, Jayasimha Talur,
- Abstract要約: 大規模言語モデル(LLM)は、テキストを多くの意味論的に類似したラベルで分類するのに苦労する。
モデルが区別に苦しむラベルペアを識別するフレームワークを提案する。
また、類似の候補を区別するターゲットルールも生成します。
- 参考スコア(独自算出の注目度): 6.5881009217005975
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) struggle to classify text into taxonomies with many semantically similar labels, as the distinctions are domain-specific and not captured by pre-training. To handle large label spaces, a common approach retrieves top-$K$ candidate labels by embedding similarity and prompt the LLM to choose among them. However, top-$K$ retrieval reduces the number of candidates but does not help the model tell similar ones apart. When two similar labels both appear as candidates, the model lacks the signal to choose correctly between them. We propose a framework that (1) identifies which label pairs the model struggles to distinguish, (2) expands the candidate set to include confusable labels, and (3) generates targeted rules to differentiate between similar candidates. The framework requires no fine-tuning, and the generated rules transfer to smaller, cheaper models. On three benchmarks (WOS, Flipkart, LEDGAR), our approach improves Macro F1 by up to 10.0pp over retrieval baselines, with smaller models (2B--20B) gaining up to 11.5pp via cross-model transfer.
- Abstract(参考訳): 大規模言語モデル(LLM)は、テキストを多くの意味論的に類似したラベルを持つ分類体系に分類するのに苦労する。
大きなラベル空間を扱うために、共通アプローチは類似性を埋め込んで上位$K$の候補ラベルを検索し、LSMにその中のどれかを選ぶよう促す。
しかし、上位$Kの検索は候補数を減らすが、モデルが類似するものを区別するのに役に立たない。
2つの類似ラベルが候補として現れると、モデルがそれらの間に正しく選択するシグナルを欠く。
本稿では,(1)モデルが区別に苦しむラベルのペアを識別し,(2)障害のあるラベルを含むように候補集合を拡張し,(3)類似の候補を区別するターゲットルールを生成するフレームワークを提案する。
フレームワークは微調整を必要とせず、生成されたルールはより小さく安価なモデルに転送される。
WOS, Flipkart, LEDGARの3つのベンチマークでは, 検索ベースライン上で最大10.0ppのマクロF1が向上し, クロスモデル転送により11.5ppまでの小型モデル(2B-20B)が得られた。
関連論文リスト
- Discrete Diffusion Language Models Are Training-Free Multi-Label Classifiers [1.3406606730449597]
マルチラベルテキスト分類のための個別マスク付き拡散言語モデルを用いた訓練不要なdLLM-SetScoreを提案する。
各候補ラベルについて、短いイエス/ノー質問を行い、2つの回答トークンの確率を1つのマスクされた位置で比較する。
論文 参考訳(メタデータ) (2026-07-30T15:21:02Z) - Mixed Blessing: Class-Wise Embedding guided Instance-Dependent Partial Label Learning [53.64180787439527]
部分ラベル学習(PLL)では、各サンプルは、基底トラスラベルと複数のノイズラベルからなる候補ラベルセットに関連付けられている。
初めて、各サンプルに対してクラスワイドな埋め込みを作成し、インスタンス依存のノイズラベルの関係を調査できるようにします。
ラベルの曖昧さを低減するため,グローバルな特徴情報を含むクラスプロトタイプのコンセプトを紹介した。
論文 参考訳(メタデータ) (2024-12-06T13:25:39Z) - Learning from Label Proportions: Bootstrapping Supervised Learners via Belief Propagation [18.57840057487926]
LLP(Learning from Label Proportions)は、トレーニング中にバッグと呼ばれるインスタンスのグループに対して、アグリゲートレベルのラベルしか利用できない学習問題である。
この設定は、プライバシー上の配慮から、広告や医療などの領域で発生する。
本稿では,この問題に対して,反復的に2つの主要なステップを実行する新しいアルゴリズムフレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-12T06:09:26Z) - Bridging the Gap between Model Explanations in Partially Annotated
Multi-label Classification [85.76130799062379]
偽陰性ラベルがモデルの説明にどのように影響するかを考察する。
本稿では,部分ラベルで学習したモデルの属性スコアを向上し,その説明をフルラベルで学習したモデルと類似させる。
論文 参考訳(メタデータ) (2023-04-04T14:00:59Z) - Decomposition-based Generation Process for Instance-Dependent Partial
Label Learning [45.133781119468836]
部分ラベル学習(Partial label learning, PLL)は、典型的な弱教師付き学習問題であり、各トレーニング例は、その中の1つだけが真である候補ラベルのセットに関連付けられている。
既存のほとんどのアプローチでは、トレーニングサンプルの誤りラベルを候補ラベルとしてランダムに選択し、候補ラベルの生成プロセスを簡単な方法でモデル化する。
候補ラベルの明示的にモデル化された生成プロセスに基づいて,最大Aポストミラー(MAP)を提案する。
論文 参考訳(メタデータ) (2022-04-08T05:18:51Z) - Instance-Dependent Partial Label Learning [69.49681837908511]
部分ラベル学習は、典型的には弱教師付き学習問題である。
既存のほとんどのアプローチでは、トレーニングサンプルの間違ったラベルがランダムに候補ラベルとして選択されていると仮定している。
本稿では,各例が実数で構成された潜在ラベル分布と関連していると仮定する。
論文 参考訳(メタデータ) (2021-10-25T12:50:26Z) - Group-aware Label Transfer for Domain Adaptive Person Re-identification [179.816105255584]
Unsupervised Adaptive Domain (UDA) Person Re-identification (ReID) は、ラベル付きソースドメインデータセットで訓練されたモデルを、さらなるアノテーションなしでターゲットドメインデータセットに適応することを目的としている。
最も成功したUDA-ReIDアプローチは、クラスタリングに基づく擬似ラベル予測と表現学習を組み合わせて、2つのステップを交互に実行する。
疑似ラベル予測と表現学習のオンラインインタラクションと相互促進を可能にするグループ認識ラベル転送(GLT)アルゴリズムを提案します。
論文 参考訳(メタデータ) (2021-03-23T07:57:39Z) - SPL-MLL: Selecting Predictable Landmarks for Multi-Label Learning [87.27700889147144]
我々は、入力(予測可能)に応じて予測しやすく、他の可能なラベル(表現可能)をうまく回復できるランドマークとして、ラベルの小さなサブセットを選択することを提案する。
我々は,ADM(Alternating Direction Method)を用いてこの問題を解決する。実世界のデータセットに関する実証研究により,本手法が他の最先端手法よりも優れた分類性能を実現することを示す。
論文 参考訳(メタデータ) (2020-08-16T11:07:44Z) - Few-shot Slot Tagging with Collapsed Dependency Transfer and
Label-enhanced Task-adaptive Projection Network [61.94394163309688]
本稿では,現在最先端の少数ショット分類モデルであるTapNetに基づくラベル強化タスク適応プロジェクションネットワーク(L-TapNet)を提案する。
実験結果から,本モデルは1ショット設定で14.64点のF1スコアで最強の少ショット学習ベースラインを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2020-06-10T07:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。