論文の概要: DocHRL: A Hierarchical Reinforcement Learning Framework for Cost-Optimised Document Classification
- arxiv url: http://arxiv.org/abs/2607.22644v1
- Date: Wed, 24 Jun 2026 13:05:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.003999
- Title: DocHRL: A Hierarchical Reinforcement Learning Framework for Cost-Optimised Document Classification
- Title(参考訳): DocHRL:コスト最適化文書分類のための階層的強化学習フレームワーク
- Abstract要約: ドキュメントごとに最もコスト効率の良い分類ポリシーを適応的に動的に選択することを学ぶ階層的強化学習フレームワークであるDocHRLを紹介する。
本研究は,文書理解システムにおける分類性能と運用効率を同時に向上できることを示す。
- 参考スコア(独自算出の注目度): 0.3424873170726626
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-world document classification pipelines typically apply the same sequence of models to every incoming document, regardless of its complexity or type. This leads to inefficient use of compute and human resources: simple documents are over-processed while difficult ones may not receive enough scrutiny. We introduce DocHRL, a hierarchical reinforcement learning framework that learns to adaptively and dynamically select the most cost-effective classification policy on a per-document basis. DocHRL formulates document classification as a sequential decision problem with a two-level policy hierarchy: a top-level policy selects among broad options (vision classifiers, LLMs, OCR, and human-in-the-loop review), while option-specific sub-policies choose the concrete model or tool to invoke. The reward signal is the negative total expected cost, which captures inference cost, cost of misclassification, and cost of human labelling. Trained with Proximal Policy Optimisation on the RVL-CDIP benchmark, DocHRL achieves a macro F1 of 0.973 across 16 document classes while reducing average per-document cost to 2.74 normalised units compared to substantially higher costs incurred by fixed standalone classifiers. Our results demonstrate that cost-aware reinforcement learning can simultaneously improve classification performance and operational efficiency in document understanding systems.
- Abstract(参考訳): 実世界の文書分類パイプラインは通常、その複雑さやタイプに関わらず、すべての受信ドキュメントに同じモデルのシーケンスを適用します。
単純な文書は過剰に処理されるが、難しい文書は十分な精査を受けられない。
ドキュメントごとに最もコスト効率の良い分類ポリシーを適応的に動的に選択することを学ぶ階層的強化学習フレームワークであるDocHRLを紹介する。
DocHRLは、文書分類を2段階のポリシー階層によるシーケンシャルな決定問題として定式化している: トップレベルのポリシーは、幅広い選択肢(ビジョン分類器、LCM、OCR、ヒューマン・イン・ザ・ループ・レビュー)を選択し、オプション固有のサブポリティケーションは、実行すべき具体的なモデルまたはツールを選択する。
報酬信号は、推論コスト、誤分類コスト、人間のラベリングコストをキャプチャする、否定的な総予測コストである。
RVL-CDIPベンチマークで近似ポリシー最適化を用いて訓練されたDocHRLは、16の文書クラスで0.973のマクロF1を達成し、固定されたスタンドアロン分類器によって生じるコストよりも平均文書単位の正規化単位は2.74に削減した。
本研究は,文書理解システムにおける分類性能と運用効率を同時に向上できることを示す。
関連論文リスト
- Delete and Retain: Efficient Unlearning for Document Classification [1.0026496861838448]
Hessian Reassignmentは、文書分類におけるクラスアンラーニングのための2段階のモデルに依存しないソリューションである。
標準のテキストベンチマークでは、Hessian Reassignmentはクラスの精度をフルアズアウトクラスに近く保ちながら、桁違いに高速に実行した。
その結果、文書分類における効率的なクラスアンラーニングへの実践的で原則化された道筋が示される。
論文 参考訳(メタデータ) (2025-12-06T18:57:06Z) - LLM Routing with Dueling Feedback [49.67815163970033]
ユーザの満足度,モデルの専門性,推論コストのバランスを保ちながら,クエリ毎に最適なモデルを選択するという課題について検討する。
絶対的なスコアではなく、ペアの選好フィードバックから学習することで、ルーティングをコンテキストデュエルの帯域として定式化する。
分類的重み付けを用いた対照的な微調整を用いて,オフラインデータからモデル埋め込みを導出する表現学習手法であるカテゴリーキャリブレーション・ファインタニング(CCFT)を導入する。
論文 参考訳(メタデータ) (2025-10-01T12:52:25Z) - Feature Identification for Hierarchical Contrastive Learning [7.655211354400059]
本稿では,2つの新しい階層型コントラスト学習法を提案する。
提案手法は,階層レベルのクラス間関係と不均衡なクラス分布を明示的にモデル化する。
提案手法は,線形評価における最先端性能を実現し,既存の階層的コントラスト学習法を精度で2ポイント向上させる。
論文 参考訳(メタデータ) (2025-10-01T12:46:47Z) - GLiClass: Generalist Lightweight Model for Sequence Classification Tasks [49.2639069781367]
本稿では,シーケンス分類タスクにGLiNERアーキテクチャを適用する新しい手法であるGLiClassを提案する。
提案手法は,ゼロショットおよび少数ショット学習シナリオに必要な柔軟性を維持しつつ,埋め込み方式に匹敵する高い精度と効率を実現する。
論文 参考訳(メタデータ) (2025-08-11T06:22:25Z) - SCAN: Structured Capability Assessment and Navigation for LLMs [54.54085382131134]
textbfSCAN (Structured Capability Assessment and Navigation) は、大規模言語モデルの詳細な特徴付けを可能にする実用的なフレームワークである。
SCANには4つの重要なコンポーネントが含まれている。
TaxBuilder – クエリから機能表示タグを抽出して階層的な分類構造を構築する。
RealMixは、各機能タグに対する十分な評価データを保証するクエリ合成とフィルタリングのメカニズムである。
PC$2$ベースのLCM-as-a-Judge法は従来のLCM-as-a-Judge法と比較して大幅に精度が向上する
論文 参考訳(メタデータ) (2025-05-10T16:52:40Z) - OCCAM: Towards Cost-Efficient and Accuracy-Aware Classification Inference [11.267210747162961]
我々は、分類クエリよりも最適な分類器割り当て戦略を計算するための原則的手法であるOCCAMを提案する。
さまざまな実世界のデータセットにおいて、OCCAMは40%のコスト削減を実現し、精度の低下はほとんど、あるいはまったくない。
論文 参考訳(メタデータ) (2024-06-06T21:05:39Z) - Reinforcement Learning from Human Feedback with Active Queries [59.855433734053555]
現在の強化学習アプローチは、多くの場合、大量の人間による嗜好データを必要とする。
本稿では,能動学習の成功に触発された問合せ効率の高いRLHF手法を提案する。
実験の結果,ADPOは人間の好みに対するクエリの約半分しか作成していないが,最先端のDPO法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2024-02-14T18:58:40Z) - Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes [54.13559879916708]
EVAPORATEは大規模言語モデル(LLM)を利用したプロトタイプシステムである。
コード合成は安価だが、各文書をLSMで直接処理するよりもはるかに正確ではない。
直接抽出よりも優れた品質を実現する拡張コード実装EVAPORATE-CODE+を提案する。
論文 参考訳(メタデータ) (2023-04-19T06:00:26Z) - Ranking hierarchical multi-label classification results with mLPRs [4.869182515096001]
与えられたクラス階層に固執しながら、参加者の少ない第2段階の質問に焦点を合わせます。
CATCHと呼ばれる新しい目的関数を導入し、適切な分類性能を確保する。
提案手法は,合成データセットと2つの実データセットを用いて評価した。
論文 参考訳(メタデータ) (2022-05-16T17:43:35Z) - Binary Classification from Multiple Unlabeled Datasets via Surrogate Set
Classification [94.55805516167369]
我々は m 個の U 集合を $mge2$ で二進分類する新しい手法を提案する。
我々のキーとなる考え方は、サロゲート集合分類(SSC)と呼ばれる補助的分類タスクを考えることである。
論文 参考訳(メタデータ) (2021-02-01T07:36:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。