論文の概要: Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction
- arxiv url: http://arxiv.org/abs/2605.31446v1
- Date: Fri, 29 May 2026 15:40:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.709653
- Title: Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction
- Title(参考訳): Aspect Sentiment Triplet 抽出のための診断推論によるきめ細かい検証
- Abstract要約: Aspect Sentiment Triplet extract (ASTE) は、アスペクト項、意見項、感情極性を構造化三重項として識別することを目的としている。
従来の研究は主にエンドツーエンドの抽出に重点を置いていたが、抽出した三重項のポストホック検証は比較的過小評価されている。
本稿では,診断推論の監督を伴うきめ細かい検証のためのフレームワークであるFiVeDを提案する。
- 参考スコア(独自算出の注目度): 14.189537313152954
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Aspect Sentiment Triplet Extraction (ASTE) aims to identify aspect terms, opinion terms, and sentiment polarities as structured triplets, providing essential inputs for downstream information system applications such as opinion mining, explainable recommendations, and review summarization. Prior work mainly focuses on end-to-end extraction, while post hoc verification of extracted triplets remains comparatively underexplored. This gap limits the reliability of ASTE systems, since predicted triplets may be locally plausible while being globally invalid. Moreover, candidate invalidity is multi-faceted and candidate usability is inherently graded, motivating a fine-grained verification mechanism that can filter or re-rank outputs from diverse extractors. In this paper, we propose FiVeD, a framework for Fine-grained Verification with Diagnostic reasoning supervision. Specifically, the verifier is trained with multiple complementary objectives, including validity classification and quality score estimation as primary tasks, with error type classification and rationale generation as auxiliary tasks. We define hierarchical error categories and construct plausible incorrect triplets under semantic and syntactic constraints, and leverage an off-the-shelf LLM with task-specific rubrics to produce quality scores and diagnostic rationales. During inference, the resulting quality scores are used to filter candidate outputs, supporting adjustable precision-recall tradeoffs. Experiments across multiple ASTE baselines demonstrate that FiVeD consistently improves extraction performance by up to 3.53 F1 points as a plug-and-play verification module.
- Abstract(参考訳): Aspect Sentiment Triplet extract (ASTE)は、アスペクト項、意見項、感情極性を構造化三重項として識別することを目的としており、意見マイニング、説明可能なレコメンデーション、要約などの下流情報システムアプリケーションに不可欠な入力を提供する。
従来の研究は主にエンドツーエンドの抽出に重点を置いていたが、抽出した三重項のポストホック検証は比較的過小評価されている。
このギャップはASTEシステムの信頼性を制限している。
さらに、候補の無効性は多面的であり、候補のユーザビリティは本質的にグレードされ、多様な抽出器からの出力をフィルタリングまたは再ランクする詳細な検証メカニズムが動機となっている。
本稿では,診断推論の監督を伴うきめ細かい検証のためのフレームワークであるFiVeDを提案する。
具体的には、妥当性分類と品質スコア推定を主課題として、誤り型分類と有理性生成を補助課題として、複数の相補的目的を訓練する。
階層的エラーカテゴリを定義し,意味的制約と構文的制約の下で不正確な三重項を構成する。
推論中、結果のクオリティスコアを使用して候補出力をフィルタリングし、調整可能な精度-リコールトレードオフをサポートする。
複数のASTEベースラインにまたがる実験により、FiVeDはプラグ・アンド・プレイ検証モジュールとして最大3.53F1ポイントの抽出性能を一貫して改善することを示した。
関連論文リスト
- The RAT: A Unified Bayesian Model for RAG Evaluation [8.650407684623714]
本稿では,検索成功,棄却行動,回答正当性を共同でモデル化するベイズ評価フレームワークを提案する。
フレームワークを3つのデータセット、3つのレトリバー、3つのジェネレータにわたる27のRAG構成に適用する。
我々は、LLM-as-a-judgeアノテーションをキャリブレーションされたノイズ観測として組み込むようモデルを拡張した。
論文 参考訳(メタデータ) (2026-08-25T15:54:30Z) - Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records [16.68744679025527]
一般ドメイン大言語モデル(LLM)は、実世界の放電サマリーから表れる。
LLMは3,460人の候補者の不一致を表面化し、69.7%が入院した。
論文 参考訳(メタデータ) (2026-07-24T23:43:35Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - Evian: Towards Explainable Visual Instruction-tuning Data Auditing [14.93566912726999]
本稿では,モデル応答を構成的認知要素に分解する「分解的評価」パラダイムを提案する。
このパラダイムを、画像テキスト一貫性、論理コヒーレンス、ファクチュアル正確性の軸に沿ってこれらのコンポーネントを評価する自動化フレームワークであるEVIANを介してインスタンス化する。
論文 参考訳(メタデータ) (2026-04-22T13:28:27Z) - Overcoming Joint Intractability with Lossless Hierarchical Speculative Decoding [58.92526489742584]
我々は無益な無益な提案をする。
承認されたトークンの数を大幅に増加させる検証方法。
HSDは様々なモデルファミリやベンチマークの受け入れ率に一貫した改善をもたらすことを示す。
論文 参考訳(メタデータ) (2026-01-09T11:10:29Z) - HADSF: Aspect Aware Semantic Control for Explainable Recommendation [4.75127493865044]
大規模言語モデル(LLM)の最近の進歩は、推薦システムに対してより効果的な情報抽出を約束している。
本稿では,適応選択によるコンパクトなコーパスレベルのアスペクトボキャブラリを誘導し,構造化アスペクトオピニオン三重項のボキャブラリ誘導,明示的に制約された抽出を行う2段階アプローチを提案する。
1.5B-70Bパラメータにまたがる約300万のレビューに関する実験では、標準評価予測器に統合された場合、HADSFは予測エラーを一貫して減少させる。
論文 参考訳(メタデータ) (2025-10-30T20:49:33Z) - What Does It Take to Build a Performant Selective Classifier? [30.90225954725644]
ベイズノイズ,近似誤差,ランキング誤差,統計的ノイズ,実装またはシフト誘起スラックについて検討した。
我々は,合成2モードデータと実世界のビジョンと言語ベンチマークを用いて,その分解を検証した。
その結果, (i)ベイズノイズとモデル容量の制限は, 実質的なギャップを考慮し, (ii) よりリッチで特徴を考慮したキャリブレータのみを有意義に改善し, (iii) データシフトは, 分散的に堅牢なトレーニングを必要とするスラックを別々に導入することを確認した。
論文 参考訳(メタデータ) (2025-10-23T05:48:40Z) - Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality [53.03186946689658]
検証によるテストタイムのスケーリングは、大規模言語モデルのパフォーマンス向上を約束している。
検証の効果は、(i)ジェネレータのカバレッジ、(ii)検証器の収束領域(ROC)、(iii)サンプリングアルゴリズムの準最適性の3つの相互作用を通して現れる。
本稿では,輸送問題として検証可能なテストタイムスケーリングの枠組みを定め,カバレッジ,ROC,サブ最適性の相互作用を特徴付ける。
論文 参考訳(メタデータ) (2025-10-21T18:05:42Z) - Continual Action Quality Assessment via Adaptive Manifold-Aligned Graph Regularization [53.82400605816587]
アクション品質アセスメント(AQA)は、ビデオにおける人間の行動を定量化し、スポーツスコアリング、リハビリテーション、スキル評価の応用を支援する。
大きな課題は、現実世界のシナリオにおける品質分布の非定常的な性質にある。
本稿では,進化する分布を扱うための連続学習機能を備えた連続AQA(Continuous AQA)を紹介する。
論文 参考訳(メタデータ) (2025-10-08T10:09:47Z) - Fair Deepfake Detectors Can Generalize [51.21167546843708]
共同設立者(データ分散とモデルキャパシティ)の制御により,公正な介入による一般化が向上することを示す。
この知見を応用して, 逆正当性重み付けとサブグループワイド特徴正規化を併用し, 新たなアライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・インセンティブ・インターベンション・インベンション・インテクション(DAID)を提案する。
DAIDは、いくつかの最先端技術と比較して、公平性と一般化の両方において一貫して優れた性能を達成する
論文 参考訳(メタデータ) (2025-07-03T14:10:02Z) - Garbage In, Reasoning Out? Why Benchmark Scores are Unreliable and What to Do About It [1.6261897792391753]
我々は、SocialIQa、FauxPas-EAI、ToMiの3つの広く使われている推論ベンチマークの体系的な監査を行う。
ベンチマーク項目と評価手法の両方において,広範な欠陥を明らかにする。
論文 参考訳(メタデータ) (2025-06-30T13:57:28Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。