論文の概要: Human Preference aligned Tabular Similarity
- arxiv url: http://arxiv.org/abs/2607.24880v1
- Date: Mon, 27 Jul 2026 09:09:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.566852
- Title: Human Preference aligned Tabular Similarity
- Title(参考訳): 人の嗜好に整列した語彙の類似性
- Abstract要約: 類似性検索のための埋め込み信頼性を十分に評価するには,標準下流メトリクスが不十分である,と我々は主張する。
具体的な評価手順を示し,その問題点をPLMのユースケースで説明する。
- 参考スコア(独自算出の注目度): 1.5360443570751798
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Task-agnostic tabular embeddings are increasingly used for similarity search in real-world business systems such as Product Lifecycle Management (PLM). However, leading embedding approaches are optimized primarily for prediction tasks - not for producing human preference aligned similarity rankings. We argue that standard downstream metrics are insufficient to fully assess embedding trustworthiness for similarity search and that human preference aligned evaluation is a necessary and currently missing component. We present a concrete evaluation procedure and illustrate the problem through a PLM use case.
- Abstract(参考訳): タスクに依存しない表形式の埋め込みは、製品ライフサイクル管理(PLM)のような現実のビジネスシステムにおける類似性検索にますます利用されています。
しかし、主要な埋め込みアプローチは、主に予測タスクに最適化されている。
我々は、標準下流メトリクスは類似性検索の組込み信頼性を十分に評価するには不十分であり、人間の嗜好に沿った評価は必要であり、現在欠落している要素であると主張している。
具体的な評価手順を示し,その問題点をPLMのユースケースで説明する。
関連論文リスト
- User Preference Induction with LLMs for Offline Top-N Recommendation Evaluation [5.10348690267577]
オフラインレコメンデータ評価における妥当性判断の枠組みを提案する。
我々のアプローチは2つの補完的な役割で大きな言語モデルを使用する。
実験により,この手法はオフライントップN評価の堅牢性を向上させるための有望な戦略であることが示された。
論文 参考訳(メタデータ) (2026-07-13T10:16:24Z) - Towards Diverse and Comprehensive Benchmarks for Mutual Information Estimation [47.29900218955283]
相互情報推定は、機械学習と統計学における中心的な問題である。
既存のベンチマークでは、単純化された低次元分布上の推定器を評価し、複雑な現実的なデータに対する性能はほとんど探索されていない。
我々はこのギャップを、統一されたコプラ理論の観点から、包括的なベンチマークフレームワークで解決する。
論文 参考訳(メタデータ) (2026-07-03T16:55:55Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - Principled Algorithms for Optimizing Generalized Metrics in Binary Classification [53.604375124674796]
一般化されたメトリクスを最適化するアルゴリズムを導入し、$H$-consistency と finite-sample generalization bounds をサポートする。
提案手法は,メトリクス最適化を一般化したコスト依存学習問題として再検討する。
我々は,理論性能を保証する新しいアルゴリズムMETROを開発した。
論文 参考訳(メタデータ) (2025-12-29T01:33:42Z) - CCE: Confidence-Consistency Evaluation for Time Series Anomaly Detection [56.302586730134806]
本稿では,新しい評価指標である信頼性・一貫性評価(CCE)を紹介する。
CCEは同時に、予測の信頼性と不確実性を測定する。
RankEvalは、さまざまなメトリクスのランキング機能を比較するためのベンチマークです。
論文 参考訳(メタデータ) (2025-09-01T03:38:38Z) - PairBench: Are Vision-Language Models Reliable at Comparing What They See? [16.49586486795478]
タスクに応じて大規模視覚言語モデル(VLM)を自動評価するためのフレームワークであるPairBenchを提案する。
提案手法では,人間アノテーションとの整合性,ペアオーダ間の整合性,分散のスムーズさ,プロンプトによる可制御性という,信頼性の高い比較のための4つの重要な指標を導入している。
私たちの分析では、モデルがすべての指標を一貫して上回り、それぞれが異なる強みと弱みを示すことは明らかです。
論文 参考訳(メタデータ) (2025-02-21T04:53:11Z) - Ranking evaluation metrics from a group-theoretic perspective [5.333192842860574]
一般的に使用される指標において、不整合評価や潜在的な不信の原因となる事例を示す。
分析では,不整合性評価を不信の原因とみなすべきではないことを強調し,評価指標のランク付けに光を当てた。
論文 参考訳(メタデータ) (2024-08-14T09:06:58Z) - On the Consistency of Average Embeddings for Item Recommendation [10.77549382103745]
推奨システムにおける一般的なプラクティスは、ユーザやより高いレベルの概念を表現するために、アイテムの埋め込みを平均化することである。
そこで本研究では,建設に使用されるアイテムに対して,平均埋込量の一貫性を測定するための予測精度スコアを提案する。
論文 参考訳(メタデータ) (2023-08-24T13:14:49Z) - Doubly Robust Off-Policy Evaluation for Ranking Policies under the
Cascade Behavior Model [11.101369123145588]
ランキングポリシのオフライン評価は、ログデータのみを使用して、新たなランキングポリシのパフォーマンス推定を可能にする。
従来の研究では、アイテム空間をトラクタブルにするために、ユーザ行動に関するいくつかの仮定が紹介されていた。
本稿では,ランキングの上位位置から次々にアイテムと対話するカスケード2倍ロバスト推定器を提案する。
論文 参考訳(メタデータ) (2022-02-03T12:42:33Z) - Conditional Sequential Slate Optimization [15.10459152219771]
検索ランキングシステムは通常、検索結果を独立したクエリ文書スコアで順序付けし、検索結果のスレートを生成する。
本稿では,従来のランク付け指標の最適化と,スレート内の文書の所定の分布基準を共同で学習する条件付きシーケンシャルスレート最適化(CSSO)を提案する。
提案手法は,eコマース検索結果の多様性の強化,トップ検索結果のバイアス軽減,結果のパーソナライズなど,現実的な課題に適用できる。
論文 参考訳(メタデータ) (2021-08-12T09:14:46Z) - Estimation of Fair Ranking Metrics with Incomplete Judgments [70.37717864975387]
本研究では,4つの評価指標のサンプリング手法と推定手法を提案する。
ラベル付きアイテムの数が極めて少ない場合でも動作可能な頑健で偏りのない推定器を定式化する。
論文 参考訳(メタデータ) (2021-08-11T10:57:00Z) - Towards Model-Agnostic Post-Hoc Adjustment for Balancing Ranking
Fairness and Algorithm Utility [54.179859639868646]
Bipartiteランキングは、ラベル付きデータから正の個人よりも上位の個人をランク付けするスコアリング機能を学ぶことを目的としている。
学習したスコアリング機能が、異なる保護グループ間で体系的な格差を引き起こすのではないかという懸念が高まっている。
本稿では、二部構成のランキングシナリオにおいて、それらのバランスをとるためのモデル後処理フレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-15T10:08:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。