論文の概要: ViHoRec: A Quality-Controlled Vietnamese Hotel Recommendation Dataset and Cold-Start Benchmark
- arxiv url: http://arxiv.org/abs/2607.12946v1
- Date: Tue, 14 Jul 2026 16:28:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.22344
- Title: ViHoRec: A Quality-Controlled Vietnamese Hotel Recommendation Dataset and Cold-Start Benchmark
- Title(参考訳): ViHoRec:ベトナムのホテルレコメンデーションデータセットとコールドスタートベンチマーク
- Abstract要約: ViHoRecは、Booking.com、Traveloka、Ivivuからクロールされたベトナムのホテルレコメンデーションデータセットである。
コントリビューションは, (i) クロスプラットフォームのエンティティ解決と量的品質管理を備えた再現可能な建設パイプライン, (ii) HMACの仮称を持つプライバシ保護リリース, (iii) 一時的離脱を1回に分けた公開コールドスタートベンチマークである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recommender-system research for Vietnamese remains limited by the absence of a public, well-documented hotel interaction resource. Building such a resource is challenging for three reasons: cross-platform hotel names must be reconciled before interactions are comparable; quality must be audited with reproducible metrics rather than ad hoc cleaning; and public release must preserve privacy while remaining benchmarkable under realistic cold-start conditions. We introduce ViHoRec, a quality-controlled Vietnamese hotel recommendation dataset of 18{,}267 interactions between 6{,}832 users and 560 hotels, crawled from Booking.com, Traveloka, and Ivivu. Our contributions are: (i) a reproducible construction pipeline with cross-platform entity resolution and quantitative quality control; (ii) a privacy-preserving release with HMAC pseudonyms; and (iii) a public cold-start benchmark with temporal leave-last-one-out split, data-centric ablations, and dependency-free baselines. On the public split, learned models degrade sharply for users with short histories (BPR-MF Recall@10: 0.065 vs. 0.120), while UserKNN remains strongest overall, establishing ViHoRec as a sparse, cold-start-dominated testbed for low-resource recommendation. All data are publicly available at https://github.com/MinhNguyenDS/ViHoRec.
- Abstract(参考訳): ベトナムのレコメンダー・システムの研究は、公的に文書化されたホテルの交流資源が欠如しているため、依然として限られている。
このようなリソースの構築には,3つの理由がある – 対話が同等になる前に,クロスプラットフォームのホテル名を和解しなくてはならない,品質はアドホックなクリーニングよりも再現可能なメトリクスで監査する必要がある,パブリックリリースではプライバシを維持しながら,現実的なコールトスタート条件下でベンチマーク可能な状態を維持しなければならない,といった理由がある。
6{,}832ユーザと560ホテル間の18{,}267のインタラクションに関する品質管理型ベトナムホテルレコメンデーションデータセットであるViHoRecを,Booking.com,Traveloka,Ivivuからクロールした。
私たちの貢献は次のとおりです。
一 クロスプラットフォームな実体解決及び量的品質管理を備えた再現可能な建設パイプライン
(二)HMACの偽名によるプライバシー保護リリース、及び
(iii) タイムラスト1アウト分割、データ中心の短縮、依存性のないベースラインを備えたパブリックコールドスタートベンチマーク。
パブリックスプリットでは、短い履歴を持つユーザ(BPR-MF Recall@10: 0.065 vs. 0.120)に対して学習モデルは大幅に低下する。
すべてのデータはhttps://github.com/MinhNguyenDS/ViHoRecで公開されている。
関連論文リスト
- Kairos: Numerically Robust News Recommendation under Item Cold-Start via Cholesky-based LinUCB [0.0]
本稿では,このデータ不足を文脈的オンライン学習アプローチによって橋渡しするフレームワークであるKairosについて述べる。
連続演算の数値的整合性を確保するため、カイロスは誤りを起こしやすいシャーマン・モリソン反転をチョーレスキー因子の直接ランク1更新に置き換える。
論文 参考訳(メタデータ) (2026-07-29T12:25:25Z) - ClawRec: A Claw-Native Recommender System [70.37279331430653]
我々はClaw-nativeレコメンデータシステムを導入し、プラットフォームローカルのランキングを超えて、多様なソースやコンテンツ形式にまたがる統一的で補完的なレコメンデーションスレートを生成する。
ClawRecは、クロスプラットフォームの振る舞いとクロスソースレコメンデーションを接続するエビデンスリンクされた、時間的に構造化されたユーザ状態を維持している。
ClawRec は NDCG@20 の 0.6134 (+0.1126) と Hit@20 の 0.6944 (+0.0854) を達成している。
論文 参考訳(メタデータ) (2026-07-26T17:56:49Z) - RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation [74.86562505934961]
言語ベースのユーザプロファイルは、長い行動履歴をレコメンデーションのために明示的な意味表現に変換する。
そこでは,ストリームやプロファイルの更新を限定的に行うことで,ユーザの行動が継続的に到着する,実世界のショートビデオレコメンデーションにおいて,この問題について検討する。
本稿では,ストリーミング構造化されたセマンティックプロファイルを過去のレコメンデーションフィードバックで最適化するためのオフラインクローズドループフレームワークRECAPを提案する。
論文 参考訳(メタデータ) (2026-07-17T08:10:37Z) - A Reproducible Universal Dependencies-Style Pipeline for Katharevousa Greek Parliamentary Text [0.0]
我々は、ギリシャのジュンタ時代初期のカサレヴサ議会の質問に対して、普遍的な依存関係スタイルの構文解析資源を構築し、評価する。
パイプラインは、OCR対応の再構築、スキーマ制約付きLCMアシストアノテーション、自動検証、決定論的CoNLL-Uスナップショット、固定分割評価、モデル系列比較をリンクする。
最強の外部ベースラインであるスパチェ・ギリシャは、0.4183 LASに達する。
本論文は,歴史的に困難なOCRを再利用可能な統語基盤に変えるための監査可能な方法論を提示する。
論文 参考訳(メタデータ) (2026-05-21T19:16:20Z) - LoMa: Local Feature Matching Revisited [56.73318466794448]
局所的特徴マッチングは、Structure-from-Motion (SfM) のような3次元視覚システムの基本コンポーネントとして長い間使われてきた。
本稿では,データ駆動の観点から局所的特徴マッチングを再考する。
大規模で多様なデータミックス、現代的なトレーニングレシピ、スケールされたモデルキャパシティ、スケールされた計算を組み合わせることで、パフォーマンスが著しく向上します。
論文 参考訳(メタデータ) (2026-04-06T17:59:49Z) - Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations [0.0]
大規模言語モデル(LLM)とクロスエンコーダのリランカーはレコメンダシステムの改善に注目されている。
本稿では,Serendipity-2018データセットを用いた冷間開始映画レコメンデーションにおけるクロスエンコーダリランカーの系統的診断について述べる。
論文 参考訳(メタデータ) (2026-02-09T16:44:42Z) - MoNaCo: More Natural and Complex Questions for Reasoning Across Dozens of Documents [107.45764251915062]
MoNaCoは、1,315の自然で時間のかかる質問のベンチマークで、解決には数十、数百の中間ステップが必要になる。
実世界の時間的問題に手動で答える,分解されたアノテーションパイプラインを開発した。
実世界の情報検索作業の複雑さと多様さに対処するLLMエージェントの限界について検討した。
論文 参考訳(メタデータ) (2025-08-15T00:58:10Z) - Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval [49.1574468325115]
トレーニング済みのAmharic BERTとRoBERTaのバックボーンをベースとした,Amharic固有の高密度検索モデルを提案する。
提案したRoBERTa-Base-Amharic-Embedモデル(110Mパラメータ)は,MRR@10の相対的な改善を17.6%達成する。
RoBERTa-Medium-Amharic-Embed (42M)のようなよりコンパクトな派生型は13倍以上小さいまま競争力を維持している。
論文 参考訳(メタデータ) (2025-05-25T23:06:20Z) - Personalized Diffusion Model Reshapes Cold-Start Bundle Recommendation [2.115789253980982]
本稿では,各ユーザがコールドスタート課題に取り組むために,分散空間にバンドルを生成する新しい手法を提案する。
DisCoはパーソナライズされたDiffusionのバックボーンに依存しており、ユーザーの興味をゆがめられたアスペクトによって強化されている。
DisCoは3つの実世界のデータセットに対して大きなマージンで5つのベースラインを上回ります。
論文 参考訳(メタデータ) (2025-05-20T20:52:31Z) - Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora [9.871701356351542]
言語モデル(LM)は進化を続け、応答品質と一貫性を改善している。
モデル品質、応答適性、推論能力を評価するために、数多くの評価ベンチマークが作成されている。
本稿では,文書群を基盤としたファクトベース合成データモデル評価の自動化手法を提案する。
論文 参考訳(メタデータ) (2025-05-13T18:50:03Z) - YourBench: Easy Custom Evaluation Sets for Everyone [12.995134931278056]
YourBenchは、大規模言語モデル(LLM)を評価するための、新しいオープンソースのフレームワークである。
手動のアノテーションなしで、信頼性が高く、最新で、ドメインに適したベンチマークを安価に生成する。
我々はTemporaに基づくYourBenchライブラリ、Tempora-0325データセット、150k以上の質問応答ペア、およびすべての評価と推論トレースをリリースする。
論文 参考訳(メタデータ) (2025-04-02T15:40:24Z) - Beyond Covariance Matrix: The Statistical Complexity of Private Linear Regression [66.93988594607842]
プライバシー制約の下では、プライベート線形回帰の複雑さは通常の共分散行列によって捉えられる。
最適率を達成するための情報重み付け回帰手法を提案する。
特に、我々の結果は、共同プライバシーは追加費用がほとんどないことを示している。
論文 参考訳(メタデータ) (2025-02-18T18:35:24Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。