論文の概要: KeySI: An Interaction Framework for Tuning Text Embeddings Based on Human Feedback
- arxiv url: http://arxiv.org/abs/2607.20556v2
- Date: Fri, 24 Jul 2026 07:57:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:30.943821
- Title: KeySI: An Interaction Framework for Tuning Text Embeddings Based on Human Feedback
- Title(参考訳): KeySI: ヒューマンフィードバックに基づくテキスト埋め込みのチューニングのためのインタラクションフレームワーク
- Authors: Yan Zhu, Y. Chen, Rebecca Faust,
- Abstract要約: KeySIは、キーワードベースのコンセプト仕様を通じて機能レベルのフィードバックを可能にするインタラクションフレームワークである。
キーワードを主要な相互作用媒体として操作することで、KeySIは手動による文書検査とラベル付けの必要性を減らすことができる。
本稿では,コーパスを付与し,代表キーワードをキュレートし,表現キーワードを視覚化し,次元的還元による文書の埋め込みを行うプロトタイプ実装を提案する。
- 参考スコア(独自算出の注目度): 2.5075889869273453
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In large-scale text analysis tasks, pre-trained language models are often used to embed text corpora for downstream analysis. However, such models may struggle to capture domain-specific semantics and adapting them typically requires large amounts of labeled data and technical expertise to implement training pipelines. Recent approaches have demonstrated how visual interactions in document projections can capture human feedback as training signals for model tuning. However, these methods operate on document-level feedback, which requires users to open and assess individual documents in order to provide effective feedback. In this paper, we propose KeySI, an interaction framework that enables feature-level feedback through keyword-based concept specification. Users specify feedback by organizing extracted keywords into groups representing concepts, which KeySI translates into document-level supervision for subsequent tuning. By operating on keywords as the primary interaction medium, KeySI reduces the need for manual document inspection and labeling and lowers the barrier to adapting embedding models. We present a prototype implementation that, given a corpus, curates representative keywords, visualizes keywords and document embeddings via dimensionality reduction, allows interactive specification of keyword groups, and supports iterative refinement through system feedback. We evaluate KeySI through a user study, usage scenarios, and quantitative experiments demonstrating its effectiveness in capturing user intent and improving embedding alignment.
- Abstract(参考訳): 大規模テキスト解析タスクでは、事前訓練された言語モデルを使用して、ダウンストリーム解析のためにテキストコーパスを埋め込むことが多い。
しかし、そのようなモデルはドメイン固有のセマンティクスを捉えるのに苦労し、それらを適用するには、通常、トレーニングパイプラインを実装するために大量のラベル付きデータと技術的専門知識が必要である。
近年、文書投影における視覚的相互作用が、モデルチューニングのためのトレーニング信号として人間のフィードバックをキャプチャする方法が実証されている。
しかし,これらの手法は文書レベルのフィードバックで動作し,個々の文書を開いて評価し,効果的なフィードバックを提供する必要がある。
本稿では,キーワードベースの概念仕様を通じて特徴レベルのフィードバックを可能にするインタラクションフレームワークであるKeySIを提案する。
ユーザは抽出したキーワードを概念を表すグループにまとめてフィードバックを指定する。
キーワードを主要な相互作用媒体として操作することで、KeySIは手動による文書検査とラベル付けの必要性を減らし、埋め込みモデルを適応するための障壁を低くする。
本稿では,コーパスを付与し,代表キーワードをキュレートし,次元還元によるキーワードや文書の埋め込みを可視化し,キーワード群のインタラクティブな仕様化を実現し,システムフィードバックによる反復的洗練を支援するプロトタイプ実装を提案する。
ユーザ調査,使用シナリオ,定量的実験を通じてKeySIを評価し,ユーザ意図を捉え,埋め込みアライメントを改善する効果を実証した。
関連論文リスト
- Perspectives - Interactive Document Clustering in the Discourse Analysis Tool Suite [20.935269641413694]
Perspectivesは、デジタル人文科学(DH)の研究者が大規模で非構造化の文書コレクションを探索し組織化するためのツールスイートである。
パースペクティブは、ヒューマン・イン・ザ・ループの洗練機能を備えたフレキシブルでアスペクト指向のドキュメントクラスタリングパイプラインを実装している。
論文 参考訳(メタデータ) (2026-02-17T12:44:05Z) - Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding [118.75567341513897]
既存のメソッドは通常、ターゲットテキストを分離して分析するか、非メンバーコンテキストでのみ分析する。
Con-ReCallは、メンバと非メンバのコンテキストによって誘導される非対称な分布シフトを利用する新しいアプローチである。
論文 参考訳(メタデータ) (2024-09-05T09:10:38Z) - Pointer-Guided Pre-Training: Infusing Large Language Models with Paragraph-Level Contextual Awareness [3.2925222641796554]
ポインター誘導セグメントオーダリング(SO)は,段落レベルのテキスト表現の文脈的理解を高めることを目的とした,新しい事前学習手法である。
実験の結果,ポインタ誘導型事前学習は複雑な文書構造を理解する能力を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2024-06-06T15:17:51Z) - Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching [74.75284453828017]
Open-Vocabulary Keypoint Detection (OVKD)タスクは、任意の種類のキーポイントを特定するためにテキストプロンプトを使用するように設計されている。
セマンティック・フェールマッチング(KDSM)を用いた開語彙キーポイント検出(Open-Vocabulary Keypoint Detection)という新しいフレームワークを開発した。
このフレームワークは視覚と言語モデルを組み合わせて、言語機能とローカルキーポイント視覚機能との相互作用を作成する。
論文 参考訳(メタデータ) (2023-10-08T07:42:41Z) - FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback [69.4639239117551]
FigCaps-HFは、新しいフィギュアキャプション生成フレームワークである。
本フレームワークは,1) 図形選択ペアの品質を評価するための自動手法,2) 人物フィードバックを用いた新しい強化学習(RLHF) により,読取者の好みに応じて生成図形選択モデルを最適化する。
論文 参考訳(メタデータ) (2023-07-20T13:40:22Z) - Vision-Language Pre-Training for Boosting Scene Text Detectors [57.08046351495244]
シーンテキスト検出に視覚言語を用いた共同学習を特に応用する。
本稿では,視覚言語による事前学習を通して,文脈化された共同表現を学習することを提案する。
事前訓練されたモデルは、よりリッチなセマンティクスでより情報的な表現を生成することができる。
論文 参考訳(メタデータ) (2022-04-29T03:53:54Z) - Unified Pretraining Framework for Document Understanding [52.224359498792836]
文書理解のための統合事前学習フレームワークであるUDocを紹介する。
UDocは、ほとんどのドキュメント理解タスクをサポートするように設計されており、Transformerを拡張してマルチモーダル埋め込みを入力とする。
UDocの重要な特徴は、3つの自己管理的損失を利用して汎用的な表現を学ぶことである。
論文 参考訳(メタデータ) (2022-04-22T21:47:04Z) - Unsupervised Key-phrase Extraction and Clustering for Classification
Scheme in Scientific Publications [0.0]
本稿では,システムマッピング (SM) とシステムレビュー (SR) プロセスの自動化の可能性について検討する。
キーフレーズは教師なしの方法で科学文書から抽出され、対応する分類体系を構築するために使用される。
また、クラスタリングを使って関連するキーフレーズをグループ化する方法についても検討する。
論文 参考訳(メタデータ) (2021-01-25T10:17:33Z) - TNT-KID: Transformer-based Neural Tagger for Keyword Identification [7.91883337742071]
本稿では,キーワード識別のための Transformer-based Neural Tagger (TNT-KID) というキーワード識別アルゴリズムを提案する。
特定のタスクにトランスフォーマーアーキテクチャを適用し、ドメイン固有のコーパスで事前学習する言語モデルを活用することにより、キーワード抽出に対する教師なしと教師なしの両方のアプローチの欠陥を克服することができる。
論文 参考訳(メタデータ) (2020-03-20T09:55:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。