論文の概要: Event-Centric Human Value Understanding in News-Domain Texts: An Actor-Conditioned, Multi-Granularity Benchmark
- arxiv url: http://arxiv.org/abs/2603.17838v1
- Date: Wed, 18 Mar 2026 15:31:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-19 18:32:57.795855
- Title: Event-Centric Human Value Understanding in News-Domain Texts: An Actor-Conditioned, Multi-Granularity Benchmark
- Title(参考訳): ニュースドメインテキストにおける事象中心的人的価値理解:アクター定義多義性ベンチマーク
- Abstract要約: textbfNEVU (textbfNews textbfEvent-centric textbfValue textbfUnderstanding) は,実ニュースにおける強調因子に依存しない,エフェヴェント中心で,かつ,間接的認識を意識した人的価値認識のためのベンチマークである。
NEVUは、モデルが値キューを識別し、それらを正しいアクターに属性し、根拠付きエビデンスから値方向を決定することができるかどうかを評価する。
- 参考スコア(独自算出の注目度): 22.290459075590324
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing human value datasets do not directly support value understanding in factual news: many are actor-agnostic, rely on isolated utterances or synthetic scenarios, and lack explicit event structure or value direction. We present \textbf{NEVU} (\textbf{N}ews \textbf{E}vent-centric \textbf{V}alue \textbf{U}nderstanding), a benchmark for \emph{actor-conditioned}, \emph{event-centric}, and \emph{direction-aware} human value recognition in factual news. NEVU evaluates whether models can identify value cues, attribute them to the correct actor, and determine value direction from grounded evidence. Built from 2{,}865 English news articles, NEVU organizes annotations at four semantic unit levels (\textbf{Subevent}, \textbf{behavior-based composite event}, \textbf{story-based composite event}, and \textbf{Article}) and labels \mbox{(unit, actor)} pairs for fine-grained evaluation across local and composite contexts. The annotations are produced through an LLM-assisted pipeline with staged verification and targeted human auditing. Using a hierarchical value space with \textbf{54} fine-grained values and \textbf{20} coarse-grained categories, NEVU covers 45{,}793 unit--actor pairs and 168{,}061 directed value instances. We provide unified baselines for proprietary and open-source LLMs, and find that lightweight adaptation (LoRA) consistently improves open-source models, showing that although NEVU is designed primarily as a benchmark, it also supports supervised adaptation beyond prompting-only evaluation. Data availability is described in Appendix~\ref{app:data_code_availability}.
- Abstract(参考訳): その多くはアクターに依存しず、孤立した発話や合成シナリオに依存しており、明示的なイベント構造やバリュー方向が欠如している。
本稿では,emph{actor-conditioned}, \emph{event-centric}, \emph{actor-conditioned}, \emph{actor-centric}, \emph{direction-aware}による実ニュースにおける人的価値認識のベンチマークとして, textbf{NEVU}(\textbf{N}ews \textbf{E}vent-centric \textbf{V}alue \textbf{U}nderstanding)を提案する。
NEVUは、モデルが値キューを識別し、それらを正しいアクターに属性し、根拠付きエビデンスから値方向を決定することができるかどうかを評価する。
NEVUは2{,}865の英語ニュース記事から構築され、4つの意味単位レベル(\textbf{Subevent}, \textbf{behavior-based Composite Event}, \textbf{story-based Composite Event}, \textbf{Article})でアノテーションを整理し、ローカルコンテキストと複合コンテキストをまたいで詳細な評価を行う。
アノテーションは、段階的検証と対象とする人間の監査を備えたLCM支援パイプラインを通じて作成される。
NEVU は \textbf{54} の微細な値と \textbf{20} の粗粒度のカテゴリを持つ階層的値空間を用い、45{,}793 の単位ベクトル対と 168{,}061 の有向値インスタンスをカバーしている。
我々は,プロプライエタリかつオープンソース LLM の統一ベースラインを提供し,軽量適応 (LoRA) はオープンソースモデルを一貫して改善し,NEVU は主としてベンチマークとして設計されているが,教師付き適応もサポートしていることを示す。
データ可用性はAppendix~\ref{app:data_code_availability}で説明されます。
関連論文リスト
- GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models [0.0]
GPF-LIVENEWSは、グループ条件フレーミングの監査のためのストリーミング評価プロトコルとベンチマークスナップショットである。
新たなBBC/Reutersニュースアンカーを42のアイデンティティラベルと7つのプロンプトファミリーに拡張し、セマンティックセンシティブと感情格差信号を使用して応答バンドルを評価する。
12回以上の監視走行と23回のモデルで、ポリシー/アクションは最も強力なセマンティック・ムーブメントを生み出す。
我々は,全てのスコアを,ヒトの評定のための観察風監査信号として解釈し,恒久的公正度ランキングや有害バイアスの直接的証明として解釈する。
論文 参考訳(メタデータ) (2026-05-16T06:32:11Z) - Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook [50.10594064510559]
DOVEは、人文テキストとLLM出力を直接比較する分散評価フレームワークである。
DOVEは, ダウンストリームタスクと31.56%の相関を達成し, 高い信頼性を保ちながら, 文化ごとのサンプル500点程度の信頼性を維持した。
論文 参考訳(メタデータ) (2026-03-16T08:33:10Z) - Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time [36.493701506207806]
我々は,高密度空間アノテーションとミリ秒レベルの脳卒中管理を備えたtextbf811エゴセントリッククリップの診断ベンチマークである textbfEcoG-Bench を提案する。
最先端MLLMのベンチマークでは、厳しい実行可能性のギャップが明らかになっている。
マルチモーダルインタフェースは、モデル推論とは独立して、時間的アライメントキューの可観測性をボトルネックにする可能性がある。
論文 参考訳(メタデータ) (2026-03-09T05:08:02Z) - Correlation-Aware Feature Attribution Based Explainable AI [4.457502798302293]
emphExCIRは、軽量転送プロトコルを備えた相関対応属性スコアである。
textscBlockCIRは、コリニアクラスタの二重カウントを緩和する。
emphscalable説明責任は、現実のデプロイメントにおいて、emphscalable説明責任を計算的に効率的、emphscalent、emphscalable説明責任を提供する。
論文 参考訳(メタデータ) (2025-11-20T15:51:00Z) - Text2Stories: Evaluating the Alignment Between Stakeholder Interviews and Generated User Stories [10.591919727046017]
テキスト間アライメントのためのタスクとメトリクスであるText2Storiesを紹介する。
我々の測定基準は、書き起こしによって支持されるストーリーの割合と(ii)完全性、少なくとも1つのストーリーで支持される書き起こしの割合を定量化します。
4つのデータセットに対する実験により、LLMベースのマーカが保持されたアノテーション上で0.86マクロF1を達成することが示された。
論文 参考訳(メタデータ) (2025-10-08T09:12:57Z) - CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning [67.18702329644526]
CoT Referringは、構造化されたチェーン・オブ・シークレット・トレーニングデータ構造を通じて、モデル推論をモダリティにわたって強化する。
トレーニングデータを再構築して、新たな出力フォームを実行し、既存のデータセットに新たなアノテーションを提供します。
また、検出とセグメント化機能を統合MLLMフレームワークに統合し、新しい適応重み付き損失で学習して性能を最適化する。
論文 参考訳(メタデータ) (2025-10-03T08:50:21Z) - Influence Guided Context Selection for Effective Retrieval-Augmented Generation [23.188397777606095]
Retrieval-Augmented Generation (RAG)は、大きな言語モデル(LLM)の幻覚に対処する。
既存のアプローチは、定義済みのコンテキスト品質評価指標に基づいて、コンテキスト選択によるパフォーマンスの向上を試みる。
我々は、文脈品質評価を推論時データ評価問題として再認識し、文脈影響値(CI値)を導入する。
リストから各コンテキストを除去する際の性能劣化を測定することにより、コンテキスト品質を定量化する。
論文 参考訳(メタデータ) (2025-09-21T07:19:09Z) - VisMin: Visual Minimal-Change Understanding [7.226130826257802]
Visual Minimal-Change Understanding (VisMin)と呼ばれる新しい挑戦的なベンチマークを導入する。
VisMinは、2つの画像と2つのキャプションによって正しい画像キャプチャマッチを予測するモデルを必要とする。
我々は,大規模言語モデルと拡散モデルを用いた自動フレームワークを構築し,続いて人間のアノテーションによる厳密な4段階の検証プロセスを構築した。
論文 参考訳(メタデータ) (2024-07-23T18:10:43Z) - Exploiting Contextual Target Attributes for Target Sentiment
Classification [53.30511968323911]
TSCの既存のPTLMベースモデルは、1)PTLMをコンテキストエンコーダとして採用した微調整ベースモデル、2)テキスト/単語生成タスクに分類タスクを転送するプロンプトベースモデル、の2つのグループに分類される。
我々は,PTLM を TSC に活用する新たな視点として,言語モデリングと文脈的ターゲット属性による明示的ターゲットコンテキスト相互作用の利点を同時に活用する。
論文 参考訳(メタデータ) (2023-12-21T11:45:28Z) - UFineBench: Towards Text-based Person Retrieval with Ultra-fine Granularity [50.91030850662369]
既存のテキストベースの人物検索データセットは、しばしば比較的粗い粒度のテキストアノテーションを持つ。
これにより、実際のシナリオにおけるクエリテキストのきめ細かいセマンティクスを理解するモデルが妨げられます。
我々は,超微細な人物検索のためにtextbfUFineBench という新しいベンチマークを作成した。
論文 参考訳(メタデータ) (2023-12-06T11:50:14Z) - Leveraging VLM-Based Pipelines to Annotate 3D Objects [68.51034848207355]
本稿では,VLMの応答に影響を与える視点などの要因を疎外する代替アルゴリズムを提案する。
テキストのみの応答をマージする代わりに、VLMの合同画像テキストの可能性を利用する。
VLMベースのパイプラインを使って764Kデータセットから764Kオブジェクトの信頼性の高いアノテーションを生成する方法を示す。
論文 参考訳(メタデータ) (2023-11-29T17:54:22Z) - Evaluating Factual Consistency of Texts with Semantic Role Labeling [3.1776833268555134]
本稿では,テキスト要約を念頭に設計した参照不要評価指標SRLScoreを紹介する。
最終事実度スコアは、調整可能なスコアリング機構により算出される。
英語の要約データセットにおける人間の判断との相関は、SRLScoreが最先端の手法と競合していることを示している。
論文 参考訳(メタデータ) (2023-05-22T17:59:42Z) - UATVR: Uncertainty-Adaptive Text-Video Retrieval [90.8952122146241]
一般的なプラクティスは、テキストとビデオのペアを同じ埋め込みスペースに転送し、特定のエンティティとのクロスモーダルなインタラクションを構築することである。
UATVRと呼ばれる不確実性言語によるテキスト・ビデオ検索手法を提案し、各ルックアップを分布マッチング手順としてモデル化する。
論文 参考訳(メタデータ) (2023-01-16T08:43:17Z) - You can't pick your neighbors, or can you? When and how to rely on
retrieval in the $k$NN-LM [65.74934004876914]
Retrieval-enhanced Language Model (LM) は、大規模な外部データストアから取得したテキストにそれらの予測を条件付ける。
そのようなアプローチの1つ、$k$NN-LMは、既存のLMの予測を$k$-nearest近くのモデルの出力と補間する。
本研究では,2つの英語モデルデータセットに対するアプローチの有効性を実証的に測定する。
論文 参考訳(メタデータ) (2022-10-28T02:57:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。