論文の概要: CRED-1: An Open Multi-Signal Domain Credibility Dataset for Automated Pre-Bunking of Online Misinformation
- arxiv url: http://arxiv.org/abs/2604.20856v1
- Date: Wed, 25 Feb 2026 11:45:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:14.115979
- Title: CRED-1: An Open Multi-Signal Domain Credibility Dataset for Automated Pre-Bunking of Online Misinformation
- Title(参考訳): CRED-1: オンライン誤情報の自動パンキングのためのオープンなマルチ署名ドメインクレシビリティデータセット
- Authors: Alexander Loth, Martin Kappes, Marc-Oliver Pahl,
- Abstract要約: CRED-1は、オープンで再現可能なドメインレベルの信頼性データセットである。
データセットは、2,672のドメインをフェイク、信頼できない、混合、陰謀、風刺と分類している。
CRED-1は、プライバシを保存するブラウザエクステンションのデバイス上でのデプロイ用に設計されている。
- 参考スコア(独自算出の注目度): 47.03825808787752
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This article presents CRED-1, an open, reproducible domain-level credibility dataset combining two openly-licensed source lists (OpenSources.co and Iffy.news) with four computed enrichment signals: domain age (WHOIS/RDAP), web popularity (Tranco Top-1M), fact-check frequency (Google Fact Check Tools API), and threat intelligence (Google Safe Browsing API). The dataset covers 2,672 domains categorized as fake, unreliable, mixed, conspiracy, or satire, each assigned a composite credibility score between 0.0 and 1.0. CRED-1 is designed for on-device deployment in privacy-preserving browser extensions to enable client-side pre-bunking of misinformation at the content delivery stage. The entire pipeline is implemented in Python using only standard library modules and is fully reproducible from publicly available sources. The dataset and pipeline code are released under CC~BY~4.0 and archived on Zenodo.
- Abstract(参考訳): この記事では、オープンにライセンスされた2つのソースリスト(OpenSources.coとIffy.news)と、ドメイン年齢(WHOIS/RDAP)、Webの人気(Tranco Top-1M)、ファクトチェック頻度(Google Fact Check Tools API)、脅威インテリジェンス(Google Safe Browsing API)の4つを組み合わせた、オープンで再現可能なドメインレベルの信頼性データセットであるCRED-1を紹介する。
データセットは、2,672のドメインをフェイク、信頼できない、混合、陰謀、風刺に分類し、それぞれ0.0から1.0の複合信頼性スコアを割り当てている。
CRED-1は、プライバシを保存するブラウザエクステンションのオンデバイス展開用に設計されており、コンテンツ配信段階でクライアント側で誤情報の事前発行を可能にする。
パイプライン全体は標準ライブラリモジュールのみを使用してPythonで実装されており、公開されているソースから完全に再現可能である。
データセットとパイプラインコードはCC~BY〜4.0でリリースされ、Zenodoにアーカイブされている。
関連論文リスト
- CiteRadar: A Citation Intelligence Platform for Researcher Profiling and Geographic Visualization [4.517994051913721]
CiteRadarは、Google Scholarの1つのユーザー識別子を受け入れるオープンソースのシステムである。
著者の完全なパブリッシュリストを含む構造化された出力フォルダを生成します。
CiteRadarは、5つの異種データソース – Google Scholar、OpenAlex、CrossRef、Semantic Scholar、Nominatim – を、慎重に設計された5段階のパイプラインを通じて統合する。
論文 参考訳(メタデータ) (2026-04-27T23:12:48Z) - CrediBench: Building Web-Scale Network Datasets for Information Integrity [27.562742270396086]
CrediBenchは、時間的Webグラフを構築するための大規模データ処理パイプラインである。
我々のアプローチは、一般的な誤情報領域の動的進化を捉えている。
本稿では,このグラフスナップショットを用いた実験から,信頼度を学習するための構造的およびWebページコンテンツ信号の強度を実証する。
論文 参考訳(メタデータ) (2025-09-27T14:42:48Z) - EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations [87.34429475432998]
既存のベンチマークには、データのリークとドメイン固有の評価の欠如という2つの制限がある。
EvoCodeBenchは、データ漏洩を避けるために、各期間(例:6ヶ月)に動的に更新される。
この記事では、25のリポジトリから275のサンプルを含む最初のバージョンであるEvoCodeBench-2403をリリースする。
論文 参考訳(メタデータ) (2024-10-30T08:57:59Z) - APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets [99.8988504388011]
APIGenは、関数呼び出しアプリケーションのための検証可能な高品質データセットを合成するために設計された、自動データ生成パイプラインである。
APIGenを活用して、21のカテゴリにわたる3,673の実行可能なAPIを収集し、多様な関数呼び出しデータセットを生成します。
機能呼び出しエージェントドメインの分野を推し進めるため、6万の高品質なエントリを含むデータセットをリリースする。
論文 参考訳(メタデータ) (2024-06-26T17:49:11Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - DADApy: Distance-based Analysis of DAta-manifolds in Python [51.37841707191944]
DADApyは、高次元データの分析と特徴付けのためのピソンソフトウェアパッケージである。
固有次元と確率密度を推定し、密度に基づくクラスタリングを行い、異なる距離メトリクスを比較する方法を提供する。
論文 参考訳(メタデータ) (2022-05-04T08:41:59Z) - A ground-truth dataset and classification model for detecting bots in
GitHub issue and PR comments [70.1864008701113]
ボットはGithubリポジトリで、分散ソフトウェア開発プロセスの一部である反復的なアクティビティを自動化するために使用されている。
本稿では,5000のGithubアカウントのプルリクエストとコメント発行に関する,高い相互契約を伴う手動分析に基づいて,基幹トラスデータセットを提案する。
ボットを検出する自動分類モデルを提案し,各アカウントの空のコメント数と空でないコメント数,コメントパターンの数,コメントパターン内のコメント間の不平等を主特徴とする。
論文 参考訳(メタデータ) (2020-10-07T09:30:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。