論文の概要: A Synthetic Prediction Market for Estimating Confidence in Published
Work
- arxiv url: http://arxiv.org/abs/2201.06924v1
- Date: Thu, 23 Dec 2021 19:11:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2022-01-23 18:26:13.040103
- Title: A Synthetic Prediction Market for Estimating Confidence in Published
Work
- Title(参考訳): 出版物の信頼度推定のための合成予測市場
- Abstract要約: 我々は,社会・行動科学文学における論文の信頼性を評価するために,総合的な予測市場を構築した。
この研究は、ピアレビューにAIを創造的に利用する研究アジェンダの基礎を築いた。
- 参考スコア(独自算出の注目度): 12.205744685945586
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Explainably estimating confidence in published scholarly work offers
opportunity for faster and more robust scientific progress. We develop a
synthetic prediction market to assess the credibility of published claims in
the social and behavioral sciences literature. We demonstrate our system and
detail our findings using a collection of known replication projects. We
suggest that this work lays the foundation for a research agenda that
creatively uses AI for peer review.
- Abstract(参考訳): 出版された学術作品の信頼性を推定することは、より速くより堅牢な科学的進歩の機会を提供する。
我々は,社会・行動科学文学における論文の信頼性を評価するための総合予測市場を開発する。
我々は,本システムについて実演し,その成果を既知の複製プロジェクトを用いて詳述する。
我々はこの研究が、ピアレビューにAIを創造的に利用する研究アジェンダの基礎となることを示唆している。
関連論文リスト
- AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era [55.37558486468993]
AgentIdeaBenchは、静的観測とアクティブ探索という2つの一致した条件下で科学的思考を評価するベンチマークである。
5つの分野にまたがる40の高密度サブフィールドにおける33個のLDMの静的アクティブ評価を一致させた。
アクティブな探索により、ヘッドルームの能力は大幅に向上し、ヘッドルームはモデル間で不均一に分散される。
論文 参考訳(メタデータ) (2026-09-07T15:19:13Z) - Human-AI Collaboration for Estimating Scientific Replicability [9.157610685256163]
アルゴリズムエージェントが人間と取引するハイブリッド予測市場を導入する。
エージェントは何百もの先行複製研究の結果に基づいて訓練され、一方で人間の参加者はドメイン知識を貢献する。
我々の結果は、いくつかのケースを除いて、ハイブリッド市場は、人工予測市場と一致するか、または優れています。
論文 参考訳(メタデータ) (2026-04-19T14:32:01Z) - Towards a Medical AI Scientist [73.6056699962416]
私たちは、臨床自律研究に特化した最初の自律的な研究フレームワークである、メディカルAIサイエンティストを紹介します。
このフレームワークは3つの研究モード、すなわち論文ベースの再現、文学にインスパイアされた革新、タスク駆動探索で動作する。
本システムでは,提案手法と実装の密接な整合性を実現するとともに,実行可能実験において極めて高い成功率を示す。
論文 参考訳(メタデータ) (2026-03-30T15:37:25Z) - The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research [56.80927148740585]
我々は、動的に進化し、研究評価者としてAIエージェントを開発することで、スケーラビリティと厳密さの課題に対処する。
我々は,機械的解釈可能性の研究をテストベッドとして使用し,標準化された研究成果を構築し,MechEvalAgentを開発した。
我々の研究は、AIエージェントが研究評価を変革し、厳格な科学的実践の道を開く可能性を実証している。
論文 参考訳(メタデータ) (2026-02-05T19:00:02Z) - Capability-Aware Early-Stage Research Idea Evaluation [8.170163951342602]
本稿では,著者情報と研究思想のみを用いて,論文の受容と評価を予測する能力認識フレームワークを提案する。
提案手法では,3方向トランスフォーマーアーキテクチャによる著者情報,(推測)能力提示,研究アイデアを統合した。
論文 参考訳(メタデータ) (2026-01-18T16:22:17Z) - How to Find Fantastic Papers: Self-Rankings as a Powerful Predictor of Scientific Impact Beyond Peer Review [41.30621399289495]
我々は、高インパクトな研究を特定するための未調査の尺度を調査する。著者自身の、同じAIカンファレンスへの複数の応募のランキング。
我々は、先進的なAIカンファレンスで大規模な実験を行い、1,342人の研究者が、2,592件の投稿を認識された品質で自己ランク付けした。
その結果,論文が著者によって上位にランクされた論文は,最もランクの低い論文の2倍の引用を受け取っていることがわかった。
論文 参考訳(メタデータ) (2025-10-02T15:50:21Z) - LiRA: A Multi-Agent Framework for Reliable and Readable Literature Review Generation [66.09346158850308]
文献レビュープロセスをエミュレートする多エージェント協調ワークフローLiRA(Literature Review Agents)を提案する。
LiRAは、コンテンツアウトライン、サブセクションの執筆、編集、レビュー、コヒーシブで包括的なレビュー記事の作成に特殊エージェントを使用している。
実世界のシナリオにおいて文書検索を用いてLiRAを評価し,そのロバスト性を評価する。
論文 参考訳(メタデータ) (2025-10-01T12:14:28Z) - SciArena: An Open Evaluation Platform for Foundation Models in Scientific Literature Tasks [87.29946641069068]
我々は,学術文献タスクの基礎モデルを評価するための,オープンで協調的なプラットフォームであるSciArenaを紹介する。
集合的知性を活用することで、SciArenaはコミュニティ主導の、オープンな科学的タスクにおけるモデルパフォーマンスの評価を提供する。
収集した嗜好データに基づいたメタ評価ベンチマークであるSciArena-Evalをリリースする。
論文 参考訳(メタデータ) (2025-07-01T17:51:59Z) - In-depth Research Impact Summarization through Fine-Grained Temporal Citation Analysis [52.42612945266194]
我々は、ニュアンス付き、表現型、時間対応のインパクトサマリーを生成する新しいタスクを提案する。
これらの要約は、微粒な引用意図の進化を通じて、賞賛(確認引用)と批評(補正引用)の両方を捉えていることを示す。
論文 参考訳(メタデータ) (2025-05-20T19:11:06Z) - From Hypothesis to Publication: A Comprehensive Survey of AI-Driven Research Support Systems [40.10425916520717]
近年、人工知能(AI)技術の急速な発展は、研究者にAIが研究を加速し、強化する方法を探るきっかけとなった。
本稿では,本領域の進展を体系的に概観する。
我々は,関連する研究を仮説定式化,仮説検証,原稿出版という3つの主要なカテゴリに分類する。
論文 参考訳(メタデータ) (2025-03-03T11:27:13Z) - Optimizing Research Portfolio For Semantic Impact [55.2480439325792]
サイテーション指標は学術的影響を評価するために広く用いられているが、社会的偏見に悩まされている。
本稿では,研究効果を予測する新しいフレームワークであるrXiv Semantic Impact (XSI)を紹介する。
XSIは学術知識グラフにおける研究概念の進化を追跡している。
論文 参考訳(メタデータ) (2025-02-19T17:44:13Z) - Automatic Evaluation Metrics for Artificially Generated Scientific Research [3.9845810840390743]
本研究では,2つの自動評価指標,特に引用数予測とレビュースコア予測について検討する。
本研究の結果から, 引用数予測はレビュースコア予測よりも有効であり, 完全論文より純粋にスコア予測が困難であることが判明した。
論文 参考訳(メタデータ) (2025-02-14T14:56:14Z) - Paper Quality Assessment based on Individual Wisdom Metrics from Open Peer Review [3.802113616844045]
本研究では,レビュアの品質を推定するオープンなボトムアッププロセスを通じて,科学的ピアレビューの精度と効率を向上させるためのデータ駆動フレームワークを提案する。
我々は,2つの主要な学術会議から開かれたピアレビューデータを分析し,レビュアー固有の品質スコアが紙の品質評価の信頼性を著しく向上することを示した。
論文 参考訳(メタデータ) (2025-01-22T17:00:27Z) - Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents [64.64280477958283]
科学文献の急激な増加は、研究者が最近の進歩と意義ある研究方向を見極めるのを困難にしている。
大規模言語モデル(LLM)の最近の発展は、新しい研究のアイデアを自動生成するための有望な道のりを示唆している。
本研究では, チェーン構造に関連文献を整理し, 研究領域の進展を効果的に反映する, LLMベースのエージェントであるChain-of-Ideas(CoI)エージェントを提案する。
論文 参考訳(メタデータ) (2024-10-17T03:26:37Z) - Two Heads Are Better Than One: A Multi-Agent System Has the Potential to Improve Scientific Idea Generation [48.29699224989952]
VirSciは研究のアイデアを共同で生成し、評価し、洗練するエージェントのチームを組織している。
このマルチエージェントアプローチは、新規で影響力のある科学的アイデアを生み出す上で、最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-10-12T07:16:22Z) - Good Idea or Not, Representation of LLM Could Tell [86.36317971482755]
我々は、大規模言語モデルの知識を活用し、科学的アイデアのメリットを評価することを目的としたアイデアアセスメントに焦点をあてる。
我々は、このタスクに対する様々なアプローチのパフォーマンスを訓練し評価するために、細心の注意を払って設計された、フルテキストを持つ約4万の原稿からベンチマークデータセットをリリースする。
その結果, 大規模言語モデルの表現は, 生成出力よりもアイデアの価値を定量化する可能性が高いことが示唆された。
論文 参考訳(メタデータ) (2024-09-07T02:07:22Z) - Performative Prediction on Games and Mechanism Design [69.7933059664256]
エージェントが過去の正確性に基づいて予測を信頼するかを判断する集団リスクジレンマについて検討する。
予測が集合的な結果を形成するにつれて、社会福祉は関心の指標として自然に現れる。
よりよいトレードオフを実現し、それらをメカニズム設計に使用する方法を示します。
論文 参考訳(メタデータ) (2024-08-09T16:03:44Z) - ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models [56.08917291606421]
ResearchAgentは、大規模言語モデルによる研究アイデア作成エージェントである。
科学文献に基づいて繰り返し精製しながら、問題、方法、実験設計を生成する。
我々は、複数の分野にわたる科学論文に関するResearchAgentを実験的に検証した。
論文 参考訳(メタデータ) (2024-04-11T13:36:29Z) - A Literature Review of Literature Reviews in Pattern Analysis and Machine Intelligence [55.33653554387953]
パターン分析とマシンインテリジェンス(PAMI)は、情報の収集と断片化を目的とした多くの文献レビューにつながっている。
本稿では、PAMI分野におけるこれらの文献レビューの徹底的な分析について述べる。
1)PAMI文献レビューの構造的・統計的特徴は何か,(2)レビューの増大するコーパスを効率的にナビゲートするために研究者が活用できる戦略は何か,(3)AIが作成したレビューの利点と限界は人間によるレビューと比較するとどのようなものか,という3つの主要な研究課題に対処しようとする。
論文 参考訳(メタデータ) (2024-02-20T11:28:50Z) - Repeatability, Reproducibility, Replicability, Reusability (4R) in
Journals' Policies and Software/Data Management in Scientific Publications: A
Survey, Discussion, and Perspectives [1.446375009535228]
我々は、引用指向のプラクティス、ジャーナルポリシー、レコメンデーション、アーティファクト記述/評価ガイドライン、提出ガイド、技術的進化の間に大きなギャップを見出した。
著者と学術雑誌の関係を,共同で科学的結果を改善するための相互取り組みとして分析した。
我々は,学術論文を著者に提出するための統一的で標準化された再現性ガイドとともに,雑誌政策の勧告を提案する。
論文 参考訳(メタデータ) (2023-12-18T09:02:28Z) - Unveiling the Sentinels: Assessing AI Performance in Cybersecurity Peer
Review [4.081120388114928]
サイバーセキュリティの分野では、ダブルブラインドピアレビューの実践がデファクトスタンダードである。
本稿では、ピアレビューの聖杯に触れ、学術的セキュリティカンファレンスのレビューにおけるAIのパフォーマンスについて光を当てることを目的としている。
本研究では,人間レビュアーと機械学習モデルから得られた結果を比較し,評価結果の予測可能性について検討する。
論文 参考訳(メタデータ) (2023-09-11T13:51:40Z) - A prototype hybrid prediction market for estimating replicability of
published work [9.59326922088501]
我々は,機械学習アルゴリズムとして人工予測市場を提案する先行作業に基づいて構築する。
人工予測市場では、訓練されたAIエージェントが将来のイベントの結果を購入し、販売する。
複製学習の結果を予測するために,試作型ハイブリッド市場を用いたパイロット研究を詳述する。
論文 参考訳(メタデータ) (2023-03-01T23:44:02Z) - Investigating Fairness Disparities in Peer Review: A Language Model
Enhanced Approach [77.61131357420201]
我々は、大規模言語モデル(LM)の助けを借りて、ピアレビューにおける公平性格差の徹底した厳密な研究を行う。
我々は、2017年から現在までのICLR(International Conference on Learning Representations)カンファレンスで、包括的なリレーショナルデータベースを収集、組み立て、維持しています。
我々は、著作者性別、地理、著作者、機関的名声など、興味のある複数の保護属性に対する公平性の違いを仮定し、研究する。
論文 参考訳(メタデータ) (2022-11-07T16:19:42Z) - Epistemic Parity: Reproducibility as an Evaluation Metric for
Differential Privacy [9.755020926517291]
本稿では,プロキシタスクの表現性に関する仮定を回避した合成データの評価手法を提案する。
著者が合成データを使用した場合、公表された結論が変わる可能性を測定する。
我々は、より強力なユーティリティ保証を支持し、プライバシー保護を提供する新しい種類のメカニズムを提唱する。
論文 参考訳(メタデータ) (2022-08-26T14:57:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。