論文の概要: AI Overviews in Academic Search: Evaluating AI-generated Summaries of Search Results in a Domain-specific Search Engine
- arxiv url: http://arxiv.org/abs/2607.03421v1
- Date: Fri, 03 Jul 2026 15:35:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:40:39.611884
- Title: AI Overviews in Academic Search: Evaluating AI-generated Summaries of Search Results in a Domain-specific Search Engine
- Title(参考訳): 学術検索におけるAIの概要: ドメイン固有の検索エンジンにおけるAI生成した検索結果の要約の評価
- Abstract要約: 社会科学情報のための学術検索エンジンにおいて,AI生成サマリーを支援機能として評価する。
主観的な作業負荷,有用性,満足感,意思決定の信頼感など,AIサマリーを支持する重要なトレンドは見つからない。
- 参考スコア(独自算出の注目度): 4.04785724664289
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating search engine results pages (SERPs) to assess result relevance is a demanding step in academic search. In a formative mixed-methods design study, we examine AI-generated SERP-level summaries as a support feature in an academic search engine for social science information. First, we manually evaluated summaries of the top five results for 10 queries using two general-purpose models, one commercial and one open, deriving an exploratory six-category error taxonomy and five safeguards for scholarly deployment. We then conducted a within-subjects user study (n = 30) comparing interfaces with and without AI summaries. Confirmatory analyses showed consistent but non-significant trends favoring AI summaries for subjective workload, perceived usefulness, satisfaction, and decision-making confidence. Exploratory analyses suggested lower mental demand, with frustration also tending to be lower. Behaviorally, participants rarely expanded the summaries and descriptively made slightly fewer result clicks and query reformulations when summaries were available. Drawing on Information Foraging Theory and participant feedback, we suggest that AI summaries may concentrate SERP-level information scent to support early triage. Overall, the findings indicate that SERP-level AI summaries are a context- and user-dependent aid rather than a universal improvement, while contributing an error taxonomy, safeguard-aware deployment guidance, and concrete design implications for scholarly search.
- Abstract(参考訳): 検索結果ページ(SERP)を評価して結果の関連性を評価することは,学術検索において要求されるステップである。
本稿では,社会科学情報のための学術検索エンジンにおいて,AIによるSERPレベルの要約を支援機能として検討する。
まず,2つの汎用モデル,1つの商用モデルと1つのオープンモデルを用いて,上位5項目の要約を手作業で評価した。
次に,AIサマリーを使わずにインターフェースを比較した内的ユーザスタディ(n = 30)を行った。
確認分析では、主観的な作業負荷に対するAIの要約、有用性、満足感、意思決定の信頼感を優先する一貫した傾向を示した。
調査分析の結果、精神的な需要は低く、フラストレーションも低い傾向にあった。
行動的には、参加者が要約を拡張することはめったになく、要約が利用可能になったときの検索結果のクリックやクエリの改定をわずかに減らした。
情報鍛造理論と参加者のフィードバックに基づき,AI要約は早期トリアージを支援するためにSERPレベルの情報香に集中することが示唆された。
全体として、SERPレベルのAI要約は、普遍的な改善よりもコンテキストに依存した支援であり、エラー分類、セーフガード対応デプロイメントガイダンス、学術的な検索のための具体的な設計上の意味を寄与している。
関連論文リスト
- Cost-efficient generative AI summarization for scalable automated essay scoring in educational assessment [0.40611352512781873]
本研究では,長文エッセイ表現を改善するためのAI支援要約フレームワークを提案する。
3種類のGPT-5変異体(GPT-5, GPT-5 mini, GPT-5 nano)の制御長サマリーを生成し, 下流AESモデルの入力として使用する。
オリジナルの筆記信号を保存するため,全エッセイから抽出した手書き言語特徴を要約表現と統合する。
論文 参考訳(メタデータ) (2026-07-17T10:39:58Z) - AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research [56.80927148740585]
我々は、動的に進化し、研究評価者としてAIエージェントを開発することで、スケーラビリティと厳密さの課題に対処する。
我々は,機械的解釈可能性の研究をテストベッドとして使用し,標準化された研究成果を構築し,MechEvalAgentを開発した。
我々の研究は、AIエージェントが研究評価を変革し、厳格な科学的実践の道を開く可能性を実証している。
論文 参考訳(メタデータ) (2026-02-05T19:00:02Z) - Let the Barbarians In: How AI Can Accelerate Systems Performance Research [80.43506848683633]
我々は、この繰り返しサイクルを、AI駆動システム研究の生成、評価、洗練のサイクルと呼ぶ。
我々はADRSが生成するソリューションが人間の最先端の設計に適合し、さらに優れることを示した。
論文 参考訳(メタデータ) (2025-12-16T18:51:23Z) - AI summaries in online search influence users' attitudes [3.459756369056329]
本研究では,AIが生成した要約が,ユーザが異なる問題に対する考え方にどのように影響するかを検討した。
ユーザーは、AIサマリーが健康被害と福利厚生に重点を置いていると認識した。
これらの結果は、AIが生成した検索サマリーが公共の認識を著しく形作ることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T23:45:19Z) - Automated Classification of Tutors' Dialogue Acts Using Generative AI: A Case Study Using the CIMA Corpus [10.325932865188514]
このケーススタディでは、教師の回答を4つのDAカテゴリに事前にアノテートしたオープンソースのCIMAコーパスを用いている。
その結果, GPT-4は80%の精度, F1スコア0.81, Cohen's Kappa0.74を得た。
論文 参考訳(メタデータ) (2025-09-11T03:36:03Z) - Reasoning-enhanced Query Understanding through Decomposition and Interpretation [87.56450566014625]
ReDIは、分解と解釈によるクエリ理解のための推論強化アプローチである。
我々は,大規模検索エンジンから実世界の複雑なクエリの大規模データセットをコンパイルした。
BRIGHT と BEIR の実験により、ReDI はスパースと密度の高い検索パラダイムの両方において、強いベースラインを一貫して超えることを示した。
論文 参考訳(メタデータ) (2025-09-08T10:58:42Z) - BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent [74.10138164281618]
BrowseComp-Plus(BrowseComp-Plus)は、BrowseCompから派生したベンチマークである。
このベンチマークは、ディープリサーチエージェントと検索方法の総合的な評価とアンタングル解析を可能にする。
論文 参考訳(メタデータ) (2025-08-08T17:55:11Z) - Are Large Language Models Ready for Business Integration? A Study on Generative AI Adoption [0.6144680854063939]
本研究では,Google Geminiのような他の大規模言語モデル(LLM)のビジネスアプリケーションへの適用性について検討する。
ディズニーランドの異なる支店からの42,654件のレビューデータセットが採用された。
その結果、75%の成功率、25%のエラー、モデル自己参照の事例など、反応のスペクトルが示された。
論文 参考訳(メタデータ) (2025-01-28T21:01:22Z) - A Literature Review of Literature Reviews in Pattern Analysis and Machine Intelligence [51.26815896167173]
本稿では,3つの相補的な側面からPAMIレビューを総合的に分析する。
我々の分析は、現在のレビューの実践において、独特の組織パターンと永続的なギャップを明らかにします。
最後に、最先端のAI生成レビューの評価は、コヒーレンスと組織の進歩を奨励していることを示している。
論文 参考訳(メタデータ) (2024-02-20T11:28:50Z) - Automatic Text Summarization Methods: A Comprehensive Review [1.6114012813668934]
本研究は,要約手法,使用する手法,標準データセット,評価指標,今後の研究範囲などのテキスト要約概念を詳細に分析する。
論文 参考訳(メタデータ) (2022-03-03T10:45:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。