論文の概要: Overview of SHROOM-Visions 2026: A Shared Task on Hallucination Detection in Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.25662v2
- Date: Fri, 28 Aug 2026 05:44:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.083908
- Title: Overview of SHROOM-Visions 2026: A Shared Task on Hallucination Detection in Large Vision-Language Models
- Title(参考訳): SHROOM-Visions 2026の概要:大型視覚言語モデルにおける幻覚検出の共有課題
- Authors: Raúl Vázquez, Aman Sinha, Chuyuan Li, Artem Shelmanov, Artem Vazhentsev, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Lorenzo Vaiani, Jörg Tiedemann, Timothee Mickus,
- Abstract要約: 2026年にはSHROOM-Visionsタスクシリーズの第4回(textbfShared-task on textbfHallucinations and textbfRelated textbfMistakes in textbfVision Language modeltextbfs)を開催した。
今回は,大規模視覚言語モデルに着目したモデル非依存検出タスクを通じて幻覚に対処する。
評価は、中国語、英語、フランス語の4言語にまたがる幻覚の5クラス分類を用いる
- 参考スコア(独自算出の注目度): 19.79187126303009
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In 2026, we held the fourth iteration of the SHROOM Shared Task series: SHROOM-Visions (\textbf{S}hared-task on \textbf{H}allucinations and \textbf{R}elated \textbf{O}bservable \textbf{O}vergeneration \textbf{M}istakes in \textbf{Vision} language model\textbf{s}), which is hosted at the UncertaiNLP Workshop co-located with EMNLP 2026. Following the success of the 2024 and 2025 tasks, this time we aim to tackle hallucinations through a model-agnostic detection task focused on large vision-language models. Building on the recently introduced SHEEP dataset, designed for long-term evaluation across model generations, the task invites participants to detect and classify fine-grained hallucination spans in image-conditioned text generation (VQA, image captioning, etc.). The evaluation uses a five-class taxonomy of hallucinations spanning four languages: Chinese, English, French, and Italian. The shared task generated strong interest in the NLP community worldwide, with 27 teams contributing 600+ system submissions. The best systems achieve average scores of 0.58 in character-level correlation, 0.46 in label-conditioned correlation, and 0.51 in intersection-over-union (IoU) across four languages, outperforming the baselines by 30-40 points.
- Abstract(参考訳): 2026年、我々はSHROOM Shared Taskシリーズの第4回を開催した: SHROOM-Visions (\textbf{S}hared-task on \textbf{H}allucinations and \textbf{R}elated \textbf{O}bservable \textbf{O}vergeneration \textbf{M}istakes in \textbf{Vision} language model\textbf{s})。
2024年と2025年のタスクの成功に続いて、我々は大規模な視覚言語モデルに焦点を当てたモデルに依存しない検出タスクを通じて幻覚に取り組みます。
最近導入されたSHEEPデータセットに基づいて、モデル世代間での長期的な評価を目的として、タスクは参加者に、画像条件付きテキスト生成(VQA、画像キャプションなど)におけるきめ細かい幻覚の検出と分類を招待する。
この評価は、中国語、英語、フランス語、イタリア語の4つの言語にまたがる幻覚の5つのクラス分類を用いる。
共有タスクは世界中のNLPコミュニティに強い関心を抱き、27チームが600以上のシステムへの投稿に貢献した。
最高のシステムは、文字レベルの相関で平均スコアが0.58、ラベル条件付き相関で0.46、および4つの言語で共通結合(IoU)で0.51となり、ベースラインを30-40ポイント上回る。
関連論文リスト
- "AGI" team at SHROOM-CAP: Data-Centric Approach to Multilingual Hallucination Detection using XLM-RoBERTa [2.444311666637296]
本稿では,SHROOM-CAP 2025の9言語にわたる科学的幻覚検出タスクについて述べる。
既存の5つのデータセットを統合して、124,821のサンプル(50%の正解、50%の幻覚)からなる総合的なトレーニングコーパスを作成します。
我々の結果は、体系的なデータキュレーションがアーキテクチャの革新を単独で著しく上回ることを示した。
論文 参考訳(メタデータ) (2025-11-23T05:48:27Z) - SLRTP2025 Sign Language Production Challenge: Methodology, Results, and Future Work [87.9341538630949]
第1回手話生産チャレンジはCVPR 2025で第3回SLRTPワークショップの一環として開催された。
コンペティションの目的は、音声言語文からスケルトンポーズのシーケンスに変換するアーキテクチャを評価することである。
本稿では,挑戦設計と入賞方法について述べる。
論文 参考訳(メタデータ) (2025-08-09T11:57:33Z) - SemEval-2025 Task 3: Mu-SHROOM, the Multilingual Shared Task on Hallucinations and Related Observable Overgeneration Mistakes [72.61348252096413]
そこで本研究では,M Mu-SHROOM共有タスクを提案する。このタスクは,命令調整型大規模言語モデル(LLM)の出力における幻覚やその他の過剰生成ミスの検出に重点を置いている。
Mu-SHROOMは14言語で汎用LLMに対処し、幻覚検出問題をスパンラベルタスクとしてフレーム化する。
私たちは43の参加チームから2,618件の提出を受けました。
論文 参考訳(メタデータ) (2025-04-16T11:15:26Z) - HausaNLP at SemEval-2025 Task 3: Towards a Fine-Grained Model-Aware Hallucination Detection [1.8230982862848586]
本研究の目的は, 幻覚の発生と重篤さに関する, 微妙な, モデルに配慮した理解を英語で提供することである。
自然言語の推論と400サンプルの合成データセットを用いたModernBERTモデルの微調整を行った。
その結果,モデルの信頼度と幻覚の有無との間には,正の相関が認められた。
論文 参考訳(メタデータ) (2025-03-25T13:40:22Z) - SemEval-2024 Shared Task 6: SHROOM, a Shared-task on Hallucinations and Related Observable Overgeneration Mistakes [48.83290963506378]
本稿では,幻覚検出に焦点をあてた共有タスクであるSHROOMの結果について述べる。
このアプローチをどのように取り組んだかについて、いくつかの重要なトレンドを観察します。
チームの大多数が提案したベースラインシステムより優れていますが、トップスコアシステムのパフォーマンスは依然として、より困難なアイテムのランダムなハンドリングと一致しています。
論文 参考訳(メタデータ) (2024-03-12T15:06:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。