論文の概要: Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling
- arxiv url: http://arxiv.org/abs/2608.04554v1
- Date: Wed, 05 Aug 2026 07:47:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.776676
- Title: Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling
- Title(参考訳): アイテムの難易度予測のための視覚的エビデンスを表現する:視覚的テクスチャライゼーションと画像Native Modeling
- Authors: Han Chen, Ming Li, Hong Jiao, Tianyi Zhou,
- Abstract要約: 既存のアプローチは、通常、質問の幹を表現し、選択をテキストとして答える。
視覚的な証拠は、アイテムの難易度を予測するためにどのように表現されるべきなのか?
質問文のみの比較,言語における視覚的エビデンスを表現する視覚的テキスト化,原画像を保持するイメージネイティブモデリングを比較した。
- 参考スコア(独自算出の注目度): 25.609338472360662
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Predicting item difficulty from content can provide an initial estimate for newly developed questions before sufficient student responses are available. Existing approaches typically represent the question stem and answer choices as text. When mathematics items contain visual components, a common pipeline first textualizes that evidence and then applies a text predictor. We ask: how should visual evidence be represented for item difficulty prediction? We compare question text alone, visual textualization, which expresses visual evidence in language, and image-native modeling, which retains the original image. Using Eedi items with difficulty calibrated from student responses, we train large language models (LLMs) and vision-language models (VLMs) directly for difficulty regression. Both visual interfaces achieve the lowest point estimates, although the leading systems cannot be reliably ordered. Open-VLM textualization yields lower RMSE point estimates for all evaluated LLMs, while broader adaptation does so for all image-native VLMs. Test-time interventions show dependence on the paired full-item image, but do not isolate the additional visual component. The two visual interfaces also make partially complementary item-level errors and differ substantially in computational workflow. Thus, textualization should not be treated as the only practical interface: image-native modeling is a competitive alternative whose effectiveness depends on how the VLM is adapted.
- Abstract(参考訳): コンテンツからアイテムの難易度を予測することは、学生の回答が十分手に入る前に、新しく開発された質問に対する最初の見積もりを提供することができる。
既存のアプローチは、通常、質問の幹を表現し、選択をテキストとして答える。
数学の項目が視覚成分を含む場合、共通のパイプラインはまずその証拠をテキスト化し、次にテキスト予測器を適用する。
視覚的な証拠は、アイテムの難易度を予測するためにどのように表現されるべきなのか?
質問文のみの比較,言語における視覚的エビデンスを表現する視覚的テキスト化,原画像を保持するイメージネイティブモデリングを比較した。
学生の反応から校正が困難であるEedi項目を用いて,大きな言語モデル(LLM)と視覚言語モデル(VLM)を直接訓練し,難易度を抑える。
どちらのビジュアルインターフェースも最低点推定を達成しているが、主要なシステムは確実に順序付けできない。
Open-VLM のテキスト化は、すべての評価された LLM に対して低いRMSE 点推定をもたらすが、より広範な適応は、すべての画像ネイティブな VLM に対してである。
テストタイムの介入は、ペアのフルイテム画像への依存を示すが、追加の視覚成分を分離しない。
2つのビジュアルインターフェースは、部分的に補完的なアイテムレベルのエラーを発生させ、計算ワークフローではかなり異なる。
したがって、テキスト化は唯一の実用的なインターフェースとして扱うべきではない: 画像ネイティブモデリングは、VLMの適応方法に依存する競合する代替手段である。
関連論文リスト
- VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text? [51.02924254085878]
VLM(Vision-Language Models)は、テキスト入力と視覚入力のクロスモーダル理解において、優れたパフォーマンスを実現している。
VISTA-Benchは、マルチモーダル認識、推論、および非モーダル理解領域のベンチマークである。
論文 参考訳(メタデータ) (2026-02-04T17:48:55Z) - When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought [118.71264263478083]
MIRAは,中間画像の生成が推論の成功に不可欠であるシナリオにおいて,モデルを評価するために設計された新しいベンチマークである。
546のマルチモーダル問題を含み、中間画像と最終回答が注釈付きである。
論文 参考訳(メタデータ) (2025-11-04T18:00:51Z) - Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance [67.26434607115392]
大規模視覚言語モデル(LVLM)は様々な視覚言語タスクにおいて印象的な成果を上げている。
LVLMは言語バイアスによる幻覚に悩まされ、画像や非効果的な視覚的理解に焦点が当てられなくなった。
MDA (Multimodal duAl-attention meChanIsm) aNd soft-image Guidance (IFG) を用いたLVLMの言語バイアスに対処するためのLACingを提案する。
論文 参考訳(メタデータ) (2024-11-21T16:33:30Z) - Improving Visual Commonsense in Language Models via Multiple Image Generation [41.565399860320966]
既存の大規模言語モデル(LLM)は、主にテキストデータのみを使用して訓練されている。
視覚言語モデルは視覚的に指向するタスクに優れており、基本的なコモンセンス推論のような視覚的でないタスクでは失敗することが多い。
この分散は、基本的なテキストベースの言語推論と堅牢な視覚的理解の統合という、重要な課題を浮き彫りにする。
論文 参考訳(メタデータ) (2024-06-19T15:17:10Z) - IMProv: Inpainting-based Multimodal Prompting for Computer Vision Tasks [124.90137528319273]
本稿では,マルチモーダルプロンプトから視覚タスクをインコンテキストで学習できる生成モデルIMProvを提案する。
我々は、コンピュータビジョン論文とその関連キャプションから、新しい数字のデータセットにマスク付き生成変換器を訓練する。
推測時間中、テキストおよび/または画像タスクの例でモデルにプロンプトし、そのモデルに対応する出力を印字させる。
論文 参考訳(メタデータ) (2023-12-04T09:48:29Z) - Visually-augmented pretrained language models for NLP tasks without
images [77.74849855049523]
既存のソリューションはしばしば視覚的知識増強のために明示的なイメージに依存している。
我々は、新しいtextbfVisually-textbfAugmented fine-tuningアプローチを提案する。
我々のアプローチは、BERT、RoBERTa、BART、T5を異なるスケールで継続的に改善することができる。
論文 参考訳(メタデータ) (2022-12-15T16:13:25Z) - Visually-Augmented Language Modeling [137.36789885105642]
本稿では,言語モデリングのための関連画像を含むテキストトークンを視覚的に拡張する,VaLMという新しい事前学習フレームワークを提案する。
視覚的に拡張されたコンテキストでは、VaLMは視覚知識融合層を使用してマルチモーダル基底言語モデリングを可能にする。
視覚情報を必要とする多モーダル・コモンセンス推論タスクについて,提案モデルの評価を行った。
論文 参考訳(メタデータ) (2022-05-20T13:41:12Z) - A Picture May Be Worth a Hundred Words for Visual Question Answering [26.83504716672634]
画像理解においては、簡潔だが詳細な画像表現を用いることが不可欠である。
より高速なR-CNNのような視覚モデルによって抽出された深い視覚的特徴は、複数のタスクで広く使われている。
本稿では、深い視覚的特徴の代わりに記述-探索ペアを入力とし、言語のみのトランスフォーマーモデルに入力する。
論文 参考訳(メタデータ) (2021-06-25T06:13:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。