論文の概要: Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks
- arxiv url: http://arxiv.org/abs/2607.18767v1
- Date: Tue, 21 Jul 2026 06:49:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.338883
- Title: Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks
- Title(参考訳): 視覚ベースグラディングタスクにおける小さな言語モデル性能向上のためのボックス境界
- Authors: Lachlan McGinness,
- Abstract要約: 本研究は,SLMの精度と計算効率を向上させるために,有界箱を用いて学生の反応を収穫する手法について検討する。
その結果,バウンディングボックスの使用によりグレーディング精度が大幅に向上し,モデル間の計算コスト(FLOP)が低減されることがわかった。
我々は,SLMを大規模かつ視覚的な教育評価に展開する上で,バウンディングボックスは重要な前処理ステップである,と結論付けた。
- 参考スコア(独自算出の注目度): 0.33842793760651557
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The deployment of Small Language Models (SLMs) in educational settings offers significant advantages in terms of privacy, cost, and scalability. However, SLMs often struggle with complex vision-based tasks, such as grading handwritten student exams, due to the high computational cost of processing large images and the visual distractions present on a full page. In this paper, we investigate whether cropping student responses using bounding boxes can improve the accuracy and computational efficiency of SLMs on a short-answer grading task. Using a dataset of scanned handwritten responses from the 2025 Australian Physics Olympiad, we evaluate the performance of several models ranging from 4B to 72B parameters under varying conditions of Chain of Thought (CoT) prompting and image cropping. Our results demonstrate that using bounding boxes significantly improves grading accuracy and reduces computational cost (FLOPs) across models. We conclude that bounding boxes are a crucial pre-processing step for deploying SLMs in large-scale, vision-based educational assessments.
- Abstract(参考訳): 教育環境でのSmall Language Models (SLM) の展開は、プライバシ、コスト、スケーラビリティという面で大きなアドバンテージを提供する。
しかし、SLMは、大きな画像を処理するのに高い計算コストと全ページにある視覚的混乱のために、手書きの学生試験の成績などの複雑な視覚ベースのタスクに悩まされることが多い。
本稿では,SLMの精度と計算効率を向上させるために,拘束箱を用いて学生の反応を収穫することにより,短時間の学習課題におけるSLMの精度と計算効率を向上させることができるかを検討する。
2025年のオーストラリア物理学オリンピックにおける手書き応答のデータセットを用いて、思考の連鎖(CoT)の促進と画像収穫の異なる条件下での4Bから72Bパラメータのいくつかのモデルの性能を評価する。
その結果,バウンディングボックスの使用によりグレーディング精度が大幅に向上し,モデル間の計算コスト(FLOP)が低減されることがわかった。
我々は,SLMを大規模かつ視覚的な教育評価に展開する上で,バウンディングボックスは重要な前処理ステップである,と結論付けた。
関連論文リスト
- Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding [56.38477453373368]
LazyMCoTは動的でトレーニング不要なフレームワークで、サンプルの難易度に基づいて視覚的接地作業を適応的に割り当てる。
LazyMCoTは、推論精度を同時に改善し、平均推論レイテンシを低減することで、トレーニングベースのアプローチと競合する。
論文 参考訳(メタデータ) (2026-06-15T03:17:44Z) - BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model [10.757627088489116]
最先端評価メトリクスは、審査員としてLarge Language Models (LLMs) を使用する際の計算コストの増大を伴う。
本稿では,視覚的質問応答モデルチェックポイントから生成する軽量なクロスエンコーダに基づく,上記の課題に対処する新たな学習指標を提案する。
本手法では, 教師あり学習において, モデル感度を高めるために, 逆LLMに基づくデータ拡張を特徴とし, 微粒な視覚言語的誤りに対するモデル感度の向上を図っている。
論文 参考訳(メタデータ) (2026-05-20T20:43:38Z) - ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning [8.933549837045932]
大きなビジョンランゲージモデルは、視覚トークンの冗長性のために高い計算コストを発生させる。
視覚エンコーダの冗長性フィルタリングと大規模言語モデル内の段階的協調処理を組み合わせた視覚的・テキスト的協調処理フレームワーク(ViTCoP)を提案する。
論文 参考訳(メタデータ) (2026-01-25T12:47:30Z) - Online In-Context Distillation for Low-Resource Vision Language Models [16.3054668860198]
小さな視覚言語モデル(VLM)は効率的だが、デプロイメント領域におけるより大きなモデルとのパフォーマンスギャップを埋めるためには、通常、コストのかかる微調整が必要である。
In-Context Distillation (ICD) 手法を提案する。この手法では,小さなVLMが推論時により強力な教師モデルと協調する。
本手法は,教師注記の少ない小モデル(最大33%)の性能を著しく向上させる。
論文 参考訳(メタデータ) (2025-10-20T21:35:17Z) - Cost-Optimal Grouped-Query Attention for Long-Context Modeling [45.981681856747365]
Grouped-Query Attention(GQA)は、大規模言語モデルにおける注目層の計算コストを削減するための広く採用されている戦略である。
我々は,文脈長,モデルサイズ,GQA構成,モデル損失の関係を分析する。
コスト最適GQA構成の導出法を提案する。
論文 参考訳(メタデータ) (2025-03-12T17:50:42Z) - Learning LLM Preference over Intra-Dialogue Pairs: A Framework for Utterance-level Understandings [9.763273544617176]
大規模言語モデル(LLM)は、ケース固有の微調整を必要とせずに複雑な対話タスクを処理できることが顕著に示されている。
本稿では,この課題に対処するための,シンプルながら効果的な枠組みを提案する。
本手法は、意図検出や対話状態追跡などのタスクを含む発話ごとの分類問題に特化して設計されている。
論文 参考訳(メタデータ) (2025-03-07T17:46:13Z) - FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression [16.53645461974695]
現在の訓練不要なビジュアルトークン圧縮法は、高解像度画像を含むタスクにおいて深刻な性能劣化を示す。
テキスト指向視覚大言語モデル(VLLM)の高解像度シナリオにおける効率的なビジュアルトークン圧縮フレームワークを提案する。
提案手法は,テキスト指向ベンチマークにおいて,ベースラインよりも高い性能を保ちながら,計算オーバーヘッドを大幅に低減する。
論文 参考訳(メタデータ) (2025-02-22T16:05:33Z) - Enhancing Large Vision Language Models with Self-Training on Image Comprehension [131.14381425260706]
本稿では、画像理解に特化して自己学習アプローチを強調する自己学習 on Image (STIC)を紹介する。
まず、ラベルのない画像を用いて、画像記述の好みを自己構築する。
抽出した視覚情報に対する推論をさらに自己改善するため,既存の命令調整データのごく一部をモデルに再利用する。
論文 参考訳(メタデータ) (2024-05-30T05:53:49Z) - Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-Tuning [55.265138447400744]
ステートメントチューニングは、有限文の集合として識別タスクをモデル化し、エンコーダモデルを訓練し、潜在的なステートメントを識別してラベルを決定するテクニックである。
その結果, ステートメント・チューニングは, パラメータが著しく少ない最先端のLCMと比較して, 競争性能が向上することを示した。
この研究は、いくつかの設計選択が少ショットとゼロショットの一般化に与える影響を調査し、ステートメントチューニングが控えめなトレーニングデータで高いパフォーマンスを達成できることを明らかにした。
論文 参考訳(メタデータ) (2024-04-19T14:05:03Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。