論文の概要: Beyond Exact Match: Task-Aware GRPO for Cross-Domain PCBA Visual Question Answering
- arxiv url: http://arxiv.org/abs/2609.21276v1
- Date: Fri, 18 Sep 2026 03:41:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.847715
- Title: Beyond Exact Match: Task-Aware GRPO for Cross-Domain PCBA Visual Question Answering
- Title(参考訳): Beyond Exact Match: クロスドメインPCBAビジュアル質問応答のためのタスク認識GRPO
- Abstract要約: クロスドメインPCBA視覚質問応答のためのマルチモーダル推論フレームワークを提案する。
このフレームワークは、標準由来、現実世界、補助的なPCBドメインデータを統一的な命令形式に変換する。
提案システムでは,PCBA 標準・レアルグランドチャレンジの総合スコアが83.24 である。
- 参考スコア(独自算出の注目度): 64.81231728620918
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In automated Printed Circuit Board Assembly (PCBA) inspection, standards-guided decisions require systems to jointly reason over fine-grained visual cues, component semantics, and manufacturing knowledge. Although large vision-language models (VLMs) provide a promising foundation, their deployment is hindered by the domain shift between standards-derived samples and real-world production-line imagery, together with heterogeneous output spaces spanning choice-based and numerical counting tasks. To address these challenges, we propose a multimodal reasoning framework for cross-domain PCBA visual question answering. The framework converts standards-derived, real-world, and auxiliary PCB-domain data into a unified instruction format and constructs verified reasoning traces aligned with visual evidence, question semantics, candidate options, and ground-truth answers. We further introduce Task-Aware Group Relative Policy Optimization (GRPO), which moves beyond exact-match supervision by integrating multi-component semantic rewards for choice-based questions, distance-aware rewards for counting questions, and an auxiliary format reward for valid outputs. During inference, answer-option semantic consistency correction, self-consistency voting, and multi-model arbitration are combined to improve prediction robustness. The proposed system achieves an Overall Score of 83.24 on the official PCBA Standard-to-Real Grand Challenge leaderboard, demonstrating the effectiveness of task-aware reward design and robust inference for cross-domain PCBA visual question answering.
- Abstract(参考訳): 自動プリント回路基板アセンブリ(PCBA)検査では、標準誘導決定は、きめ細かい視覚的手がかり、コンポーネントのセマンティクス、製造知識を共同で判断する必要がある。
大きな視覚言語モデル(VLM)は有望な基盤を提供するが、それらの展開は、標準由来のサンプルと実世界の生産ラインイメージとのドメインシフトと、選択ベースおよび数値カウントタスクにまたがる異質な出力空間によって妨げられる。
これらの課題に対処するため、クロスドメインPCBA視覚質問応答のためのマルチモーダル推論フレームワークを提案する。
このフレームワークは、標準由来、実世界および補助的PCBドメインデータを統一的な命令形式に変換し、視覚的エビデンス、質問セマンティクス、候補オプション、地味な答えと整合した検証された推論トレースを構築する。
さらに、選択に基づく質問に対する多成分意味報酬、質問のカウントに対する距離認識報酬、有効出力に対する補助形式報酬を統合することで、正確なマッチング管理を超えて、タスク認識グループ相対ポリシー最適化(GRPO)を導入する。
推論の間には、応答-オプションの意味的整合性補正、自己整合性投票、多モデル仲裁が組み合わされ、予測の堅牢性が改善される。
提案システムは,タスク認識型報酬設計の有効性と,クロスドメイン型PCBA視覚的質問応答に対する頑健な推論を実証し,PCBA Standard-to-Real Grand Challengeのリーダーボード上で83.24のスコアを達成している。
関連論文リスト
- Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception [14.939557815820693]
Marginal Contribution Reward (MCR) は、各予測ボックスのコントリビューションを、アウトアウト比較によって推定する。
Continuous Matched Set Value Evaluatorは、置換不変マッチング、カウントアウェア正規化、グレードローカライゼーションを統合している。
REC、DOD、セグメンテーション、カウントベンチマークにわたる実験は、以前のGRPOベースのベースラインよりも最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-08-02T07:43:09Z) - MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG [50.46218163777298]
知識に基づくビジュアル質問回答 (KB-VQA) では、大規模百科事典の知識ベースからクエリ画像と一致する視覚エンティティを検索し、関連する質問に答える必要がある。
MMAgent-R$2$は、視覚的リランク化と能動的拒絶を内部検証機構として統合したエージェントmRAGフレームワークである。
論文 参考訳(メタデータ) (2026-07-08T13:15:39Z) - UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities [70.79422099851506]
対話型AIシステム評価のための統合評価ツールキットUniDial-EvalKit(UDE)を提案する。
UDEは異種データフォーマットを普遍的なスキーマに標準化し、モジュールアーキテクチャを通じて複雑な評価パイプラインを合理化し、一貫したスコアリングインターフェースの下でメートル法計算を調整する。
論文 参考訳(メタデータ) (2026-03-24T13:01:31Z) - Consensus Group Relative Policy Optimization for Text Generation [26.428687964354605]
C-GRPOは、グループ相対的な目的としてコンセンサスユーティリティを定式化することにより、最小ベイズリスク(MBR)デコーディングをトレーニングに蒸留する。
理想的な条件下では、C-GRPO の目的関数は期待効用目標の勾配に方向整合していることが示される。
機械翻訳(WMT 2024)とテキスト要約(XSum)の実験は、C-GRPOがMBR復号化に匹敵する性能を達成することを示した。
論文 参考訳(メタデータ) (2026-02-03T04:54:40Z) - SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning [11.991985041067638]
本稿では,モンテカルロ木探索(MCTS)における制約誘導手法SCULPTを紹介する。
SCULPTは、シンボルチェック(次元整合性、型整合性、大きさの正しさ、深さ制御、多様性)と構造パターンガイダンスを組み合わせることで、スコアとプルーンのアクションを出力する。
全体として、ドメイン認識の制約は効率と安定性を維持しながら精度を向上させることができる。
論文 参考訳(メタデータ) (2026-01-19T08:55:46Z) - ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment [11.754819989978785]
ARCANEは、複数エージェントの協調問題としてアライメントをフレーム化して、自然言語のルーリックとして利害関係者の好みを動的に表現するフレームワークである。
実用理論に着想を得て, ルーブリック学習を再構築問題として定式化し, 正規化グループシーケンスポリシー最適化(GSPO)手法を適用した。
以上の結果から,ルーブリックに基づく報酬モデルが,複雑な長軸AIシステムに対して,解釈可能な,テスト時適応アライメントへの有望な経路を提供することが示された。
論文 参考訳(メタデータ) (2025-12-05T22:39:54Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Automated Visualization Code Synthesis via Multi-Path Reasoning and Feedback-Driven Optimization [13.178750787401263]
VisPathは構造化されたマルチステージ処理を通じて、不特定クエリを処理する。
最初はChain-of-Thoughtプロンプトを通じてユーザ入力をリフォームする。
VisPathは、最適な最終結果を合成するために集約されたターゲットフィードバックを生成する。
論文 参考訳(メタデータ) (2025-02-16T14:09:42Z) - Logically Consistent Loss for Visual Question Answering [66.83963844316561]
ニューラルネットワークに基づく視覚質問応答(VQA)の現在の進歩は、同じ分布(すなわち、d)の仮定による一貫性を保証することができない。
マルチタスク学習フレームワークにおける論理的一貫した損失を定式化することにより,この問題に対処するための新しいモデルに依存しない論理制約を提案する。
実験により、提案された損失公式とハイブリッドバッチの導入により、一貫性が向上し、性能が向上することを確認した。
論文 参考訳(メタデータ) (2020-11-19T20:31:05Z) - Robust Question Answering Through Sub-part Alignment [53.94003466761305]
我々はアライメント問題として質問応答をモデル化する。
私たちは、SQuAD v1.1でモデルをトレーニングし、いくつかの逆および外ドメインデータセットでそれをテストします。
論文 参考訳(メタデータ) (2020-04-30T09:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。