論文の概要: Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs
- arxiv url: http://arxiv.org/abs/2607.14099v1
- Date: Fri, 01 May 2026 17:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.005969
- Title: Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs
- Title(参考訳): Just Keep Prompting: VLMにおける反復的ソクラテス的プロンプトの評価
- Abstract要約: JKP(Just Keep Prompting)は,ユーザがモデルの回答に何度も挑戦したり,質問したり,矛盾したりするときに,VLMの安定性を計測するマルチターン評価フレームワークである。
JKPは、Adversarial Negation(繰り返し拒否)、Pure Socratic Interrogation(再評価のための繰り返し呼び出し)、Context-Aware Socratic Summarization(文脈対応ソクラティック要約)という3つの戦略を用いて、最大10回の追従ターンのモデルを探索する。
GPT-4o, Gemini 2.5 Pro, Qwen3-VL-30BをSTARベンチマークのサブセットとして720回のマルチターンランで評価した。
- 参考スコア(独自算出の注目度): 7.833541893955439
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Deploying Vision-Language Models (VLMs) in real-world settings requires not only strong visual reasoning but also stability under sustained conversational pressure. We introduce Just Keep Prompting (JKP), a multi-turn evaluation framework that measures VLM epistemic stability when users repeatedly challenge, question, or contradict a model's answer. JKP probes models for up to 10 follow-up turns using three strategies: Adversarial Negation (repeated rejection), Pure Socratic Interrogation (repeated calls to reassess certainty), and Context-Aware Socratic Summarization (reflecting the model's prior rationale back before asking for reconsideration). We evaluate GPT-4o, Gemini 2.5 Pro, and Qwen3-VL-30B on a subset of the STAR benchmark across 720 multi-turn runs. Aggregate accuracy changes modestly from Turn 0 to Turn 10, but trajectory-level analysis reveals substantial instability: correct answers regress, wrong answers recover, and many runs exhibit repeated answer flipping. Repeated prompting has bounded upside and often acts as a destabilizer rather than a reasoning aid. The effect is strongly model-dependent: Qwen3-VL-30B achieves the highest final accuracy but becomes confidently wrong under direct contradiction; Gemini 2.5 Pro is comparatively stable but token-expensive; GPT-4o is the most brittle and oscillatory. These findings reveal that multi-turn VLM evaluation captures not just additional reasoning but pressure-response profiles: how models trade off visual grounding, calibration, and conversational compliance under repeated challenge.
- Abstract(参考訳): VLM(Vision-Language Models)を現実の環境で展開するには、強い視覚的推論だけでなく、持続的な会話圧力下での安定性も必要である。
JKP(Just Keep Prompting)は、ユーザが繰り返し挑戦したり、質問したり、モデルの回答に矛盾したりする際に、VLMのエピステマ性を評価するマルチターン評価フレームワークである。
JKPは、Adversarial Negation(繰り返し拒否)、Pure Socratic Interrogation(確実性を再評価する繰り返し呼び出し)、Context-Aware Socratic Summarization(再考を求める前にモデルの事前の理論的根拠を反映する)という3つの戦略を用いて、最大10回の追従ターンのモデルを探索する。
GPT-4o, Gemini 2.5 Pro, Qwen3-VL-30BをSTARベンチマークのサブセットとして720回のマルチターンランで評価した。
集計精度はターン0からターン10に微妙に変化するが、軌道レベルの解析ではかなりの不安定さが示される。
繰り返しプロンプトは逆さまになり、しばしば推論補助ではなく不安定化剤として機能する。
Qwen3-VL-30Bは最終精度が最も高いが、直接矛盾の下で確実に誤りを犯す; Gemini 2.5 Proは比較的安定だが、トークンに強い; GPT-4oは最も脆く、発振性がある。
これらの結果から、マルチターンVLM評価は、視覚的グラウンド、キャリブレーション、会話的コンプライアンスを、繰り返しの課題の下でどのように取り除くかという、追加の推論だけでなく、圧力応答プロファイルを捉えていることが明らかとなった。
関連論文リスト
- SAVOR: Self-Aware Visual Grounding via Confidence-Calibrated Reinforcement Learning for Multimodal Hallucination Mitigation [4.100479369058624]
MLLM(Multimodal large language model)は、画像に基づかないオブジェクト、属性、関係について、流動的なクレームを生成する。
Savorは、トークンと回答の信頼性で出力スキーマを拡張するトレーニングフレームワークです。
本研究では,MME や MMBench の一般性を維持しながら幻覚を低減し,DPO よりも低い誤差とデコードベースラインを有することを示す。
論文 参考訳(メタデータ) (2026-09-15T03:53:32Z) - LOCI: A Locator-Critic with Refinement Loop [65.51043732421378]
VLM(Vision-Language Models)は、複雑な視覚的理解を必要とするタスクに苦戦している。
中心的な問題は、高レベルの推論ではなく、画像に重要な詳細を見つけることに失敗している、と我々は主張する。
証拠検証から視覚検索を分離する学習自由フレームワークであるLocator-Critic(LOCI)を提案する。
論文 参考訳(メタデータ) (2026-08-31T15:26:00Z) - The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure [8.86745721473138]
推論モデルはシングルターンベンチマークで評価されるが、マルチターンダイアログにデプロイされる。
われわれはこの不信な降伏(UC)を2ドル(約2万2000円)のラテント・ヴァース・ビヘイビア・フレームワークで分離し、指標のフリップレートとシングルターンプローブの両方を見逃す。
論文 参考訳(メタデータ) (2026-05-27T20:41:08Z) - Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems [52.83669998269706]
テキストのみの設定で研究されてきたが、まだマルチモーダルに探索されていない。
現在のベンチマークでは、未解決性を無視するか、現実的な障害モードを見逃す粗末なメソッドに依存している。
MM-AQAは、2つの軸に沿った変換によって解答不能なインスタンスを解答可能なインスタンスから構築するベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T09:23:22Z) - VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification [73.02304272829785]
VideoBenchは、証拠を厳格に検証する長ビデオ応答のための階層的なベンチマークだ。
これは、13のドメインに500の注釈付き質問を手動で記述し、時間間隔と空間境界ボックスを組み合わせて証拠とする。
GeminiPro-3-Proでさえ、標準のエンドツーエンドのQA設定で17%未満の質問に正しく答えている。
その結果,表面レベルでの回答の正しさと真正な証拠に基づく推論との間に大きなギャップが生じた。
論文 参考訳(メタデータ) (2026-04-02T03:29:43Z) - BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents [0.0]
BeliefShiftはマルチセッション会話エージェントにおける信念のダイナミクスを評価するために設計されたベンチマークである。
テンポラル・リーフ・一貫性、コントラディション・インテクション、エビデンス・ドリブン・リビジョンの3つのトラックをカバーしている。
GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro, LLaMA-3, Mistral-Largeの7つのモデルについて, ゼロショットおよび検索拡張生成設定で評価した。
論文 参考訳(メタデータ) (2026-03-25T02:09:35Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes [79.36545159724703]
隠れ状態や注目パターンの軽量プローブを学習するためのLRP(Latent Representation Probing)を提案する。
LRPは、ベストベースラインよりも吸音精度を7.6%向上させる。
これにより、デプロイメント対応AIシステムを構築するための原則化されたフレームワークが確立される。
論文 参考訳(メタデータ) (2025-11-25T00:24:42Z) - Reasoning Models Are More Easily Gaslighted Than You Think [85.84943447589511]
我々はOpenAIのo4-mini、Claude-3.7-Sonnet、Gemini-2.5-Flashの3つの最先端推論モデルを評価する。
ガス灯消火プロンプトによる精度低下が認められた。
GaslightingBench-Rは、推論モデルの認識可能性を評価するために設計された新しい診断ベンチマークである。
論文 参考訳(メタデータ) (2025-06-11T12:52:25Z) - Reliability Check: An Analysis of GPT-3's Response to Sensitive Topics
and Prompt Wording [0.0]
GPT-3を混乱させるものは何か、モデルが特定のセンシティブなトピックにどう反応するか、そしてモデル応答にどのような影響があるのかを解析する。
GPT-3は明らかな陰謀やステレオタイプと正しく一致しないが、一般的な誤解や論争では誤りを犯す。
モデル応答はプロンプトや設定に不整合であり、GPT-3の信頼性の欠如を強調している。
論文 参考訳(メタデータ) (2023-06-09T19:07:31Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。