論文の概要: Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?
- arxiv url: http://arxiv.org/abs/2605.08816v1
- Date: Sat, 09 May 2026 09:10:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.905723
- Title: Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?
- Title(参考訳): 壁の鏡:VLMのエージェントが誰だかわかる?
- Abstract要約: 動物界では、ミラー自己認識(英: mirror self-recognition)は高次認知の標準的プローブであり、一部の種でのみ現れる。
擬似視覚言語モデル(VLM)エージェントに類似の機能が現れるのかを問う。
- 参考スコア(独自算出の注目度): 12.841846686021023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In the animal kingdom, mirror self-recognition is a canonical probe of higher-order cognition, emerging only in some species. We ask whether an analogous functional capability emerges in embodied vision-language model (VLM) agents: can they recognize themselves in a mirror? We introduce a controlled 3D benchmark where a first-person VLM agent must infer a hidden body attribute from its reflection and select the matching target, while avoiding self-other misattribution. To separate mirror-grounded self-identification from shortcuts, we test mirror removal, misleading cues, and occluded reflections. We also evaluate the decision process through mirror seeking, temporal ordering, self-attribution, and reasoning-action consistency. Our experiments show that mirror-based self-identification emerges mainly in stronger VLMs. These models can use reflected evidence for action, whereas weaker models often inspect the mirror but fail to extract self-relevant information or misattribute their reflection. Language-vision conflict further shows that self-referential language alone is not evidence of grounded self-identification. Overall, mirror-based evaluation provides a diagnostic for whether embodied self-grounding is causally rooted in perception and action rather than priors, prompt compliance, or confabulation.
- Abstract(参考訳): 動物界では、ミラー自己認識(英: mirror self-recognition)は高次認知の標準的プローブであり、一部の種でのみ現れる。
擬似視覚言語モデル(VLM)エージェントに類似の機能が現れるのかを問う。
本稿では,一人称のVLMエージェントが,その反射から隠れた身体属性を推測し,一致した対象を選択するとともに,自己他的誤帰を避けた制御された3Dベンチマークを提案する。
鏡面の自己識別をショートカットから切り離すため,ミラー除去,誤解を招く手がかり,隠蔽反射を検査した。
また, ミラー探索, 時間秩序, 自己帰属, 推論-行動整合性による意思決定プロセスの評価を行った。
本実験は,鏡による自己識別が主に強いVLMに現れることを示す。
これらのモデルは行動の反射的証拠を使用することができるが、弱いモデルはしばしば鏡を検査するが、自己関連情報を抽出したり、その反射を誤った帰属させることができない。
言語ビジョンの対立はさらに、自己参照言語だけでは、基礎的な自己識別の証拠ではないことを示している。
全体として、鏡ベースの評価は、具体化された自己接地が、前者よりも知覚と行動に因果的に根ざされているか、コンプライアンスを急ぐか、あるいは非難されているかを診断する。
関連論文リスト
- Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination [39.713386491199884]
VLM(Vision-Language Models)は、しばしば推論中に「図をもう一度確認する」といった自己表現的なステートメントを生成する。
このようなステートメントは、真の視覚的再検査を引き起こすのか、それとも単にテキストパターンを学んだだけなのか?
我々は、イメージスワップ探索フレームワークであるVisualSwapを通してこれを調査する。
論文 参考訳(メタデータ) (2026-05-15T11:31:14Z) - MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror [68.92922229518848]
心理学における古典的ミラー自己認識(MSR)テストに触発されたシミュレーションベースのベンチマークであるMirrorBenchを紹介する。
MirrorBenchはこのパラダイムを、段階的に困難なタスクの結合されたフレームワークを通じてMLLMを具現化したものに拡張している。
本研究は,心理学的パラダイムとインテリジェンスを橋渡しし,大規模モデルにおける汎用インテリジェンスの出現を評価するための原則的枠組みを提供する。
論文 参考訳(メタデータ) (2026-04-16T08:45:34Z) - Active Inference with a Self-Prior in the Mirror-Mark Task [7.031699672463923]
鏡自己認識テストは、被写体が鏡でのみ見える自身の身体のマークに触れているかどうかを評価し、自己認識の指標として広く使用されている。
本稿では,この行動が外部報酬を伴わずに,単一メカニズムである自己優先機構を通じて自然に発生する計算モデルを提案する。
論文 参考訳(メタデータ) (2026-04-02T08:15:03Z) - Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs [60.93949629734977]
モデル生成論理における幻覚を軽減するために,視覚コントラスト型自己学習共振器(VC-STaR)を提案する。
多様なVQAデータセットを収集し、マルチモーダルな類似性に応じてコントラストペアをキュレートし、VC-STaRを用いて合理性を生成する。
大規模な実験によると、VC-STaRは既存の自己改善アプローチを上回るだけでなく、SoTA視覚推論データセットで微調整されたモデルを上回る。
論文 参考訳(メタデータ) (2026-03-03T03:18:31Z) - Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs [63.88783817420284]
ロボットは、何がどうなったのか、なぜ失敗したのかを反映できず、展開を一連の独立した試行に転換する。
リフレクティブテストタイムプランニングを導入し、リフレクティブの2つのモードを統合する:textitreflection-in-actionと textitreflection-on-action
また、振り返りのリフレクションが含まれており、エージェントは事前の判断を再評価し、後向きでモデル更新を実行できます。
論文 参考訳(メタデータ) (2026-02-24T18:55:18Z) - Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning [52.99434388759101]
ツール統合推論による継続的改善を実現する自己進化型視覚言語エージェントを提案する。
Agent0-VLは、ツールの使用法を推論だけでなく、自己評価や自己修復にも取り入れている。
実験の結果,Agent0-VLはベースモデルよりも12.5%向上していることがわかった。
論文 参考訳(メタデータ) (2025-11-25T04:15:14Z) - Mirror-Consistency: Harnessing Inconsistency in Majority Voting [37.707204723835765]
本稿では,標準的な自己整合性アプローチの強化であるミラー・一貫性について述べる。
Mirror-Consistencyは「反射鏡」を自己組織化復号プロセスに組み込む。
ミラー一貫性は自己整合性と比較して,推理精度と信頼性校正の両面において優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2024-10-07T03:41:08Z) - AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models [91.78328878860003]
視覚言語モデル(LVLM)は幻覚の傾向が強い。
ベンチマークは多くの場合、障害パターンが一般化できない手作りのコーナーケースに依存します。
最初の自動ベンチマーク生成手法であるAutoHallusionを開発した。
論文 参考訳(メタデータ) (2024-06-16T11:44:43Z) - Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives [45.87069217634753]
研究によると、外部からのフィードバックがなければ、Large Language Modelの本質的なリフレクションは不安定である。
我々の調査によると、重要なボトルネックは自己評価されたフィードバックの品質である。
要求に合わせて様々な解決の観点を適応的に探求し、相違点を対比し、これらの相違点を再検討し、相違点を排除するために使用できるチェックリストにまとめます。
論文 参考訳(メタデータ) (2024-01-04T00:32:33Z) - Robot in the mirror: toward an embodied computational model of mirror
self-recognition [1.9686770963118383]
鏡の自己認識テストは、被験者の顔に隠れてマークを付け、鏡の前に彼女を置き、反応を観察する。
この作業では、このテストに合格するために必要なコンポーネントについて、機械的分解(mechanistic decomposition)またはプロセスモデルを提供します。
そこで我々は,ヒューマノイドロボットのNuがテストに合格できるようにするモデルを開発した。
論文 参考訳(メタデータ) (2020-11-09T15:11:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。