MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents
Abstractの概要
MNIST-PROは、MNISTの数字認識を部分観測可能な逐次探索タスクとして再構築し、エージェントが覗き窓(glimpse window)を動かして証拠を蓄積し、いつ予測を行うかを決定する設定にしています。本ベンチマークは、制御可能な過去の参照制約を持つ2D POMDP設定を採用することで、広範な身体性制御の複雑さから知覚状態の構築を切り離しています。本研究では、生の視覚履歴、自由形式のテキスト状態、計量グリッドマップ、統合された視覚キャンバスなど、複数のメモリ表現にわたって10種類のマルチモーダルモデルを評価しています。実験全体を通じて、エージェント的知覚がどこで破綻するかを診断するため、精度に加えて探索行動、停止判断、カバレッジ、再訪パターンを調査しています。
新規性
本論文の主な新規性は、標準的な認識データセットを受動的な分類ではなくエージェント的知覚を研究するための部分観測世界へと変換する、制御されたベンチマークにあります。メモリ表現と視覚的な過去参照の範囲を体系的に変化させることで、証拠の獲得、知覚状態の構築、および状態の解釈を分離して評価できるようにしています。
成果
完全に可視化されたMNISTで高い認識精度を達成するモデルでも、部分観測下では大幅な性能低下が生じ、特に複数桁の数列において顕著でした。メモリ表現は行動に大きく影響し、構造化された計量グリッドマップは冗長な再訪を削減し、プログラムによる視覚キャンバスの統合は認識精度を著しく向上させました。自律的なエージェントハーネスによってGemini-3.7-Flashは大幅に改善されたものの、永続的な手続き型メモリや正誤フィードバックによるさらなる精度の向上は見られませんでした。
論文の注目点
- MNIST-PROは、MNISTを明示的な観測予算、ステップごとの探索、制御可能な視覚的過去参照を備えた覗き窓ベースのPOMDPに変換することで、エージェント的知覚を単離して評価します。
- 完全観測下での認識と部分観測タスクの成功率との間には大きなギャップが生じており、時系列で断片的な視覚情報を得ても、それが直ちに利用可能な知覚状態へと変換されるわけではないことが示されています。
- 状態表現が性能に強く影響し、計量グリッドマップは空間追跡のドリフトを低減させ、統合された視覚キャンバスは蓄積された証拠の解釈を容易にすることで下流の予測精度を向上させます。
参考リンク
- arXiv: https://arxiv.org/abs/2608.31022v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.31022v1
- Hugging Face Papers: https://huggingface.co/papers/2608.31022