論文の概要: Secret MCP: Evidence-Bounded and Context-Isolated Design Specification Generation from Web Screenshots
- arxiv url: http://arxiv.org/abs/2608.24944v1
- Date: Mon, 24 Aug 2026 14:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.286465
- Title: Secret MCP: Evidence-Bounded and Context-Isolated Design Specification Generation from Web Screenshots
- Title(参考訳): Secret MCP: Web スクリーンショットからのエビデンス境界およびコンテキスト分離設計仕様生成
- Abstract要約: Secret MCPは、公開Web参照ごとに1つの監査可能な設計仕様を生成する。
文書構造、相互作用論理、応答性規則、そして推測から観察を区別するために必要となる証明。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Screenshot-to-code systems optimize for rendered implementations, but screenshots omit document structure, interaction logic, responsive rules, and provenance needed to distinguish observation from guesswork. Multi-reference prompts also risk contaminating one reference with evidence or inferences from another. We present Secret MCP, an open-source local system that produces one auditable design specification per public web reference. It separates retrieval, evidence preparation, model invocation, storage, and inspection. Long captures are resized and tiled with overlap; evidence records preserve prepared- and source-space coordinates and a measured color palette. A 19-section contract covers page inventories, navigation geometry, responsive matrices, components, accessibility, acceptance criteria, and explicit labels for measured, observed, inferred, and unknown claims. References are processed sequentially through a sampler interface. The evaluated MCP adapter sends one sampling/createMessage request per reference with includeContext set to none; a fresh-process adapter provides a stronger boundary. We evaluate commit c130c9c at two levels. A live retrieval and fixture-model integration run selected two references after excluding a third, prepared nine evidence images, issued two sampling requests, and produced two documents with zero cross-reference identifier occurrences. A static audit of three externally generated design indexes found all 19 required sections in every document, one unique reference identifier per document, eight page specifications, 1,943 pixel-valued measurements, and 319 color literals. These tests establish orchestration invariants and syntactic contract compliance, not semantic or visual reconstruction accuracy. The sampler abstraction preserves these boundaries across direct model APIs and transports despite MCP sampling's 2026 deprecation.
- Abstract(参考訳): スクリーンショット・トゥ・コードシステムはレンダリング実装を最適化するが、スクリーンショットは文書構造、相互作用ロジック、応答性ルール、そして推測から観察を区別するために必要な証明を省略する。
複数参照のプロンプトは、ある参照を別の参照から証拠や推論で汚染する危険性もある。
本研究では,公開Web参照毎に1つの監査可能な設計仕様を生成するオープンソースローカルシステムであるSecret MCPを提案する。
検索、証拠準備、モデル呼び出し、保管、検査を分離する。
ロングキャプチャーは再サイズされ、重複し、エビデンス記録には準備された空間座標とソース空間座標と測定されたカラーパレットが保存されている。
19条の契約は、ページの在庫、ナビゲーション幾何学、応答行列、コンポーネント、アクセシビリティ、受け入れ基準、測定、観察、推測、未知のクレームのための明示的なラベルをカバーしている。
参照は、サンプルインターフェイスを通じて順次処理される。
評価済みのMPPアダプタは参照毎に1つのサンプリング/作成MessageリクエストをinsentContextセットで送信する。
コミットc130c9cを2レベル評価した。
ライブ検索とフィクスチャモデルの統合実行では,3番目を除いて2つの参照を選択し,9つのエビデンス画像を作成し,サンプリング要求を2つ発行し,クロスリファレンス識別子をゼロとした2つのドキュメントを生成した。
外部から生成された3つのデザインインデックスの静的監査では、すべてのドキュメントで必要な19のセクション、文書ごとに1つのユニークな参照識別子、8ページの仕様、1,943ピクセルの値測定、319色のリテラルが見つかった。
これらのテストは、意味的あるいは視覚的再構成の正確性ではなく、オーケストレーション不変性と構文的コントラクトコンプライアンスを確立する。
MCPサンプリングの2026年の非推奨にもかかわらず、サンプル抽象化はこれらの境界を直接モデルAPIとトランスポートで保存する。
関連論文リスト
- ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval [62.80735412748694]
ConceptFormerは、ビジュアル文書検索のための潜在概念表現学習フレームワークである。
クエリ関連エビデンスとは、局所化された視覚的エビデンスとセマンティックな関連性を明確に橋渡しする、連続的でクエリ条件付き潜在概念である。
平均的なNDCG@10では、最強のビジュアル検索ベースラインと最強のOCRベースのテキスト検索ベースラインに対して16.7%と22.1%の相対的な改善が達成されている。
論文 参考訳(メタデータ) (2026-08-16T12:07:12Z) - MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation [27.198976547095565]
MR2AV(Multi-Reference-to-audio-video)生成は,複数の参照とテキスト命令を条件としたコヒーレントなオーディオビデオコンテンツを生成することを目的としている。
既存のベンチマークは主にテキスト駆動生成、単一参照主題保存、孤立したオーディオビデオアライメントに焦点を当てている。
MR2AV生成のための統合ベンチマークであるMultiRef-を導入する。
論文 参考訳(メタデータ) (2026-07-15T16:02:45Z) - Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation [74.0621258662676]
レポート生成のためのマルチエージェントハーネスであるPtahを提案する。
Ptahは計画、研究、執筆段階を通じて、ユーザクエリからレンダリングされたWebレポートまでのライフサイクルを編成する。
検証エージェントがハーネスの受け入れ機能として機能し、ワークフロー全体を通して事実的接地、引用の忠実性、相互の整合性を強制する。
論文 参考訳(メタデータ) (2026-05-28T12:40:34Z) - RaV-IDP: A Reconstruction-as-Validation Framework for Faithful Intelligent Document Processing [0.0]
Restructation as Validation (RaV-IDP)は、第一級アーキテクチャコンポーネントとして再構築を導入するドキュメント処理パイプラインである。
専用再構成器は、抽出した表現を元の文書領域に匹敵する形式に戻す。
忠実度がエンタリティ型閾値以下になると、構造化されたGPT-4.1ビジョンフォールバックがトリガーされ、検証ループが繰り返される。
論文 参考訳(メタデータ) (2026-04-26T10:26:42Z) - MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering [51.19392014547221]
検索型マルチモーダル文書QAは,視覚的にリッチな文書から複雑なマルチモーダル構造を持つ関連情報を識別し,統合することを目的としている。
現在のアプローチは、サージェントなコンテンツを見渡すクエリに依存しないドキュメント表現に依存しています。
本稿では,クエリ適応生成を導入したMultimodal Adaptive Retrieval-Augmented (MARA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T12:27:40Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG [82.84014669683863]
マルチモーダル検索拡張生成(MM-RAG)は,大規模言語モデルを現実世界の知識ベースに適用するための重要なアプローチである。
UniDoc-Benchは、70万の現実世界のPDFページから構築されたMM-RAGのための最初の大規模で現実的なベンチマークである。
実験により,マルチモーダルテキスト画像融合RAGシステムは,非モーダルおよび共同マルチモーダル埋め込みに基づく検索において一貫して優れていた。
論文 参考訳(メタデータ) (2025-10-04T04:30:13Z) - Relation-Rich Visual Document Generator for Visual Information Extraction [12.4941229258054]
本稿では2段階のアプローチでこれらの制限に対処するリレーショナルrIchビジュアルドキュメンテーション・ジェネレータ(RIDGE)を提案する。
提案手法は,様々なVIEベンチマークにおける文書理解モデルの性能を大幅に向上させる。
論文 参考訳(メタデータ) (2025-04-14T19:19:26Z) - DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed Learning [39.10966524559436]
文書画像のセグメンテーションは、文書解析と認識に不可欠である。
既存のメソッドはこれらのタスクを別々に処理し、その結果、一般化とリソースの浪費が制限される。
本稿では,様々な文書画像セグメンテーションタスク用に設計されたトランスフォーマーベースの統合フレームワークであるDocSAMを紹介する。
論文 参考訳(メタデータ) (2025-04-05T07:14:53Z) - Synthetic Document Generator for Annotation-free Layout Recognition [15.657295650492948]
本稿では,空間的位置,範囲,レイアウト要素のカテゴリを示すラベル付きリアル文書を自動生成する合成文書生成装置について述べる。
合成文書上で純粋に訓練された深層レイアウト検出モデルが,実文書を用いたモデルの性能と一致することを実証的に示す。
論文 参考訳(メタデータ) (2021-11-11T01:58:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。