論文の概要: Machine-Interpretable Information: Compiling Documents into Searchable and Readable Protocol States
- arxiv url: http://arxiv.org/abs/2609.23371v1
- Date: Sun, 20 Sep 2026 05:43:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.804794
- Title: Machine-Interpretable Information: Compiling Documents into Searchable and Readable Protocol States
- Title(参考訳): 機械解釈可能な情報: ドキュメントを検索可能で可読なプロトコル状態にコンパイルする
- Abstract要約: 本稿では,最初のエージェント・ツー・エージェント(A2A)ドキュメント・ツー・ステートプロトコルであるMII(Machine-Interpretable Information)を紹介する。
デュアルタイムスケールのステートスペース Writer はドキュメントを標準的な固定バンド幅のステート(56トークン)にコンパイルし、軽量のTranslator はそれを冷凍されたReaderの埋め込みスペースにマップする。
結果として得られる.miiアーティファクトは、単一の転送可能な媒体でRetrieval(探索可能な幾何学)、Reasoning(言語記憶)、Reasoning(地下詳細)を統一する。
- 参考スコア(独自算出の注目度): 28.06744741539406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context language models interface with external knowledge through raw natural language. In retrieval-augmented systems, this creates a persistent index-payload schism: dense vectors enable searchable routing, but models must re-ingest lengthy text payloads for reasoning at O(N^2) attention cost. Existing compression methods further produce private states tied to specific architectures. We introduce Machine-Interpretable Information (MII), the first agent-to-agent (A2A) document-to-state protocol. A dual-timescale state-space Writer compiles documents into a canonical, fixed-bandwidth state (56 tokens), and a lightweight Translator maps it into any frozen Reader's embedding space, reducing query-time cost to O(K). The resulting .mii artifact unifies Retrieval (searchable geometry), Reasoning (global memory), and Reconstruction (grounded details) in a single transferable medium. We demonstrate strong cross-model interoperability across heterogeneous LLMs (e.g., Llama, Qwen, Mistral) -- despite the Writer using a legacy GPT-2 vocabulary, forcing genuine semantic translation rather than token-level memorization. Mechanistic probes reveal modular latent structure: entity representations can be causally traced and zero-shot transplanted between unrelated document states while remaining decodable. To address lexical reconstruction under fixed bandwidth, we propose Residual-MII, a cache hierarchy combining compiled global memory with sparse local evidence. On HotpotQA (7,405 queries), Residual-MII exceeds full-context Exact Match at approximately 7% of the attention FLOPs, suggesting a paradigm shift toward compiled, transferable neural document formats.
- Abstract(参考訳): 長期コンテキスト言語モデルは、生の自然言語を通して外部知識と相互作用する。
密度ベクトルは探索可能なルーティングを可能にするが、モデルはO(N^2)注意コストで推論するために、最も長いテキストペイロードを再入力する必要がある。
既存の圧縮手法は、特定のアーキテクチャに結びついたプライベートステートを更に生成する。
本稿では,最初のエージェント・ツー・エージェント(A2A)ドキュメント・ツー・ステートプロトコルであるMII(Machine-Interpretable Information)を紹介する。
デュアルタイムスケールのステートスペース Writerはドキュメントを標準的な固定バンド幅のステート(56トークン)にコンパイルし、軽量のTranslatorはそれを冷凍されたReaderの埋め込みスペースにマップし、クエリ時間コストをO(K)に削減する。
結果。
retrieval (検索可能な幾何学)、Reasoning (グローバルメモリ)、Reasoning (グラウンドドディテール)を単一の転送可能な媒体に統合する。
我々は,レガシGPT-2ボキャブラリを用いて,トークンレベルの暗記よりも真に意味翻訳を強制するにもかかわらず,異種LLM(Llama,Qwen,Mistral)間の強力なクロスモデル相互運用性を示す。
エンティティ表現は因果的にトレースされ、非関係なドキュメント状態間でゼロショットで移植され、デオード可能のままである。
固定帯域幅での語彙再構成に対処するために,コンパイルされたグローバルメモリと少ない局所的証拠を組み合わせたキャッシュ階層Residual-MIIを提案する。
HotpotQA (7,405クエリ)では、Residual-MIIがフルコンテキストのExact Matchを超え、FLOPの約7%で注目され、コンパイル可能で転送可能なニューラルドキュメントフォーマットへのパラダイムシフトが示唆されている。
関連論文リスト
- Code as Representation: A Compilable Parsing Paradigm for Academic Documents [50.40789738182074]
Compilable Academic Document Parsing (CADP)は、コンテキストラプラス実行可能なPythonとして全ページを再構築するパラダイムである。
テキストと複数のSAEタイプを含む全学術ページのエキスパート検証ベンチマークであるCADP-Benchを紹介する。
その結果、フロンティアモデルでさえも、高忠実度で実行可能な再構築を行うのに苦戦していることがわかった。
論文 参考訳(メタデータ) (2026-08-18T09:10:43Z) - TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki [6.956097396264084]
LLMエージェントは、検索をワンショットのコンテキストフェッチのように振る舞うのではなく、推論のように振る舞う必要がある。
現在、RAG(Retrieval-Augmented Generation)システムは、類似性を埋め込んだフラットチャンクとして外部知識を整理している。
本稿では,外部知識をコンパイル可能,構成可能,自己進化的構造として扱うことにより,検索パラダイムを運用するエージェントネイティブ検索システム LLM-Wiki を提案する。
論文 参考訳(メタデータ) (2026-05-25T06:36:14Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - Model-Document Protocol for AI Search [11.377241012645994]
原文が大規模言語モデル (LLM) にどのようにブリッジされているかを形式化する汎用フレームワークである Model-Document Protocol (MDP) を導入する。
MDPは、検索をパスフェッチとして扱う代わりに、構造化されていない文書をタスク固有のLCM対応の入力に変換する複数の経路を定義している。
本稿では,エージェントプロセスを通じてプロトコルを実現するMPP-Agentを提案する。
論文 参考訳(メタデータ) (2025-10-29T04:29:17Z) - The Surprising Soupability of Documents in State Space Models [28.95633840848728]
そこで本研究では,文書を独立に符号化し,その表現をプールする手法を提案する。
我々はMamba2モデルを微調整し、スープ可能な表現を生成し、マルチホップQA、スパース検索、長い文書推論を高い精度でサポートする。
HotpotQAでは、10個の独立したエンコードされたドキュメントが、同じ入力でトレーニングされたクロスエンコーダのパフォーマンスとほぼ一致している。
論文 参考訳(メタデータ) (2025-05-29T22:13:21Z) - UnifieR: A Unified Retriever for Large-Scale Retrieval [84.61239936314597]
大規模な検索は、クエリを与えられた巨大なコレクションから関連ドキュメントをリコールすることである。
事前学習型言語モデル(PLM)に基づく最近の検索手法は,高密度ベクターあるいはレキシコンに基づくパラダイムに大別することができる。
本論文では,高密度ベクトルとレキシコンに基づく検索を2つの表現能力を持つ1つのモデルで統合する学習フレームワークUnifieRを提案する。
論文 参考訳(メタデータ) (2022-05-23T11:01:59Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。