論文の概要: Budget-Constrained Embodied Perception: Four Resource Walls and a Pre-Registered Evaluation of Access-Structured Perception on Open Models at less than 31B
- arxiv url: http://arxiv.org/abs/2608.22975v1
- Date: Mon, 24 Aug 2026 08:34:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.995533
- Title: Budget-Constrained Embodied Perception: Four Resource Walls and a Pre-Registered Evaluation of Access-Structured Perception on Open Models at less than 31B
- Title(参考訳): 予算拘束型身体知覚:4つの資源壁と31B未満のオープンモデルにおけるアクセス構造知覚の事前登録評価
- Abstract要約: 身体的マルチモーダルエージェントは、固定された決定単位のトークン予算の下で成長する観察ストリームから答えなければならない。
ASPは、カプセル化された構造化状態、動詞のエピソードインデックス、クエリ条件の予算割当と反復アクセスを組み合わせた、凍結したマルチモーダルモデルのためのトレーニングフリーラッパーである。
- 参考スコア(独自算出の注目度): 13.848323590023972
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied multimodal agents must answer from growing observation streams under a fixed per-decision token budget. We formalize this constraint through four resource walls: a perceptual Shannon wall for bounded state, a horizon wall for query-independent frame selection, a round wall for non-adaptive retrieval, and a conditional composition wall for fixed-depth inference. We introduce ASP, a training-free wrapper for frozen multimodal models that combines a capped structured state, a verbatim episodic index, and query-conditioned budget allocation with iterative access. Following a pre-registered protocol, we evaluate seven open-weight models from 3B to 31B on SEW-Bench, a license-free synthetic long-horizon walkthrough benchmark constructed to instantiate these walls. The registered natural-video benchmarks were not run because their frames require dataset agreements; our evidence therefore concerns access mechanisms, not natural-scene perception. Under a 4,096-token decision budget, ASP reaches 75 to 94% episodic retrieval accuracy, compared with 3 to 19% for equal-budget query-independent sampling, and budget reallocation outperforms quadrupling the sampling budget on every backbone. However, the full three-component architecture does not validate channel duality: removing the compressive state raises the flagship mean from 35.4 to 58.0, ASP does not outperform the verbatim-only baseline on any backbone, and two of four pre-registered falsification criteria fire. These results show that query-conditioned access, rather than parameter count or context growth alone, is decisive under a fixed budget, while prompted online compression does not earn its cost in this setting.
- Abstract(参考訳): 身体的マルチモーダルエージェントは、固定された決定単位のトークン予算の下で成長する観察ストリームから答えなければならない。
我々は,この制約を,有界状態に対する知覚的なシャノン壁,クエリ非依存フレーム選択のための水平壁,非適応検索のための円形壁,固定深度推論のための条件付き合成壁の4つの資源壁を通じて定式化する。
ASPは、カプセル化された構造化状態、動詞のエピソードインデックス、クエリ条件の予算割当と反復アクセスを組み合わせた、凍結したマルチモーダルモデルのためのトレーニングフリーラッパーである。
事前に登録されたプロトコルに従って,SEW-Bench上で3Bから31Bまでのオープンウェイトモデルの評価を行った。
登録されたナチュラルビデオのベンチマークは、フレームがデータセットの合意を必要とするため実行されなかった。
4,096件の意思決定予算の下では、ASPは75~94%のエピソード検索精度に達し、等予算のクエリ非依存サンプリングでは3~19%、予算再配置はすべてのバックボーンでサンプリング予算を4倍に上回る。
圧縮状態を取り除くことでフラグシップ平均値が35.4から58.0に上昇し、ASPは任意のバックボーン上の動詞のみのベースラインを上回りません。
これらの結果から,パラメータ数や文脈成長のみではなく,問合せ条件によるアクセスが一定の予算で決定的であり,オンライン圧縮がコストを稼げないことが示唆された。
関連論文リスト
- Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark [0.0]
本研究では,仕様の形式的セマンティックブロックモデルと,仕様品質を評価するための実行基準ベンチマークを導入する。
仕様は、セマンティックブロック、依存関係の関係、ブロック所有ルール、決定ポイント、明示的にオープンな質問からなる構造として表現される。
ベンチマークは実装者のパネルを固定し、必須の非仕様管理アームを含み、決定論的実行ジャッジとして16と実動のOracleインスタンスを使用する。
論文 参考訳(メタデータ) (2026-08-19T22:17:31Z) - DA-CASE: reusable measurements for adaptive quantum subspaces [0.0]
本稿では,Dyadic Adaptive Clifford-Algebra Subspace Eigensolver (DA-CASE)を提案する。
凍結した8量子ビット H$_4$ Hamiltonian 上でその貿易を明示する。
独立に、ダイアドの通勤階層は、決定的銀行を913キュービットの交換設定から64の完全通勤設定に還元する。
論文 参考訳(メタデータ) (2026-08-09T14:35:52Z) - Width, Memory, and Delay: A Resource Accounting for the Limits of Flat Multi-Agent Systems [27.425096016504174]
最近のプレプリントでは、平らで均質なマルチエージェントシステムは、達成不可能なエラーに対して、人口非依存の因果的フロア'に直面すると論じられている。
この結論は強すぎることを示し、3つのリソース上に構築された定量的リソースモデルに置き換える。
障害スペクトルのオラクル知識をオンライン学習に置き換える価格を定量化する。
論文 参考訳(メタデータ) (2026-07-14T20:35:17Z) - Capability from Access Structure, Not Scale: Lower Bounds and Pre-Registered Tests for Hybrid Sequence Models [14.867869624585886]
ネットワークがスケールするにつれて、異種ネットワークの表現は現実の共有モデルへと収束する。
O(Nb) 状態構造を持つシャノン壁,固定窓を持つ水平壁,固定深度のみの組成を持つ回路壁の3つの資源壁を命名した。
明示的な分離可能性の仮定の下では、ハイブリッドは各壁の価格を支払うことによって3つ全てを横切るので、その能力は厳密に超加法的である。
論文 参考訳(メタデータ) (2026-07-14T05:52:12Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models [51.947287846779545]
ReasonAllocはデコード時のKV圧縮を階層的な予算配分問題として再キャストする。
オフラインのレイヤ単位の事前配置戦略は、アーキテクチャ駆動の需要パターンをキャプチャする。
オンラインのヘッドワイド戦略は、リアルタイムユーティリティに基づいた情報豊富なヘッドへのデコード中にリソースを再配置する。
論文 参考訳(メタデータ) (2026-06-09T17:44:23Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting [36.83545196908392]
BASTIONは、ツリーベースの拡散ドラフトを備えた、予算対応の投機的デコーディングフレームワークである。
本フレームワークは,(1)経路信頼度によって予測される受理長を推定する受理サロゲート,(2)ハードウェアを意識した屋上モデルのキャリブレーションを行うオンライン遅延推定器,(3)積算検証コストを正当化しなくなるまで木を成長させる適応的最優先拡張の3つの相乗的要素を統合する。
論文 参考訳(メタデータ) (2026-05-28T10:21:34Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - TRUST: A Framework for Decentralized AI Service v.0.1 [47.384270414446604]
大規模推論モデル (LRM) とマルチエージェントシステム (MAS) は, 信頼性の高い検証を必要とする。
TRUST(Transparent, Robust, and Unified Services for Trustworthy AI)は,3つのイノベーションを備えた分散フレームワークである。
我々は、悪質な俳優が損失を被っている間、正直な監査人の利益を確実に確保する安全利益理論を証明する。
論文 参考訳(メタデータ) (2026-04-29T19:32:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。