論文の概要: Interaction Scaling: Grounding the Third Axis of Test-Time Compute
- arxiv url: http://arxiv.org/abs/2607.11598v1
- Date: Mon, 13 Jul 2026 14:22:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.501795
- Title: Interaction Scaling: Grounding the Third Axis of Test-Time Compute
- Title(参考訳): インタラクションスケーリング - テスト時間計算の第3軸を基盤として
- Authors: Bojie Li, Noah Shi,
- Abstract要約: 一つの変数がこの第3の軸を接地として支配し、ループの両側に保持しなければならないと論じる。
固定トークン予算でのハードコーディングタスクでは、推論のみとベストオブNの両方をサンプリングする。
提案手法は, ラン・ツー・ラン分散を伴わず, 100%パスレートに到達した。
- 参考スコア(独自算出の注目度): 0.33451037881913753
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: There are two standard ways to spend more compute at test time: let a model reason longer, or sample more attempts and keep one. Both share a hidden limit: they are internal. Every extra token comes from the same frozen weights and the same prompt, so neither can tell the model anything it does not already know. We study a third way, interaction: the model proposes an artifact, an external instrument observes how it actually behaves, and the model revises. Each cycle imports a real observation, so interaction breaks through the ceiling the other two hit. We argue that a single variable governs this third axis, grounding, and that it must hold on both sides of the loop. The feedback that drives revision must come from an instrument that actually observes the flaw, and so must the metric that scores the result. On hard coding tasks at a fixed token budget, reasoning-only and best-of-N sampling both plateau (the latter even when an oracle picks the best sample), while every interaction strategy keeps improving; our proposer-reviewer harness reaches a perfect 100% pass rate with no run-to-run variance, and the gain holds across three model families. On rendered visual artifacts, the usual judge (a vision-language model, or VLM, reading a screenshot) rates 14 of 15 visibly broken figures "perfect," because the screenshot hides the flaws before the judge can see them. A tool that measures the real layout instead shows the loop removing 40-74% of defects across four modalities; and that same VLM, used as the reviewer, makes slide layouts worse where the measuring tool repairs them. Interaction scaling is real and distinct from reasoning and sampling, but only visible when both the feedback and the metric are grounded.
- Abstract(参考訳): テスト時により多くの計算に費やす標準的な方法は2つあります。
どちらも隠れた限界を共有している。
すべての余分なトークンは、同じ凍結重量と同じプロンプトから来るので、どちらもまだ知らないことをモデルに教えることはできません。
モデルがアーティファクトを提案し、外部機器が実際にどのように振る舞うかを観察し、モデルが修正する。
各サイクルは実際の観測をインポートするので、相互作用は天井を突破し、他の2つがぶつかる。
一つの変数がこの第3の軸を接地として支配し、ループの両側に保持しなければならないと論じる。
リビジョンを駆動するフィードバックは、実際に欠陥を観察する機器から得られるものでなければならない。
固定トークン予算でのハードコーディングタスクでは、推論のみとベスト・オブ・Nの両方のプラトー(オラクルがベストサンプルを選んでも後者は後者)をサンプリングするが、全てのインタラクション戦略は改善され続けており、提案者・レビュアーのハーネスは、ラン・トゥ・ランのばらつきのない100%パスレートに達し、3つのモデルファミリ間で利得が保持される。
レンダリングされた視覚的アーティファクトでは、通常の裁判官(視覚言語モデルまたはVLM、スクリーンショットを読む)は、15の視覚的に壊れた人物の14を「完璧」と評価する。
実際のレイアウトを測定するツールは、代わりに4つのモードで40~74%の欠陥を取り除くループを示している。
相互作用のスケーリングは推論やサンプリングとは現実的かつ異なるが、フィードバックとメトリクスの両方が根拠となる場合にのみ見える。
関連論文リスト
- LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning [6.241883798820154]
モデル間コンセンサス(モデル間コンセンサス)について検討し、独立に訓練されたモデル(各モデルが一度解ける程度)が最終解に一致するかを検討した。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
3つのパネル統計値から平均絶対誤差0.03$までのコンセンサス精度を予測する。
論文 参考訳(メタデータ) (2026-07-11T05:57:54Z) - Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - Looking Is Not Picking: An Attention-Segment Account of Tool-Selection Failures in LLM Agents [0.4855342112648282]
LLMエージェントは誤呼ツールであり、自然の推測では、モデルは混み合ったハーネスで適切なツールを見られなかった。
レンズコンカレントな作業セットは別として、ラベル付きツール定義セグメントに対するモデルの注意を、その逆で示します。
論文 参考訳(メタデータ) (2026-06-15T07:58:56Z) - VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning? [79.44137632338062]
マルチモーダルな大規模言語モデルが視覚的推論問題に正しく答える場合、その予測はタスククリティカルな視覚的証拠によって実際に支持されているか?
VisualFLIPは1,374枚の画像が基数,属性,空間,論理的タスクにまたがって同一の問合せペアとして配置されたベンチマークである。
ペアの両面を解く必要がある24個のMLLMと、少なくとも一方の面を解くモデルが両方の画像に対して同じ空でない答えを繰り返す頻度を測定するCR(Collapse Rate)を評価した。
論文 参考訳(メタデータ) (2026-06-05T22:06:07Z) - StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning [13.74158437063828]
マルチモーダルな大言語モデル(MLLM)はルールをよく知っているが、視覚的推論タスクについて間違った答えを選択する。
既存のベンチマークでは、知覚を崩壊させ、ルール誘導し、答えの選択を1つの右または右の信号に変換するため、これを検出できない。
StemBindは、同じ視覚幹を3つの質問で探索する共有視点診断ベンチマークである。
論文 参考訳(メタデータ) (2026-05-29T03:20:05Z) - Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures [0.0]
我々は、モデルのエラーが出力コミット前に検出可能で、一度検出されると修正できる程度、統治性を導入します。
ベンチマーク精度は支配可能性を予測するものではなく、補正能力は検出と独立に異なり、同一のガバナンス足場はモデル間で逆の効果をもたらす。
本稿では,モデルとタスクの組み合わせをGovernable, Monitor Only, Steer Blind, Ungovernableの4つに分類する。
論文 参考訳(メタデータ) (2026-03-22T21:50:28Z) - e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings [91.3041144166326]
市販の視覚言語モデルをロバストなオムニモーダル埋め込みモデルに適応させる軽量な明示的アライメントレシピであるe5-omniを提案する。
e5-omniは、類似度尺度を整合させるためにモード対応温度校正と、混乱する負の点に焦点を合わせた制御可能な負のカリキュラムと、クロスモーダル幾何に適合するバッチホワイトニングを組み合わせる。
MMEB-V2とAudioCapsの実験では、強いバイモーダルおよびオムニモーダルベースラインよりも一貫した利得を示した。
論文 参考訳(メタデータ) (2026-01-07T07:39:40Z) - Show Your Work with Confidence: Confidence Bands for Tuning Curves [51.12106543561089]
チューニング作業の関数としての曲線プロット検証性能。
そこで我々は,曲線のチューニングに有効な信頼帯域を構築するための最初の方法を提案する。
提案手法と比較し,提案手法の有効性を検証し,サンプルサイズの影響を解析し,モデルの比較に関するガイダンスを提供する。
論文 参考訳(メタデータ) (2023-11-16T00:50:37Z) - Warp Consistency for Unsupervised Learning of Dense Correspondences [116.56251250853488]
密接な対応を学習する上で重要な課題は、実画像対に対する地道整合の欠如である。
密な対応回帰のための教師なし学習目標であるWarp Consistencyを提案する。
私たちのアプローチは、MegaDepth、RobotCar、TSSなど、いくつかの挑戦的なベンチマークに新しい最先端を設定します。
論文 参考訳(メタデータ) (2021-04-07T17:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。