論文の概要: Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images
- arxiv url: http://arxiv.org/abs/2607.21672v1
- Date: Thu, 23 Jul 2026 09:19:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.952418
- Title: Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images
- Title(参考訳): プログラム用画素 : テキストと画像としてのソースコードの入力トークン会計のクロスプロバイダケーススタディ
- Abstract要約: 本稿では、原文とコンパクトな描画画像表現のためのプロバイダレポートされた入力トークンのケーススタディを示す。
このベンチマークは、5つのプログラミング言語、20行から2000行までのソース長9行、利用可能な15のモデルエイリアスでリクエストをペアリングする。
675組の完全なテキスト/画像対のうち、合計画像と画像の比率は0.135、0.194、0.242で、それぞれ86.5%、80.6%、75.8%と報告されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Long source-code contexts consume many text tokens, motivating the proposal to render code as images for vision-language models. Recent work asks whether models can still solve code tasks after this transformation. We examine a different systems question: how commercial APIs count the resulting requests. We present a reproducible measurement case study of provider-reported input tokens for raw source text and a compact rendered-image representation. The benchmark pairs requests across five programming languages, nine source lengths from 20 to 2,000 lines, and 15 available model aliases exposed by Anthropic, OpenAI, and Google Vertex AI. These aliases collapse to approximately five distinct accounting signatures and are not independent model replications. Across 675 complete text/image pairs, aggregate image-to-text ratios are 0.135, 0.194, and 0.242, corresponding to reported input-token reductions of 86.5\%, 80.6\%, and 75.8\%, respectively. These totals conceal materially different break-even behavior: Anthropic and OpenAI images receive lower counts at every tested size, while Gemini images require 6.95 times as many tokens at 20 lines and cross below text only at 200 lines in the aggregate. A targeted audit also reproduces non-monotonic Gemini image accounting across a page boundary. This study measures black-box request accounting for one compact rendering pipeline. It does not measure semantic fidelity, task accuracy, latency, monetary cost, or coding-agent efficiency. We release the scripts, revision-pinned corpus specification, raw usage records, validators, and deterministic analysis needed to reproduce and extend the study.
- Abstract(参考訳): 長いソースコードコンテキストは多くのテキストトークンを消費し、ビジョン言語モデルのイメージとしてコードを記述するという提案を動機付けている。
最近の研究は、モデルがこの変換後にコードタスクを解決できるかどうかを問うものだ。
私たちは、商用APIが結果の要求をどうカウントするかという、異なるシステムの問題を調べます。
本稿では,原文に対するプロバイダ報告された入力トークンとコンパクトな描画画像表現の再現可能なケーススタディを提案する。
このベンチマークは、5つのプログラミング言語、20から2000行までのソース長9、Anthropic、OpenAI、Google Vertex AIによって公開されている15のモデルエイリアスをペアリングする。
これらのエイリアスは、およそ5つの異なる会計シグネチャに崩壊し、独立したモデル複製ではない。
675の完全テキスト/イメージ対のうち、合計画像対テキスト比は0.135、0.194、0.242であり、それぞれ86.5\%、80.6\%、75.8\%と報告されている。
人類像とOpenAI像はテストされた各サイズで低い数を受け取っているのに対し、ジェミニ像は20行のトークンの6.95倍、合計で200行のテキストしか渡らない。
ターゲット監査は、ページ境界を越えて非モノトニックなジェミニ画像も再現する。
本研究では,1つのコンパクトなレンダリングパイプラインのブラックボックス要求を計測する。
セマンティックな忠実さ、タスクの正確性、レイテンシ、金銭的コスト、コーディングエージェントの効率を計測しません。
我々は,本研究の再現と拡張に必要なスクリプト,リビジョンピン付コーパス仕様,生使用記録,バリデータ,決定論的解析を公表する。
関連論文リスト
- Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs [23.958966900531692]
MLLM(Multimodal large language model)は、画像として表示されるテキストを処理できるが、同じコンテンツがテキストトークンとして提供される場合よりも処理が悪くなることが多い。
我々は,この「モダリティギャップ」を7つのベンチマークを5つの入力モードで評価することにより,系統的に診断する。
論文 参考訳(メタデータ) (2026-03-10T02:14:23Z) - Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders [41.08205377881149]
本研究は,セマンティックカテゴリを指定または記述したクエリのテキスト・ツー・イメージ検索について検討する。
生成拡散モデルを用いて,テキストクエリを視覚的なクエリに変換する。
そして、視覚モデルと画像間の類似性を推定する。
論文 参考訳(メタデータ) (2025-08-29T18:24:38Z) - LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images? [80.4577892387028]
テキストリッチな画像上でLMMの論理的推論能力を評価するために設計された1,100の多重選択質問からなるベンチマークであるLogicOCRを紹介する。
我々は、テキストコーパスをマルチモーダルサンプルに変換するスケーラブルで自動化されたパイプラインを開発した。
我々は,Chain-of-Thought (CoT) とダイレクト・アンサー・セッティングの両方で,オープンソースとプロプライエタリなLMMを多岐にわたって評価する。
論文 参考訳(メタデータ) (2025-05-18T08:39:37Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document [60.01330653769726]
テキスト中心タスクに適した大規模マルチモーダルモデル(LMM)であるTextMonkeyを提案する。
ゼロ初期化によるシフトウィンドウアテンションの導入により、高い入力解像度でクロスウィンドウ接続を実現する。
テキストスポッティングとグラウンド化を包含する能力を拡張し、位置情報を応答に組み込むことで、解釈可能性を高める。
論文 参考訳(メタデータ) (2024-03-07T13:16:24Z) - Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with
Text [130.89493542553151]
テキスト内ビジョンやFlamingoのような言語モデルは、任意のインターリーブされた画像とテキストのシーケンスを入力としてサポートする。
このインターフェースをサポートするために、インターリーブされた画像+テキストを含むウェブコーパス上でプレトレーニングが行われる。
画像がインターリーブされた人気テキスト専用C4コーパスの拡張であるMultimodal C4をリリースする。
論文 参考訳(メタデータ) (2023-04-14T06:17:46Z) - TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation
with Question Answering [86.38098280689027]
視覚的質問応答(VQA)を用いたテキスト入力に生成した画像の忠実度を測定する自動評価指標を導入する。
そこで本研究では,12カテゴリにわたる4Kの多様なテキスト入力と25Kの質問(オブジェクト,カウントなど)からなるベンチマークを用いて,既存のテキスト・ツー・イメージ・モデルの包括的評価を行う。
論文 参考訳(メタデータ) (2023-03-21T14:41:02Z) - Language Quantized AutoEncoders: Towards Unsupervised Text-Image
Alignment [81.73717488887938]
Language-Quantized AutoEncoder (LQAE)は、事前訓練された言語モデルを利用して、教師なしの方法でテキストイメージデータを整列することを学ぶ。
LQAEは類似した画像を類似したテキストトークンのクラスタで表現することを学び、一致したテキストイメージペアを使わずにこれら2つのモダリティを整列させる。
これにより、大きな言語モデル(例えばGPT-3)による少数ショット画像の分類や、BERTテキストの特徴に基づく画像の線形分類が可能になる。
論文 参考訳(メタデータ) (2023-02-02T06:38:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。