論文の概要: From Advertised Improvements to Measured Capabilities: Evaluating ChatGPT Images 2.5 on Forgery Tasks
- arxiv url: http://arxiv.org/abs/2609.13617v1
- Date: Sat, 12 Sep 2026 00:15:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.409929
- Title: From Advertised Improvements to Measured Capabilities: Evaluating ChatGPT Images 2.5 on Forgery Tasks
- Title(参考訳): 広告改善から計測能力へ:偽タスクにおけるChatGPT画像2.5の評価
- Abstract要約: 画像登録後、FrareとSunburstは、周辺レシートテキストに対するOCR検出された変更が少ないことを示した。
フレアはCORDレシートの以前の編集を少なく保ち、フォト編集シーケンスはモデル間ではほとんど分離しない。
微細プリントの改良はOCRの信頼性限界以下で未解決のままである。
- 参考スコア(独自算出の注目度): 15.787104302260168
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We evaluate whether the improvements advertised for ChatGPT Images 2.5 translate into better performance on forgery tasks with predetermined answers. We compare its Flare and Sunburst API models with GPT-Image-2 re-run in the same week, using receipt-field edits, repeated editing, product placement and fine-print rendering. After image registration, Flare and Sunburst show fewer OCR-detected changes to surrounding receipt text (31.7% and 31.2% versus 44.2% for both GPT-Image-2 baselines), mainly on CORD receipts, without a detectable improvement in target-field correctness. Flare retains fewer earlier edits on CORD receipts, while photo-edit sequences provide little separation between models. Product codes are more often legible with Images 2.5, alongside larger product placement; the analyses do not establish a fidelity gain independent of size. Fine-print improvements remain unresolved below the OCR reliability limit. Refusals are rare and localisation is weak in both generations. At a fixed detection threshold, Community Forensics flags 68.6% of controlled Images 2.5 images averaged across cells, versus 35.9% of self-reported images posted online. These results motivate task-specific evaluation of advertised capabilities and defences, with explicit limits on what automatic checks can establish.
- Abstract(参考訳): また,ChatGPT Images 2.5で宣伝された改善が,所定の回答を得た偽タスクの性能向上に寄与するか否かを検証した。
同じ週にFrareとSunburstのAPIモデルとGPT-Image-2の再実行を比較し、レシートフィールド編集、繰り返し編集、製品配置、ファインプリントレンダリングを使用しました。
画像登録後、フレアとサンバーストは、主にCORDレシートに基づいて、周辺レシートテキスト(GPT-Image-2ベースラインの31.7%と31.2%と44.2%)にOCRが検出した変更を減らした。
フレアはCORDレシートの以前の編集を少なく保ち、フォト編集シーケンスはモデル間ではほとんど分離しない。
製品コードは、より大きな製品配置とともに、イメージ2.5で検証可能であることが多い。
微細プリントの改良はOCRの信頼性限界以下で未解決のままである。
拒絶はまれであり、両方の世代で局所性が弱い。
固定検出しきい値では、Community Forensicsのフラグ68.6%は、制御されたイメージ2.5のイメージが細胞全体で平均され、35.9%はオンラインに投稿されている。
これらの結果は、自動チェックが確立できる範囲を明確に制限して、広告機能と防衛のタスク固有の評価を動機付けている。
関連論文リスト
- ChatGPT Images 2.5 in the Wild: A Launch-Period Dataset and Detector Evaluation [12.307366979757065]
ChatGPT Images 2.5は、公称を維持しながら、基礎となるジェネレータを変更することができ、オンライン投稿からバージョン属性を曖昧にする。
凍結したコレクションには、8つのソースにわたる2,440のポストから3,478のイメージが含まれています。
3つのアトリビューションティアを記録し、イメージ形式のフィルタリングとターゲットレビュー後にスタンドアロンイメージを保持する。
論文 参考訳(メタデータ) (2026-09-14T06:25:39Z) - TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval [10.927254533551563]
電子商取引の画像検索は、しばしばクロップされたイメージをクエリとして取り、各候補は完全なアイテムイメージと構造化されたテキストで表現される。
我々は,電子商取引検索のためのテキスト誘導型暗黙的きめ細かなグラウンドディングフレームワークTIGER-FGを提案する。
論文 参考訳(メタデータ) (2026-05-18T14:07:20Z) - EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement [76.76247443244293]
EditRefinerは、編集後の修正を人間のような認識・推論・行動評価ループとして再構成するエージェントフレームワークである。
歪み、診断精度、人間の知覚アライメントにおいて、最先端の手法を一貫して上回る。
論文 参考訳(メタデータ) (2026-05-08T09:05:08Z) - Benchmarking OCR Pipelines with Adaptive Enhancement for Multi-Domain Retail Bill Digitization [0.0]
本稿では,小売請求書のデジタル化のための知的かつ品質に配慮した適応型光文字認識パイプラインの提案とベンチマークを行う。
360枚の不均質な請求書画像の実際のデータセットを用いて実験を行った。
提案したパイプラインは18.4%の文字誤り率(CER)と27.6%のワード誤り率(WER)を達成し、それぞれ26.4%と31.2%の改善率を示している。
論文 参考訳(メタデータ) (2026-04-28T03:31:27Z) - GEditBench v2: A Human-Aligned Benchmark for General Image Editing [58.86807672117726]
GEditBench v2は、23のタスクにまたがる1200の現実世界のユーザクエリを備えた包括的なベンチマークである。
また、視覚的整合性を評価するためのオープンソースのペアワイドアセスメントモデルであるPVC-Judgeを提案する。
PVC-Judgeは、オープンソースモデルの最先端評価性能を達成し、平均してGPT-5.1を超えている。
論文 参考訳(メタデータ) (2026-03-30T15:08:32Z) - PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing [3.889218009169166]
Composed Image Retrieval (CIR) は大きな進歩を遂げているが、現在のベンチマークは1つの接地的回答に限られている。
我々は、7,635のクエリと329Kの関連判断を備えた総合的な実世界のベンチマークであるPinPointを紹介する。
論文 参考訳(メタデータ) (2026-03-04T20:55:30Z) - RAVID: Retrieval-Augmented Visual Detection: A Knowledge-Driven Approach for AI-Generated Image Identification [14.448350657613368]
RAVIDは、視覚検索強化生成(RAG)を活用するAI生成画像検出のための最初のフレームワークである
提案手法では,表現学習を改善するためにカテゴリ関連プロンプトを付加した細調整のCLIP画像エンコーダであるRAVID CLIPを利用する。
RAVIDの平均精度は80.27%で、最先端のC2P-CLIPでは63.44%である。
論文 参考訳(メタデータ) (2025-08-05T23:10:56Z) - TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity [76.98973481600002]
本稿では,TAG-WMと命名されたタンパ認識画像ウォーターマーキング手法を提案する。
提案手法は、4つのキーモジュールからなる: 生成品質を保ちつつ、著作権と局所化の透かしを潜伏空間に埋め込むためのデュアルマークジョイントサンプリング (DMJS) アルゴリズム。
実験結果から,TAG-WMは歪み下においても,改質性および局所化能力の両面において最先端性能を達成できることが示された。
論文 参考訳(メタデータ) (2025-06-30T03:14:07Z) - GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing [60.66800567924348]
テキスト誘導画像編集モデルを評価するための新しいベンチマークを導入する。
このベンチマークには、20種類のコンテンツカテゴリにわたる高品質な編集例が1000以上含まれている。
我々は、GPT-Image-1をいくつかの最先端編集モデルと比較する大規模な研究を行っている。
論文 参考訳(メタデータ) (2025-05-16T17:55:54Z) - Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models [52.877452505561706]
データセットのオーナシップ検証(DOV)を損なうよう特別に設計された最初の著作権回避攻撃を提案する。
CEAT2Iは, 試料検出, トリガー同定, 効率的な透かし除去の3段階からなる。
実験の結果,CEAT2I はモデル性能を保ちながら DOV 機構を効果的に回避できることがわかった。
論文 参考訳(メタデータ) (2025-05-05T17:51:55Z) - Doubly Abductive Counterfactual Inference for Text-based Image Editing [130.46583155383735]
本稿では,1つの画像のテキストベースの画像編集(TBIE)について,反事実推論を用いて検討する。
本稿では,DAC(Dububly Abductive Counterfactual Inference framework)を提案する。
我々のDACは編集性と忠実さのトレードオフをうまく達成しています。
論文 参考訳(メタデータ) (2024-03-05T13:59:21Z) - Revisiting Consistency Regularization for Semi-supervised Change
Detection in Remote Sensing Images [60.89777029184023]
教師付きクロスエントロピー(CE)損失に加えて、教師なしCD損失を定式化する半教師付きCDモデルを提案する。
2つの公開CDデータセットを用いて実験を行った結果,提案手法は教師付きCDの性能に近づきやすいことがわかった。
論文 参考訳(メタデータ) (2022-04-18T17:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。