論文の概要: ChatGPT Images 2.5 on Forgery Tasks: Testing Advertised Improvements Against Known Answers
- arxiv url: http://arxiv.org/abs/2609.13617v2
- Date: Wed, 16 Sep 2026 03:38:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.394176
- Title: ChatGPT Images 2.5 on Forgery Tasks: Testing Advertised Improvements Against Known Answers
- Title(参考訳): ChatGPT Images 2.5 on forgery Tasks: Testing Testing Advertated Improvements against Known Answers
- Abstract要約: GPT-Image-2は、同じ週のベースラインを安価でより高価な層で提供する。
調整後、OCRはフレア出力の31.7%で周辺のテキストの変更を検出し、44.2%は安いベースラインである。
繰り返し編集ときめ細かい印刷では、測定可能な利益は得られない。
防衛の成果はほとんど変わらず、両方の世代で地域化は弱いままである。
- 参考スコア(独自算出の注目度): 15.787104302260168
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: OpenAI released ChatGPT Images 2.5 on 8 September 2026, advertising more precise local edits, better consistency across edits, more faithful reference products and sharper detail. We evaluate these claims on four forgery tasks with answers fixed in advance: receipt-field alteration, repeated editing, product placement and small-print rendering. GPT-Image-2 provides same-week baselines at a cheaper and a more expensive tier. A limited improvement appears in receipt editing. After alignment, OCR detects changes to surrounding text in 31.7% of Flare outputs, against 44.2% for the cheaper baseline. This gain is concentrated on CORD receipts and sensitive to shifts of a pixel or less; the forged value itself is no more often correct. Repeated editing and fine print show no measurable gain. Product codes become more legible mainly because Images 2.5 draws the product larger. Defence outcomes change little: localisation remains weak for both generations. A detector that flags 68.6% of controlled benchmark images flags only 35.9% of images posted online. Advertised improvements therefore transfer unevenly to the tested forgery capabilities, while substantial detection limitations remain.
- Abstract(参考訳): OpenAIは2026年9月8日にChatGPT Images 2.5をリリースした。
本報告では,4つの偽造作業に対して,事前に回答を定めている:レシートフィールド修正,反復編集,製品配置,小型印刷レンダリング。
GPT-Image-2は、同じ週のベースラインを安価でより高価な層で提供する。
限定的な改善はレシート編集に現れる。
調整後、OCRはフレア出力の31.7%で周辺のテキストの変更を検出し、44.2%は安いベースラインである。
この利得はCORDレシートに集中し、ピクセルのシフトに敏感である。
繰り返し編集ときめ細かい印刷では、測定可能な利益は得られない。
製品コードは、主に画像2.5が製品を大きくするので、より正確になる。
防衛の成果はほとんど変わらず、両方の世代で地域化は弱いままである。
制御されたベンチマーク画像の68.6%にフラグを付ける検出器は、オンラインに投稿された画像の35.9%に過ぎなかった。
したがって、広告された改善はテストされた偽造能力に不均一に移行するが、かなりの検出制限は残っている。
関連論文リスト
- ChatGPT Images 2.5 in the Wild: A Launch-Period Dataset and Detector Evaluation [12.307366979757065]
ChatGPT Images 2.5は、公称を維持しながら、基礎となるジェネレータを変更することができ、オンライン投稿からバージョン属性を曖昧にする。
凍結したコレクションには、8つのソースにわたる2,440のポストから3,478のイメージが含まれています。
3つのアトリビューションティアを記録し、イメージ形式のフィルタリングとターゲットレビュー後にスタンドアロンイメージを保持する。
論文 参考訳(メタデータ) (2026-09-14T06:25:39Z) - TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval [10.927254533551563]
電子商取引の画像検索は、しばしばクロップされたイメージをクエリとして取り、各候補は完全なアイテムイメージと構造化されたテキストで表現される。
我々は,電子商取引検索のためのテキスト誘導型暗黙的きめ細かなグラウンドディングフレームワークTIGER-FGを提案する。
論文 参考訳(メタデータ) (2026-05-18T14:07:20Z) - EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement [76.76247443244293]
EditRefinerは、編集後の修正を人間のような認識・推論・行動評価ループとして再構成するエージェントフレームワークである。
歪み、診断精度、人間の知覚アライメントにおいて、最先端の手法を一貫して上回る。
論文 参考訳(メタデータ) (2026-05-08T09:05:08Z) - Benchmarking OCR Pipelines with Adaptive Enhancement for Multi-Domain Retail Bill Digitization [0.0]
本稿では,小売請求書のデジタル化のための知的かつ品質に配慮した適応型光文字認識パイプラインの提案とベンチマークを行う。
360枚の不均質な請求書画像の実際のデータセットを用いて実験を行った。
提案したパイプラインは18.4%の文字誤り率(CER)と27.6%のワード誤り率(WER)を達成し、それぞれ26.4%と31.2%の改善率を示している。
論文 参考訳(メタデータ) (2026-04-28T03:31:27Z) - GEditBench v2: A Human-Aligned Benchmark for General Image Editing [58.86807672117726]
GEditBench v2は、23のタスクにまたがる1200の現実世界のユーザクエリを備えた包括的なベンチマークである。
また、視覚的整合性を評価するためのオープンソースのペアワイドアセスメントモデルであるPVC-Judgeを提案する。
PVC-Judgeは、オープンソースモデルの最先端評価性能を達成し、平均してGPT-5.1を超えている。
論文 参考訳(メタデータ) (2026-03-30T15:08:32Z) - PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing [3.889218009169166]
Composed Image Retrieval (CIR) は大きな進歩を遂げているが、現在のベンチマークは1つの接地的回答に限られている。
我々は、7,635のクエリと329Kの関連判断を備えた総合的な実世界のベンチマークであるPinPointを紹介する。
論文 参考訳(メタデータ) (2026-03-04T20:55:30Z) - RAVID: Retrieval-Augmented Visual Detection: A Knowledge-Driven Approach for AI-Generated Image Identification [14.448350657613368]
RAVIDは、視覚検索強化生成(RAG)を活用するAI生成画像検出のための最初のフレームワークである
提案手法では,表現学習を改善するためにカテゴリ関連プロンプトを付加した細調整のCLIP画像エンコーダであるRAVID CLIPを利用する。
RAVIDの平均精度は80.27%で、最先端のC2P-CLIPでは63.44%である。
論文 参考訳(メタデータ) (2025-08-05T23:10:56Z) - TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity [76.98973481600002]
本稿では,TAG-WMと命名されたタンパ認識画像ウォーターマーキング手法を提案する。
提案手法は、4つのキーモジュールからなる: 生成品質を保ちつつ、著作権と局所化の透かしを潜伏空間に埋め込むためのデュアルマークジョイントサンプリング (DMJS) アルゴリズム。
実験結果から,TAG-WMは歪み下においても,改質性および局所化能力の両面において最先端性能を達成できることが示された。
論文 参考訳(メタデータ) (2025-06-30T03:14:07Z) - GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing [60.66800567924348]
テキスト誘導画像編集モデルを評価するための新しいベンチマークを導入する。
このベンチマークには、20種類のコンテンツカテゴリにわたる高品質な編集例が1000以上含まれている。
我々は、GPT-Image-1をいくつかの最先端編集モデルと比較する大規模な研究を行っている。
論文 参考訳(メタデータ) (2025-05-16T17:55:54Z) - Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models [52.877452505561706]
データセットのオーナシップ検証(DOV)を損なうよう特別に設計された最初の著作権回避攻撃を提案する。
CEAT2Iは, 試料検出, トリガー同定, 効率的な透かし除去の3段階からなる。
実験の結果,CEAT2I はモデル性能を保ちながら DOV 機構を効果的に回避できることがわかった。
論文 参考訳(メタデータ) (2025-05-05T17:51:55Z) - Doubly Abductive Counterfactual Inference for Text-based Image Editing [130.46583155383735]
本稿では,1つの画像のテキストベースの画像編集(TBIE)について,反事実推論を用いて検討する。
本稿では,DAC(Dububly Abductive Counterfactual Inference framework)を提案する。
我々のDACは編集性と忠実さのトレードオフをうまく達成しています。
論文 参考訳(メタデータ) (2024-03-05T13:59:21Z) - Revisiting Consistency Regularization for Semi-supervised Change
Detection in Remote Sensing Images [60.89777029184023]
教師付きクロスエントロピー(CE)損失に加えて、教師なしCD損失を定式化する半教師付きCDモデルを提案する。
2つの公開CDデータセットを用いて実験を行った結果,提案手法は教師付きCDの性能に近づきやすいことがわかった。
論文 参考訳(メタデータ) (2022-04-18T17:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。