論文の概要: Frontier vision-language models have overtaken young adults at detecting AI-generated portraits -- but not their calibration
- arxiv url: http://arxiv.org/abs/2608.30210v1
- Date: Mon, 31 Aug 2026 03:45:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.21414
- Title: Frontier vision-language models have overtaken young adults at detecting AI-generated portraits -- but not their calibration
- Title(参考訳): 最前線の視覚言語モデルは、AIによる肖像画の検出で若者を追い越しているが、その校正は行われていない。
- Authors: Sunwhi Kim, Sunyul Kim, Meounggun Jo, Jini Tae,
- Abstract要約: 視覚言語モデル(VLM)は、このような画像にフラグを付けるためにますます提案されている。
19のVLMを198の顔のポートレートでベンチマークしました。
モデル感度は現在、若年層を決定的に超えている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI image generators now create face portraits that are hard to tell from real photographs. Vision-language models (VLMs) are increasingly proposed to flag such images. We benchmarked 19 VLMs on the same 198 face portraits -- real photographs and identity-matched ChatGPT-4o and Imagen 3 versions -- under the same task as our earlier study of 1,667 adults (85% correct overall; accuracy fell steeply with age). The June-2026 cohort of 14 models only matched adults in their 20s-30s. Four weeks later the ceiling broke. Among five July-2026 releases under the identical protocol, gpt-5.6-sol reached 92.8% balanced accuracy (five-draw mean 92.1%), clearly above adults in their 20s (88.5%), and claude-fable-5 detected every AI image while averaging 91.9%. Model sensitivity now exceeds young adults decisively (d' up to 3.4 versus ~ 2.4). What has not been overtaken is human calibration. Model criteria spread from c = -1.10 to +1.45 while humans sit near zero at every age; both new leaders are biased (+0.44, -0.97), and only a few mid-ranked models approach the human balance. Changing the labelled examples still flipped about one answer in four. The best machines now out-see young adults here, without matching the human balance between suspicion and trust.
- Abstract(参考訳): AI画像ジェネレータは、実際の写真から見分けるのが難しい顔の肖像画を作成できるようになった。
視覚言語モデル(VLM)は、このような画像にフラグを付けるためにますます提案されている。
19枚のVLMを198枚の顔写真(実写写真と身元が一致したChatGPT-4oとImagen 3バージョン)でベンチマークしました。
6~2026年モデル14機のコホートは、20~30代の大人にしかマッチしなかった。
4週間後、天井が壊れた。
同じプロトコルで7月から2026年7月までにリリースされた5つのリリースのうち、gpt-5.6-solは92.8%の精度(5つのドロー平均92.1%)に達し、20代の大人(88.5%)より明らかに上回っており、Claude-fable-5は平均91.9%の精度ですべてのAI画像を検出した。
モデル感度は現在、若年者(最大3.4対2.4)を決定的に上回っている。
乗り越えられていないのは人間の校正です。
モデル基準は c = -1.10 から +1.45 に広がっており、人間はすべての年齢でゼロに近づき、新しいリーダーは2人ともバイアス(+0.44, -0.97)があり、中間ランクのモデルだけが人間のバランスに近づいた。
ラベル付きの例を変えることは、まだ4つに1つだけ答えた。
最高のマシンは、疑いと信頼のバランスを一致させることなく、ここでは若者を見渡せます。
関連論文リスト
- Can a Teenager Fool an AI? Evaluating Low-Cost Cosmetic Attacks on Age Estimation Systems [5.0710101224393735]
年齢推定システムは、年齢制限のあるオンラインコンテンツのためのゲートキーパーとしてますます展開されている。
ヒゲを含むシンプルで家庭で利用できる化粧品の変化は、AI年齢推定者が未成年者を成人に分類する原因となるかどうかを考察する。
VLM画像エディターを用いて10歳から21歳までの人物の329枚の顔画像に対する身体的攻撃をシミュレートした。
論文 参考訳(メタデータ) (2026-02-23T06:13:52Z) - Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test [62.17144846428715]
我々は、Embodied Turing Testベンチマーク: WoW-World-Eval (Wow,wo,val)を紹介する。
Wow-wo-valは知覚、計画、予測、一般化、実行の5つのコア能力を調べる。
Inverse Dynamic Model Turing Testでは、まずIMMを用いて、実世界におけるビデオ基盤モデルの実行精度を評価する。
論文 参考訳(メタデータ) (2026-01-07T17:50:37Z) - We are not able to identify AI-generated images [0.0]
私たちのデータセットには、CC12Mからサンプルされた実際の画像と、MidJourneyで生成されたAI生成のデータを慎重にキュレートする、120の難しいケースが含まれています。
我々の結果は、比較的単純なポートレート画像でも、人間が確実にAI生成コンテンツを検出するのに苦労していることを示している。
これらの発見は、AIが生成するメディアが現実と差別化されていくにつれて、より大きな認識と倫理的ガイドラインの必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2025-12-23T11:55:40Z) - Beyond Human Judgment: A Bayesian Evaluation of LLMs' Moral Values Understanding [1.7635992653738075]
我々はアノテータ不一致をモデル化し、アレタリック不一致(遺伝性ヒト不一致)とてんかん不一致(モデルドメイン感度)の両方を捉える。
我々は、ソーシャルネットワーク、ニュース、フォーラムにまたがる100K以上のテキストにおいて、約700のアノテーションから250K以上のアノテーションにまたがる最高の言語モデルを評価する。
GPUに最適化されたBayesianフレームワークは、1M以上のモデルクエリを処理し、AIモデルが人間のアノテータの上位25%にランクされ、平均的なバランスの取れた精度よりもはるかに優れた結果が得られた。
論文 参考訳(メタデータ) (2025-08-19T13:05:48Z) - Underage Detection through a Multi-Task and MultiAge Approach for Screening Minors in Unconstrained Imagery [6.903111965769448]
凍結したFaRLビジョンバックボーンをベースとしたマルチタスクアーキテクチャを提案する。
視力の低下と年齢差を伴って, 全体の清潔化を訓練した。
F2スコアが0.801から0.857から1%の偽エラー率で18以下で検出された。
アンダー-12タスクとアンダー-15タスクでは、F2の各ブースターは0.666から0.955、それぞれ0.689から0.916である。
論文 参考訳(メタデータ) (2025-06-12T13:36:27Z) - CO-SPY: Combining Semantic and Pixel Features to Detect Synthetic Images by AI [58.35348718345307]
実際の画像とAI生成画像を区別する現在の取り組みには、一般化が欠如している可能性がある。
既存のセマンティック機能を強化した新しいフレームワークCo-Spyを提案する。
また、5つの実画像データセットと22の最先端生成モデルからなる包括的データセットであるCo-Spy-Benchを作成します。
論文 参考訳(メタデータ) (2025-03-24T01:59:29Z) - Seeing is not always believing: Benchmarking Human and Model Perception
of AI-Generated Images [66.20578637253831]
人工知能(AI)技術の進歩が偽写真を生み出すのではないかという懸念が高まっている。
本研究の目的は、最先端のAI生成視覚コンテンツを識別するためのエージェントを包括的に評価することである。
論文 参考訳(メタデータ) (2023-04-25T17:51:59Z) - Conformer and Blind Noisy Students for Improved Image Quality Assessment [80.57006406834466]
知覚品質評価(IQA)のための学習ベースアプローチは、通常、知覚品質を正確に測定するために歪んだ画像と参照画像の両方を必要とする。
本研究では,変換器を用いた全参照IQAモデルの性能について検討する。
また,全教師モデルから盲人学生モデルへの半教師付き知識蒸留に基づくIQAの手法を提案する。
論文 参考訳(メタデータ) (2022-04-27T10:21:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。