論文の概要: The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking
- arxiv url: http://arxiv.org/abs/2605.06707v1
- Date: Wed, 06 May 2026 18:19:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:38.477134
- Title: The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking
- Title(参考訳): 単一ファイルテスト:ソーシャルリーチトラッキングを用いた第一出力LDM Web 生成の経時的公開インターフェース評価
- Abstract要約: 本稿では,"HTML AI Battle"プロジェクトにおける17の公開実験から収集した68個の単一ファイルHTML世代を8週間にわたって比較した。
GPT、Gemini、Grok、Claudeの4つの推論モデルファミリは、カスタムインストラクションなし、パーソナリティチューニングなし、修理プロンプトなし、固定された公開インターフェースプロトコルで比較された。
クロードは最強で一貫した家族であり、平均的なパフォーマンスを導き、主要な人間の重み付けスコアで9/17のプロンプトを獲得した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents an eight-week observational comparison of 68 single-file HTML generations collected across 17 public experiments in the "HTML AI Battle" project between December 10, 2025 and February 4, 2026. Four reasoning model families, GPT, Gemini, Grok, and Claude, were compared under a fixed public-interface protocol with no custom instructions, no personality tuning, and no repair prompts. Each output was evaluated from a rendered browser video using human scores and a Gemini LLM-as-a-judge layer for prompt adherence, functional correctness, and UI quality, then packaged into a standardized social-media protocol spanning X (Twitter), TikTok, and YouTube. The tracker was also used for two supervised predictive analyses: an experiment-level model for 24-hour X impressions and a generation-level model for HTML verbosity. Under this protocol, Claude was the strongest and most consistent family, leading mean performance and winning 9/17 prompts under the primary human weighted score. Longer measured reasoning time was not associated with higher quality overall. Gemini as a judge was significantly more lenient than the human evaluator on functional correctness and overall performance, while stable self-favoring bias remained unresolved. The exploratory X-impressions model remained weak under post-screen cross-validation (MAE = 46,874, R^2 = -0.377), whereas the HTML-lines model performed better, with a model-family-only baseline outperforming prompt-aware alternatives (MAE = 135.2, R^2 = 0.576). Overall, selected pre-publication technical/audio variables were not sufficient to predict 24-hour X reach, while code verbosity was driven much more by model family than by prompt wording. The comparisons remain observational and are limited by public-interface drift, access-path differences, and one primary human scorer.
- Abstract(参考訳): 本稿では,2025年12月10日から2026年2月4日までの17の公開実験において,68個のシングルファイルHTML世代を8週間にわたって比較した。
GPT、Gemini、Grok、Claudeの4つの推論モデルファミリは、カスタムインストラクションなし、パーソナリティチューニングなし、修理プロンプトなし、固定された公開インターフェースプロトコルで比較された。
各出力は、人間のスコアとGemini LLM-as-a-judgeレイヤを使用してレンダリングされたブラウザビデオから評価され、アテンデンス、機能的正確性、UI品質が促進され、X(Twitter)、TikTok、YouTubeにまたがる標準化されたソーシャルメディアプロトコルにパッケージされた。
このトラッカーは、24時間Xインプレッションの実験レベルモデルとHTML冗長性の世代レベルモデルという2つの教師付き予測分析にも使用された。
このプロトコルの下でクロードは最強で一貫した家族であり、平均的なパフォーマンスを導き、主要な人間の重み付けスコアで9/17のプロンプトを獲得した。
より長い測定値の推論時間と全体的な品質との関連は認められなかった。
審査員としてのジェミニは、機能的正当性と全体的な性能に関する人間の評価者よりもはるかに寛大であったが、安定した自己満足バイアスは未解決のままであった。
探索的X印象モデルは、ポストスクリーン・クロスバリデーション(MAE = 46,874, R^2 = -0.377)の下でも弱いままであったが、HTMLラインモデルは、モデルファミリーのみのベースラインがプロンプト・アウェアの代替品(MAE = 135.2, R^2 = 0.576)よりも優れていた。
全体として、選択されたプレパブリケーションの技術的/オーディオ変数は24時間のX到達を予測するには不十分であった。
比較は観察的であり、公開対面ドリフト、アクセスパスの違い、および1つの主要なヒトスコアラーによって制限されている。
関連論文リスト
- vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - VB: Visibility Benchmark for Visibility and Perspective Reasoning in Images [0.0]
本稿では、視覚言語モデルが写真で何が見えていないのかを判断できるかどうかを判定するベンチマークであるVBを提案する。
アイテムは、最小限の画像編集を最小限のテキスト編集で横断する2x2デザインを使用して、100のファミリーに編成される。
我々は,自信認識精度(CAA),最小編集フリップ率(MEFR),信頼ランク選択予測(SelRank),第2次視点推論のモデルを評価する。
論文 参考訳(メタデータ) (2026-03-03T23:03:11Z) - Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test [62.17144846428715]
我々は、Embodied Turing Testベンチマーク: WoW-World-Eval (Wow,wo,val)を紹介する。
Wow-wo-valは知覚、計画、予測、一般化、実行の5つのコア能力を調べる。
Inverse Dynamic Model Turing Testでは、まずIMMを用いて、実世界におけるビデオ基盤モデルの実行精度を評価する。
論文 参考訳(メタデータ) (2026-01-07T17:50:37Z) - Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open Datasets [0.0]
汎用ユースケースの回帰テストを実行するベンチマークであるGPR-benchを紹介する。
より新しいモデルは一般的に正確性を改善するが、違いは控えめで統計的に有意ではない。
対照的に、簡潔な命令は簡潔さを著しく向上させ、迅速なエンジニアリングの有効性を実証する。
論文 参考訳(メタデータ) (2025-05-02T12:31:43Z) - Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens [53.99177152562075]
視覚における自己回帰モデルのスケールアップは、大きな言語モデルほど有益でないことが証明されている。
モデルが離散トークンを使用するか、連続トークンを使用するか、BERTやGPTのようなトランスフォーマーアーキテクチャを用いてランダムまたは固定順序でトークンを生成するか、という2つの重要な要素に焦点を当てる。
その結果,すべてのモデルが検証損失の点で効果的にスケールしているのに対して,評価性能はFID,GenEvalスコア,視覚的品質などによって異なる傾向を呈することがわかった。
論文 参考訳(メタデータ) (2024-10-17T17:59:59Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z) - Perception Test: A Diagnostic Benchmark for Multimodal Video Models [78.64546291816117]
本稿では,事前学習したマルチモーダルモデルの知覚と推論能力を評価するために,新しいマルチモーダルビデオベンチマークを提案する。
知覚テストは、スキル(記憶、抽象化、物理学、セマンティックス)と、ビデオ、オーディオ、テキストモダリティ間の推論(記述的、説明的、予測的、反ファクト的)のタイプに焦点を当てている。
このベンチマークは、ゼロショット/少数ショットまたは限定的な微調整方式で、転送機能の事前訓練されたモデルを探索する。
論文 参考訳(メタデータ) (2023-05-23T07:54:37Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。