論文の概要: Frozen Scenes, Shifting Winners: Configuration Fragility in Text-to-3D Evaluation
- arxiv url: http://arxiv.org/abs/2610.00447v1
- Date: Wed, 30 Sep 2026 17:55:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.661525
- Title: Frozen Scenes, Shifting Winners: Configuration Fragility in Text-to-3D Evaluation
- Title(参考訳): 凍結したシーン, シフトする勝者: テキストから3次元評価における構成上の脆弱性
- Abstract要約: 19個のアライメント評価器に対して8つのレンダリングおよびキャプション因子と1つの知覚品質制御を行い、4つのシーン劣化を検査した。
ピーク構成のばらつきは、17/19アライメント評価器のジェネレータ間分散を超え、11/19では1以上のプロンプト・ブートストラップの下界を持つ。
即時制御さえも、レイアウトスクランブルの方向識別が67%を超える評価器は存在しない。
- 参考スコア(独自算出の注目度): 33.12070734213112
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Can a text-to-3D leaderboard change when every generated scene stays fixed? We audit this question for rendered-image evaluation, where camera settings and caption wording become part of the measurement protocol. Across 300 frozen scenes from six generators, we vary eight render and caption factors for 19 alignment evaluators plus one perceptual-quality control, then test four targeted scene degradations. Peak configuration variance exceeds between-generator variance for 17/19 alignment evaluators, with prompt-bootstrap lower bounds above 1 for 11/19. Rankings are more stable than scores, yet 18/19 evaluators change their point-estimate winner under some configuration. Pairwise protocol margin envelopes show which comparisons keep their direction across the tested settings. Selected pairs have opposite pointwise intervals, but no reversal survives simultaneous inference over the full search. Thus the observed winner changes are descriptive, not confirmed changes in generator superiority. Sensitivity remains separate: no evaluator, even the prompt-free control, exceeds 67% tie-adjusted directional discrimination on layout scrambling, which is diagnostic rather than human-validated ground truth. The audit separates score stability, decision uncertainty, and targeted sensitivity, and recommends reporting (generator, score, card ID) with protocol-dependent comparisons and selection-aware uncertainty.
- Abstract(参考訳): 生成されたシーンがすべて固定されている場合、テキストから3Dのリーダーボードは変更できますか?
本稿では,カメラの設定やキャプションが測定プロトコルの一部となるレンダリング画像の評価を行う。
6つのジェネレータの300枚以上の凍結シーンは、19個のアライメント評価器の8つのレンダリングおよびキャプション要因と1つの知覚的品質制御、そして4つのターゲットされたシーン劣化をテストする。
ピーク構成のばらつきは、17/19アライメント評価器のジェネレータ間分散を超え、11/19では1以上のプロンプト・ブートストラップの下界を持つ。
ランキングはスコアよりも安定しているが、18/19の評価者はいくつかの設定でポイント推定勝者を変更する。
ペアワイズプロトコルマージンのエンベロープは、テストされた設定間で、どの比較が方向を保つかを示しています。
選択されたペアは反対の点間隔を持つが、全探索に対する同時推論は残らない。
したがって、観測された勝者の変化は記述的であり、ジェネレータの優越性は確認されていない。
評価者も、即席制御さえも、レイアウトスクランブルの方向識別が67%を超えており、これは人間による検証ではなく診断である。
監査は、スコアの安定性、決定の不確実性、ターゲットの感度を分離し、プロトコルに依存した比較と選択対応の不確実性によるレポート(ジェネレータ、スコア、カードID)を推奨する。
関連論文リスト
- Measuring Collapse and Correction in Homogeneous-Panel LLM Debate [51.03982042769297]
マルチエージェント大言語モデル(LLM)の議論は、最終回答が改善するかどうかによってしばしば評価されるが、運動は必ずしも改善されない。
標準的な最終精度評価は、これらの反対のメカニズムを詳述する。
複数選択質問(MCQ)に関する同質な議論のための監査可能なプロトコルを導入し、各実行を、崩壊、修正、オンセット、署名された介入ユーティリティよりも、遷移台帳として記録する。
論文 参考訳(メタデータ) (2026-09-28T14:31:19Z) - Looks the Same, Answers Differently: Flip-Direction Steering for Robust Vision-Language Reasoning [46.43059067383253]
視覚言語モデル(VLM)は、強い視覚的推論性能を達成する。
イメージキャプチャーと処理の微妙な変更は 推論の軌跡を変える可能性がある
FlipDirは、元の入力と答えフリップ入力の対照的なペアから低ランクなフリップ誘導活性化部分空間を推定する。
論文 参考訳(メタデータ) (2026-09-23T23:43:26Z) - From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection [12.159476982130286]
音声のディープフェイクは、聞き手や自動化されたシステムを騙すのに十分な説得力のある話者の声を模倣することができる。
ほとんどの検出器は発話ごとに1点のスコアで終わるが、なぜ境界線アイテムが信頼されるべきなのか、延期されたのか、あるいはレビューされるべきなのかは、ほとんど語っていない。
この疑問に答えるには、4つの整列した手がかりを後期校正ステップに伝達する監査可能な決定記録がある。
論文 参考訳(メタデータ) (2026-09-08T15:38:57Z) - A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation [14.867869624585886]
評価器の構成妥当性を2次元プロファイルとして定式化する。
S と R は独立であり、スカラーの要約がすべての関連する比較を保存することはないことを示す。
これらの結果から, 評価対象構造の変化に対して, 高判定基準は弱い感度で共存できることが示唆された。
論文 参考訳(メタデータ) (2026-08-25T11:32:54Z) - Which Reranking Conclusions Survive the Answer Interface? A Prospective Finite-Orbit Audit [0.0]
RAGuard と FEVER に対するクレーム対効果を,4人の読者で将来評価する。
推定された検索政治効果、その順序、選択値が変化するかどうかを問う。
6つの確認条件のいずれも、予め規定された0.015の物質性閾値以上の統計的に認証されたインターフェース変化は示さなかった。
論文 参考訳(メタデータ) (2026-08-13T03:22:01Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。