論文の概要: Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces
- arxiv url: http://arxiv.org/abs/2608.25876v1
- Date: Wed, 26 Aug 2026 14:49:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.871135
- Title: Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces
- Title(参考訳): 視覚言語モデルは形状の感情的品質を判断するか? : 生成設計インタフェースのためのクロスモデル監査
- Abstract要約: ジェネレーティブデザインインターフェースは、ユーザが"よりエレガント"や"よりミニマリスト"といった概念で出力をコントロールできるセマンティックコントロールをますます公開します。
現実的な疑問は、最先端のビジョン言語モデルが、同じ概念の観点で一貫してオブジェクトを表現するかどうかである。
感性形容詞対に沿って非テクスチャな3Dオブジェクトをランク付けすることで、6つのVLMを検査する。
- 参考スコア(独自算出の注目度): 3.284045052514267
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative design interfaces increasingly expose semantic controls that let users steer output with concepts such as "more elegant" or "more minimalist," typically encoded by a vision-language model (VLM). A practical question is whether state-of-the-art VLMs represent objects consistently in terms of the same concept. We audit 6 VLMs by ranking untextured 3D objects along Kansei adjective pairs, where Kansei describes affective impressions of product form, with each axis defined as the difference between the text representations of its two poles. Geometric pairs serve as positive controls, and pairs of unrelated adjectives establish an empirical null. Across 10 categories of ShapeNet database, affective axes converge above the null (mean pairwise rank correlation 0.36 vs. 0.14) but below the geometric ceiling (0.44). The agreement between models is partial and highly uneven: on the three axes shared by all categories, mean convergence ranges from 0.21 for bookshelves to 0.51 for jars. Convergence depends primarily on whether a category's representational variation aligns with the semantic direction being evaluated, rather than simply on how much the objects vary in shape overall. Cross-model convergence does not imply agreement with human judgments. Based on our findings, we implement a UI prototype that shows how the audit can inform which Kansei descriptors to expose as controls for a given object class and which to withhold.
- Abstract(参考訳): ジェネレーティブデザインインタフェースは、ユーザーが「よりエレガント」や「よりミニマリスト」といった概念で出力を制御できるセマンティックコントロールを次第に公開し、視覚言語モデル(VLM)によって符号化される。
現実的な問題は、最先端のVLMがオブジェクトを同じ概念で一貫して表現するかどうかである。
感性形容詞対(かんせい形容詞対)に沿って無テクスチャな3次元オブジェクトをランク付けして6つのVLMを検査し,各軸を2つの極のテキスト表現の差として定義した。
幾何学的対は正の制御として機能し、無関係な形容詞の対は経験的ヌルを確立する。
ShapeNetデータベースの10のカテゴリで、感情的軸はヌル(平均的なペアのランク相関0.36 vs. 0.14)よりも高く収束するが、幾何学的天井(0.44)より下にある。
モデル間の合意は部分的かつ非常に不均一であり、すべてのカテゴリーで共有される3つの軸について、平均収束範囲は本棚の0.21から瓶の0.51までである。
収束は主に、カテゴリーの表現的変動が、対象が全体形によってどの程度異なるかではなく、評価される意味的な方向と一致するかどうかに依存する。
クロスモデル収束は人間の判断と必ずしも一致しない。
そこで本研究では,対象とするオブジェクトクラスに対するコントロールとして,どのカンセイ記述子を公開すべきかを監査が通知する方法を示すUIプロトタイプを実装した。
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Mapping and Measuring the Behavioral Evolution of Large Language Models [28.603443859513153]
ベンチマークのリーダーボードは、言語モデルのパフォーマンスを概説するが、その振る舞いが他のモデルとどのように関係しているか、世代によって異なる。
1万のプロンプトの共有バンクに対する応答を用いて、6つのファミリーから32モデルの出力挙動を特徴付ける。
論文 参考訳(メタデータ) (2026-08-11T15:07:28Z) - 3D Segmentation Using Viewpoint-Dependent Spatial Relationships [55.198821645924234]
220kのベンチマークサンプルを含む視点対応3Dセグメンテーションデータセットを提案する。
このデータセットでは、対象オブジェクトはオブザーバー中心の空間関係によってのみ識別できる。
カメラのポーズをエンコードする視点表現を導入し、そのモデルに観察視点を条件づける。
論文 参考訳(メタデータ) (2026-05-15T07:58:44Z) - Object Pose Transformer: Unifying Unseen Object Pose Estimation [54.20344997573707]
モデルなしのオブジェクトポーズ推定を未知のインスタンスで学習することは、3Dビジョンにおける根本的な課題である。
我々のチームは、RGB入力から深度、ポイントマップ、カメラパラメータ、正規化されたオブジェクト座標を共同で予測します。
当社はカメラ非依存で、カメラ固有の知識をオンザフライで学習し、メトリックスケールリカバリのためのオプションの深度入力をサポートします。
論文 参考訳(メタデータ) (2026-03-24T16:04:16Z) - Do It Yourself: Learning Semantic Correspondence from Pseudo-Labels [81.22943696917304]
擬似ラベルを3次元認識することで意味的対応性の推定を改善することを提案する。
我々はSPair-71kに新たな最先端技術を導入し、同様の監督要件を持つ手法と比較して、絶対的な4%以上、7%以上を達成した。
論文 参考訳(メタデータ) (2025-06-05T17:54:33Z) - VSFormer: Mining Correlations in Flexible View Set for Multi-view 3D Shape Understanding [9.048401253308123]
本稿では,複数の視点に対するフレキシブルな組織と明示的な相関学習について検討する。
我々は,集合内のすべての要素の対関係と高次相関を明示的に捉えるために,emphVSFormerというニブルトランスフォーマーモデルを考案した。
ModelNet40、ScanObjectNN、RGBDなど、さまざまな3D認識データセットの最先端結果に到達している。
論文 参考訳(メタデータ) (2024-09-14T01:48:54Z) - Towards Category Unification of 3D Single Object Tracking on Point Clouds [10.64650098374183]
カテゴリー特化モデルは、シームズや動き中心のパラダイムに関わらず、3次元単体追跡(SOT)において非常に価値のある手法である。
本稿ではまず,共有モデルパラメータを持つ単一ネットワークを用いて,すべてのカテゴリにまたがるオブジェクトを同時に追跡できる統一モデルを提案する。
論文 参考訳(メタデータ) (2024-01-20T10:38:28Z) - Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence [80.6840060272386]
本稿では,意味的対応のための幾何学的認識の重要性を明らかにする。
この情報を活用することで,意味的対応性能が著しく向上することを示す。
提案手法は,SPair-71kデータセット上で,65.4(ゼロショット)と85.6(教師)のPCK@0.10スコアを達成する。
論文 参考訳(メタデータ) (2023-11-28T18:45:13Z) - Zero-shot point cloud segmentation by transferring geometric primitives [68.18710039217336]
ゼロショットポイントクラウドセマンティックセマンティックセマンティックセマンティクスについて検討し、そこではネットワークが見えないオブジェクトに対してトレーニングされ、見えないオブジェクトをセマンティクスできる。
本研究では,視覚的および視覚的カテゴリーのオブジェクトで共有される幾何学的プリミティブを学習し,言語と学習された幾何学的プリミティブとの微粒なアライメントを利用する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-10-18T15:06:54Z) - Sim2Real Object-Centric Keypoint Detection and Description [40.58367357980036]
キーポイントの検出と記述はコンピュータビジョンにおいて中心的な役割を果たす。
対象中心の定式化を提案し、各関心点が属する対象をさらに特定する必要がある。
我々はシミュレーションで訓練されたモデルを現実のアプリケーションに一般化できるsim2realコントラスト学習機構を開発した。
論文 参考訳(メタデータ) (2022-02-01T15:00:20Z) - Synthesizing the Unseen for Zero-shot Object Detection [72.38031440014463]
そこで本研究では,視覚領域における視覚的特徴と視覚的対象の両方を学習するために,視覚的特徴を合成することを提案する。
クラスセマンティックスを用いた新しい生成モデルを用いて特徴を生成するだけでなく,特徴を識別的に分離する。
論文 参考訳(メタデータ) (2020-10-19T12:36:11Z) - Global-Local Bidirectional Reasoning for Unsupervised Representation
Learning of 3D Point Clouds [109.0016923028653]
局所構造とグローバル形状の双方向推論による点雲表現を人間の監督なしに学習する。
本研究では, 実世界の3次元オブジェクト分類データセットにおいて, 教師なしモデルが最先端の教師付き手法を超越していることを示す。
論文 参考訳(メタデータ) (2020-03-29T08:26:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。