論文の概要: SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment
- arxiv url: http://arxiv.org/abs/2608.17514v2
- Date: Wed, 19 Aug 2026 05:20:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.27598
- Title: SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment
- Title(参考訳): SE-MoLoRA:ドメイン特有の写真評価のための共有出力LoRAアダプタ
- Abstract要約: ドメイン固有の写真アセスメントのためのモジュール型パラメータ効率適応フレームワークSE-MoLoRAを提案する。
ランク64共有アダプタは広い写真語彙をキャプチャし、ランク32の専門家はドメイン固有の残基を学習する。
SE-MoLoRAは、モノリシックなLoRA上でBERTScore-F1を0.2317から0.4215に改善した。
- 参考スコア(独自算出の注目度): 9.306646806206976
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models can describe images fluently, but they often fail to provide actionable photographic critique because semantic content and aesthetic judgment remain entangled. We propose SE-MoLoRA, a modular parameter-efficient adaptation framework for domain-specific photographic assessment. The method separates general photographic knowledge from specialist residual judgments using an always-active shared LoRA expert and routed adapters for composition, lighting, and technical quality. A lightweight query router selects the relevant specialist, enabling targeted critique without training separate full models. A rank-64 shared adapter captures broad photographic vocabulary, while rank-32 specialists learn domain-specific residuals with an orthogonal regularization penalty that encourages disentangled representations. Training data is obtained by distilling the Reddit Photo Critique Dataset into domain-labeled critique samples. On held-out critique generation, SE-MoLoRA improves BERTScore-F1 from 0.2317 to 0.4215 over monolithic LoRA and is preferred in 84.6\% of pairwise comparisons, while using fewer active parameters than separate specialist models. SVD-based ablation study shows that shared-specialist decomposition and orthogonal regularization reduce expert overlap. These results demonstrate that modular adaptation improves controllability and specificity in multimodal photographic critique.
- Abstract(参考訳): 視覚言語モデルでは画像の表現に精通しているが、意味的内容や美的判断が絡み合っているため、アクション可能な写真批評の提供に失敗することが多い。
ドメイン固有の写真アセスメントのためのモジュール型パラメータ効率適応フレームワークSE-MoLoRAを提案する。
この方法は、常にアクティブな共有LoRA専門家と、合成、照明、技術品質のためのルーティングアダプタを用いて、写真知識を専門的な残留判断から分離する。
軽量なクエリルータが関連するスペシャリストを選択し、個別のフルモデルをトレーニングすることなく、対象とする批判を可能にする。
ランク64共有アダプタは広い写真語彙をキャプチャし、ランク32の専門家は直交正規化ペナルティでドメイン固有の残基を学ぶ。
トレーニングデータは、Reddit Photo Critique Datasetをドメインラベルの批判サンプルに蒸留することで得られる。
SE-MoLoRAは、モノリシックなLoRA上でBERTScore-F1を0.2317から0.4215に改善し、84.6\%のペア比較で好まれる。
SVDに基づくアブレーション研究は、共有特殊主義者の分解と直交正規化が専門家の重複を減少させることを示している。
これらの結果から,モジュラ適応はマルチモーダル写真批評における可制御性と特異性を向上させることが示唆された。
関連論文リスト
- Rethinking Text-Based Image Retrieval in Specific Domain [12.468935521282434]
Security Multi-Match TBIR (SecMM-TBIR) は、500万の監視画像と200の包括的なクエリからなるベンチマークである。
本稿では,セマンティック・アウェア・ファイン・チューニング(SAFT)フレームワークを提案する。
様々なCLIPライクなモデルに対する実験により、SAFTは標準的な画像テキストのコントラストよりも平均mAP@20のSecMM-TBIRで7.8ポイント上昇することが示された。
論文 参考訳(メタデータ) (2026-08-11T06:00:27Z) - CopyCat: Improving Fine-Grained Subject Consistency in Subject-to-Image Models within Seconds [52.84219088497834]
CopyCatは軽量なモデルリファインメントフレームワークで、わずか数秒で詳細な被写体一貫性を改善する。
DreamBench と XVerseBench の実験では、対象物から対象物までの対象物間の微粒化一貫性が一貫した改善を示した。
論文 参考訳(メタデータ) (2026-08-01T13:49:03Z) - ChimeraLoRA: Multi-Head LoRA-Guided Synthetic Datasets [48.20200154292035]
そこで我々は,数ショットの実集合で訓練されたクラスワイズLoRAを提案し,追加の画像を合成する。
多様なデータセットにまたがって、我々の合成画像は多様かつ詳細に富みながら、数発の実際の分布と密接に一致している。
論文 参考訳(メタデータ) (2026-02-23T10:59:41Z) - Towards Minimal Fine-Tuning of VLMs [59.01498204407219]
Image-LoRAは、トランスフォーマーベースの視覚言語モデルのための軽量パラメータ効率の良い微調整レシピである。
Image-LoRAは、視覚的なスパン内の注目層の値パスにのみ、低ランク適応を適用します。
トレーニング可能なパラメータが少なく、アダプタのみのトレーニング FLOP は少ないが、標準のLoRAの精度と一致または密接に対応している。
論文 参考訳(メタデータ) (2025-12-22T10:02:10Z) - Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution [76.66229730098759]
実世界の画像超解像(Real-ISR)では、既存のアプローチは主に微調整された事前学習拡散モデルに依存している。
単一ステップ画像超解像のためのMixture-of-Ranks (MoR)アーキテクチャを提案する。
LoRAの各ランクを独立した専門家として扱う、きめ細かい専門家分割戦略を導入する。
論文 参考訳(メタデータ) (2025-11-20T04:11:44Z) - FreeLoRA: Enabling Training-Free LoRA Fusion for Autoregressive Multi-Subject Personalization [39.50687410991598]
FreeLoRAは、マルチオブジェクトパーソナライズのための主題固有のLoRAモジュールのトレーニング不要な融合を可能にする。
実験の結果,FreeLoRAは主観的忠実度と即効性の両方において高い性能を発揮することがわかった。
論文 参考訳(メタデータ) (2025-07-02T15:16:59Z) - LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair [116.48684498656871]
視覚的指示を用いた画像編集のためのLoRA of Change (LoC) フレームワークを提案する。
我々は、命令固有のLoRAを学習し、事前のイメージペアで「変更」を符号化し、モデルの解釈可能性と再利用性を高める。
本モデルでは,ユーザ意図に整合した高品質な画像を生成し,現実世界の視覚的指示の幅広い範囲をサポートする。
論文 参考訳(メタデータ) (2024-11-28T13:55:06Z) - Multi-LoRA Composition for Image Generation [107.83002438126832]
復号化中心の観点から,マルチロラ合成について検討する。
我々は,各聴覚ステップで異なるLoRAを交互に切り替えるLoRA Switchと,より密着的な画像合成を導くためにすべてのLoRAを同時に組み込むLoRA Compositeの2つのトレーニングフリー手法を提案する。
論文 参考訳(メタデータ) (2024-02-26T18:59:18Z) - MASA-SR: Matching Acceleration and Spatial Adaptation for
Reference-Based Image Super-Resolution [74.24676600271253]
本稿では、RefSRのためのMASAネットワークを提案し、これらの問題に対処するために2つの新しいモジュールを設計する。
提案したMatch & extract Moduleは、粗大な対応マッチング方式により計算コストを大幅に削減する。
空間適応モジュールは、LR画像とRef画像の分布の差を学習し、Ref特徴の分布を空間適応的にLR特徴の分布に再マップする。
論文 参考訳(メタデータ) (2021-06-04T07:15:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。