論文の概要: AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing
- arxiv url: http://arxiv.org/abs/2605.31053v1
- Date: Fri, 29 May 2026 09:25:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.506175
- Title: AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing
- Title(参考訳): AnchorSteer: 構造保存音楽編集のための自己発見コンセプトインジェクション
- Abstract要約: AnchorSteerは、構造的アンカーと自己発見のセマンティックステアリングを結合することで緊張を解消するフレームワークである。
提案手法は内部表現を探索し,解釈可能なラベルのない概念ベクトルを抽出する。
ZoME-Benchと主観的テストの実験では、提案フレームワークはステアリングのみのベースラインとアンカーのみのベースラインの両方に優れていた。
- 参考スコア(独自算出の注目度): 14.255074251309168
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Controllable music editing is to modify high-level attributes while strictly preserving rhythmic and melodic structures. However, this task is challenged by a semantic-structural entanglement: steering methods often degrade structure to achieve editing performance, while structural adaptors suppress semantic responsiveness. We propose AnchorSteer, a framework that disentangles this tension by coupling structural anchoring with self-discovered semantic steering. The proposed approach probes internal representations to extract interpretable, label-free concept vectors via a self-supervised reconstruction objective, isolating attributes without curated data. During editing, these portable, plug-and-play concept vectors are injected into diffusion hidden manifolds while a structural adaptor enforces consistency. Variants for unconditioned and conditioned injections are provided to balance robustness and semantic strength. Experiments on ZoME-Bench and subjective tests show that the proposed framework outperforms both steering-only and anchoring-only baselines, enabling significant semantic transformations with high-fidelity structural preservation.
- Abstract(参考訳): コントロール可能な音楽編集は、リズム構造とメロディック構造を厳密に保存しながら、ハイレベルな属性を変更することである。
しかし、この課題は意味的構造的絡み合いによって解決される: ステアリング法は、しばしば構造を劣化させて編集性能を達成し、構造的適応器は意味的応答性を抑制する。
AnchorSteerは、構造的アンカーと自己発見セマンティックステアリングを結合することで、この緊張を解消するフレームワークである。
提案手法は内部表現を探索し,自己教師付き再構成目標を用いてラベルなしの解釈可能な概念ベクトルを抽出し,データなしで属性を分離する。
編集中、これらのポータブルなプラグアンドプレイの概念ベクトルは拡散隠れ多様体に注入され、構造適応器は一貫性を強制する。
無条件および条件付き注入用バリアントは、ロバストネスとセマンティック強度のバランスをとるために提供される。
ZoME-Bench実験と主観的実験の結果,提案手法は操舵のみのベースラインとアンカーのみのベースラインの両方で優れた性能を示し,高忠実度構造保存を伴う意味的変換を実現している。
関連論文リスト
- Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation [84.5255199507027]
Agentic Designerは、構造を意識した内部レイアウト生成を反復的かつ制約的に検証された決定プロセスとして定式化する、プログレッシブなフレームワークである。
提案、検証、合成、調整のモジュールステージにレイアウトを分解することで、フレームワークは3つの特殊エージェント、ジェネレータ、評価器、精錬器を協調する。
この機構は、各配置がコミットされる前に段階的に幾何的検証と補正を行い、エラーの蓄積を防止する。
論文 参考訳(メタデータ) (2026-07-23T02:46:11Z) - Token-to-Token Alignment of Text Embeddings for Semantic Blending [55.88554156801394]
本稿では,プロンプト間のトークン間の明示的な意味的対応を確立するフレームワークであるToken-to-Tokenアライメントを紹介する。
この結果から,テキストから画像への埋め込み空間は,表現が適切に整列されたときにアクセス可能な連続的な意味構造を暗黙的に符号化していることがわかった。
論文 参考訳(メタデータ) (2026-06-22T23:54:40Z) - AnyEdit++: Adaptive Long-Form Knowledge Editing via Bayesian Surprise [10.675226603704937]
我々はBayes-Chunkを組み込んだ構造対応フレームワークであるAnyEdit++を提案する。
我々はAnyEdit++が最先端のベースラインに比べて優れたパフォーマンスと堅牢性を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-31T06:48:43Z) - KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing [24.315720861063397]
KGEditは、テキスト・トゥ・ビデオ(T2V)拡散モデルのための構造化セマンティック・コントロール・フレームワークである。
まず、入力プロンプトのアンビグニティ対応知識グラフ(AAKG)を構築し、入力プロンプトのアンビグニティ化とアンビグニティ化を行う。
次に,拡散変換器の鍵層に意味信号を注入する構造的意味注入モジュール(SSIM)を設計する。
論文 参考訳(メタデータ) (2026-05-28T07:31:22Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Explicit Dropout: Deterministic Regularization for Transformer Architectures [55.09895958546215]
ドロップアウトはディープラーニングにおいて広く使われている正規化手法であるが、その効果は一般的にマスキングによって実現される。
トレーニング損失に直接組み込まれた加算正則化器としてドロップアウトを表現する決定論的定式化を提案する。
論文 参考訳(メタデータ) (2026-04-22T12:45:51Z) - A Unified Conditional Flow for Motion Generation, Editing, and Intra-Structural Retargeting [26.68081874066983]
両タスクを単一の生成フレームワーク内で条件付き移動のインスタンスとしてキャストする統一的な視点を示す。
我々はこのビジョンを、整流運動モデルと目標骨格構造を併用して実装する。
SnapMoGenとマルチキャラクタのMixamoサブセットの実験は、単一のトレーニングされたモデルがテキスト・ツー・モーション生成、ゼロショット編集、ゼロショット・イン・ストラクチャをサポートすることを示している。
論文 参考訳(メタデータ) (2026-04-15T02:53:07Z) - Decouple and Rectify: Semantics-Preserving Structural Enhancement for Open-Vocabulary Remote Sensing Segmentation [23.298715255853782]
リモートセンシング(RS)分野におけるオープンボキャブラリセマンティックセマンティックセマンティックセマンティクスは、言語対応認識と細粒度空間デライン化の両方を必要とする。
最近の手法は、RS-pretrained DINO特徴を導入して、これを補おうとしている。
本稿では, DR-Segを提案する。
論文 参考訳(メタデータ) (2026-04-02T13:15:05Z) - SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing [76.349958946335]
本稿では,映像編集をセマンティックアンカーとモーションモデリングに分解するフレームワークであるSAMA(factorized Semantic Anchoring and Motion Alignment)を提案する。
まずセマンティックアンカリング(Semantic Anchoring)を導入し、スパースアンカフレームでのセマンティックトークンとビデオ潜在者を共同で予測することで、信頼性の高い視覚アンカを確立する。
第2に、モーションアライメントは同じバックボーンをモーション中心のビデオ復元のプリテキストタスクで事前トレーニングする。
論文 参考訳(メタデータ) (2026-03-19T17:59:51Z) - Structured Prompt Optimization for Few-Shot Text Classification via Semantic Alignment in Latent Space [3.66782592128973]
本研究は, 意味的絡み合い, ラベル構造の不明確さ, 特徴表現不足といった問題に対処する。
低リソース条件下でのセマンティック理解とタスク適応を強化するために,構造化プロンプトに基づく最適化フレームワークを提案する。
実験結果から,提案手法は意味的矛盾やラベルの曖昧さを効果的に軽減する。
論文 参考訳(メタデータ) (2026-02-27T07:31:16Z) - ERIS: An Energy-Guided Feature Disentanglement Framework for Out-of-Distribution Time Series Classification [51.07970070817353]
理想的な時系列分類(TSC)は不変表現をキャプチャできるべきである。
現在の手法は、真に普遍的な特徴を分離するために必要な意味的な方向性を欠いている。
本稿では,シフト・ロバストネス・フレームワークのためのエンドツーエンドのエネルギー規則化情報を提案する。
論文 参考訳(メタデータ) (2025-08-19T12:13:41Z) - DisProtEdit: Exploring Disentangled Representations for Multi-Attribute Protein Editing [48.819599672346136]
DisProtEditは、デュアルチャネル自然言語管理を利用する制御可能なタンパク質編集フレームワークである。
DisProtEditは、明示的にセマンティックファクタを分離し、モジュールと解釈可能なコントロールを可能にする。
論文 参考訳(メタデータ) (2025-06-17T06:12:18Z) - Unsupervised Distillation of Syntactic Information from Contextualized
Word Representations [62.230491683411536]
我々は,ニューラルネットワーク表現における意味論と構造学の非教師なしの絡み合いの課題に取り組む。
この目的のために、構造的に類似しているが意味的に異なる文群を自動的に生成する。
我々は、我々の変換クラスタベクトルが、語彙的意味論ではなく構造的特性によって空間に現れることを実証する。
論文 参考訳(メタデータ) (2020-10-11T15:13:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。