論文の概要: Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation
- arxiv url: http://arxiv.org/abs/2607.11334v1
- Date: Mon, 13 Jul 2026 09:52:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.420572
- Title: Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation
- Title(参考訳): 検証ガイドによる12曲構成:シンボリック音楽生成のための生成検証・再生のハーネス
- Abstract要約: 本稿では,言語モデルの提案を表現的検証を伴う生成-検証-再生-トレースループでラップするニューロシンボリックハーネスを提案する。
完全なパイプラインは、全体の合法性を主張することなく、イベントローカルの一貫性を改善する。
- 参考スコア(独自算出の注目度): 37.048771679940984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models can produce superficially legal twelve-tone scores that collapse into degenerate textures. We introduce a neuro-symbolic harness that wraps a language-model proposer in a generate-verify-repair-trace loop with symbolic verification. The complete pipeline improves event-local consistency without claiming whole-piece legality. Across 40 controlled tasks and four paired models, audited delivery yield rises from 13.3% under raw generation to 48.1% with the harness, which explicitly abstains otherwise. The pass rate of a narrower collision and serialisation-consistency check rises from 33.5% to 58.3%, while degeneracy remains near 0.05, including under exploratory adversarial prompting. A blinded evaluation by five experts also shows a descriptive aggregate preference for harness candidates over raw generation in adherence, perceived legality, coherence, and overall quality.
- Abstract(参考訳): 大規模な言語モデルでは、表面的に合法的な12音のスコアを生成して、退化したテクスチャに分解することができる。
本稿では,言語モデルの提案を表現的検証を伴う生成-検証-再生-トレースループでラップするニューロシンボリックハーネスを提案する。
完全なパイプラインは、全体の合法性を主張することなく、イベントローカルの一貫性を改善する。
40の制御されたタスクと4つのペアモデルで、監査された納入利回りは13.3%から48.1%に上昇し、それ以外は明確に禁じられている。
より狭い衝突とシリアライゼーション・一貫性のチェックのパスレートは33.5%から58.3%に上昇し、デジェネリズムは探索的な逆転のプロンプトを含む0.05に近づいたままである。
5人の専門家による盲目評価では、従順性、知覚された合法性、一貫性、全体的な品質よりも、ハーネス候補に対する記述的な集合的嗜好が示されている。
関連論文リスト
- Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - From Blind Edits to Verified Repair: Building Trustworthy User-Side LLM Agents for Web Accessibility [0.5872014229110213]
Chrome拡張機能はページのスタイルシートを抽出し、それを凝縮してローカルモデルのコンテキストウィンドウに適合させ、その結果をライブページに可逆的に注入する。
二重条件プロトコルは、10の違反に富む10の高アクセスのライブサイトで6つの小さなオープンウェイトモデル(7Bから14B)に適用される。
検証された修理器具は、トリリンガルシード違反ベンチマークと、違反が厳格に減少した場合のみ変更を受け入れる監査注入検証ループとをペアリングする。
論文 参考訳(メタデータ) (2026-07-26T17:21:24Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - Teaching LLMs Program Semantics via Symbolic Execution Traces [0.7046782561282057]
SV-COMP 2025上に構築された500 C 検証タスクの評価フレームワークを提案する。
6家族の14モデルを評価し,総合的精度の高いマスクが致命的な弱点であることを確認した。
わずか$sim$3,000のバグトレースと、推論時の連鎖推論を組み合わせることで、違反検出を17ポイント以上改善する。
論文 参考訳(メタデータ) (2026-05-07T13:01:06Z) - CuraView: A Multi-Agent Framework for Medical Hallucination Detection with GraphRAG-Enhanced Knowledge Verification [3.422186949568493]
本報告では,文レベル検出のためのフレームワークであるCuraViewについて述べる。
CuraViewは、患者レベルのEHRからGraphRAGベースの知識グラフを構築する。
我々は,50例の患者を対象に,Ex Discharge-Meベンチマークから250例のCuraViewを評価した。
論文 参考訳(メタデータ) (2026-05-05T08:05:31Z) - Hallucination as Trajectory Commitment: Causal Evidence for Asymmetric Attractor Dynamics in Transformer Generation [0.0]
自己回帰言語モデルにおける幻覚は非対称的な誘引力学によって制御される。
高速分岐法を用いて、軌道力学をインパルスレベルから分離する。
論文 参考訳(メタデータ) (2026-04-16T12:16:53Z) - Contrastive Deep Learning for Variant Detection in Wastewater Genomic Sequencing [0.0]
本稿では,Vector-Quantized Variational Autoencoders (VQ-VAE) を用いた非教師付きウイルス変異検出のための包括的フレームワークを提案する。
VQ-VAEは、参照ゲノムや変異ラベルを必要とせずに、k-merトークン化配列からゲノムパターンの離散コードブックを学習する。
我々のフレームワークは、ゲノム監視のスケーラブルで解釈可能なアプローチと、公衆衛生モニタリングへの直接的な応用を提供する。
論文 参考訳(メタデータ) (2025-12-02T19:04:05Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers [34.31192184496381]
デンスレトリバーとリランカーは、検索強化世代(RAG)パイプラインの中心である。
我々は,これらのコンポーネントがベースとする大規模言語モデル(LLM)をどの程度の事実的能力で継承するか,あるいは失うかを評価する。
全ての埋め込みモデルにおいて、クエリと正しい完了の間のコサイン類似度スコアは、間違ったものよりも著しく高い。
論文 参考訳(メタデータ) (2025-08-28T04:13:51Z) - A Stitch in Time Saves Nine: Detecting and Mitigating Hallucinations of
LLMs by Validating Low-Confidence Generation [76.34411067299331]
大規模な言語モデルは、しばしば信頼性を著しく損なう「ハロシン化」する傾向がある。
生成過程における幻覚を積極的に検出・緩和する手法を提案する。
提案手法は, GPT-3.5モデルの幻覚を平均47.5%から14.5%に低減する。
論文 参考訳(メタデータ) (2023-07-08T14:25:57Z) - (Certified!!) Adversarial Robustness for Free! [116.6052628829344]
逆方向の摂動が0.5の2ノルム以内であることに制約された場合,ImageNetでは71%の精度が証明された。
これらの結果は,モデルパラメータの微調整や再学習を必要とせず,事前学習した拡散モデルと画像分類器のみを用いて得られる。
論文 参考訳(メタデータ) (2022-06-21T17:27:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。