論文の概要: ChartGenEval: Corruption-Tested Multi-Dimensional Feedback for Rhythm-Game Chart Generation
- arxiv url: http://arxiv.org/abs/2607.12857v1
- Date: Tue, 14 Jul 2026 15:08:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.180914
- Title: ChartGenEval: Corruption-Tested Multi-Dimensional Feedback for Rhythm-Game Chart Generation
- Title(参考訳): ChartGenEval: リズムゲームチャート生成のための倒壊テストによる多次元フィードバック
- Abstract要約: 生成されたリズムゲームチャートは、1つの公式メモ列を再生する必要はない。
ChartGenEvalは、6つのクエスト評価フレームワークで、自動的な汚職テストのコアを持つ。
慣れ親しんだ統計値がチャートの品質を測定することを前提とせず、各コア出力を線量制御障害でテストする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A generated rhythm-game chart need not reproduce one official note sequence: many note choices can fit the same song and difficulty. Reference-note agreement therefore measures reconstruction, not the full design problem. We introduce ChartGenEval, a six-question evaluation framework with an automatic, corruption-tested core. It leaves note choice open while anchoring timing to the song: the matched official chart supplies only its authored timing map, never target notes. We test each core output with dose-controlled failures rather than assume that a familiar statistic measures chart quality. Across 80 held-out song groups, seven output axes satisfy prespecified sensitivity and invariance criteria in nine nonredundant tests. Complementary stress tests on the 40-song development panel expose two broader lessons. A chart-wide phase estimate recovers injected shifts of 15, 30, and 60 ms while chart-only outputs remain essentially unchanged. Common-pattern rewriting lowers mean language-model perplexity by 37%, and loop collapse raises mean self-similarity by 62%. ChartGenEval therefore reports separate, role-specific signals instead of one proxy or total score. This profile provides automatic feedback for comparing and iterating generators; selected outputs are candidate optimization targets or constraints after task-specific stress testing.
- Abstract(参考訳): 生成されたリズムゲームチャートは、1つの公式メモ列を再現する必要はない。
したがって、リファレンスノートの合意は、完全な設計問題ではなく、再構築を測る。
ChartGenEvalは、6つのクエスト評価フレームワークで、自動的な汚職テストのコアを持つ。
曲のタイミングを固定しながら、音符の選択を開いている: マッチした公式チャートは、作者のタイミングマップのみを提供し、決してターゲットの音符を供給しない。
慣れ親しんだ統計値がチャートの品質を測定することを前提とせず、各コア出力を線量制御障害でテストする。
80曲以上で、7つの出力軸は、9つの非冗長試験において、予め規定された感度および非分散基準を満たす。
40曲の開発パネルでの補足的ストレステストでは、より広範な2つの教訓が明らかになった。
チャート全体の位相推定は15,30,60ミリ秒の注入シフトを回復するが、チャートのみの出力は基本的に変化しない。
共通パターンの書き換えは言語モデルの難易度を37%低下させ、ループ崩壊は平均自己相似度を62%上昇させる。
したがってChartGenEvalは、ひとつのプロキシやトータルスコアではなく、独立したロール固有のシグナルを報告します。
このプロファイルは、ジェネレータの比較と反復のための自動フィードバックを提供する。
関連論文リスト
- GTA: Graph Theory Agent and Benchmark for Algorithmic Graph Reasoning with LLMs [50.68372832207766]
Graph Theory Bench (GT Bench) は、44のタスク構造設定において24の古典的なグラフ問題をカバーするベンチマークである。
GT Benchは、精度が入力表現と強く結びついていることを示している。
本稿では,選好学習された表現セレクタと計画と分解の足場を組み合わせたグラフ理論エージェント(GTA)を提案する。
論文 参考訳(メタデータ) (2026-09-10T22:50:10Z) - Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training [0.0]
オープンエンド言語モデル評価は、欠落した応答キーに対して、他のモデルや小さな選好パネルの代わりに行われることが多い。
FlavourBenchを導入し、バージョン付き料理環境から高密度な回答マップをコンパイルする。
同じ534の置換、ペアリング、制約タスク上で27のフロンティアエンドポイントを評価し、14,418の完全なモデルタスク観測結果を得た。
論文 参考訳(メタデータ) (2026-08-20T21:14:52Z) - ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning [1.827510863075184]
ClosureBenchはグラフ関係推論のための構築的なベンチマークである。
証明済みの真実だ
1.5Bのオープンウェイトからフロンティアシステムへのモデルの評価を行った。
論文 参考訳(メタデータ) (2026-08-18T18:36:21Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents [22.30468215041597]
ツール使用エージェントは別の言語で同じタスクを与えられるが、それでも同じステップを踏むだろうか?
アクションポリシーを,8つのモデル,6つの並列ベンチマーク,41の言語で測定対象とする。
論文 参考訳(メタデータ) (2026-08-11T16:18:34Z) - What You See Is What You Get: Observation-Aligned Supervision for Chart-to-Code Generation [50.62320148925983]
多くのチャートプログラムは、レンダリングされた画像から一意に回収できない潜在生変数を含む。
本稿では,潜伏する生データターゲットを視覚的観察に制約された量で置き換えるリライトフレームワークであるオブザーバ・アラインド・インフォメーションを導入する。
この結果から,チャート・トゥ・コードモデルの改善には,データや高度な学習目的やアルゴリズムだけでなく,チャート画像から識別可能なものを尊重する監視対象も必要であることが示唆された。
論文 参考訳(メタデータ) (2026-07-06T06:53:40Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence [22.315546054051143]
大規模言語モデルのバイアス監査は、EU AI Actなどのガバナンスフレームワーク内で運用されている。
このプロトコルでは、各バイアススコアを2つの軸上での信頼性推定とともに報告する。
論文 参考訳(メタデータ) (2026-05-09T16:26:49Z) - VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation [4.694504497452662]
視覚言語モデル(VLM)は、マルチモーダルシステムの自動判断器としてますます使われているが、そのスコアは信頼性を示すものではない。
本研究では,判断者の得点を校正した予測区間に変換する分布自由フレームワークである共形予測を用いて,この問題を考察する。
本稿では,VLM-as-a-Judgeのコンフォメーション予測を3つの審査員と14の視覚的タスクカテゴリで初めて体系的に解析した。
論文 参考訳(メタデータ) (2026-04-28T05:30:18Z) - Scaling Test-Time Compute for Agentic Coding [126.72747643609274]
本稿では,ロールアウト軌跡のコンパクトな表現に基づくエージェントコーディングのためのテスト時間スケーリングフレームワークを提案する。
当社のフレームワークは,各ロールアウトを,その健全な仮説,進捗,障害モードを保存する構造的な要約に変換する。
提案手法は,SWE-Bench Verified および Terminal-Bench v2.0 におけるフロンティア符号化エージェントの性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-04-16T17:39:33Z) - Does It Run and Is That Enough? Revisiting Text-to-Chart Generation with a Multi-Agent Approach [7.613758211231583]
大規模な言語モデルでは、自然言語チャートの記述を実行可能なコードに変換することができるが、生成したスクリプトの約15%はまだ実行できない。
本稿では,既製のGPT-4o-miniモデルのみを用いて,ドラフト,実行,修理,判断を分離する軽量マルチエージェントパイプラインを提案する。
論文 参考訳(メタデータ) (2025-06-06T15:39:17Z) - SMATCH++: Standardized and Extended Evaluation of Semantic Graphs [4.987581730476023]
Smatchメトリックはグラフ距離を評価する一般的な方法である。
構造的に逸脱するが有効なグラフを許容するアノテーションガイドラインに完全に準拠する方法を示す。
スコアリングの改善のために,細粒度部分グラフの意味の計算を標準化し,拡張する手法を提案する。
論文 参考訳(メタデータ) (2023-05-11T17:29:47Z) - Span Pointer Networks for Non-Autoregressive Task-Oriented Semantic
Parsing [55.97957664897004]
seq2seq、非自動回帰的、タスク指向を構築するための効果的なレシピは、3つのステップで発話とセマンティックフレームをマッピングする。
これらのモデルは通常、長さ予測によってボトルネックとなる。
本研究では,デコードタスクをテキスト生成からスパン予測へシフトさせる非自己回帰手法を提案する。
論文 参考訳(メタデータ) (2021-04-15T07:02:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。