論文の概要: RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models
- arxiv url: http://arxiv.org/abs/2608.26832v1
- Date: Thu, 27 Aug 2026 09:05:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.320945
- Title: RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models
- Title(参考訳): RuleWeaver: 大きな言語モデルのためのベンチマークルール中心のシナリオ推論
- Abstract要約: 本稿ではルール中心のシナリオ推論を評価するためのベンチマーク構築フレームワークであるルールウィーバーを紹介する。
現在のモデルは依然として複雑なルール中心のシナリオ推論に苦戦しており、最高の性能のモデルでさえ、最大ルーリックスコアの50%程度しか達成できていない。
- 参考スコア(独自算出の注目度): 39.01774351778858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly applied to specialized domains, where effective use of domain expertise often requires reasoning over complex rules in concrete scenarios. However, existing benchmarks only partially evaluate this capability, as they either focus on output-level instruction constraints or overlook the distinct roles that rules play in scenario reasoning. To address these gaps, this paper introduces RuleWeaver, a benchmark construction framework for evaluating rule-centered scenario reasoning. RuleWeaver starts from corpus-derived IF-THEN Meta Rules, progressively augments them into complex rules, and composes these rules into rule-centered scenario QA instances. Beyond final-answer correctness, RuleWeaver further supports process-level evaluation through rubric-based answer quality, rule recall, and rule precision. Experiments on 11 representative LLMs show that current models still struggle with complex rule-centered scenario reasoning, with even the best-performing model achieving only around 50% of the maximum rubric score. We make our code and dataset available here: https://github.com/SharkSpicy-NLP/RuleWeaver.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ドメインの専門知識を効果的に活用するためには、具体的なシナリオにおいて複雑なルールを推論する必要があることが多い。
しかし、既存のベンチマークでは、アウトプットレベルの命令制約に焦点を当てたり、ルールがシナリオ推論で果たす異なる役割を見落としているため、この機能を部分的に評価するしかありません。
本稿では,ルール中心のシナリオ推論を評価するためのベンチマーク構築フレームワークであるルールウィーバーを紹介する。
RuleWeaverは、コーパスから派生したIF-THENメタルールから始まり、それらを徐々に複雑なルールに拡張し、これらのルールをルール中心のシナリオQAインスタンスに構成する。
最終回答の正確性以外にも、ルールウィーバーはルーブリックベースの回答品質、ルールリコール、ルール精度によるプロセスレベルの評価もサポートする。
11の代表的なLCMの実験では、現在のモデルは依然として複雑なルール中心のシナリオ推論に苦戦しており、最高の性能のモデルでさえ最大ルーリックスコアの50%程度しか達成していない。
コードとデータセットはここで公開しています。
関連論文リスト
- Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models [33.61747923589224]
大規模言語モデル(LLM)は、テキストの理解と生成に優れるが、大規模に提供される外部の手続き規則を確実に理解し適用することは困難である。
我々は、ルールをインスタンス固有の事実ではなく、グローバルに再利用可能な抽象単位として再構成する大規模なベンチマークであるルールワールドを紹介した。
我々は、与えられたルールをKVキャッシュに注入し、検索を内部で学習可能なステップワイズプロセスに変換するエンドツーエンドフレームワークDynaRuleを提案する。
論文 参考訳(メタデータ) (2026-08-24T03:22:45Z) - Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering [54.97384993676565]
複雑な国内R&D規制から派生した運用知識グラフを特徴とする,新たなベンチマークであるRegOps-Benchを用いて,レギュレーションコンプライアンスQAを形式化する。
RefWalkはクロスドキュメントの引用を横切り、マックスベースのアグリゲーションを通じてマルチビュー候補を融合させ、ソースへのクレームを明示的にマッピングするためにルールごとの属性を強制する。
論文 参考訳(メタデータ) (2026-05-28T10:38:38Z) - Logic-Regularized Verifier Elicits Reasoning from LLMs [63.65875399266337]
論理規則で正規化された教師なしの検証器であるLOVERを提案する。
ローバーは、定理を二項潜在変数として扱い、内部の活性化を活用し、3つの論理的制約を課す。
ローバーは教師なしのベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-05-07T09:03:49Z) - SLogic: Subgraph-Informed Logical Rule Learning for Knowledge Graph Completion [2.8845104295670017]
本稿では、クエリ依存のスコアを論理ルールに割り当てるフレームワークであるSLogicを紹介する。
SLogicの中核は、クエリのヘッダーエンティティを中心としたサブグラフを利用するスコアリング機能である。
ローカルなサブグラフコンテキストを活用することで、SLogicは一貫して最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-09-30T20:59:22Z) - Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs [23.958458849973248]
マルチタスク設定における長さの一般化について検討し、ロバストなクロスタスク長の一般化を可能にする最初のフレームワークとしてメタルール追従ファインチューニング(Meta-RFFT)を提案する。
多数のタスクやインスタンスをトレーニングした後、我々のモデルは、最小限の微調整やワンショットプロンプトで、目に見えないタスクに対して驚くほどの長さの一般化能力を達成する。
論文 参考訳(メタデータ) (2025-02-17T07:54:50Z) - LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models [87.49676980090555]
大規模言語モデル(LLM)は、様々なタスクにまたがる顕著な能力を示し、複雑な問題解決能力を示している。
LLMの包括的なルール理解、実行、計画能力を評価するために設計された新しいベンチマークであるLogicGameを紹介する。
論文 参考訳(メタデータ) (2024-08-28T13:16:41Z) - Symbolic Working Memory Enhances Language Models for Complex Rule Application [87.34281749422756]
大規模言語モデル(LLM)は、顕著な推論性能を示しているが、多段階の推論に苦慮している。
本稿では,外部ワーキングメモリを用いたLLMの拡張と,ルール適用のためのニューロシンボリックフレームワークを提案する。
当社のフレームワークは,LLMベースのルール実装とシンボリックルールグラウンディングを反復的に実施する。
論文 参考訳(メタデータ) (2024-08-24T19:11:54Z) - Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs [87.34281749422756]
大規模言語モデル(LLM)は、様々な推論タスクにおいて、印象的な人間的なパフォーマンスを実現している。
しかし、その根底にある推論規則の熟達性は、人間の能力に欠ける。
本稿では,推論ルールベースであるULogicを構築するための,推論ルール生成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-18T03:38:51Z) - Can LLMs Follow Simple Rules? [28.73820874333199]
ルール追従言語評価シナリオ(ルール追従言語評価シナリオ、RuLES)は、大規模言語モデルにおけるルール追従能力を測定するためのフレームワークである。
RuLESは14の単純なテキストシナリオで構成され、そこではモデルがユーザと対話しながら様々なルールに従うように指示される。
現在のほとんどのモデルは、単純なテストケースであっても、シナリオルールに従うのに苦労しています。
論文 参考訳(メタデータ) (2023-11-06T08:50:29Z) - Building Rule Hierarchies for Efficient Logical Rule Learning from
Knowledge Graphs [20.251630903853016]
本稿では,ルール階層を用いて非プロミッシングルールを抽出する新しい手法を提案する。
HPMの応用は非プロムルールの除去に有効であることを示す。
論文 参考訳(メタデータ) (2020-06-29T16:33:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。