論文の概要: Suppressing Domain-Specific Hallucination in Construction LLMs: A Knowledge Graph Foundation for GraphRAG and QLoRA on River and Sediment Control Technical Standards
- arxiv url: http://arxiv.org/abs/2603.13307v1
- Date: Tue, 03 Mar 2026 15:51:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:42.289512
- Title: Suppressing Domain-Specific Hallucination in Construction LLMs: A Knowledge Graph Foundation for GraphRAG and QLoRA on River and Sediment Control Technical Standards
- Title(参考訳): 建築用LLMにおけるドメイン特異的幻覚の抑制:河川・堆積物管理技術標準に関する知識グラフの基礎
- Authors: Takato Yasuno,
- Abstract要約: 本稿では,日本の河川・土砂管理技術標準からの技術的疑問に答えることの課題について論じる。
ケースA(Plain 20B LLMベースライン),ケースB(QLoRAドメインを715グラフ由来のQAペアに微調整した8B LLM),ケースC(Neo4jナレッジグラフをGraphRAG経由で拡張した20B LLM)の3つの補完的アプローチを実装し,評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper addresses the challenge of answering technical questions derived from Japan's River and Sediment Control Technical Standards -- a multi-volume regulatory document covering survey, planning, design, and maintenance of river levees, dams, and sabo structures -- using open-source large language models running entirely on local hardware. We implement and evaluate three complementary approaches: Case A (plain 20B LLM baseline), Case B (8B LLM with QLoRA domain fine-tuning on 715 graph-derived QA pairs), and Case C (20B LLM augmented with a Neo4j knowledge graph via GraphRAG). All three cases use the Swallow series of Japanese-adapted LLMs and are evaluated on a 100-question benchmark spanning 8 technical categories, judged automatically by an independent LLM (Qwen2.5-14B, score 0--3). The key finding is a performance inversion: the 8B QLoRA fine-tuned model (Case B) achieves a judge average of 2.92/3 -- surpassing both the 20B plain baseline (Case A: 2.29/3, $+$0.63) and the 20B GraphRAG approach (Case C: 2.62/3, $+$0.30) -- while running at 3$\times$ faster latency (14.2s vs. 42.2s for Case A). GraphRAG provides moderate gains ($+$0.33 over baseline) but is outperformed by domain-specific fine-tuning in both quality and efficiency. We document the full engineering pipeline, including knowledge graph construction (200 nodes, 268 relations), QLoRA training data generation from Neo4j relations, training on a single GPU (16 GB VRAM) using unsloth, GGUF Q4_K_M quantisation and Ollama deployment, and the graph retrieval and re-ranking design. High-level engineering lessons are distilled in the main body; implementation pitfalls and toolchain details are documented in Supplementary Materials.
- Abstract(参考訳): 本論文は,河川レブ,ダム,サボ構造物の調査,計画,設計,維持を網羅する多巻の規制文書である河川・土砂管理技術標準から得られた技術的問題に,完全にローカルハードウェアで動作するオープンソースの大規模言語モデルを用いて答えることの課題に対処する。
ケースA(プレイン20B LLMベースライン)、ケースB(QLoRAドメインを715グラフ由来のQAペアに微調整した8B LLM)、ケースC(グラフRAGを介してNeo4j知識グラフを付加した20B LLM)の3つの補完的アプローチを実装し,評価した。
3例とも日本語対応LLMのスワローシリーズを使用し,独立LLM(Qwen2.5-14B,スコア0--3)で自動的に判断される8つの技術カテゴリにまたがる100のクエストベンチマークで評価される。
8B QLoRAファインチューニングモデル(ケースB)は、20Bプレーンベースライン(ケースA: 2.29/3, $+0.63)と20B GraphRAGアプローチ(ケースC: 2.62/3, $+0.30)の両方を上回る2.92/3の判定平均を達成する。
GraphRAGは適度な利得(ベースライン以上0.33ドル)を提供するが、品質と効率の両面でドメイン固有の微調整によりパフォーマンスが向上する。
我々は、知識グラフ構築(200ノード、268リレーション)、Neo4jリレーションからのQLoRAトレーニングデータ生成、Unslothを使用した1つのGPU(16 GB VRAM)のトレーニング、GGUF Q4_K_M量子化とOllamaデプロイメント、グラフ検索と再ランク付け設計を含む完全なエンジニアリングパイプラインを文書化する。
高レベルのエンジニアリングのレッスンは本体で蒸留され、実装の落とし穴とツールチェーンの詳細は補助材料に記録されている。
関連論文リスト
- The Reasoning Bottleneck in Graph-RAG: Structured Prompting and Context Compression for Multi-Hop QA [4.190399245544758]
グラフRAGシステムは、文書を知識グラフにインデックス化することで、強力なマルチホップ質問応答を実現するが、強力な検索は強力な回答を保証しない。
検索された文脈では77%から91%の質問が金の答えを持っているが、精度は35%から78%に過ぎず、エラーの73%から84%が失敗の原因となっている。
i) SPARQLチェーン・オブ・シークレット・プロンプトは,質問をエンティティ・リレーショナル・コンテキストと整合したトリプル・パターンのクエリに分解し,(ii)グラフウォーク圧縮を行う。
論文 参考訳(メタデータ) (2026-03-14T17:29:13Z) - Adapting Methods for Domain-Specific Japanese Small LMs: Scale, Architecture, and Quantization [0.0]
本稿では,QLoRAファインチューニングを用いたドメイン固有日本語小言語モデルの構築手法を提案する。
最適なトレーニングスケール、ベースモデルの選択、アーキテクチャ対応の量子化の3つに対処する。
論文 参考訳(メタデータ) (2026-03-12T18:27:57Z) - AutoGraph-R1: End-to-End Reinforcement Learning for Knowledge Graph Construction [60.51319139563509]
強化学習(RL)を用いたタスクパフォーマンスのKG構築を直接最適化する最初のフレームワークであるAutoGraph-R1を紹介する。
我々は2つの新しいタスク対応報酬関数を設計し、1つは知識担体としてのグラフと、もう1つは知識指標としてのグラフを設計する。
私たちの研究は、構築とアプリケーションの間のループを閉じることが可能であることを示している。
論文 参考訳(メタデータ) (2025-10-17T06:03:36Z) - Enrich-on-Graph: Query-Graph Alignment for Complex Reasoning with LLM Enriching [61.824094419641575]
大言語モデル(LLM)は知識グラフ質問応答(KGQA)のような知識集約的なシナリオにおける幻覚と事実的誤りに苦しむ
これは、構造化知識グラフ(KG)と非構造化クエリのセマンティックギャップによるもので、その焦点や構造に固有の違いが原因である。
既存の手法は通常、バニラKGの資源集約的で非スケーリング可能な推論を用いるが、このギャップを見落としている。
我々は、LLMの事前知識を活用してKGを充実させる柔軟なフレームワークEnrich-on-Graph(EoG)を提案し、グラフとクエリ間のセマンティックギャップを埋める。
論文 参考訳(メタデータ) (2025-09-25T06:48:52Z) - Learning Efficient and Generalizable Graph Retriever for Knowledge-Graph Question Answering [75.12322966980003]
大規模言語モデル(LLM)は、様々な領域にわたって強い帰納的推論能力を示している。
既存のRAGパイプラインのほとんどは非構造化テキストに依存しており、解釈可能性と構造化推論を制限する。
近年,知識グラフ解答のための知識グラフとLLMの統合について検討している。
KGQAにおける効率的なグラフ検索のための新しいフレームワークであるRAPLを提案する。
論文 参考訳(メタデータ) (2025-06-11T12:03:52Z) - KG2QA: Knowledge Graph-enhanced Retrieval-augmented Generation for Communication Standards Question Answering [7.079181644378029]
KG2QAは、細調整された大言語モデル(LLM)とドメイン固有知識グラフ(KG)を統合する質問応答フレームワークである。
ITU-TレコメンデーションとQwen2.5-7B-インストラクトから,高品質な6,587対のQAデータセットを構築した。
我々のKG-RAGパイプラインでは、細調整されたLLMがまずKGから関連する知識を取得し、より正確で現実的な応答を可能にします。
論文 参考訳(メタデータ) (2025-06-08T08:07:22Z) - ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates [51.633266497799745]
思考テンプレートのスケーリングによる階層的LLM推論は、推論検索空間を効果的に最適化することができる。
i)類似または関連する推論問題に一般化可能な500ほどの高レベルな思考テンプレートを含む構造化・汎用的な思考テンプレートライブラリ,(ii)長いCoTではなく一連の思考テンプレート上で階層的な強化学習を行う,(iii)全く新しい推論スケーリングシステム,の3つの革新を紹介した。
論文 参考訳(メタデータ) (2025-02-10T18:51:47Z) - AttackQA: Development and Adoption of a Dataset for Assisting Cybersecurity Operations using Fine-tuned and Open-Source LLMs [0.0]
大規模言語モデル(LLM)は、ユーザクエリに対する応答を生成するために微調整される。
本研究では,AttackQAと呼ばれるサイバーセキュリティ質問応答(Q&A)データセットを開発する。
我々は、セキュリティオペレーションセンターのアナリスト向けに設計されたRAGベースのQ&Aシステムを構築するためにそれを利用している。
論文 参考訳(メタデータ) (2024-11-01T23:03:40Z) - RankRAG: Unifying Context Ranking with Retrieval-Augmented Generation in LLMs [60.38044044203333]
大規模言語モデル(LLM)は、通常、検索拡張生成(RAG)において、レトリバーからトップkコンテキストを利用する。
本稿では,RAGにおける文脈ランク付けと回答生成の両目的のために,単一のLLMをチューニング可能な新しい命令微調整フレームワークであるRanRAGを提案する。
例えば、GPT-4-0613, GPT-4-turbo-2024-0409, ChatQA-1.5, RAGベンチマークの最先端性能を備えたオープンソースモデルなどである。
論文 参考訳(メタデータ) (2024-07-02T17:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。