論文の概要: ReadingMachine: A Computational Methodology for Structured Corpus Reading and Large-Scale Synthesis
- arxiv url: http://arxiv.org/abs/2606.07753v1
- Date: Fri, 05 Jun 2026 18:01:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 13:51:53.177198
- Title: ReadingMachine: A Computational Methodology for Structured Corpus Reading and Large-Scale Synthesis
- Title(参考訳): ReadingMachine: 構造化コーパス読解と大規模合成のための計算手法
- Authors: James Morrissey,
- Abstract要約: ReadingMachineは構造化コーパス読解のための計算手法である。
分析をインサイト抽出やセマンティッククラスタリングを含む検査可能なステージに分解する。
システムは152の産業政策文書の不均一なコーパスで実証される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: ReadingMachine is a computational methodology for structured corpus reading that uses large language models to perform bounded reading operations over entire document collections. Rather than relying on retrieval or recursive summarization, the approach decomposes analysis into inspectable stages including insight extraction, semantic clustering, theme generation, and iterative omission detection. By delaying irreversible compression and explicitly tracking intermediate representations, the method prioritizes coverage, traceability, and preservation of disagreement across large corpora. The system is demonstrated on a heterogeneous corpus of 152 industrial policy documents, producing more than 17,500 extracted insights and a structured thematic map. ReadingMachine is released as an open-source experimental framework for large-scale qualitative synthesis and corpus analysis.
- Abstract(参考訳): ReadingMachineは構造化コーパス読解のための計算手法であり、大きな言語モデルを用いて文書コレクション全体にわたって有界読解操作を行う。
この手法は、検索や再帰的な要約に頼るのではなく、洞察抽出、セマンティッククラスタリング、テーマ生成、反復的省略検出を含む検査可能なステージに分析を分解する。
可逆圧縮を遅延させ、中間表現を明示的に追跡することにより、大規模コーパス間の不一致のカバレッジ、トレーサビリティ、保存を優先する。
このシステムは152の産業政策文書の不均一なコーパスで実証され、17,500以上の抽出された洞察と構造化されたテーママップが得られた。
ReadingMachineは、大規模な定性的合成とコーパス分析のためのオープンソースの実験フレームワークとしてリリースされた。
関連論文リスト
- CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning [48.56088080889236]
我々は、新しいデータ合成フレームワークによって生成された1000万のトークンをスケーリングする新しいベンチマークであるCorpusQAを紹介した。
合成データの微調整はLLMの一般的な長文推論能力を効果的に向上させることを示す。
メモリ拡張型エージェントアーキテクチャは,より堅牢な代替手段であることを示す。
論文 参考訳(メタデータ) (2026-01-21T12:52:30Z) - Three Stage Narrative Analysis; Plot-Sentiment Breakdown, Structure Learning and Concept Detection [0.0]
本稿では,映画脚本の感情弧を解析し,関連するキャラクターの文脈に関する拡張分析を行うフレームワークを提案する。
辞書に基づく感情分析を用いて,LabMTsimple storylabモジュールで構築した独自の語彙を適用した。
このフレームワークは、Wards階層的クラスタリング技術を用いて、類似の感情プロットをクラスタリングすることで分析を前進させる。
論文 参考訳(メタデータ) (2025-11-14T20:30:18Z) - Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering [51.7493726399073]
本稿では,長文質問応答を改善するための対話型階層型フレームワークを提案する。
このフレームワークには3つの重要な革新がある: 長文の専門的な談話解析、LLMに基づく談話関係ノードの拡張、構造誘導階層検索である。
論文 参考訳(メタデータ) (2025-05-26T14:45:12Z) - Concept Navigation and Classification via Open-Source Large Language Model Processing [0.0]
本稿では,オープンソースのLarge Language Models (LLMs) を用いたテキストデータから潜在構造を検出・分類するための新しい手法を提案する。
提案手法は,自動要約とループ内検証を組み合わせることで,構造同定の精度と解釈性を向上させる。
論文 参考訳(メタデータ) (2025-02-07T08:42:34Z) - Context-Aware Hierarchical Merging for Long Document Summarization [56.96619074316232]
本論文では,階層的なマージをソース文書からコンテキストと統合する手法を提案する。
法的および物語的領域を表すデータセットの実験結果は、文脈的拡張がゼロショットと階層的な融合ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-02-03T01:14:31Z) - Hierarchical Indexing for Retrieval-Augmented Opinion Summarization [60.5923941324953]
本稿では,抽出アプローチの帰属性と拡張性と,大規模言語モデル(LLM)の一貫性と拡散性を組み合わせた,教師なし抽象的意見要約手法を提案する。
我々の方法であるHIROは、意味的に整理された離散的な階層を通して文を経路にマッピングするインデックス構造を学習する。
推測時にインデックスを投入し、入力レビューから人気意見を含む文群を識別し、検索する。
論文 参考訳(メタデータ) (2024-03-01T10:38:07Z) - Top-Down Synthesis for Library Learning [46.285220926554345]
コーパス誘導トップダウン合成は、プログラムのコーパスから共通機能をキャプチャするライブラリ関数を合成するメカニズムである。
本稿では,この手法をStitchと呼ばれるツールに実装し,DreamCoderの最先端の推論ライブラリ学習アルゴリズムに対して評価する。
論文 参考訳(メタデータ) (2022-11-29T21:57:42Z) - Scholastic: Graphical Human-Al Collaboration for Inductive and
Interpretive Text Analysis [20.008165537258254]
解釈学者は、意味のあるテーマが現れるまで、文書を手作業でサンプリングし、コードを適用し、コードをカテゴリに書き換え、照合することで、テキストコーパスから知識を生成する。
大規模なコーパスがあれば、機械学習はデータのサンプリングと分析をスケールするのに役立ちますが、以前の研究は、専門家が一般的に、解釈奨学金の破壊や推進に懸念を抱いていることを示しています。
我々は,機械・イン・ザ・ループクラスタリングアルゴリズムに関わる問題に対処するために,人間中心の設計アプローチを採り入れ,解釈テキスト分析を足場とした。
論文 参考訳(メタデータ) (2022-08-12T06:41:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。