論文の概要: Coalescing Global and Local Information for Procedural Text
Understanding
- arxiv url: http://arxiv.org/abs/2208.12848v1
- Date: Fri, 26 Aug 2022 19:16:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2022-08-30 13:41:09.677274
- Title: Coalescing Global and Local Information for Procedural Text
Understanding
- Title(参考訳): 手続き的テキスト理解のためのグローバル・ローカル情報の連携
- Abstract要約: 完全な手続き的理解ソリューションは、入力のローカル・グローバル・ビューとアウトプットのグローバル・ビューの3つの中核的な側面を組み合わせるべきである。
本稿では,エンティティと時間表現を構築する新しいモデルであるCoalescing Global and Local InformationCGを提案する。
一般的な手続き的テキスト理解データセットの実験は、我々のモデルが最先端の結果を得ることを示す。
- 参考スコア(独自算出の注目度): 70.10291759879887
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Procedural text understanding is a challenging language reasoning task that
requires models to track entity states across the development of a narrative. A
complete procedural understanding solution should combine three core aspects:
local and global views of the inputs, and global view of outputs. Prior methods
considered a subset of these aspects, resulting in either low precision or low
recall. In this paper, we propose Coalescing Global and Local Information
(CGLI), a new model that builds entity- and timestep-aware input
representations (local input) considering the whole context (global input), and
we jointly model the entity states with a structured prediction objective
(global output). Thus, CGLI simultaneously optimizes for both precision and
recall. We extend CGLI with additional output layers and integrate it into a
story reasoning framework. Extensive experiments on a popular procedural text
understanding dataset show that our model achieves state-of-the-art results;
experiments on a story reasoning benchmark show the positive impact of our
model on downstream reasoning.
- Abstract(参考訳): 手続き的テキスト理解(Procedural text understanding)は、物語の開発全体にわたってエンティティ状態を追跡するモデルを必要とする、困難な言語推論タスクである。
完全な手続き的理解ソリューションは、入力のローカルビューとグローバルビュー、出力のグローバルビューの3つの中核的な側面を組み合わせるべきである。
以前の手法はこれらの側面のサブセットを考慮し、結果として低い精度または低いリコールをもたらす。
本稿では,文脈全体(グローバルインプット)を考慮したエンティティとタイムステップを意識した入力表現(ローカルインプット)を構築する新しいモデルであるCalescing Global and Local Information(CGLI)を提案し,構造化予測目標(グローバルアウトプット)を用いてエンティティ状態を共同でモデル化する。
したがって、CGLIは精度とリコールの両方を同時に最適化する。
CGLIを出力層を追加して拡張し、ストーリー推論フレームワークに統合します。
一般的な手続き的テキスト理解データセットに関する広範な実験は、我々のモデルが最先端の結果を達成していることを示している;ストーリー推論ベンチマークにおける実験は、我々のモデルが下流の推論に与える影響を示している。
関連論文リスト
- State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models [49.57973975600996]
文書解析は、きめ細かい視覚知覚に強い要求を与える。
既存の視覚言語モデル(VLM)に基づく解析手法は、グローバルに圧縮された視覚トークンに依存している。
自己回帰復号における状態条件付き視覚的エビデンス検索(SCVER)として認識を定式化する。
論文 参考訳(メタデータ) (2026-08-27T12:56:45Z) - Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation [15.117449876348774]
オープンボキャブラリー3D屋内レイアウト生成について検討し、ラベルのない3D言語命令から様々な物理的に可視なシーンを合成する。
本手法は,オープンな3次元屋内レイアウト生成における最先端性能を実現する。
論文 参考訳(メタデータ) (2026-08-04T03:24:09Z) - Bridging the Agent-World Gap: Text World Models for LLM-based Agents [83.8237017249529]
大規模言語モデル(LLM)ベースのエージェントは、インタラクティブなテキスト環境においてますます使われている。
多くは反応が強く、これらの環境がどのように構成され、どのように進化するかの明確なモデルなしで、観察を行動にマッピングする。
テキストワールドモデル(TWMs): 状態と候補アクションが与えられたら、結果のWebページ、端末出力、API応答、ユーザ応答を予測する。
LLMをベースとしたエージェントのテキストワールドモデルについて,形式的なフレームワークとエージェントライフサイクルを中心に整理し,体系的にレビューを行った。
論文 参考訳(メタデータ) (2026-06-08T04:58:52Z) - FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios [58.34124792457706]
製造業セクターは、単純な認識から自律的な実行に移行するために、MLLM(Multimodal Large Language Models)をますます採用している。
進捗は、データの不足と、既存のデータセットにおけるきめ細かいドメインセマンティクスの欠如によって妨げられている。
まず、実世界の2D画像と3Dポイントクラウドを組み合わせて、微粒なドメインセマンティクスを付加した高品質なデータセットを構築します。
次に, 3 つの製造課題,すなわち, 構造面検査, 組立検査, 組立検証の18の最先端MLLMを評価し, 大幅な性能差を明らかにした。
論文 参考訳(メタデータ) (2026-04-08T12:23:27Z) - State Design Matters: How Representations Shape Dynamic Reasoning in Large Language Models [2.869209069091683]
状態を表すための設計選択は、情報そのものの可用性とは別として、パフォーマンスにおいて決定的な要素であることを示す。
しかし,従来のLLMとVLMは長い地平線上でも不安定であり続けている。
論文 参考訳(メタデータ) (2026-01-25T17:41:26Z) - Chain-of-Thought Textual Reasoning for Few-shot Temporal Action Localization [22.58434223222062]
そこで本研究では,Chain-of-Thought文による時間的局所化手法を提案する。
具体的には、テキスト意味情報を活用して、アクションの共通点やバリエーションを捉える能力を高める新しい数ショット学習フレームワークを設計する。
公開されているActivityNet1.3とTHUMOS14データセットについて広範な実験を行った。
論文 参考訳(メタデータ) (2025-04-18T04:35:35Z) - Core Context Aware Transformers for Long Context Language Modeling [50.774702091154204]
高速な長文モデリングのためのCCAアテンションを提案する。
本手法は,学習過程における冗長性を低下させながら,コアコンテキストに自動的に焦点を合わせ,強化する。
提案手法は,既存の大規模言語モデルにおける自己注意モジュールを最小限の微調整コストで置き換えることができる。
論文 参考訳(メタデータ) (2024-12-17T01:54:08Z) - Bridging Local Details and Global Context in Text-Attributed Graphs [62.522550655068336]
GraphBridgeは、コンテキストテキスト情報を活用することで、ローカルおよびグローバルな視点をブリッジするフレームワークである。
提案手法は最先端性能を実現し,グラフ対応トークン削減モジュールは効率を大幅に向上し,スケーラビリティの問題を解消する。
論文 参考訳(メタデータ) (2024-06-18T13:35:25Z) - CELA: Cost-Efficient Language Model Alignment for CTR Prediction [71.85120354973073]
CTR(Click-Through Rate)予測は、レコメンダシステムにおいて最重要位置を占める。
最近の取り組みは、プレトレーニング言語モデル(PLM)を統合することでこれらの課題を緩和しようとしている。
CTR予測のためのtextbfCost-textbfEfficient textbfLanguage Model textbfAlignment (textbfCELA)を提案する。
論文 参考訳(メタデータ) (2024-05-17T07:43:25Z) - Contextualization Distillation from Large Language Model for Knowledge
Graph Completion [51.126166442122546]
我々は、差別的かつ生成的なKGCフレームワークと互換性のあるプラグイン・アンド・プレイ方式であるContextualization Distillation戦略を導入する。
提案手法は,大規模言語モデルに対して,コンパクトで構造的な三重項を文脈に富んだセグメントに変換するように指示することから始まる。
多様なデータセットとKGC技術にわたる総合的な評価は、我々のアプローチの有効性と適応性を強調している。
論文 参考訳(メタデータ) (2024-01-28T08:56:49Z) - DistFormer: Enhancing Local and Global Features for Monocular Per-Object
Distance Estimation [35.6022448037063]
物体ごとの距離推定は、自律運転、監視、ロボット工学などの安全上重要な応用において重要である。
既存のアプローチは、ローカル情報(すなわち、境界ボックスの割合)とグローバル情報という2つの尺度に依存している。
私たちの仕事は、地域とグローバルの両方の手段を強化することを目的としています。
論文 参考訳(メタデータ) (2024-01-06T10:56:36Z) - Generative Judge for Evaluating Alignment [84.09815387884753]
本稿では,これらの課題に対処するために,13Bパラメータを持つ生成判断器Auto-Jを提案する。
我々のモデルは,大規模な実環境シナリオ下でのユーザクエリとLLM生成応答に基づいて訓練されている。
実験的に、Auto-Jはオープンソースモデルとクローズドソースモデルの両方を含む、強力なライバルのシリーズを上回っている。
論文 参考訳(メタデータ) (2023-10-09T07:27:15Z) - Plug-and-Play Recipe Generation with Content Planning [28.65323853250831]
本稿では,生成されたテキストのグローバルなコンテンツプランを明示的にモデル化するフレームワークを提案する。
プラグイン・アンド・プレイ方式で自然言語シーケンスとグローバルコンテンツプランの同時配信を最適化する。
本モデルは,レシピ生成作業における最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-12-09T19:39:10Z) - Leveraging Locality in Abstractive Text Summarization [44.67905693077539]
制限されたコンテキストを持つモデルが、メモリ効率の低いアテンションモデルと比較して競合性能を持つかどうかを検討する。
本モデルは,局所性の原理によってグループ化された入力の一部を含む個々のページに適用される。
論文 参考訳(メタデータ) (2022-05-25T03:59:24Z) - Unsupervised Keyphrase Extraction by Jointly Modeling Local and Global
Context [25.3472693740778]
埋め込みベースの手法は、教師なしキーフレーズ抽出(UKE)タスクに広く用いられている。
本稿では,地域とグローバルのコンテキストを共同でモデル化するUKEの新しい手法を提案する。
論文 参考訳(メタデータ) (2021-09-15T13:41:10Z) - Time-Stamped Language Model: Teaching Language Models to Understand the
Flow of Events [8.655294504286635]
我々はこの課題を質問応答問題として定式化することを提案する。
これにより、手続き的テキスト理解に適応することで、他のQAベンチマークで事前訓練された言語モデルを使用することができる。
Proparaデータセットで評価したモデルでは、F1スコアが3.1%上昇した状態での公開結果の改善が示されている。
論文 参考訳(メタデータ) (2021-04-15T17:50:41Z) - Pairwise Similarity Knowledge Transfer for Weakly Supervised Object
Localization [53.99850033746663]
弱教師付き画像ラベルを持つ対象クラスにおける局所化モデル学習の問題点について検討する。
本研究では,対象関数のみの学習は知識伝達の弱い形態であると主張する。
COCOおよびILSVRC 2013検出データセットの実験では、ペアワイズ類似度関数を含むことにより、ローカライズモデルの性能が大幅に向上することが示された。
論文 参考訳(メタデータ) (2020-03-18T17:53:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。