論文の概要: Reading a Legal Question Word by Word: Embedding Trajectories of 2,144 Vietnamese Legal Headlines
- arxiv url: http://arxiv.org/abs/2609.08372v2
- Date: Wed, 09 Sep 2026 03:59:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.609295
- Title: Reading a Legal Question Word by Word: Embedding Trajectories of 2,144 Vietnamese Legal Headlines
- Title(参考訳): ベトナムの法定見出し2,144件を埋め込んだ「法定質問文」
- Authors: Tran Minh Quan,
- Abstract要約: 密度の高いレトリバーは、質問を1つのベクトルとしてエンコードするが、その質問は一度に1つの単語に到達する。
私たちはThu Vien Phap Luat(ベトナムの法定図書館)から2,144の見出しを言葉で読みました。
- 参考スコア(独自算出の注目度): 0.5076419064097732
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A dense retriever encodes a question as one vector, but the question arrives one word at a time. We read 2,144 held-out headlines from Thu Vien Phap Luat (Vietnamese legal library) word by word with Nemotron-3-Embed 8B/1B and Qwen3-Embedding 8B/0.6B, encoding 65,444 prefixes against 20,034 articles, plus every prefix of 3,438 sub-questions from 1,112 multi-question headlines and of 168 answers. (i) The gold article becomes rank 1 after a median of 6-7 content words in every encoder, before the interrogative frame is read, and stays there to the end in 78-85% of cases. (ii) In a multi-question headline the lock is inside the first sub-question 94-98% of the time; the second leaves rank unchanged in 89-95%; encoded alone, the second reaches rank 1 in 42-58% vs 91-96% for the first, at the same lock word (95-97% identical). (iii) Numbers, dates and instrument identifiers move the embedding twice as far as content words and four times as far as interrogative words; 72-78% of steps move toward the gold article, and the closing interrogative frame moves against that direction in 95-99% of headlines. (iv) Rank/cosine clustering yields six archetypes (instant, typical, unstable, late, never-locking) that differ by legal area and form (chi-squared p < 1e-8): real-estate and litigation headlines never lock on a number; environmental and accounting headlines do so a third of the time. (v) An answer read word by word retrieves its article after 8-16 words and addresses the sub-questions in order asked in 83-89% of cases. (vi) A word's step keeps a consistent direction across headlines (cosine 0.25-0.33; 0.44-0.60 for numbers); a preceding question rotates that step by about 60 degrees and a greeting by about 30 degrees; steps shrink as i^{-0.8}; and a two-question headline is within 12-17 degrees of a linear mix of its two questions. We call this a context-modulated additive walk.
- Abstract(参考訳): 密度の高いレトリバーは、質問を1つのベクトルとしてエンコードするが、その質問は一度に1つの単語に到達する。
我々は、Nemotron-3-Embed 8B/1B と Qwen3-Embedding 8B/0.6B の単語で Thu Vien Phap Luat (ベトナムの法定図書館) から2,144 の見出しを読みました。
一 問合せ枠が読まれる前に、各エンコーダにおける六七のコンテンツワードの中央値の後に、金品がランク1となり、78〜85%の場合には、最後に留まる。
(ii)マルチクエストの見出しでは、ロックは第1サブクエスト94-98%の範囲内であり、第2の葉は89-95%で変化せず、第2の葉は42-58%、第1の葉は91-96%で同じロックワード(95-97%が同一)である。
三 数字、日付及び楽器の識別子は、内容語を二倍、疑問語を四倍、ステップの72~78%が金品に、クローズド・クェリティブ・フレームが95~99%の見出しにその方向に向かっている。
(四)ランク/コサイン・クラスタリングは、法域と形態によって異なる六つのアーキタイプ(即時、典型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型、定型。
(v) 回答読解語は、8~16語後にその記事を取得し、83~89%の症例の順にサブクエストに回答する。
(vi)単語のステップは見出し全体の一貫した方向(数字は0.25-0.33; 0.44-0.60)を維持し、前の質問はそのステップを約60度回転させ、挨拶を約30度回転させ、i^{-0.8}としてステップを縮小し、2つの質問の見出しは2つの質問の線形混合の12-17度以内である。
これを文脈変調加法ウォークと呼ぶ。
関連論文リスト
- Annotated Surrogate Retrieval for Polish Statutory Law [0.0]
本稿では,文書代理法に基づくポーランド法典の検索方法のファミリについて述べる。
ASCRはサロゲートカスケードであり、ASCR-Hはそのカスケードに密度の高いリストを融合させ、DTFは言語モデルの両方のステージを3つの語彙と密度の高いレトリバーで置き換える。
2024年と2025年のポーランドの弁護士試験と法律顧問試験の300問に対して,これら3項目について,語彙,密集度,融解度,融解度と4つの基準値とを比較検討した。
論文 参考訳(メタデータ) (2026-08-31T15:05:00Z) - A Glyph Is Not a Letter, a Token Is Not a Word, a Space Is Not a Space: What the Units of Voynichese Are Not [45.88028371034407]
我々は、Voynichの原稿(Beinecke MS 408)を、一致した散文、暗号、擬似テキスト制御、クワイアレベルの再サンプリングで分析する。
ヴォイニチェの順序はトークンの端とそれらの間のグレードされた境界に置かれる。
公表されたVoynich-imitating暗号と自己励磁テキスト生成器はどちらも、校正置換攻撃による低エントロピー、単位スケール、弱いトークンオーダー、ヌル結果を再現する。
論文 参考訳(メタデータ) (2026-08-17T20:05:12Z) - Reading Copom's Tone: A Weighted LLM Framework for Hawkish-Dovish Sentiment, Forward Guidance, and Uncertainty [0.0]
本稿ではブラジル通貨政策委員会(Copom)声明のトーンを測定するための自然言語処理フレームワークについて述べる。
LLMは短いホーク語とドブ語を識別し、それぞれ0から1の重みを割り当てる。
独立したフル言語レイヤは、前方誘導方向、ガイダンスの明示性、不確実性レベル、不確実性の変化を測定する。
論文 参考訳(メタデータ) (2026-08-07T14:08:31Z) - Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion [0.0]
ストイチェア (Stoicheia) は古代ギリシアの文字レベルのマスク付き拡散エンコーダである。
オープンでリビジョンされた380万ワードのコーパスで事前トレーニングを行い、11個のチェックポイントをリリースする。
イサカ自身のテスト分割では、同じ凍結サンプルと厳密なスコアで、Stoicheiaは両方の従来の最先端システムと比較して文字エラーを減らす。
論文 参考訳(メタデータ) (2026-08-07T14:07:43Z) - Measuring Alignment With Reader Highlights Net of Position and Length [1.8620637029128544]
120のウェブ文書(少なくとも12の独立した読者)では、言語モデルに重点を置くランキングが38.4%と一致した隣人の19.9%に対して群衆マーク付き文を維持している。
GPT-5.4 (+0.002 [-0.081, +0.088]) と区別できない 0.182 に到達し、5以下となる。
論文 参考訳(メタデータ) (2026-07-30T06:24:38Z) - From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models [41.36461541603076]
大規模言語モデル(LLM)の評価は多様なタスクとベンチマークにまたがる。
証拠は、調査する能力よりも、タスクを中心に組織化されている。
14の能力ドメインと91のサブスキルからなる多層分類を導入した。
論文 参考訳(メタデータ) (2026-07-24T10:49:50Z) - SoftSkill: Behavioral Compression for Contextual Adaptation [45.10778084241114]
本稿では、自然言語スキルがコンパクトな連続コンテキストオブジェクトを初期化できるかどうかを問う。
そこで本研究では,凍結したバックボーン法であるSoftSkillを提案する。
Skillとは対照的に、SoftSkillはSearchQAでは5.2ポイント、LiveMathでは12.5ポイントの精度向上を実現している。
論文 参考訳(メタデータ) (2026-06-18T15:04:47Z) - AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing [55.03371974830747]
AliMarkは、文レベルの透かしをビットシーケンスエンコーディングとアライメントの問題として再構成するフレームワークである。
AliMarkは様々なパラフレーズ攻撃で最先端のベースラインを大幅に上回ることを示す。
論文 参考訳(メタデータ) (2026-05-28T06:30:43Z) - Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models [0.0]
大きな言語モデル(LLM)が、ひとつの単語の誤読が安全性を損なう可能性があるような設定でコードを書くようになりました。
有用な堅牢性と有害な不感度の開始点を調査するために、50のLeetCode問題をコンパイルし、3つの最小限の急激な摂動を発生させる。
3つの「推論チューニング」バージョンを含む6つのフロンティアモデルにより、各変更プロンプトが解決される。
論文 参考訳(メタデータ) (2025-07-15T03:22:07Z) - The SIGMORPHON 2022 Shared Task on Morpheme Segmentation [39.44280269663147]
SIGMORPHON 2022は、形態素分割システムのタスクを共有し、単語を一連の形態素に分解する。
最も優れたシステムは、最先端の3つのサブワードトークン法(BPE、ULM、Morfessor2)を30.71%の絶対値で上回った。
エラー解析を容易にし,今後の研究をサポートするため,システム予測,評価スクリプト,ゴールド標準データセットをすべてリリースした。
論文 参考訳(メタデータ) (2022-06-15T15:57:22Z) - More Embeddings, Better Sequence Labelers? [75.44925576268052]
最近の研究は、文脈埋め込みのファミリを提案し、非文脈埋め込みよりもシーケンスラベルの精度を大幅に向上させる。
我々は18のデータセットと8の言語にまたがる3つのタスクについて広範囲にわたる実験を行い、様々な埋め込み結合を用いたシーケンスラベリングの精度について検討した。
論文 参考訳(メタデータ) (2020-09-17T14:28:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。