論文の概要: Jev for Scientific Decisions: Evaluating Semantic Choices and Their Consequences
- arxiv url: http://arxiv.org/abs/2609.24965v2
- Date: Wed, 23 Sep 2026 04:04:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.671187
- Title: Jev for Scientific Decisions: Evaluating Semantic Choices and Their Consequences
- Title(参考訳): Jev for Scientific Decisions:Evaluating Semantic Choices and their Consequences
- Abstract要約: 我々は、Jevを文書化されたガイダンスに従うハーネスを用いて意味決定コンポーネントとして評価し、コードに算術を割り当てる。
この研究は、10の科学ケースに対して、20のソースグラウンドで12のモデル構成を比較し、それぞれ5回繰り返している。
- 参考スコア(独自算出の注目度): 6.739760779260819
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Scientific workflows often require choosing among known relations before a deterministic calculation can proceed. Whether observations share a culture, treatment or reference standard can change the scientific meaning of the resulting count or comparison. We evaluate Jev as a semantic decision component using a harness that follows its documented guidance and assigns arithmetic to code. The study compares twelve model configurations on twenty source-grounded Choices across ten scientific cases, each repeated five times. We measure semantic selections, downstream outputs and final claim labels separately. Jev matched five other configurations at complete semantic correctness and achieved the lowest observed median latency among successful responses. Across three comparison models, seven wrong selections on one culture-history question changed downstream counts while preserving the correct final label. These results identify a useful role for Jev in prepared scientific decision tasks and show why evaluating that role requires checking the relations and quantities that a workflow will reuse.
- Abstract(参考訳): 科学的ワークフローは、決定論的計算が進む前に、既知の関係の選択を必要とすることが多い。
観察結果が文化を共有しているかどうかに関わらず、治療基準や基準基準は結果のカウントや比較の科学的意味を変える可能性がある。
我々は、Jevを文書化されたガイダンスに従うハーネスを用いて意味決定コンポーネントとして評価し、コードに算術を割り当てる。
この研究は、10の科学ケースに対して、20のソースグラウンドで12のモデル構成を比較し、それぞれ5回繰り返している。
セマンティックセレクション、ダウンストリーム出力、最終的なクレームラベルを別々に測定する。
Jevは他の5つの構成と完全にセマンティックな正しさで一致し、成功したレスポンスの中で最低の中央値レイテンシを達成した。
3つの比較モデル全体で、1つの文化史的質問に対する7つの間違った選択は、正しい最終ラベルを保持しながら下流のカウントを変更した。
これらの結果は、準備された科学的決定タスクにおけるJevの有用な役割を特定し、ワークフローが再利用する関係や量を確認する必要がある理由を示している。
関連論文リスト
- OBER+: Continuity-Aware Reporting and Traceable Continuous Improvement in Outcome-Based Education [1.0998907972211756]
OBER+は、測定された不足から評価された修正行動までのステップを計算する、展開された機関達成プラットフォームの拡張である。
このコントリビューションは結果に基づくレポートのための計算設計であり、どんな達成プラットフォームでも実装可能なルールとして述べられている。
論文 参考訳(メタデータ) (2026-09-03T12:40:47Z) - Split the Labor: Separating Evidence Interpretation from Decision Aggregation [0.0]
言語モデルに多くの情報源から結論に達するよう要求するシステムは通常、それらを1つのプロンプトに分割する。
提案する4分野のエビデンス(仮説,信頼性バケット,合理性,証明)は,両半減期を決定することを示す。
この修正はアーキテクチャよりも算術的であり、言語モデル以外のルールのクラスに適用される。
論文 参考訳(メタデータ) (2026-08-14T17:24:55Z) - Multiperspectivity as a Resource for Narrative Similarity Prediction [5.242380995471618]
同じテキストの異なる、等しく有効な読解は、異なる解釈を生じさせ、したがって異なる類似性判断を生じさせる。
本稿では,予測システムの意思決定プロセスに,このマルチスペクティビティを取り入れることを提案する。
実験はSemEval-2026 Task 4で行われ、精度は0.705。
論文 参考訳(メタデータ) (2026-03-23T15:32:40Z) - Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think [51.0691253204425]
我々は2つの質問に答えるために中間的推論ステップを解析する: 最終的な答えはモデルの最適結論を確実に表すか?
我々のアプローチは、推論トレースを言語的手がかりに基づくシーケンシャルなサブソートに分割することである。
これらの解答を最も頻繁な解(モード)を選択して集約すると、元の完全トレースから得られる解のみに依存するよりも、はるかに高い精度が得られることが判明した。
論文 参考訳(メタデータ) (2025-04-29T12:39:07Z) - CritiQ: Mining Data Quality Criteria from Human Preferences [91.44025907584931]
人間の嗜好からデータ品質の基準を自動的にマイニングする新しいデータ選択手法であるCritiQを紹介する。
CritiQ Flowはマネージャエージェントを使用して品質基準を進化させ、ワーカーエージェントはペアで判断する。
コード,数学,論理領域において,本手法の有効性を実証する。
論文 参考訳(メタデータ) (2025-02-26T16:33:41Z) - Investigating Distributions of Telecom Adapted Sentence Embeddings for Document Retrieval [12.135498957287004]
公開可能なモデルとドメイン適応型から得られた埋め込みを評価した。
我々は,異なる埋め込みに対する類似度スコアのしきい値を得るための体系的手法を確立する。
ドメイン固有の文に対する埋め込みは、ドメインに依存しない文とほとんど重複しないことを示す。
論文 参考訳(メタデータ) (2024-06-18T07:03:34Z) - In Search of Insights, Not Magic Bullets: Towards Demystification of the
Model Selection Dilemma in Heterogeneous Treatment Effect Estimation [92.51773744318119]
本稿では,異なるモデル選択基準の長所と短所を実験的に検討する。
選択戦略,候補推定器,比較に用いるデータの間には,複雑な相互作用があることを強調した。
論文 参考訳(メタデータ) (2023-02-06T16:55:37Z) - Tweet Sentiment Quantification: An Experimental Re-Evaluation [88.60021378715636]
センチメント定量化(Sentiment Quantification)は、教師付き学習によって、感情関連クラスの相対周波数(prevalence')を推定するタスクである。
統合され、より堅牢な実験プロトコルに従って、これらの定量化手法を再評価する。
結果はガオ・ガオ・セバスティアーニ(Gao Gao Sebastiani)によって得られたものとは大きく異なり、異なる感情量化法の相対的な強さと弱さについて、よりしっかりとした理解を提供する。
論文 参考訳(メタデータ) (2020-11-04T21:41:34Z) - Why do you think that? Exploring Faithful Sentence-Level Rationales
Without Supervision [60.62434362997016]
文レベルで忠実な論理を出力するモデルを作成するために,異なる訓練枠組みを提案する。
本モデルでは,各理性に基づいて各課題を個別に解決し,その課題を最もよく解決した者に高いスコアを割り当てることを学ぶ。
論文 参考訳(メタデータ) (2020-10-07T12:54:28Z) - Does the Objective Matter? Comparing Training Objectives for Pronoun
Resolution [52.94024891473669]
目的の4つのカテゴリを表す4つのモデルのパフォーマンスとシードの安定性を比較した。
提案実験により, 順序付けの目的がドメイン内最良であるのに対して, 候補と代名詞間の意味的類似性はドメイン内最良であることがわかった。
論文 参考訳(メタデータ) (2020-10-06T09:29:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。