論文の概要: Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark
- arxiv url: http://arxiv.org/abs/2605.29400v1
- Date: Thu, 28 May 2026 05:49:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.769357
- Title: Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark
- Title(参考訳): PiSARベンチマークによるスクリーンコンディションアクション予測のためのアーキテクチャ・センシティブ・スーパーバイザード・ファインチューニング
- Authors: Rahul Bissa, Abhishek Vyas, Yash Jain,
- Abstract要約: 我々は,661列のPiSARのホールドアウトスライスのフロンティアゼロショットベースラインに対して,教師付き微調整モデル3つをベンチマークした。
すべてのモデル、フロンティアまたは微調整は、同じスコアリングパイプラインを持つ661ロースライスで評価される。
- 参考スコア(独自算出の注目度): 4.626261940793026
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We benchmark three supervised fine-tuned models against frontier zero-shot baselines on a 661-row held-out slice of PiSAR (Persona, intent, Screen, Action, Rationale), a 12,929-tuple corpus of screen-anchored behavioural rationales curated from public app-store reviews, Pew American Trends Panel demographics, and the OPeRA shopper traces. Every model, frontier or fine-tuned, is evaluated on the same 661-row slice with the same scoring pipeline. Two findings. First, frontier zero-shot baselines (Claude Opus 4.7 and GPT-5.5) reach sem_sim 0.459 and 0.482 respectively; a fine-tuned Qwen3-VL-8B-Instruct reaches 0.783 and clears sem_sim >= 0.7 on 79% of rows, against 1-2% for either frontier baseline, a gap of 0.30 absolute on the same test set. Second, the same training data and recipe on Gemma-4-26B-A4B-IT scores only 0.441, in the same band as the frontier zero-shot baselines rather than the fine-tuned Qwen. We read this as a recipe-vs-model mismatch: the reasoning-tuned high-parameter model resists displacement and would likely need either more data or a stronger fine-tuning method.
- Abstract(参考訳): 我々は,661列のPiSAR(Persona, intent, Screen, Action, Rationale)のホールトアウトスライス(Persona, intent, Action, Rationale)に対するフロンティアゼロショットベースラインに対する教師付き微調整モデルのベンチマークを行った。
すべてのモデル、フロンティアまたは微調整は、同じスコアリングパイプラインを持つ661ロースライスで評価される。
2つの発見。
まず、フロンティアゼロショットベースライン(Claude Opus 4.7 と GPT-5.5)がそれぞれ sem_sim 0.459 と 0.482 に達し、微調整された Qwen3-VL-8B-インストラクトが 0.783 に達し、79% の行に対して sem_sim >= 0.7 となる。
第2に、Gemma-4-26B-A4B-ITのトレーニングデータとレシピは、微調整されたQwenではなく、フロンティアのゼロショットベースラインと同じバンドでわずか0.441点である。
我々はこれをレシピ-vsモデルミスマッチとして読み、推論調整された高パラメータモデルが変位に抵抗し、より多くのデータまたはより強力な微調整方法を必要とする可能性が高い。
関連論文リスト
- Benchmarking Patent Embeddings: A Multi-Task Evaluation of 22 Models Across Retrieval, Classification, and Clustering [0.0]
我々は,情報検索,分類,クラスタリングという3つのタスクに対して,事前学習した22の埋め込みモデルを評価する。
2つの結果は、一般的な知恵に疑問を投げかけている。
論文 参考訳(メタデータ) (2026-05-22T23:51:13Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Optimised Support Vector Regression for California Housing Price Prediction: The Critical Role of Feature Engineering and Hyperparameter Tuning [0.0]
Support Vector Regressionは、California Housingベンチマークデータセットで最も弱いパフォーマーの1つとして引用されている。
本稿では,従来報告されていた性能が,アルゴリズムに固有の制限ではなく,実験的な構成選択を反映しているかどうかを検討する。
チューニングされたSVRは、以前報告されたSVR結果よりも0.123ポイントの絶対的な改善である0.723の試験R2を達成する。
論文 参考訳(メタデータ) (2026-05-09T03:58:50Z) - Paired-CSLiDAR: Height-Stratified Registration for Cross-Source Aerial-Ground LiDAR Pose Refinement [46.13526676100776]
Paired-CSLiDAR(英語版)は、シングルスキャンポーズリファインメントのためのクロスソース空地LiDARベンチマークである。
このベンチマークには6つの評価サイトで12,683組の地上空対が含まれている。
本稿では,RGSR(Residual-Guided Stratified Registration)を提案する。
論文 参考訳(メタデータ) (2026-05-01T13:14:20Z) - Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models [0.0]
MIRRORは、大規模言語モデルがより優れた意思決定に自己知識を使用できるかどうかを評価するベンチマークである。
約25万の評価インスタンスに対して,8つの実験室から16のモデルを評価した。
論文 参考訳(メタデータ) (2026-04-15T08:41:12Z) - Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models [6.396911723204044]
Mixture-of-experts (MoE)言語モデルは、高密度モデルよりも優れた品質と効率のトレードオフをもたらすことがしばしば期待されている。
そこで本研究では,高密度および高密度なMoE設計にまたがる7つの推論指向命令調整モデルのベンチマークを示す。
論文 参考訳(メタデータ) (2026-04-08T12:50:52Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - EdgeJury: Cross-Reviewed Small-Model Ensembles for Truthful Question Answering on Serverless Edge Inference [0.0]
EdgeJuryは、真実性と堅牢性を改善する軽量アンサンブルフレームワークです。
TruthfulQA (MC1)では、EdgeJuryの精度は76.2%である。
200-question adversarial EdgeCasesセットでは、EdgeJuryは+48.2%の利得を得る。
論文 参考訳(メタデータ) (2025-12-29T14:48:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。