論文の概要: Contextual Scalarisation Thompson Sampling for multi-objective decisions in public media
- arxiv url: http://arxiv.org/abs/2605.31291v1
- Date: Fri, 29 May 2026 13:27:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.633385
- Title: Contextual Scalarisation Thompson Sampling for multi-objective decisions in public media
- Title(参考訳): メディアにおける多目的意思決定のための文脈拡張トンプソンサンプリング
- Abstract要約: 我々は,多目的文脈帯域幅法であるContextual Scalarisation Thompson Sampler (CSTS)を提案する。
CSTSは、観測されたコンテキストの関数として目的を重み付けすることを学ぶ。
スイスの放送局Radio Télévision Suisseの実際の番組データに基づいてCSTSを評価した。
- 参考スコア(独自算出の注目度): 15.843991307972153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recommender systems may operate under multiple, competing objectives. For example, audience reach, cultural values, public service mandate, and operational constraints must be balanced in editorial decisions of public service media. Existing approaches relying on fixed combinations of objectives or Pareto-based optimisation do not adapt to changing priorities across situations. In this paper, we propose Contextual Scalarisation Thompson Sampler (CSTS), a multi-objective contextual bandit method that learns to weight objectives as a function of the observed context. We evaluate CSTS on real programming data from Radio Télévision Suisse, the Swiss national broadcaster, showing improved contextual relevance and better alignment with expert curation practices compared to fixed weight and standard contextual bandit approaches.
- Abstract(参考訳): レコメンダシステムは、複数の競合する目的の下で運用することができる。
例えば、聴衆のリーチ、文化的価値、公共サービスの委任、運用上の制約は、公共サービスメディアの編集決定においてバランスをとらなければならない。
既存のアプローチでは、目標の固定的な組み合わせやパレートベースの最適化は、状況によって異なる優先順位に適応しない。
本稿では、観測されたコンテキストの関数として目的を重み付けすることを学ぶ多目的文脈帯域幅法であるContextual Scalarisation Thompson Sampler (CSTS)を提案する。
我々は,スイスの放送局Radio Télévision Suisseの実際の番組データに基づいてCSTSを評価し,一定の重み付けや標準のコンテキストブレイジットアプローチと比較して,文脈関連性の向上と専門家のキュレーションプラクティスとの整合性の向上を示した。
関連論文リスト
- Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio Optimization [37.7469110349782]
本稿では,多目的強化学習(MORL)問題としてESG対応ポートフォリオ最適化を定式化する。
高次元のアルゴリズムトレードオフと人間の意思決定のギャップを埋めるために、Preference Elicitationフレームワークを統合する。
論文 参考訳(メタデータ) (2026-09-02T14:48:03Z) - Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs [2.840505903487544]
本稿では,大規模言語モデル(LLM)を,連合学習環境における多種多様な人間の嗜好と整合させるという課題に対処する。
本研究では,人間の嗜好に異なるアグリゲーション戦略を用いる場合,アライメント品質と公正性のトレードオフを評価する総合評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-09T16:39:32Z) - Customize Multi-modal RAI Guardrails with Precedent-based predictions [55.63757336900865]
マルチモーダルガードレールは、ユーザ定義ポリシーに基づいて、画像コンテンツを効果的にフィルタリングする必要がある。
既存の微調整手法は、通常、事前に定義されたポリシーの条件予測を行う。
本稿では、入力に類似した先行データポイントの推論過程である「先行情報」に対する条件モデルの判断を提案する。
論文 参考訳(メタデータ) (2025-07-28T03:45:34Z) - Public Service Algorithm: towards a transparent, explainable, and scalable content curation for news content based on editorial values [0.0]
Public Service Algorithm(PSA)は、Public Service Media(PSM)にインスパイアされた価値に基づいた、スケーラブルで透明なコンテンツキュレーションのための新しいフレームワークである。
以上の結果から,人間の編集判断とLarge Language Models (LLMs) の評価との間に有望な整合性があることが示唆された。
この研究は、信頼できるニュースコンテンツの自動キュレーションのためのスケーラブルなフレームワークへの第一歩となる。
論文 参考訳(メタデータ) (2025-06-27T14:39:38Z) - Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time [52.230936493691985]
本稿では,2次基準のしきい値に基づく制約を満たしつつ,主目的を最大化し,アライメントの多面性に対処する推論フレームワークSITAlignを提案する。
我々は、満足度に基づく推論アライメントアプローチの準最適境界を導出することで理論的洞察を提供する。
論文 参考訳(メタデータ) (2025-05-29T17:56:05Z) - Social Choice for Heterogeneous Fairness in Recommendation [9.753088666705985]
推薦システムにおけるアルゴリズムの公正性は、様々な利害関係者のニーズによく注意する必要がある。
それまでの作業はしばしば、公正性の固定された単目的の定義によって制限されてきた。
我々の研究は、計算社会の選択の観点からのフェアネスを推奨する。
論文 参考訳(メタデータ) (2024-10-06T17:01:18Z) - Optimal Baseline Corrections for Off-Policy Contextual Bandits [61.740094604552475]
オンライン報酬指標の偏りのないオフライン推定を最適化する意思決定ポリシーを学習することを目指している。
学習シナリオにおける同値性に基づく単一のフレームワークを提案する。
我々のフレームワークは、分散最適非バイアス推定器の特徴付けを可能にし、それに対する閉形式解を提供する。
論文 参考訳(メタデータ) (2024-05-09T12:52:22Z) - Evaluating the Fairness of Discriminative Foundation Models in Computer
Vision [51.176061115977774]
本稿では,CLIP (Contrastive Language-Pretraining) などの差別基盤モデルのバイアス評価のための新しい分類法を提案する。
そして、これらのモデルにおけるバイアスを緩和するための既存の手法を分類学に関して体系的に評価する。
具体的には,ゼロショット分類,画像検索,画像キャプションなど,OpenAIのCLIPとOpenCLIPモデルをキーアプリケーションとして評価する。
論文 参考訳(メタデータ) (2023-10-18T10:32:39Z) - Constrained Policy Optimization for Controlled Self-Learning in
Conversational AI Systems [18.546197100318693]
ユーザ定義制約により、個々のドメインに対するきめ細かい探索ターゲットをサポートするスケーラブルなフレームワークを導入する。
この問題に対処するために,スケーラブルで実用的なメタ段階学習手法を提案する。
我々は、現実的な制約ベンチマークのセット上で、現実世界の会話型AIのデータを使用して広範な実験を行う。
論文 参考訳(メタデータ) (2022-09-17T23:44:13Z) - Post-Contextual-Bandit Inference [57.88785630755165]
コンテキストバンディットアルゴリズムは、電子商取引、医療、政策立案における非適応的なA/Bテストを置き換える傾向にある。
研究参加者の成果を改善することもでき、良い方針や最良の政策を特定できる可能性を高めることもできる。
研究の終盤における新規介入の信頼性推論を支援するため, 平均治療効果, サブグループ効果, あるいは新政策の価値について, 有効な信頼区間を構築したい。
論文 参考訳(メタデータ) (2021-06-01T12:01:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。