FuguReport

FuguReport

最新の週次テーマと直近の日次レポートをまとめて確認できます。

ページ基準日: 2026-09-10
Weekly

2026-08-28 - 2026-09-03

Daily

最新の日次レポート

50 件のレポート
2026-09-10 Evaluation / Overfitting Analysis / MoE overfit under repeated data

Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

本論文は、固定された総トークン数の条件下において、訓練データの繰り返しが疎なMixture-of-Experts(MoE)言語モデルに与える影響を、高密度(Dense)Transformerと比較して調査しています。

2026-09-10 Evaluation / Benchmarking / Multimodal long-horizon research tasks

Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research Agents

Mr.

2026-09-10 Method / Video Generation / Real-time interactive video generation techniques

Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

Vidu S2は、Vidu S2-AvatarとVidu S2-Editingから構成される、リアルタイムなインタラクティブ動画生成およびリアルタイム動画編集のための統合フレームワークとして提案されています。

2026-09-10 Evaluation / Conversational Agent Benchmarking / Proactive mediation dialogue evaluation

ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation

ProMediConvは、調停を単なる受動的な会話ではなく、プロアクティブで多段階、多者間の対話プロセスとしてモデル化する法的紛争調停のためのベンチマークです。

2026-09-10 Task / Multimodal Grounding / Linking comments to evidence

ReGround: Grounding Reviewer Comments in Multimodal Evidence

本論文では、査読者のコメントを匿名の科学論文投稿原稿内の特定の根拠にグラウンディングするためのデータセット「ReGround」を導入します。

2026-09-09 Method / Graph Neural Networks / Theoretical foundations of VNN

Learning with Covariance Matrices: Principal Component Analysis Meets Learning with Graphs

本稿は、共分散行列を用いた学習に対するグラフ信号処理の視点を提示し、共分散行列をグラフシフト作用素として扱うことで主成分分析(PCA)をグラフベースの学習と結び付けます。

2026-09-09 Task / Multilingual Reasoning / In-language reasoning consistency

Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning

本論文は、モデルが英語をデフォルトとするのではなく、ユーザーのプロンプトと同じ言語で中間推論トレースを生成することと定義される「L2推論」を調査しています。

2026-09-09 Method / World Model / Separation of observation and state evolution

Programmable World Model

Programmable World Modelは、世界状態の遷移と視覚的観測の合成を分離するインタラクティブな動画生成フレームワークです。

2026-09-09 Method / Visual Token Pruning / Training-free pruning framework

TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents

本論文では、マルチステップの軌跡全体でキャッシュを通じてスクリーンショットが再利用される状況における、GUIエージェント向けのビジュアルトークンプルーニングを研究しています。

2026-09-09 Task / Entity Linking / Linking text and images to knowledge base

Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking

本論文はMERLINにおける多言語マルチモーダルエンティティリンキングを研究し、エンティティの希少性(レア度)をページビューなどの人気度シグナルのみで測定すべきではないと論じています。

2026-09-08 Method / Diffusion Models / Enhancing training convergence and sampling quality

Revisiting Spectral Representations in Generative Diffusion Models

本論文は、摂動カーネルの観点から拡散モデリングを再考し、拡散モデルの学習が自己教師ありスペクトル表現学習と密接に関連していると主張しています。

2026-09-08 Application / Depth Estimation / Monocular depth prediction

Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

本論文は、オープンソースの画像編集モデルQwen-Image-Edit-2509を転用することで、拡散Transformerベースの単眼深度推定アプローチとしてMarigoldを再検討しています。

2026-09-08 Method / Profile Learning / Constructing minimal sufficient profiles

Less Is Personal: Learning Minimal Sufficient User Profiles for Personalized Language Models

本論文では、パーソナライズ言語モデリングを固定長のリトリーバル問題ではなく、最小十分なプロファイル構築問題として検討しています。

2026-09-08 Method / Policy Optimization / Student policy gradient amplification

Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

本論文では、オンポリシー蒸留における弱から強への汎化を研究し、より強力な生徒モデルが、より弱い事後学習済み教師モデルの最終方策の模倣に制約されることなく、その教師からどのように恩恵を受けられるかを探求しています。

2026-09-08 Application / Video-Language Modeling / Modeling over space, time, and dynamics

Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics

Kairosは、時間分解能の高いアノテーションを用いて空間、時間、ダイナミクスにわたるきめ細かなモデリングを行うために設計された長尺動画・言語データセットです。

2026-09-07 Method / Process Mining / Agentic process mining framework

From Event Logs to Governed Action: A BlueSky Agenda for Agentic Process Mining

本BlueSky論文は、異種混合な運用イベントデータをプロセス認識型エージェント向けの統制された行動推奨へと変換するアジェンダである「イベント・トゥ・アクション(event-to-action)プロセスマイニング」を提案しています。

2026-09-07 Evaluation / Memory Evaluation / Recall capacity benchmarking

On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing

本論文は、機構的解釈可能性を通じてMambaにおける連想記憶想起(associative recall)を検証し、マルチクエリ連想想起(MQAR)において用いられる内部アルゴリズムを特定しています。

2026-09-07 Method / Reinforcement Learning / Reward design for long-horizon tasks

Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching

本論文は、標準的なスパースな結果報酬では訓練シグナルが弱くなる長期推論タスクにおける言語モデルの強化学習を研究しています。

2026-09-07 Method / Invariant Learning / Learning with exact group invariances

Efficient Learning and Symmetry Discovery under Exact Invariances

本論文は、厳密な群不変性の下での教師あり回帰を研究し、対称性群が有限、無限、または未知である場合に不変推定量が効率的に計算可能かどうかを扱っています。

2026-09-07 Method / Reinforcement Learning / Training coding agents with RL

FrogNano: Training a 4B Coding Agent via Online Task Synthesis

FrogNanoは、リポジトリレベルのソフトウェアエンジニアリングタスク向けに設計された4Bパラメータのコーディングエージェントであり、約1,500件の合成SWE環境上で強化学習のみを用いて訓練されています。

2026-09-06 Method / Recursive Improvement / Self-improving system design

MetaRSI / RSI2: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves

本論文は、デプロイされたシステムをデータ、実行ハーネス、モデルパラメータという3つの書き込み可能なサーフェスとして扱うメタ再帰的自己改善フレームワークであるMetaRSI-v1を提案しています。

2026-09-06 Method / Gradient Control / Mitigating interference in updates

One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control

本論文では、大規模言語モデル向けのマルチドメイン強化学習における干渉を、単一ステップの勾配という視点ではなくクロスステップの観点から研究しています。

2026-09-06 Method / MoE Routing / Routing effective rank definition

From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts

本論文では、テスト時推論におけるMoEエキスパートルーティングのトレースから構築されたロールアウト間類似度グラフのスペクトル次元性を表す、エントロピーベースの尺度である「ルーティング有効ランク」を提案しています。

2026-09-06 Evaluation / Multimodal Reasoning / Benchmark for cultural interpretation

NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures

NormVizは、視覚的規範理解のための人間による検証済みベンチマークを提案しており、16か国にまたがる3,272組の対照的な画像ペアで構成されています。

2026-09-06 Theory / Representation Theory / Theoretical aspects of feature superposition

Feature Superposition in Neural Networks: From Theory to Practice

本論文は、次元数よりも多くの特徴量を表現することと定義される、ニューラルネットワークにおける特徴量の重ね合わせ(スーパーポジション)に関するサーベイです。

2026-09-05 Method / Multimodal Fusion / Text-guided LLM adapter

MVFA: A Multi-View Text-Guided Multimodal Fusion LLM Adapter for Sentiment Analysis and Emotion Recognition

本論文では、凍結された大規模言語モデルを用いたマルチモーダル感情分析および対話における感情認識のためのパラメータ効率的なアダプタであるMVFAを提案しています。

2026-09-05 Method / Online Learning / Adaptive prompt routing with limited feedback

Online Learning with LLM Experts from Limited Feedback

本論文では、応答品質のフィードバックが限られた回数しか得られない状況下で、複数のLLMエキスパート間でプロンプトをオンラインルーティングする問題を研究しています。

2026-09-05 Method / Skill Routing / Diversity-aware routing framework

Beyond Top-$k$ Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents

本論文では、大規模なレジストリに重複または冗長なスキルが多数含まれ、複雑なタスクが相補的なスキルセットを必要とする場合における、LLMエージェントのためのスキルルーティングを研究しています。

2026-09-05 Method / 3D Reconstruction / Dense-view feed-forward splatting

AVSplat: Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning

AVSplatは、多数の入力ビューを追加すると再構成品質が低下してしまうという、カメラ姿勢不要なフィードフォワード型3D Gaussian Splattingにおける失敗モードに対処します。

2026-09-05 Evaluation / Visual Benchmarking / Fine-grained image difference evaluation

VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification

VDiff-Benchは、マルチモーダル大規模言語モデルにおける細粒度な画像差分識別のための多肢選択式ベンチマークです。

2026-09-04 Method / Domain Generalization / Risk-aware adversarial tuning and generation

PAPT++: Risk-Aware Adversarial Tuning and Generation for Single Domain Generalization

PAPT++は、事前学習済みのテキストから画像への拡散モデルを用いて、多様であるだけでなく現在の分類器にとって困難な学習サンプルを生成することにより、単一ドメイン汎化課題に対処します。

2026-09-04 Evaluation / Reasoning Assessment / Mathematical reasoning knowledge evaluation

Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory

本論文は、大規模言語モデル(LLM)が高い正解精度だけでなく、数学的推論において一貫した知識構造を示しているかを評価するために、知識空間理論(KST)に基づく枠組みを提案しています。

2026-09-04 Method / Model Explanation / Causal dependency graph construction

DCFA: Dual-view Causal-inspired Attribution for Failure Reasoning in LLM-based Multi-agent Systems

本論文は、大規模言語モデル(LLM)ベースのマルチエージェントシステムにおける失敗原因の帰属に取り組み、その修正によってシステムの失敗を覆す、あるいは最大限に低減できる決定的なエラーの特定を目的としています。

2026-09-04 Method / Agent Environments / Scalable environment pipeline

CUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents

CUA-Universeは、実際のデスクトップソフトウェアを、エージェントが共有されたアプリケーション状態に対してGUIとCLIツールの双方から操作できるハイブリッド環境へと変換するパイプラインです。

2026-09-04 Method / World Model / Physics-informed world modeling

TourPhysics: Bringing Physics to World Models for Exploration and Manipulation from a Single Image

TourPhysicsは、単一の画像と宣言的な物理構成から制御可能なシーン仮説を初期化するオンラインワールドモデルフレームワークです。

2026-09-03 Method / Test-Time Adaptation / Adaptation via human-AI interaction

Efficient Test-Time Adaptation through Human-AI Interaction

本論文では、対話型AIエージェントが自由形式タスクにおいて個々の人間の専門知識に適応できるようにするフレームワークであるTAHI(Test-time Adaptation through Human-agent Interaction)を提案しています。

2026-09-03 Method / Attention / Random token preservation in attention heads

Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

本論文は大規模言語モデルにおける長連鎖推論のためのKVキャッシュ破棄を研究し、キャッシュされたトークンを重要度スコアで順位付けする必要があるという標準的な前提に疑問を投げかけています。

2026-09-03 Method / Diffusion Models / Training diffusion transformer from scratch

LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

LLaDA-Imageは、ゼロから学習された6BのDiffusion Transformerを中心に構成され、凍結されたdLLMベースの視覚言語モジュールによって条件付けられる統合画像生成フレームワークです。

2026-09-03 Method / Embedding / Distillation for compositional reasoning

CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

本論文では、マルチモーダル検索におけるクロスアテンション型リランカーとデュアルエンコーダ型埋め込みモデルの間のギャップについて研究しています。

2026-09-03 Method / Pose Estimation / Multi-relative pose query learning

Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

Scal3Rは、固定された最初のフレームに対する絶対姿勢回帰を複数参照の相対姿勢クエリに置き換えることで、長時間の動画シーケンスにおけるオンライン3D再構成モデルの破綻に対処します。

2026-09-02 Method / Video Modeling / Interactive video world model construction

SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

SolarWMは、オープンなデータエンジンと異種動画バックボーン向けの統一学習スタックを組み合わせた、インタラクティブ動画世界モデルのオープン基盤として提案されています。

2026-09-02 Method / Model Fine-Tuning / Post-training with SFT and RL

Post-Training Language Models for Gold-Medal Performance in Coding Competitions

本論文は、大規模な問題収集、合成推論トレース、教師あり微調整(SFT)、強化学習(RL)、およびGenCorrectと呼ばれる反復的なテスト時計算手順を統合した、競技プログラミング向けのエンドツーエンドな事後学習・推論パイプラインを提案しています。

2026-09-02 Method / Attention / Controlling attention in decoding

Language Models Can Control Their Own Attention

本論文では、言語モデル自身がデコード中にアテンションを向けるべき箇所を明示的に宣言するプロンプティングおよび推論プロトコルであるDeclarative Attention(DA)を提案しています。

2026-09-02 Method / Reinforcement Learning / Tail-likelihood based learning

Tail-Likelihood Reinforcement Learning

本論文では、一様にサンプリングされた報酬閾値を超える期待対数確率を最大化する、連続報酬向けの強化学習(RL)目的関数であるTail-Likelihood Reinforcement Learning(TailRL)を提案しています。

2026-09-02 Method / In-Context Learning / Task-specific reasoning operation learning

SALA: Semantic-Aware Logical Alignment for Complex Reasoning in In-Context Learning

本論文は、インコンテキスト学習における複雑な推論のためのデモ選択を研究し、表層的な類似性や事前に定義された固定的な推論ステップのマッチングでは問題解決の論理を十分に捉えられないと主張しています。

2026-09-01 Method / Model Training / Training personalized simulators

StudentSim: Training LLM-based Student Simulators

StudentSimは、生徒ごとのスパースなデータから個別化された生徒シミュレータを構築するための2段階学習フレームワークです。

2026-09-01 Method / Reinforcement Learning / Off-policy and on-policy reward supervision

Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

本論文では、大規模言語モデルにおける事後学習の固定アノテーション予算を、教師あり微調整(SFT)とその後の強化学習(RL)段階の間でどのように配分するかを調査しています。

2026-09-01 Method / Multimodal Models / Unified understanding-generation framework

Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System

本論文は、統合マルチモーダルモデルが単に1つのインターフェースを通じて両機能を提供するだけでなく、視覚的理解と画像生成の共同学習から実際に恩恵を受けているかを調査しています。

2026-09-01 Method / Knowledge Distillation / Mid-training distillation with confident tokens

Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

本論文では、事前学習と事後学習の間の継続的な自己教師あり学習段階であるミッドトレーニングにおいて、ロジットベースの知識蒸留がどのように機能するかを調査しています。

2026-09-01 Method / Sparse Models / Input-adaptive sparse prefilling technique

CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

CRISPは、従来の動的スパースアテンションシステムで特定された2つの限界に対処する、ロングコンテキスト向けのトレーニングフリーなスパースプリフィリング手法です。

ページ基準日: 2026-09-10
Archive

アーカイブ

週次アーカイブ

15

翻訳・エージェント向け評価ベンチマーク

今週のテーマは、簡易的なテスト設定ではなく、より現実的で高制約のベンチマークへと評価が移行している点に焦点を当てている。

2026-08-28 - 2026-09-03

3D再構成と動的ガウシアンモデリング

本テーマは、純粋な光度フィッティングを超え、スパースビューや単眼条件下での3D/4D再構成・レンダリングの実用化を目指すものである。

2026-08-28 - 2026-09-03

強化学習における目的関数設計

本テーマは、標準的な期待リターン訓練を超えて、強化学習が何を最適化すべきかを再考することに焦点を当てている。

2026-08-28 - 2026-09-03

マルチモーダル推論の評価

本テーマは、言語モデルやマルチモーダルシステムが視覚・言語・空間の各表現にまたがる真の推論を行えているか、それとも表面的なベンチマーク信号に依存しているかを評価することに焦点を当てている。

2026-08-21 - 2026-08-27

オムニモーダル表現と評価

本テーマは、複数のモダリティを統合しつつ、その表現の制御性と評価の実質性を高めるモデルに焦点を当てている。

2026-08-21 - 2026-08-27

エージェント環境とハーネスのスケーリング

本テーマは、固定的な設定でエージェントを評価する段階から、エージェントの振る舞いを形作る環境・インタラクションループ・ランタイムスキャフォールドをスケーリングする段階への移行を中心に据えている。

2026-08-21 - 2026-08-27

インタラクティブモデルとエージェントのためのベンチマーク

今週のテーマは、モデル評価を狭いオフライン指標から、身体性世界モデルやマルチモーダルGUIエージェント向けの実行可能でタスクに根ざしたベンチマークへと移行させることに焦点を当てている。

2026-08-14 - 2026-08-20

幾何学を考慮した3D再構成と生成

本テーマは、視覚的な生成・再構成を幾何学、カメラパラメータ、シーン構造に明示的に基づかせることに関するものである。

2026-08-14 - 2026-08-20

スケーラブルな汎用強化学習

今週の強化学習研究は、RLシステムのさらなる汎用化、計算効率の向上、および高負荷な訓練体制下での安定性に焦点を当てている。

2026-08-14 - 2026-08-20

科学LLMの評価と適応

本テーマは、基盤モデルが科学的・マルチモーダルな用途に向けてどのように評価・改善されているかに焦点を当てており、事前学習戦略、データの現実性、効率的なクロスモーダル設計が重視されている。

2026-08-07 - 2026-08-13

スパースニューラル表面再構成

今週のテーマは、スパースビュー条件下でニューラル表面再構成の汎化性能と効率性の両立を目指す研究に焦点を当てている。

2026-08-07 - 2026-08-13

自己進化型LLMマルチエージェントシステム

本テーマは、静的で中央集権的に制御されるLLMエージェントから、役割・記憶・ツール・協調方法を時間とともに適応させる自己進化型・分散型マルチエージェントシステムへの移行を追跡する。

2026-08-07 - 2026-08-13

根拠付きマルチモーダルQAベンチマーク

マルチモーダル質問応答のベンチマーク研究は、モデルが浅い多肢選択の手がかりに頼るのではなく、証拠を検索・根拠付けすることが求められる、より困難で信頼性の高い評価設定を志向する傾向が強まっている。

2026-07-31 - 2026-08-06

コンピュータ操作エージェントの評価

コンピュータ操作およびGUIエージェントの評価は、タスク成功率の測定から、安全性・効率性・クロスプラットフォーム能力の診断へと移行しつつある。

2026-07-31 - 2026-08-06

オンライン模倣学習と世界モデル強化学習

代表的な論文群は、静的な模倣学習や標準的なモデルベース制御に共通する限界に収束している。

2026-07-31 - 2026-08-06
このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。