FuguReport
最新の週次テーマと直近の日次レポートをまとめて確認できます。
2026-08-28 - 2026-09-03
最新の日次レポート
Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data
本論文は、固定された総トークン数の条件下において、訓練データの繰り返しが疎なMixture-of-Experts(MoE)言語モデルに与える影響を、高密度(Dense)Transformerと比較して調査しています。
Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research Agents
Mr.
Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation
Vidu S2は、Vidu S2-AvatarとVidu S2-Editingから構成される、リアルタイムなインタラクティブ動画生成およびリアルタイム動画編集のための統合フレームワークとして提案されています。
ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation
ProMediConvは、調停を単なる受動的な会話ではなく、プロアクティブで多段階、多者間の対話プロセスとしてモデル化する法的紛争調停のためのベンチマークです。
ReGround: Grounding Reviewer Comments in Multimodal Evidence
本論文では、査読者のコメントを匿名の科学論文投稿原稿内の特定の根拠にグラウンディングするためのデータセット「ReGround」を導入します。
Learning with Covariance Matrices: Principal Component Analysis Meets Learning with Graphs
本稿は、共分散行列を用いた学習に対するグラフ信号処理の視点を提示し、共分散行列をグラフシフト作用素として扱うことで主成分分析(PCA)をグラフベースの学習と結び付けます。
Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning
本論文は、モデルが英語をデフォルトとするのではなく、ユーザーのプロンプトと同じ言語で中間推論トレースを生成することと定義される「L2推論」を調査しています。
Programmable World Model
Programmable World Modelは、世界状態の遷移と視覚的観測の合成を分離するインタラクティブな動画生成フレームワークです。
TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents
本論文では、マルチステップの軌跡全体でキャッシュを通じてスクリーンショットが再利用される状況における、GUIエージェント向けのビジュアルトークンプルーニングを研究しています。
Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking
本論文はMERLINにおける多言語マルチモーダルエンティティリンキングを研究し、エンティティの希少性(レア度)をページビューなどの人気度シグナルのみで測定すべきではないと論じています。
Revisiting Spectral Representations in Generative Diffusion Models
本論文は、摂動カーネルの観点から拡散モデリングを再考し、拡散モデルの学習が自己教師ありスペクトル表現学習と密接に関連していると主張しています。
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
本論文は、オープンソースの画像編集モデルQwen-Image-Edit-2509を転用することで、拡散Transformerベースの単眼深度推定アプローチとしてMarigoldを再検討しています。
Less Is Personal: Learning Minimal Sufficient User Profiles for Personalized Language Models
本論文では、パーソナライズ言語モデリングを固定長のリトリーバル問題ではなく、最小十分なプロファイル構築問題として検討しています。
Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
本論文では、オンポリシー蒸留における弱から強への汎化を研究し、より強力な生徒モデルが、より弱い事後学習済み教師モデルの最終方策の模倣に制約されることなく、その教師からどのように恩恵を受けられるかを探求しています。
Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics
Kairosは、時間分解能の高いアノテーションを用いて空間、時間、ダイナミクスにわたるきめ細かなモデリングを行うために設計された長尺動画・言語データセットです。
From Event Logs to Governed Action: A BlueSky Agenda for Agentic Process Mining
本BlueSky論文は、異種混合な運用イベントデータをプロセス認識型エージェント向けの統制された行動推奨へと変換するアジェンダである「イベント・トゥ・アクション(event-to-action)プロセスマイニング」を提案しています。
On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing
本論文は、機構的解釈可能性を通じてMambaにおける連想記憶想起(associative recall)を検証し、マルチクエリ連想想起(MQAR)において用いられる内部アルゴリズムを特定しています。
Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching
本論文は、標準的なスパースな結果報酬では訓練シグナルが弱くなる長期推論タスクにおける言語モデルの強化学習を研究しています。
Efficient Learning and Symmetry Discovery under Exact Invariances
本論文は、厳密な群不変性の下での教師あり回帰を研究し、対称性群が有限、無限、または未知である場合に不変推定量が効率的に計算可能かどうかを扱っています。
FrogNano: Training a 4B Coding Agent via Online Task Synthesis
FrogNanoは、リポジトリレベルのソフトウェアエンジニアリングタスク向けに設計された4Bパラメータのコーディングエージェントであり、約1,500件の合成SWE環境上で強化学習のみを用いて訓練されています。
MetaRSI / RSI2: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves
本論文は、デプロイされたシステムをデータ、実行ハーネス、モデルパラメータという3つの書き込み可能なサーフェスとして扱うメタ再帰的自己改善フレームワークであるMetaRSI-v1を提案しています。
One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control
本論文では、大規模言語モデル向けのマルチドメイン強化学習における干渉を、単一ステップの勾配という視点ではなくクロスステップの観点から研究しています。
From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts
本論文では、テスト時推論におけるMoEエキスパートルーティングのトレースから構築されたロールアウト間類似度グラフのスペクトル次元性を表す、エントロピーベースの尺度である「ルーティング有効ランク」を提案しています。
NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures
NormVizは、視覚的規範理解のための人間による検証済みベンチマークを提案しており、16か国にまたがる3,272組の対照的な画像ペアで構成されています。
Feature Superposition in Neural Networks: From Theory to Practice
本論文は、次元数よりも多くの特徴量を表現することと定義される、ニューラルネットワークにおける特徴量の重ね合わせ(スーパーポジション)に関するサーベイです。
MVFA: A Multi-View Text-Guided Multimodal Fusion LLM Adapter for Sentiment Analysis and Emotion Recognition
本論文では、凍結された大規模言語モデルを用いたマルチモーダル感情分析および対話における感情認識のためのパラメータ効率的なアダプタであるMVFAを提案しています。
Online Learning with LLM Experts from Limited Feedback
本論文では、応答品質のフィードバックが限られた回数しか得られない状況下で、複数のLLMエキスパート間でプロンプトをオンラインルーティングする問題を研究しています。
Beyond Top-$k$ Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents
本論文では、大規模なレジストリに重複または冗長なスキルが多数含まれ、複雑なタスクが相補的なスキルセットを必要とする場合における、LLMエージェントのためのスキルルーティングを研究しています。
AVSplat: Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning
AVSplatは、多数の入力ビューを追加すると再構成品質が低下してしまうという、カメラ姿勢不要なフィードフォワード型3D Gaussian Splattingにおける失敗モードに対処します。
VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification
VDiff-Benchは、マルチモーダル大規模言語モデルにおける細粒度な画像差分識別のための多肢選択式ベンチマークです。
PAPT++: Risk-Aware Adversarial Tuning and Generation for Single Domain Generalization
PAPT++は、事前学習済みのテキストから画像への拡散モデルを用いて、多様であるだけでなく現在の分類器にとって困難な学習サンプルを生成することにより、単一ドメイン汎化課題に対処します。
Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory
本論文は、大規模言語モデル(LLM)が高い正解精度だけでなく、数学的推論において一貫した知識構造を示しているかを評価するために、知識空間理論(KST)に基づく枠組みを提案しています。
DCFA: Dual-view Causal-inspired Attribution for Failure Reasoning in LLM-based Multi-agent Systems
本論文は、大規模言語モデル(LLM)ベースのマルチエージェントシステムにおける失敗原因の帰属に取り組み、その修正によってシステムの失敗を覆す、あるいは最大限に低減できる決定的なエラーの特定を目的としています。
CUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents
CUA-Universeは、実際のデスクトップソフトウェアを、エージェントが共有されたアプリケーション状態に対してGUIとCLIツールの双方から操作できるハイブリッド環境へと変換するパイプラインです。
TourPhysics: Bringing Physics to World Models for Exploration and Manipulation from a Single Image
TourPhysicsは、単一の画像と宣言的な物理構成から制御可能なシーン仮説を初期化するオンラインワールドモデルフレームワークです。
Efficient Test-Time Adaptation through Human-AI Interaction
本論文では、対話型AIエージェントが自由形式タスクにおいて個々の人間の専門知識に適応できるようにするフレームワークであるTAHI(Test-time Adaptation through Human-agent Interaction)を提案しています。
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
本論文は大規模言語モデルにおける長連鎖推論のためのKVキャッシュ破棄を研究し、キャッシュされたトークンを重要度スコアで順位付けする必要があるという標準的な前提に疑問を投げかけています。
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
LLaDA-Imageは、ゼロから学習された6BのDiffusion Transformerを中心に構成され、凍結されたdLLMベースの視覚言語モジュールによって条件付けられる統合画像生成フレームワークです。
CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
本論文では、マルチモーダル検索におけるクロスアテンション型リランカーとデュアルエンコーダ型埋め込みモデルの間のギャップについて研究しています。
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
Scal3Rは、固定された最初のフレームに対する絶対姿勢回帰を複数参照の相対姿勢クエリに置き換えることで、長時間の動画シーケンスにおけるオンライン3D再構成モデルの破綻に対処します。
SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
SolarWMは、オープンなデータエンジンと異種動画バックボーン向けの統一学習スタックを組み合わせた、インタラクティブ動画世界モデルのオープン基盤として提案されています。
Post-Training Language Models for Gold-Medal Performance in Coding Competitions
本論文は、大規模な問題収集、合成推論トレース、教師あり微調整(SFT)、強化学習(RL)、およびGenCorrectと呼ばれる反復的なテスト時計算手順を統合した、競技プログラミング向けのエンドツーエンドな事後学習・推論パイプラインを提案しています。
Language Models Can Control Their Own Attention
本論文では、言語モデル自身がデコード中にアテンションを向けるべき箇所を明示的に宣言するプロンプティングおよび推論プロトコルであるDeclarative Attention(DA)を提案しています。
Tail-Likelihood Reinforcement Learning
本論文では、一様にサンプリングされた報酬閾値を超える期待対数確率を最大化する、連続報酬向けの強化学習(RL)目的関数であるTail-Likelihood Reinforcement Learning(TailRL)を提案しています。
SALA: Semantic-Aware Logical Alignment for Complex Reasoning in In-Context Learning
本論文は、インコンテキスト学習における複雑な推論のためのデモ選択を研究し、表層的な類似性や事前に定義された固定的な推論ステップのマッチングでは問題解決の論理を十分に捉えられないと主張しています。
StudentSim: Training LLM-based Student Simulators
StudentSimは、生徒ごとのスパースなデータから個別化された生徒シミュレータを構築するための2段階学習フレームワークです。
Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs
本論文では、大規模言語モデルにおける事後学習の固定アノテーション予算を、教師あり微調整(SFT)とその後の強化学習(RL)段階の間でどのように配分するかを調査しています。
Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System
本論文は、統合マルチモーダルモデルが単に1つのインターフェースを通じて両機能を提供するだけでなく、視覚的理解と画像生成の共同学習から実際に恩恵を受けているかを調査しています。
Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
本論文では、事前学習と事後学習の間の継続的な自己教師あり学習段階であるミッドトレーニングにおいて、ロジットベースの知識蒸留がどのように機能するかを調査しています。
CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing
CRISPは、従来の動的スパースアテンションシステムで特定された2つの限界に対処する、ロングコンテキスト向けのトレーニングフリーなスパースプリフィリング手法です。
アーカイブ
週次アーカイブ
15翻訳・エージェント向け評価ベンチマーク
今週のテーマは、簡易的なテスト設定ではなく、より現実的で高制約のベンチマークへと評価が移行している点に焦点を当てている。
3D再構成と動的ガウシアンモデリング
本テーマは、純粋な光度フィッティングを超え、スパースビューや単眼条件下での3D/4D再構成・レンダリングの実用化を目指すものである。
強化学習における目的関数設計
本テーマは、標準的な期待リターン訓練を超えて、強化学習が何を最適化すべきかを再考することに焦点を当てている。
マルチモーダル推論の評価
本テーマは、言語モデルやマルチモーダルシステムが視覚・言語・空間の各表現にまたがる真の推論を行えているか、それとも表面的なベンチマーク信号に依存しているかを評価することに焦点を当てている。
オムニモーダル表現と評価
本テーマは、複数のモダリティを統合しつつ、その表現の制御性と評価の実質性を高めるモデルに焦点を当てている。
エージェント環境とハーネスのスケーリング
本テーマは、固定的な設定でエージェントを評価する段階から、エージェントの振る舞いを形作る環境・インタラクションループ・ランタイムスキャフォールドをスケーリングする段階への移行を中心に据えている。
インタラクティブモデルとエージェントのためのベンチマーク
今週のテーマは、モデル評価を狭いオフライン指標から、身体性世界モデルやマルチモーダルGUIエージェント向けの実行可能でタスクに根ざしたベンチマークへと移行させることに焦点を当てている。
幾何学を考慮した3D再構成と生成
本テーマは、視覚的な生成・再構成を幾何学、カメラパラメータ、シーン構造に明示的に基づかせることに関するものである。
スケーラブルな汎用強化学習
今週の強化学習研究は、RLシステムのさらなる汎用化、計算効率の向上、および高負荷な訓練体制下での安定性に焦点を当てている。
科学LLMの評価と適応
本テーマは、基盤モデルが科学的・マルチモーダルな用途に向けてどのように評価・改善されているかに焦点を当てており、事前学習戦略、データの現実性、効率的なクロスモーダル設計が重視されている。
スパースニューラル表面再構成
今週のテーマは、スパースビュー条件下でニューラル表面再構成の汎化性能と効率性の両立を目指す研究に焦点を当てている。
自己進化型LLMマルチエージェントシステム
本テーマは、静的で中央集権的に制御されるLLMエージェントから、役割・記憶・ツール・協調方法を時間とともに適応させる自己進化型・分散型マルチエージェントシステムへの移行を追跡する。
根拠付きマルチモーダルQAベンチマーク
マルチモーダル質問応答のベンチマーク研究は、モデルが浅い多肢選択の手がかりに頼るのではなく、証拠を検索・根拠付けすることが求められる、より困難で信頼性の高い評価設定を志向する傾向が強まっている。
コンピュータ操作エージェントの評価
コンピュータ操作およびGUIエージェントの評価は、タスク成功率の測定から、安全性・効率性・クロスプラットフォーム能力の診断へと移行しつつある。
オンライン模倣学習と世界モデル強化学習
代表的な論文群は、静的な模倣学習や標準的なモデルベース制御に共通する限界に収束している。