FuguReport
最新の週次テーマと直近の日次レポートをまとめて確認できます。
2026-09-04 - 2026-09-10
最新の日次レポート
PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control
PhysStreamは、複数の物体が存在する卓上シーンにおいて、物理に基づいたインタラクティブな制御を行うための自己回帰型image-to-video生成手法です。
World Models for Embodied Intelligence: From Plausible to Controllable to Actionable
本論文は身体知能に向けたワールドモデルに関するサーベイであり、ワールドモデルは視覚的なリアリズム単体ではなく行動をいかに向上させるかによって評価されるべきであると主張しています。
Not Another Text Benchmark: Putting the "Visual" Back in Visual Question Answering for Large Video Models
本論文は、既存の動画質問応答ベンチマークが主にテキストの選択肢を介して推論を評価しているため、大規模動画モデルにおける真の視覚的推論の失敗が見えにくくなっていると主張しています。
From Transient Prompts to Persistent Control: Scientific Poster Generation via Recursive Semantic-Geometric Contracts
本論文では、コンテンツ作成、レイアウト構築、レンダリングの各段階において、局所的なプロンプトを一貫した制御へと置き換える科学ポスター生成フレームワーク「PosterVisor」を提案しています。
ECHO: Early-layer Collaborative Hierarchical Orchestration with Bonus Logits in Speculative Decoding
ECHOは、Transformer層間の機能的非対称性を利用し、推論を高頻度な初期層の内部ループと低頻度なモデル全体の外部ループに分離する、ドラフトモデル不要の投機的デコーディングフレームワークです。
Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
本論文では、トリガー、ターゲット動作、クリーンデータ、およびポイズン数を固定したまま、どのポイズン事例を選択するかのみを変化させる、LLMバックドア攻撃におけるポイズンセット選択を調査しています。
HazardAuditor: From Executable Threats to Safer Computer-Use Agents
HazardAuditorは、静的なプロンプトや応答ではなく実行時の振る舞いに着目した、コンピュータ利用エージェント向けの実行基盤型安全性フレームワークです。
Kaininja: Extending Native 3D Generators to the Part Level
KaiNinjaは、単一画像からのネイティブ3D生成器であるTRELLIS.
LLM Inference in a Flash!
本論文では、大容量ストレージとニアデータ実行を実現する一方で、書き込み耐性の低さ、オフチップ帯域幅の狭さ、高精度浮動小数点サポートの弱さといった制約を抱えるフラッシュベースのコンピュートインメモリ(CIM)アーキテクチャに、LLMデコーディングを適合させる手法を検討しています。
Projection-Free Multi-level Algorithms for Stochastic Constrained Compositional Optimization
本論文では、目的関数が閉凸集合上での滑らかな関数の入れ子構造(ネスト構造)をとる確率的制約付きマルチレベル合成最適化を扱い、射影ステップを線形最小化オラクル(LMO)に置き換える手法を研究しています。
MCIQA-2K: A Multi-Dimensional Dataset and No-Reference Quality Assessment Benchmark for Colorized Images
本論文では、本質的に曖昧さを伴う着色タスクにおいて、人間の知覚と従来のフルリファレンス指標との間に生じる不一致を動機として、着色画像のノーリファレンス画質評価ベンチマークであるMCIQA-2Kを提案します。
LLMs as Oracles: Reliance on LLMs for Subjective Personal Questions
本論文は、解釈、判断、意思決定、コミュニケーションの起草などをモデルに委ねることで、人々が主観的な個人的質問に対して大規模言語モデル(LLM)を「オラクル(神託)」としてどのように利用しているかを調査しています。
DenMark: Robust Semantic Watermarking for Diffusion Language Models
DenMarkは、テキストが左から右へのトークン出力ではなく反復的なノイズ除去を通じて生成される拡散言語モデル向けに設計された意味電子透かしフレームワークです。
The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis
本論文では、競技プログラミングの問題と受理されたコードを自然言語推論データへと変換する4段階のフレームワーク「MIMIC」を提案しています。
State of Thought Enables Endogenous Reasoning
本論文では、LLMの内部推論状態に基づいて過去のどの証拠を活性化したままにするかや、いつ推論を停止すべきかを制御するテスト時推論フレームワークである「State of Thought (SoT)」を提案しています。
Drift-Constrained Optimization: Only Direction Matters in Fine-Tuning Instruct Models
本論文では、参照モデルからの振る舞いのドリフト(乖離)という観点から指示モデルの教師ありファインチューニングを検討し、ドリフトを制御不能な副作用ではなく固定された予算として扱っています。
North Small Translate: Advanced Cost-Effective Translation (Cohere CAT+)
North Small Translateは、CohereのCommand A+基盤上に構築されたオープンウェイトの指示追従型機械翻訳モデルであり、総パラメータ数218B、アクティブパラメータ数25BのスパースMixture-of-Experts(MoE)アーキテクチャを採用しています。
What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and Latency
本論文は、バックボーン系列(SigLIP2およびQwen2.
Towards a faithful stochastic model for brain digital twins
本論文は脳のデジタルツインに向けた確率的ニューロンモデルを検討し、単一ニューロンおよびネットワークレベルの電気的メカニズムの双方を十分に再現できる既存の手法は存在しないと主張しています。
Does Reasoning Improve Psychological Depth in Large Language Models? It Depends on Who's Judging
本論文は、推論指向の大規模言語モデルがより心理的深みのある短編小説を生成できるか、また人間の評価との相関に基づいて選定されたLLMジャッジが新たな分布においてその質を妥当に測定できるかを検証しています。
DementiaCare-Bench: A Modality-Validated Video Benchmark
DementiaCare-Benchは、9つの行動・心理症状カテゴリにわたる56本の公開専門トレーニング動画を94本のクリップに分割して構築された、認知症介護向け動画質問応答ベンチマークです。
LifeMem: Enabling Lifelong Experience Reuse for LLM Agents
LifeMemは、異種環境にわたって過去の経験を蓄積・再利用しつつ破滅的忘却を緩和するために設計された、LLMエージェント向けの生涯学習フレームワークです。
When Does AI Augment Work? A Workflow-Level Framework for Human-Agent Collaboration
本論文は、職場におけるAIの価値は、個別のタスクや導入統計ではなく、ワークフロー全体のレベルで評価されるべきであると主張しています。
Generative Retrieval for Unsupervised Text-Based Person Search
本論文では、人手で注釈付けされた画像とテキストのペアを用いず、ラベルなしの人物画像のみに依存してモデル学習を行う教師なしテキストベース人物検索(TBPS)を研究しています。
Beyond ID Embeddings: Process-Grounded Language Modeling for Cognitive Diagnosis
本論文では、学習された生徒や問題のID埋め込みを、言語から導出された構造化された認知エビデンスに置き換えるプロセス認識型の言語認知診断フレームワークであるPLCDを提案します。
Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data
本論文は、固定された総トークン数の条件下において、訓練データの繰り返しが疎なMixture-of-Experts(MoE)言語モデルに与える影響を、高密度(Dense)Transformerと比較して調査しています。
Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research Agents
Mr.
Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation
Vidu S2は、Vidu S2-AvatarとVidu S2-Editingから構成される、リアルタイムなインタラクティブ動画生成およびリアルタイム動画編集のための統合フレームワークとして提案されています。
ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation
ProMediConvは、調停を単なる受動的な会話ではなく、プロアクティブで多段階、多者間の対話プロセスとしてモデル化する法的紛争調停のためのベンチマークです。
ReGround: Grounding Reviewer Comments in Multimodal Evidence
本論文では、査読者のコメントを匿名の科学論文投稿原稿内の特定の根拠にグラウンディングするためのデータセット「ReGround」を導入します。
Learning with Covariance Matrices: Principal Component Analysis Meets Learning with Graphs
本稿は、共分散行列を用いた学習に対するグラフ信号処理の視点を提示し、共分散行列をグラフシフト作用素として扱うことで主成分分析(PCA)をグラフベースの学習と結び付けます。
Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning
本論文は、モデルが英語をデフォルトとするのではなく、ユーザーのプロンプトと同じ言語で中間推論トレースを生成することと定義される「L2推論」を調査しています。
Programmable World Model
Programmable World Modelは、世界状態の遷移と視覚的観測の合成を分離するインタラクティブな動画生成フレームワークです。
TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents
本論文では、マルチステップの軌跡全体でキャッシュを通じてスクリーンショットが再利用される状況における、GUIエージェント向けのビジュアルトークンプルーニングを研究しています。
Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking
本論文はMERLINにおける多言語マルチモーダルエンティティリンキングを研究し、エンティティの希少性(レア度)をページビューなどの人気度シグナルのみで測定すべきではないと論じています。
Revisiting Spectral Representations in Generative Diffusion Models
本論文は、摂動カーネルの観点から拡散モデリングを再考し、拡散モデルの学習が自己教師ありスペクトル表現学習と密接に関連していると主張しています。
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
本論文は、オープンソースの画像編集モデルQwen-Image-Edit-2509を転用することで、拡散Transformerベースの単眼深度推定アプローチとしてMarigoldを再検討しています。
Less Is Personal: Learning Minimal Sufficient User Profiles for Personalized Language Models
本論文では、パーソナライズ言語モデリングを固定長のリトリーバル問題ではなく、最小十分なプロファイル構築問題として検討しています。
Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
本論文では、オンポリシー蒸留における弱から強への汎化を研究し、より強力な生徒モデルが、より弱い事後学習済み教師モデルの最終方策の模倣に制約されることなく、その教師からどのように恩恵を受けられるかを探求しています。
Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics
Kairosは、時間分解能の高いアノテーションを用いて空間、時間、ダイナミクスにわたるきめ細かなモデリングを行うために設計された長尺動画・言語データセットです。
From Event Logs to Governed Action: A BlueSky Agenda for Agentic Process Mining
本BlueSky論文は、異種混合な運用イベントデータをプロセス認識型エージェント向けの統制された行動推奨へと変換するアジェンダである「イベント・トゥ・アクション(event-to-action)プロセスマイニング」を提案しています。
On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing
本論文は、機構的解釈可能性を通じてMambaにおける連想記憶想起(associative recall)を検証し、マルチクエリ連想想起(MQAR)において用いられる内部アルゴリズムを特定しています。
Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching
本論文は、標準的なスパースな結果報酬では訓練シグナルが弱くなる長期推論タスクにおける言語モデルの強化学習を研究しています。
Efficient Learning and Symmetry Discovery under Exact Invariances
本論文は、厳密な群不変性の下での教師あり回帰を研究し、対称性群が有限、無限、または未知である場合に不変推定量が効率的に計算可能かどうかを扱っています。
FrogNano: Training a 4B Coding Agent via Online Task Synthesis
FrogNanoは、リポジトリレベルのソフトウェアエンジニアリングタスク向けに設計された4Bパラメータのコーディングエージェントであり、約1,500件の合成SWE環境上で強化学習のみを用いて訓練されています。
MetaRSI / RSI2: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves
本論文は、デプロイされたシステムをデータ、実行ハーネス、モデルパラメータという3つの書き込み可能なサーフェスとして扱うメタ再帰的自己改善フレームワークであるMetaRSI-v1を提案しています。
One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control
本論文では、大規模言語モデル向けのマルチドメイン強化学習における干渉を、単一ステップの勾配という視点ではなくクロスステップの観点から研究しています。
From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts
本論文では、テスト時推論におけるMoEエキスパートルーティングのトレースから構築されたロールアウト間類似度グラフのスペクトル次元性を表す、エントロピーベースの尺度である「ルーティング有効ランク」を提案しています。
NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures
NormVizは、視覚的規範理解のための人間による検証済みベンチマークを提案しており、16か国にまたがる3,272組の対照的な画像ペアで構成されています。
Feature Superposition in Neural Networks: From Theory to Practice
本論文は、次元数よりも多くの特徴量を表現することと定義される、ニューラルネットワークにおける特徴量の重ね合わせ(スーパーポジション)に関するサーベイです。
アーカイブ
週次アーカイブ
15統合マルチモーダル表現学習
今週のテーマは、単一のシステムで画像の理解・生成・編集を行うマルチモーダルモデルにおいて、視覚情報をどのように表現すべきかに焦点を当てている。
頑健な音声認識システム
本テーマは、クリーンな単一話者条件を超えて動作する音声認識システムを扱い、騒音環境・遮音環境、話者重複、チャネル不一致への対応を対象とする。
リスク制御された自己改善
本テーマは、学習システムが自身を改善したり推論を修正したりする際に、有害な変更を暗黙的に蓄積しない方法に焦点を当てている。
翻訳・エージェント向け評価ベンチマーク
今週のテーマは、簡易的なテスト設定ではなく、より現実的で高制約のベンチマークへと評価が移行している点に焦点を当てている。
3D再構成と動的ガウシアンモデリング
本テーマは、純粋な光度フィッティングを超え、スパースビューや単眼条件下での3D/4D再構成・レンダリングの実用化を目指すものである。
強化学習における目的関数設計
本テーマは、標準的な期待リターン訓練を超えて、強化学習が何を最適化すべきかを再考することに焦点を当てている。
マルチモーダル推論の評価
本テーマは、言語モデルやマルチモーダルシステムが視覚・言語・空間の各表現にまたがる真の推論を行えているか、それとも表面的なベンチマーク信号に依存しているかを評価することに焦点を当てている。
オムニモーダル表現と評価
本テーマは、複数のモダリティを統合しつつ、その表現の制御性と評価の実質性を高めるモデルに焦点を当てている。
エージェント環境とハーネスのスケーリング
本テーマは、固定的な設定でエージェントを評価する段階から、エージェントの振る舞いを形作る環境・インタラクションループ・ランタイムスキャフォールドをスケーリングする段階への移行を中心に据えている。
インタラクティブモデルとエージェントのためのベンチマーク
今週のテーマは、モデル評価を狭いオフライン指標から、身体性世界モデルやマルチモーダルGUIエージェント向けの実行可能でタスクに根ざしたベンチマークへと移行させることに焦点を当てている。
幾何学を考慮した3D再構成と生成
本テーマは、視覚的な生成・再構成を幾何学、カメラパラメータ、シーン構造に明示的に基づかせることに関するものである。
スケーラブルな汎用強化学習
今週の強化学習研究は、RLシステムのさらなる汎用化、計算効率の向上、および高負荷な訓練体制下での安定性に焦点を当てている。
科学LLMの評価と適応
本テーマは、基盤モデルが科学的・マルチモーダルな用途に向けてどのように評価・改善されているかに焦点を当てており、事前学習戦略、データの現実性、効率的なクロスモーダル設計が重視されている。
スパースニューラル表面再構成
今週のテーマは、スパースビュー条件下でニューラル表面再構成の汎化性能と効率性の両立を目指す研究に焦点を当てている。
自己進化型LLMマルチエージェントシステム
本テーマは、静的で中央集権的に制御されるLLMエージェントから、役割・記憶・ツール・協調方法を時間とともに適応させる自己進化型・分散型マルチエージェントシステムへの移行を追跡する。