FuguReport

FuguReport

最新の週次テーマと直近の日次レポートをまとめて確認できます。

ページ基準日: 2026-09-15
Weekly

2026-09-04 - 2026-09-10

Daily

最新の日次レポート

50 件のレポート
2026-09-15 Method / Physics-Based Synthesis / Physics-grounded video synthesis

PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control

PhysStreamは、複数の物体が存在する卓上シーンにおいて、物理に基づいたインタラクティブな制御を行うための自己回帰型image-to-video生成手法です。

2026-09-15 Method / World Models / Connecting perception and decision making

World Models for Embodied Intelligence: From Plausible to Controllable to Actionable

本論文は身体知能に向けたワールドモデルに関するサーベイであり、ワールドモデルは視覚的なリアリズム単体ではなく行動をいかに向上させるかによって評価されるべきであると主張しています。

2026-09-15 Evaluation / Visual Question Answering / Visual query reasoning benchmarks

Not Another Text Benchmark: Putting the "Visual" Back in Visual Question Answering for Large Video Models

本論文は、既存の動画質問応答ベンチマークが主にテキストの選択肢を介して推論を評価しているため、大規模動画モデルにおける真の視覚的推論の失敗が見えにくくなっていると主張しています。

2026-09-15 Method / Control Methods / Recursive contract enforcement

From Transient Prompts to Persistent Control: Scientific Poster Generation via Recursive Semantic-Geometric Contracts

本論文では、コンテンツ作成、レイアウト構築、レンダリングの各段階において、局所的なプロンプトを一貫した制御へと置き換える科学ポスター生成フレームワーク「PosterVisor」を提案しています。

2026-09-15 Method / Speculative Decoding / Hierarchical dual-loop framework

ECHO: Early-layer Collaborative Hierarchical Orchestration with Bonus Logits in Speculative Decoding

ECHOは、Transformer層間の機能的非対称性を利用し、推論を高頻度な初期層の内部ループと低頻度なモデル全体の外部ループに分離する、ドラフトモデル不要の投機的デコーディングフレームワークです。

2026-09-14 Method / Backdoor Attack / Learning poison set selection

Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks

本論文では、トリガー、ターゲット動作、クリーンデータ、およびポイズン数を固定したまま、どのポイズン事例を選択するかのみを変化させる、LLMバックドア攻撃におけるポイズンセット選択を調査しています。

2026-09-14 Method / Safety Evaluation / Executable threat assessment

HazardAuditor: From Executable Threats to Safer Computer-Use Agents

HazardAuditorは、静的なプロンプトや応答ではなく実行時の振る舞いに着目した、コンピュータ利用エージェント向けの実行基盤型安全性フレームワークです。

2026-09-14 Method / 3D Generation / Part-level native generator extension

Kaininja: Extending Native 3D Generators to the Part Level

KaiNinjaは、単一画像からのネイティブ3D生成器であるTRELLIS.

2026-09-14 Method / Quantization / Integer-only LLM quantization

LLM Inference in a Flash!

本論文では、大容量ストレージとニアデータ実行を実現する一方で、書き込み耐性の低さ、オフチップ帯域幅の狭さ、高精度浮動小数点サポートの弱さといった制約を抱えるフラッシュベースのコンピュートインメモリ(CIM)アーキテクチャに、LLMデコーディングを適合させる手法を検討しています。

2026-09-14 Method / Constrained Optimization / Multi-level algorithm design

Projection-Free Multi-level Algorithms for Stochastic Constrained Compositional Optimization

本論文では、目的関数が閉凸集合上での滑らかな関数の入れ子構造(ネスト構造)をとる確率的制約付きマルチレベル合成最適化を扱い、射影ステップを線形最小化オラクル(LMO)に置き換える手法を研究しています。

2026-09-13 Evaluation / Image Quality Assessment / No-reference quality evaluation for colorized images

MCIQA-2K: A Multi-Dimensional Dataset and No-Reference Quality Assessment Benchmark for Colorized Images

本論文では、本質的に曖昧さを伴う着色タスクにおいて、人間の知覚と従来のフルリファレンス指標との間に生じる不一致を動機として、着色画像のノーリファレンス画質評価ベンチマークであるMCIQA-2Kを提案します。

2026-09-13 Evaluation / Model Evaluation / Measuring LLM dependency

LLMs as Oracles: Reliance on LLMs for Subjective Personal Questions

本論文は、解釈、判断、意思決定、コミュニケーションの起草などをモデルに委ねることで、人々が主観的な個人的質問に対して大規模言語モデル(LLM)を「オラクル(神託)」としてどのように利用しているかを調査しています。

2026-09-13 Method / Watermarking / Semantic watermark injection and detection

DenMark: Robust Semantic Watermarking for Diffusion Language Models

DenMarkは、テキストが左から右へのトークン出力ではなく反復的なノイズ除去を通じて生成される拡散言語モデル向けに設計された意味電子透かしフレームワークです。

2026-09-13 Method / Reasoning Methods / Code-based reasoning frameworks

The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis

本論文では、競技プログラミングの問題と受理されたコードを自然言語推論データへと変換する4段階のフレームワーク「MIMIC」を提案しています。

2026-09-13 Method / Reasoning / Endogenous reasoning mechanisms

State of Thought Enables Endogenous Reasoning

本論文では、LLMの内部推論状態に基づいて過去のどの証拠を活性化したままにするかや、いつ推論を停止すべきかを制御するテスト時推論フレームワークである「State of Thought (SoT)」を提案しています。

2026-09-12 Method / Model Fine-Tuning / Optimization with drift budget constraints

Drift-Constrained Optimization: Only Direction Matters in Fine-Tuning Instruct Models

本論文では、参照モデルからの振る舞いのドリフト(乖離)という観点から指示モデルの教師ありファインチューニングを検討し、ドリフトを制御不能な副作用ではなく固定された予算として扱っています。

2026-09-12 Application / Machine Translation / Multilingual translation in 50 languages

North Small Translate: Advanced Cost-Effective Translation (Cohere CAT+)

North Small Translateは、CohereのCommand A+基盤上に構築されたオープンウェイトの指示追従型機械翻訳モデルであり、総パラメータ数218B、アクティブパラメータ数25BのスパースMixture-of-Experts(MoE)アーキテクチャを採用しています。

2026-09-12 Method / Model Design / Action head and module scale design

What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and Latency

本論文は、バックボーン系列(SigLIP2およびQwen2.

2026-09-12 Method / Stochastic Modeling / Combining random neural networks and Markov processes

Towards a faithful stochastic model for brain digital twins

本論文は脳のデジタルツインに向けた確率的ニューロンモデルを検討し、単一ニューロンおよびネットワークレベルの電気的メカニズムの双方を十分に再現できる既存の手法は存在しないと主張しています。

2026-09-12 Evaluation / Model Evaluation / Correlation with human judgments

Does Reasoning Improve Psychological Depth in Large Language Models? It Depends on Who's Judging

本論文は、推論指向の大規模言語モデルがより心理的深みのある短編小説を生成できるか、また人間の評価との相関に基づいて選定されたLLMジャッジが新たな分布においてその質を妥当に測定できるかを検証しています。

2026-09-11 Evaluation / Video Benchmarking / Modality-validated video dataset

DementiaCare-Bench: A Modality-Validated Video Benchmark

DementiaCare-Benchは、9つの行動・心理症状カテゴリにわたる56本の公開専門トレーニング動画を94本のクリップに分割して構築された、認知症介護向け動画質問応答ベンチマークです。

2026-09-11 Method / Lifelong Learning / Framework for lifelong experience reuse

LifeMem: Enabling Lifelong Experience Reuse for LLM Agents

LifeMemは、異種環境にわたって過去の経験を蓄積・再利用しつつ破滅的忘却を緩和するために設計された、LLMエージェント向けの生涯学習フレームワークです。

2026-09-11 Method / Human-Agent Collaboration / Framework for workplace AI augmentation

When Does AI Augment Work? A Workflow-Level Framework for Human-Agent Collaboration

本論文は、職場におけるAIの価値は、個別のタスクや導入統計ではなく、ワークフロー全体のレベルで評価されるべきであると主張しています。

2026-09-11 Task / Person Search / Text-based person retrieval

Generative Retrieval for Unsupervised Text-Based Person Search

本論文では、人手で注釈付けされた画像とテキストのペアを用いず、ラベルなしの人物画像のみに依存してモデル学習を行う教師なしテキストベース人物検索(TBPS)を研究しています。

2026-09-11 Method / Language Modeling / Process-grounded framework for cognitive diagnosis

Beyond ID Embeddings: Process-Grounded Language Modeling for Cognitive Diagnosis

本論文では、学習された生徒や問題のID埋め込みを、言語から導出された構造化された認知エビデンスに置き換えるプロセス認識型の言語認知診断フレームワークであるPLCDを提案します。

2026-09-10 Evaluation / Overfitting Analysis / MoE overfit under repeated data

Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

本論文は、固定された総トークン数の条件下において、訓練データの繰り返しが疎なMixture-of-Experts(MoE)言語モデルに与える影響を、高密度(Dense)Transformerと比較して調査しています。

2026-09-10 Evaluation / Benchmarking / Multimodal long-horizon research tasks

Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research Agents

Mr.

2026-09-10 Method / Video Generation / Real-time interactive video generation techniques

Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

Vidu S2は、Vidu S2-AvatarとVidu S2-Editingから構成される、リアルタイムなインタラクティブ動画生成およびリアルタイム動画編集のための統合フレームワークとして提案されています。

2026-09-10 Evaluation / Conversational Agent Benchmarking / Proactive mediation dialogue evaluation

ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation

ProMediConvは、調停を単なる受動的な会話ではなく、プロアクティブで多段階、多者間の対話プロセスとしてモデル化する法的紛争調停のためのベンチマークです。

2026-09-10 Task / Multimodal Grounding / Linking comments to evidence

ReGround: Grounding Reviewer Comments in Multimodal Evidence

本論文では、査読者のコメントを匿名の科学論文投稿原稿内の特定の根拠にグラウンディングするためのデータセット「ReGround」を導入します。

2026-09-09 Method / Graph Neural Networks / Theoretical foundations of VNN

Learning with Covariance Matrices: Principal Component Analysis Meets Learning with Graphs

本稿は、共分散行列を用いた学習に対するグラフ信号処理の視点を提示し、共分散行列をグラフシフト作用素として扱うことで主成分分析(PCA)をグラフベースの学習と結び付けます。

2026-09-09 Task / Multilingual Reasoning / In-language reasoning consistency

Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning

本論文は、モデルが英語をデフォルトとするのではなく、ユーザーのプロンプトと同じ言語で中間推論トレースを生成することと定義される「L2推論」を調査しています。

2026-09-09 Method / World Model / Separation of observation and state evolution

Programmable World Model

Programmable World Modelは、世界状態の遷移と視覚的観測の合成を分離するインタラクティブな動画生成フレームワークです。

2026-09-09 Method / Visual Token Pruning / Training-free pruning framework

TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents

本論文では、マルチステップの軌跡全体でキャッシュを通じてスクリーンショットが再利用される状況における、GUIエージェント向けのビジュアルトークンプルーニングを研究しています。

2026-09-09 Task / Entity Linking / Linking text and images to knowledge base

Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking

本論文はMERLINにおける多言語マルチモーダルエンティティリンキングを研究し、エンティティの希少性(レア度)をページビューなどの人気度シグナルのみで測定すべきではないと論じています。

2026-09-08 Method / Diffusion Models / Enhancing training convergence and sampling quality

Revisiting Spectral Representations in Generative Diffusion Models

本論文は、摂動カーネルの観点から拡散モデリングを再考し、拡散モデルの学習が自己教師ありスペクトル表現学習と密接に関連していると主張しています。

2026-09-08 Application / Depth Estimation / Monocular depth prediction

Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

本論文は、オープンソースの画像編集モデルQwen-Image-Edit-2509を転用することで、拡散Transformerベースの単眼深度推定アプローチとしてMarigoldを再検討しています。

2026-09-08 Method / Profile Learning / Constructing minimal sufficient profiles

Less Is Personal: Learning Minimal Sufficient User Profiles for Personalized Language Models

本論文では、パーソナライズ言語モデリングを固定長のリトリーバル問題ではなく、最小十分なプロファイル構築問題として検討しています。

2026-09-08 Method / Policy Optimization / Student policy gradient amplification

Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

本論文では、オンポリシー蒸留における弱から強への汎化を研究し、より強力な生徒モデルが、より弱い事後学習済み教師モデルの最終方策の模倣に制約されることなく、その教師からどのように恩恵を受けられるかを探求しています。

2026-09-08 Application / Video-Language Modeling / Modeling over space, time, and dynamics

Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics

Kairosは、時間分解能の高いアノテーションを用いて空間、時間、ダイナミクスにわたるきめ細かなモデリングを行うために設計された長尺動画・言語データセットです。

2026-09-07 Method / Process Mining / Agentic process mining framework

From Event Logs to Governed Action: A BlueSky Agenda for Agentic Process Mining

本BlueSky論文は、異種混合な運用イベントデータをプロセス認識型エージェント向けの統制された行動推奨へと変換するアジェンダである「イベント・トゥ・アクション(event-to-action)プロセスマイニング」を提案しています。

2026-09-07 Evaluation / Memory Evaluation / Recall capacity benchmarking

On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing

本論文は、機構的解釈可能性を通じてMambaにおける連想記憶想起(associative recall)を検証し、マルチクエリ連想想起(MQAR)において用いられる内部アルゴリズムを特定しています。

2026-09-07 Method / Reinforcement Learning / Reward design for long-horizon tasks

Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching

本論文は、標準的なスパースな結果報酬では訓練シグナルが弱くなる長期推論タスクにおける言語モデルの強化学習を研究しています。

2026-09-07 Method / Invariant Learning / Learning with exact group invariances

Efficient Learning and Symmetry Discovery under Exact Invariances

本論文は、厳密な群不変性の下での教師あり回帰を研究し、対称性群が有限、無限、または未知である場合に不変推定量が効率的に計算可能かどうかを扱っています。

2026-09-07 Method / Reinforcement Learning / Training coding agents with RL

FrogNano: Training a 4B Coding Agent via Online Task Synthesis

FrogNanoは、リポジトリレベルのソフトウェアエンジニアリングタスク向けに設計された4Bパラメータのコーディングエージェントであり、約1,500件の合成SWE環境上で強化学習のみを用いて訓練されています。

2026-09-06 Method / Recursive Improvement / Self-improving system design

MetaRSI / RSI2: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves

本論文は、デプロイされたシステムをデータ、実行ハーネス、モデルパラメータという3つの書き込み可能なサーフェスとして扱うメタ再帰的自己改善フレームワークであるMetaRSI-v1を提案しています。

2026-09-06 Method / Gradient Control / Mitigating interference in updates

One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control

本論文では、大規模言語モデル向けのマルチドメイン強化学習における干渉を、単一ステップの勾配という視点ではなくクロスステップの観点から研究しています。

2026-09-06 Method / MoE Routing / Routing effective rank definition

From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts

本論文では、テスト時推論におけるMoEエキスパートルーティングのトレースから構築されたロールアウト間類似度グラフのスペクトル次元性を表す、エントロピーベースの尺度である「ルーティング有効ランク」を提案しています。

2026-09-06 Evaluation / Multimodal Reasoning / Benchmark for cultural interpretation

NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures

NormVizは、視覚的規範理解のための人間による検証済みベンチマークを提案しており、16か国にまたがる3,272組の対照的な画像ペアで構成されています。

2026-09-06 Theory / Representation Theory / Theoretical aspects of feature superposition

Feature Superposition in Neural Networks: From Theory to Practice

本論文は、次元数よりも多くの特徴量を表現することと定義される、ニューラルネットワークにおける特徴量の重ね合わせ(スーパーポジション)に関するサーベイです。

ページ基準日: 2026-09-15
Archive

アーカイブ

週次アーカイブ

15

統合マルチモーダル表現学習

今週のテーマは、単一のシステムで画像の理解・生成・編集を行うマルチモーダルモデルにおいて、視覚情報をどのように表現すべきかに焦点を当てている。

2026-09-04 - 2026-09-10

頑健な音声認識システム

本テーマは、クリーンな単一話者条件を超えて動作する音声認識システムを扱い、騒音環境・遮音環境、話者重複、チャネル不一致への対応を対象とする。

2026-09-04 - 2026-09-10

リスク制御された自己改善

本テーマは、学習システムが自身を改善したり推論を修正したりする際に、有害な変更を暗黙的に蓄積しない方法に焦点を当てている。

2026-09-04 - 2026-09-10

翻訳・エージェント向け評価ベンチマーク

今週のテーマは、簡易的なテスト設定ではなく、より現実的で高制約のベンチマークへと評価が移行している点に焦点を当てている。

2026-08-28 - 2026-09-03

3D再構成と動的ガウシアンモデリング

本テーマは、純粋な光度フィッティングを超え、スパースビューや単眼条件下での3D/4D再構成・レンダリングの実用化を目指すものである。

2026-08-28 - 2026-09-03

強化学習における目的関数設計

本テーマは、標準的な期待リターン訓練を超えて、強化学習が何を最適化すべきかを再考することに焦点を当てている。

2026-08-28 - 2026-09-03

マルチモーダル推論の評価

本テーマは、言語モデルやマルチモーダルシステムが視覚・言語・空間の各表現にまたがる真の推論を行えているか、それとも表面的なベンチマーク信号に依存しているかを評価することに焦点を当てている。

2026-08-21 - 2026-08-27

オムニモーダル表現と評価

本テーマは、複数のモダリティを統合しつつ、その表現の制御性と評価の実質性を高めるモデルに焦点を当てている。

2026-08-21 - 2026-08-27

エージェント環境とハーネスのスケーリング

本テーマは、固定的な設定でエージェントを評価する段階から、エージェントの振る舞いを形作る環境・インタラクションループ・ランタイムスキャフォールドをスケーリングする段階への移行を中心に据えている。

2026-08-21 - 2026-08-27

インタラクティブモデルとエージェントのためのベンチマーク

今週のテーマは、モデル評価を狭いオフライン指標から、身体性世界モデルやマルチモーダルGUIエージェント向けの実行可能でタスクに根ざしたベンチマークへと移行させることに焦点を当てている。

2026-08-14 - 2026-08-20

幾何学を考慮した3D再構成と生成

本テーマは、視覚的な生成・再構成を幾何学、カメラパラメータ、シーン構造に明示的に基づかせることに関するものである。

2026-08-14 - 2026-08-20

スケーラブルな汎用強化学習

今週の強化学習研究は、RLシステムのさらなる汎用化、計算効率の向上、および高負荷な訓練体制下での安定性に焦点を当てている。

2026-08-14 - 2026-08-20

科学LLMの評価と適応

本テーマは、基盤モデルが科学的・マルチモーダルな用途に向けてどのように評価・改善されているかに焦点を当てており、事前学習戦略、データの現実性、効率的なクロスモーダル設計が重視されている。

2026-08-07 - 2026-08-13

スパースニューラル表面再構成

今週のテーマは、スパースビュー条件下でニューラル表面再構成の汎化性能と効率性の両立を目指す研究に焦点を当てている。

2026-08-07 - 2026-08-13

自己進化型LLMマルチエージェントシステム

本テーマは、静的で中央集権的に制御されるLLMエージェントから、役割・記憶・ツール・協調方法を時間とともに適応させる自己進化型・分散型マルチエージェントシステムへの移行を追跡する。

2026-08-07 - 2026-08-13
このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。