ランキング(注目度スコア)

スコア算出日: 2026-08-23

合計スコア = √(HF Upvotes) + √(GitHub Stars) + cvFactor + venueBonus(HF・Stars が 0 のとき各 √ 項は 0、cvFactor は LLM による 100 点満点、venueBonus は学会採択加点)(算定方法の詳細

順位論文公開日学会リンクHF UpvotesGitHub StarscvFactorvenueBonus合計
1InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis 3DGS マルチビュー2026-08-03SIGGRAPH 2026arXiv
Hugging Face
GitHub
723008515125.81
2PolyLayout: Multi-room Manhattan Layout Estimation マルチビュー2026-08-04ECCV 2026arXiv
Hugging Face
GitHub
01447515102.00
3Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors2026-08-05CVPR 2026arXiv
Hugging Face
008515100.00
4DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing 3DGS 自動運転2026-08-03ECCV 2026arXiv
Hugging Face
00821597.00
5FlexSplat: Flexible Feed-Forward 3D Gaussian Splatting without Point Cloud Correspondence 3DGS マルチビュー 点群 NVS2026-08-08BMVC 2026arXiv
Hugging Face
GitHub
0684894.45
6Multi-View Face and Gesture Animation with Dynamic Gaussians マルチビュー NVS2026-08-05MAJOR 2026arXiv
Hugging Face
00821092.00
7UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models 3DGS NeRF マルチビュー 点群 NVS 動画生成2026-08-05arXiv
Hugging Face
GitHub
814076090.66
8D^2-4DGS: Dual-Depth Guided Sparse-Camera 4D Gaussian Splatting 3DGS 深度 マルチビュー NVS2026-08-03arXiv
Hugging Face
0086086.00
9UniqueSplat: View-conditioned 3D Gaussian Splatting for Generalizable 3D Reconstruction 3DGS NeRF 3D再構築2026-08-03arXiv
Hugging Face
0086086.00
10LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation 深度 マルチビュー 3D再構築2026-08-04CVPR 2026arXiv
Hugging Face
0082385.00

今週のコンピュータビジョン界隈は、まさに「3D Gaussian Splatting(3DGS)のパラダイムシフト」が加速していると言っても過言ではない。単なるレンダリング技術としての3DGSを超え、単一画像からの即時生成(Feed-forward)、動的なアバターへの応用、さらには自動運転シミュレーションへの統合といった、実用化に向けた爆発的な進化が見て取れる。特に、これまで膨大な計算コストを要していた「シーンの最適化」を、いかにして「推論(Inference)」のフェーズへと押し上げるかという戦いが、論文の最前線で繰り広げられている。エンジニア諸君、今週も目が離せない。

トップ3の深掘り

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

どんな論文? / 新規性 従来の単一画像からの3DGS生成は、画像ピクセルに紐付いた「Pixel-aligned」な表現に制約され、視点移動が大きくなると破綻しやすいという課題があった。InfiniSplatは、この制約を打破するために「Implicit Gaussian Decoding」を導入。画像グリッドに依存しない潜在表現を用いることで、単一の入力画像から、広範囲な視点変化(Large-baseline)に耐えうる高品質な3Dシーンを、フィードフォワード形式で生成することに成功している。

なぜ注目すべきか(スコア内訳を数字で) 合計スコアは125.81点と、今週のトップを独走。Hugging FaceでのUpvotes(72件)に加え、GitHub Starが300★に達していることから、研究者だけでなく、実装を急ぐエンジニアコミュニティからも極めて高い関心を集めていることがわかる。3DGSの「単一画像からの生成」における決定版となる可能性を秘めている。

関連リンク arXiv | Hugging Face | GitHub

PolyLayout: Multi-room Manhattan Layout Estimation

どんな論文? / 新規性 室内空間の理解において、部屋のレイアウト推定は極めて重要だが、従来のモデルはデータの一般化性能や、部屋の形状に関する幾何学的仮定に縛られていた。PolyLayoutは、複数の部屋が共有する「Manhattan Layout(直交する壁構造)」という建築的な構造的特徴を明示的に活用。これにより、複数の視点画像から、より実世界の構造に即した、精度が高く汎用的な部屋のレイアウト推定を可能にした。

なぜ注目すべきか(スコア内訳を数字で) 合計スコアは102.00点。Hugging FaceのUpvotesこそ0だが、GitHub Starが144★と非常に高く、実用的なツールとしてのポテンシャルが評価されている。空間コンピューティングやロボティクスにおける、室内環境のセマンティックな理解を一段階引き上げる研究だ。

関連リンク arXiv | Hugging Face | GitHub

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

どんな論文? / 新規性 dToF(Direct Time-of-Flight)センサは高精度な距離情報を得るための鍵だが、コストとハードウェアの制約から、出力される深度マップは極めて疎(Sparse)でノイズが多い。本論文は、この疎なdToFデータから、VR/XRやロボティクスで即座に利用可能な「高密度かつメートルスケール(Metric)な深度マップ」を補完・生成する手法を提案している。

なぜ注目すべきか(スコア内訳を数字で) 合計スコアは100.00点。コミュニティでの反応(HF/GitHub)はまだこれからだが、cvFactor(85)が示す通り、コンピュータビジョンの専門家から極めて高く評価されている。ハードウェアの限界をソフトウェアの力で突破する、極めてエンジニアリング的な価値の高い研究だ。

関連リンク arXiv | Hugging Face

第4位〜第10位 クイックレビュー

【第4位】DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing 自動運転の閉ループ検証に向けた、インタラクティブな3DGS環境を提案。高い視覚的忠実度とリアルタイム性を両立し、動的なシーン構成にも対応できる、シミュレーション技術の進化系だ。 関連リンク arXiv

【第5位】FlexSplat: Flexible Feed-Forward 3D Gaussian Splatting without Point Cloud Correspondence 点群の対応付け(Correspondence)を必要とせず、未キャリブレーションの多視点画像から3DGSを生成する柔軟なフレームワーク。オブジェクト中心の再構成において、Transformerベースの新しいアプローチを提示している。 関連リンク arXiv | GitHub

【第6位】Multi-View Face and Gesture Animation with Dynamic Gaussians 顔の微細な表情と、手のジェスチャーの両方を、動的なGaussianを用いてリアルにアニメーションさせる技術。従来のフルボディモデルが苦手としていた「顔のディテール」と「手のポーズ」の精度を同時に解決している。 関連リンク arXiv

【第7位】UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models ビデオ拡散モデルを活用し、ソーシャルメディアに溢れるカジュアルな動画から、幾何的一貫性のある広角な視点合成を実現。動画から没入型コンテンツを生み出すための、強力な生成パイプラインを提案。 関連リンク arXiv | Hugging Face | GitHub

【第8位】D^2-4DGS: Dual-Depth Guided Sparse-Camera 4D Gaussian Splatting 少ないカメラ数(Sparse-camera)でも、二重の深度ガイドを用いることで動的な4DGSの再構成を可能にする手法。キャプチャのコストを大幅に抑えつつ、動的なシーンの高品質なレンダリングを追求している。 関連リンク arXiv

【第9位】UniqueSplat: View-conditioned 3D Gaussian Splatting for Generalizable 3D Reconstruction 各視点のクエリに応じてカスタマイズされた3D放射場を生成する、View-conditionedなフィードフォワードモデル。従来の固定的なGaussian生成とは異なる、より柔軟な再構成アプローチを提案。 リンク arXiv

【第10位】LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation 基盤モデルの知識を蒸留し、エキスパートモデルを統合することで、効率的な多視点ステレオ(MVS)を実現。テクスチャの少ない領域でも、幾何学的な正しさを保ちながらリアルタイムな3D認識を可能にする。 リンク arXiv

編集後記

今週のランキングを俯瞰して感じるのは、3DGSが「いかにして現実世界の複雑さを、軽量な数学的表現(Gaussian)へと落とし込むか」という、より高次元なフェーズに入ったことだ。特に1位のInfiniSplatが示した「単一画像からの広角視点合成」の可能性は、スマートフォンのカメラ一本で3Dスキャンが完了する未来を、ぐっと手前に引き寄せた。

また、4DGS(動的シーン)やMVS(多視点ステレオ)といった、これまで計算コストの壁に阻まれていた領域が、拡散モデルやTransformerといった強力なバックボーンによって次々と「フィードフォワード化(推論化)」されている。これは単なる高速化ではない。3Dコンテンツ制作の民主化、あるいは空間コンピューティングにおける「リアルタイム・デジタルツイン」の実現に向けた、不可逆的なうねりである。

次週も、この激流の最前線をお届けしよう。