動いている人を3D動画にできるのか〜4D Gaussian Splattingで何が必要か調べてみた

本ページは広告(アフィリエイトプログラム)を含みます。詳しくはプライバシーポリシーをご覧ください。
動いている人を3D空間ごと記録できるという4D Gaussian Splatting(4DGS)について、自分のRTX 3090で動かせるのかを調べてみました。ふだんはUbuntu PCにRTX 3090とRTX 3060の2枚を挿して、ローカルLLMや画像生成の検証をしている環境です。 前回の記事で、スマホで撮った写真から静止物の3Dモデルを作るフォトグラメトリを紹介しました。ただ、あれはあくまで「静止した物体」の話です。動いている人——たとえば踊っている人、遊んでいる子ども、ステージで動いている人——を3D空間に記録して、あとから自由な角度で見返す。これはフォトグラメトリでは原理的に不可能でした。撮影中に被写体が動いたら3Dモデルが破綻するからです。 2026年に入って、この壁を越える技術がついに実用レベルに近づいてきました。4D Gaussian Splatting(4DGS)です。3D Gaussian Splattingに「時間軸」を加えた技術で、動きのあるシーンを丸ごと自由視点映像として再構成できます。 本記事は、手元の環境で4DGSができるのかどうかを調べた記録です。まだ実際には撮影も処理もしていません。何が必要で、どこに壁があるのかを、公開されている情報から整理しました。 動いている人を3D動画にすることは、個人の手元でどこまでできるのでしょうか。
目次

3DGS(静止)と4DGS(動的)の違い

3DGSと4DGSの関係を整理します。3DGS(3D Gaussian Splatting)は2023年にSIGGRAPHで発表され、2024年から急速に広まった3D再構成の技術で、写真や動画から静止シーンのフォトリアルな3D表現を作ります。4DGSはこれに時間軸を追加したもので、「動きのある3Dシーン」を扱えます。
項目3DGS(静止)4DGS(動的)
入力写真20〜50枚、または動画同期された複数視点動画(1台でも可)
出力静止した3Dシーン時間軸を持つ3D動画
対象建物、部屋、静物人物の動き、パフォーマンス、動く物体
処理時間(30秒分)10〜30分1時間〜半日
GPU要件RTX 3060以上(12GB VRAM=GPUに載る作業用メモリ)RTX 3090推奨(24GB VRAM)
再生方法Webブラウザ、VRヘッドセット専用ビューワー、WebXR
3DGSでは、異なる角度から撮った写真のそれぞれの瞬間を「同じ静止シーンの別視点」として扱います。時間が経過しても被写体は動かない前提です。 4DGSでは、各フレームが「ある時刻における3Dシーン」を表します。時刻tのフレーム群から3Dシーンを復元し、時刻t+1のフレーム群からまた別の3Dシーンを復元する。この連続が「動く3D映像」を構成します。
スポンサーリンク

3D Gaussian Splattingの数式を直感的に理解する

4DGSを理解するには、まず土台となる3DGSの仕組みを知る必要があります。数式が出てきますが、一つひとつ「何をやっているか」を説明していきます。

ガウス分布で空間を表現する

従来の3Dモデルは「三角形の集合体(メッシュ)」で表現していました。3DGSはまったく異なるアプローチで、3D空間に無数の「ぼやけた光の球」を配置して、その重ね合わせでシーンを表現します。 1つのガウス球(3D Gaussian)は、以下のパラメータを持ちます。
パラメータ数式記号直感的な意味
位置μ(ミュー)球の中心がどこにあるか(x, y, z座標)
共分散行列Σ(シグマ)球の大きさと向き(楕円形に伸びている方向と度合い)
不透明度α(アルファ)球の濃さ(透明〜完全に不透明)
SH係数見る角度によって変わる色(球面調和関数で表現)
3D空間内の任意の点 x における、あるガウス球の影響度は以下の式で計算されます。
G(x) = exp( -1/2 · (x - μ)ᵀ · Σ⁻¹ · (x - μ) )
要点: ガウス球の中心(μ)に近い点ほどG(x)が1に近づき、遠い点ほど0に近づく。要するに「中心が明るくて、端に行くほどフェードアウトする光の球」です。この球を数十万〜数百万個、空間中にばらまくことで、複雑なシーンを表現します。1つの球が壁のレンガ1個分、木の葉1枚分、といった感覚です。

レンダリング(3Dデータを画面に映る絵として描き出す処理):カメラから見た色をどう計算するか

3DGSのレンダリングは、カメラの視線方向に沿って手前から奥に向かってガウス球を重ね合わせます。各ピクセルの色 C は以下の式で計算されます。
C = Σᵢ cᵢ · αᵢ · Tᵢ  ただし Tᵢ = Π(j<i) (1 - αⱼ)
要点: 手前のガウス球から順番に色を重ねていく。手前の球が不透明(αが大きい)なら、奥の球はほとんど見えなくなる。半透明なら奥が透けて見える。これは、色つきのセロハンを何枚も重ねて向こう側を見るのと同じ原理です。Tᵢは「このガウス球より手前の球がどれだけ光を遮っているか」を表す透過率で、手前が濃いほどTᵢは小さくなり、奥の球の影響が弱まります。
この計算は並列化しやすいため、GPUで高速に処理できます。だからこそ3DGSはリアルタイムレンダリング(30fps以上)が可能なのです。

4DGSへの拡張:時間軸の追加方法

3DGSでは各ガウス球のパラメータ(μ, Σ, α, 色)は固定でした。4DGSではこれらを時間 t の関数にします。
μ(t) = μ₀ + Δμ(t)    ← 位置が時間とともに変化
Σ(t) = Σ₀ + ΔΣ(t)    ← 形状が時間とともに変化
α(t) = α₀ + Δα(t)    ← 不透明度が時間とともに変化
要点: 各ガウス球が「時刻ごとにちょっとずつ動いたり、形が変わったり、消えたり現れたりする」ことで動きを表現します。手を振る人を4DGSで表現するなら、手の部分にあるガウス球群が時間とともに位置をずらしていく。体幹部分のガウス球はほぼ動かない。この「球ごとの動き方」をニューラルネットワークで学習するのが4DGSの本質です。
時間変化の表現方法は複数の手法が提案されています。
手法時間の表現方法メリットデメリット
Deformable 3DGSDeformation MLPで各ガウスの変位を予測滑らかな動き。メモリ効率が良い急な動きに弱い
4D Gaussian(CVPR 2024)4Dガウス分布(空間3D + 時間1D)理論的にエレガント。高品質計算コストが高い
Per-frame最適化フレームごとに独立して3DGSを学習実装が簡単フレーム間の整合性がない
現在主流なのはDeformable 3DGSベースのアプローチのようです。
注意点: 4DGSは3DGSより計算コストが格段に高く、処理時間は5〜10倍以上かかります。GPUのVRAMも多く必要で、公開されている要件・報告値を見る限り、RTX 3060(12GB)だと1080p・短尺が限界、RTX 3090(24GB)でも4K以上は厳しい状況のようです。

スマホ1台で完結する構想は、まだ「夢」の段階でした

調べはじめた時点で、いちばん期待していたのがこれです。スマホで撮った動画をアップロードするだけで、クラウドが4DGSに変換してくれる。追加費用0円で試せるなら、これ以上ない入口です。
★調べて分かったこと: このサービス(4DGS.jp)の発表は、PR TIMESの「April Dream」という企画で出されたものでした。4月1日に「いつか叶えたい夢」を発信するという趣旨の企画です。つまりまだ提供されていません。うっかり「もう使える」と思い込むところでした。

発表された構想の中身

構想としては、被写体の周りをスマホで歩きながら撮るだけで、クラウド側が数十秒で4DGSデータへ自動変換する、というものです。カメラ位置の推定(SfM)と4DGS学習を一括で処理する形が想定されています。1回の生成で最大1時間ぶんのデータに対応する、とも書かれています。 実現すれば入口としては理想的ですが、時期は明記されていません。

ただし、ビューワーは実在します

同じIZUTSUYAが、2025年10月に4DGS専用ビューワーを無償公開しています。こちらは構想ではなく実物です。WebGL/WebGPUを使ったブラウザ表示で、Windows・Mac・Linux・モバイルのいずれでも動きます。 生成は自分でやる必要がありますが、できたものを見せる手段はすでにあるということです。
調査メモ: 手軽なクラウド入口がまだ無い以上、いま4DGSを試すなら自前で処理するしかないようです。ここから先が現実的な話です。
スポンサーリンク

中級編:スマホ複数台で自前4DGS

なぜ複数台が必要か

スマホ1台では、撮影中に被写体の周りを歩く必要があります。このとき2つの問題が生じます。
  1. 撮影者の映り込み: 被写体の周囲を歩くと、被写体側から見て撮影者が動いている。他のカメラがあれば撮影者が映り込んでしまう可能性がある
  2. 同時刻の全方向データが取れない: 時刻t=0秒では正面の映像しかなく、t=5秒で側面、t=10秒で背面……というように、同じ瞬間を複数角度で記録できない
複数台のスマホを固定して同時に撮影すれば、同一時刻における複数視点のデータが取れます。これにより4DGSの品質が大幅に向上します。

必要な機材

機材数量目安費用備考
スマホ3〜6台手持ち or 中古1080p/30fps以上。機種が異なってもOK
三脚(100均やスマホ用)3〜6台1台500〜1,000円100均のフレキシブル三脚で十分
PC1台手持ち(RTX 3090推奨)VRAM 24GBあると余裕がある
ffmpeg無料フレーム抽出・音声同期に使用
COLMAP無料カメラキャリブレーション
4DGS実装無料(GitHub公開)学習・レンダリング
三脚はダイソーやセリアで売っているスマホ用クリップ付きのもので十分です。3台なら1,500円〜3,000円程度の出費で揃います。

同期方法:手を叩いて音声同期

プロの映像制作ではタイムコード同期を使いますが、スマホ同士では使えません。代わりに、撮影開始時に「手を叩く(クラップ)」方法が実用的です。
  1. 全スマホの録画を開始
  2. 被写体の前で手を「パン!」と叩く
  3. 撮影を実行
  4. 録画停止
あとからffmpegで各動画の音声波形を解析し、クラップ音のピーク位置を検出して同期ポイントを合わせます。フレーム単位(1/30秒 = 約33ms)の精度で同期できます。
# ffmpegでクラップ音の位置を検出する例
ffmpeg -i camera1.mp4 -af "silencedetect=noise=-30dB:d=0.1" -f null -

ワークフロー

  1. 撮影: スマホを三脚に固定して配置 → 全台同時録画開始 → クラップ → 被写体がパフォーマンス → 録画停止
  2. フレーム抽出: ffmpegで各動画からフレームを抽出(5fpsが目安。30fpsは処理が重すぎる)
  3. 音声同期: クラップ音でフレームの時刻を揃える
  4. COLMAP: 各カメラの位置と内部パラメータを推定
  5. 4DGS学習: 同期済みフレーム群を入力として4DGSモデルを学習
  6. ビューワーで確認: 学習済みモデルを専用ビューワーやWebビューワーで再生

スマホの配置例

3台の場合:
CAMERA LAYOUT
3台配置(扇形120°カバー)
被写体
カメラL
左60°
カメラC
正面
カメラR
右60°
被写体を中心に正面+左右60度の扇形に配置します。正面側の約120度をカバーできます。背面は撮れないので、被写体が主にカメラ側を向いている前提です。 6台の場合:
CAMERA LAYOUT
6台配置(360°フルカバー)
カメラ1
正面
カメラ2
右60°
カメラ3
右後120°
カメラ4
背面
カメラ5
左後120°
カメラ6
左60°
被写体
被写体を中心に等間隔60度で6台を配置します。全方向360度をカバーできるので、どの角度から見ても穴が少なくなります。ただしスマホ6台の確保がハードルです。家族や友人のスマホを借りるのが現実的でしょう。

本格編:ミラーレスカメラ3台で高品質4DGS

5K以上で撮影できるミラーレスカメラを3台使う構成は、調べた範囲では、個人が手の届く最高品質ルートとして挙げられます。スマホの1080pとは大きく異なる情報量を入力にできるためです。 ただし費用は正直に書いておきます。5K以上で撮れる機種は1台20万円前後のものが多く、3台そろえると60万円ほど。カメラが本業の方ならともかく、4DGSのためだけに買う金額ではありません。すでに複数台お持ちの方向けの選択肢、と考えたほうが現実的だと思います。

5.7K解像度の利点

  • ディテールの再現: 衣装の模様、肌のテクスチャ、楽器の木目など、スマホの1080pでは潰れてしまう細部まで記録できます
  • 遠景の奥行き: 被写体から少し離れて撮影しても、十分な解像度が維持されます。スマホだと被写体に近づく必要があり、レンズの歪みが問題になりがちです
  • クロップ耐性: 5.7Kで撮影しておけば、あとから1080pや2Kにリサイズしても情報量は十分。処理時間とのバランスで解像度を選べます

タイムコード同期(フレーム精度)

機種によっては、タイムコード端子(TC IN/OUT)を備えているものがあります。BNC変換ケーブルを使って3台のタイムコードを同期させれば、フレーム単位(1/24秒 = 約42ms)で正確に映像を揃えられます。スマホのクラップ同期より1桁高い精度です。 タイムコード同期のメリットは、長時間の撮影でもズレが蓄積しないことです。スマホの音声同期だと、録画開始から時間が経つにつれてフレームレートの微妙な差でズレが広がることがあります。5分以上の撮影ではタイムコード同期が事実上必須です。

カメラの配置:正面+左右15度

ミラーレス3台では、正面+左右15度の狭い扇形に配置するのが良いようです。
カメラ配置:正面+左右15度
15° 15° 被写体 カメラL カメラC カメラR
3台を狭い扇形に置きます。左右の開きが小さいほど映像の重なりが増え、再構成が安定するようです。
スマホ6台で360度を狙うのとは真逆のアプローチです。3台を近い角度に集中させることで、「客席の最前列で頭を少し動かしたときの視差」を再現します。ライブやダンスの記録では、この配置が没入感の高い6DoF映像(前後左右と上下、さらに見る向きまで自由に動かせる映像)を生み出します。

異なる画角(焦点距離)の扱い

3台のカメラにそれぞれ異なるレンズ(たとえば25mm、35mm、50mm)を付けても問題ありません。COLMAPが各カメラの内部パラメータ(焦点距離、歪み係数)を個別にキャリブレーションしてくれます。ただし、あまりに画角が異なると重なり領域が減って品質が落ちるので、近い焦点距離で揃える方が安定します。

処理前のリサイズ推奨

5.7Kのフルサイズで4DGSを学習させると、処理時間が膨大にふくらみます。30秒の動画でも8時間以上かかる見込みです。現実的には、処理前にffmpegで1080p〜2Kにリサイズすることを強くおすすめします。
# ffmpegで2Kにリサイズする例
ffmpeg -i input_5.7k.mp4 -vf scale=2048:-1 -c:v libx264 -crf 18 output_2k.mp4
5.7Kで撮影する意味は「情報を最大限記録しておく」ことにあります。リサイズは後からいくらでもできますが、低解像度で撮った映像を後から高精細にすることはできません。
調査メモ: 公開されている作例やユーザー報告を見る限り、高解像度ソースを2Kにリサイズして処理したものは、スマホ1080p由来の4DGSと比べて差が出るとされています。特に被写体のエッジ(輪郭線)のシャープさと、背景と被写体の分離がきれいに出やすいようです。リサイズしてもソースの情報量が効いてくる、ということのようです。
スポンサーリンク

処理時間の目安

4DGSで一番気になるのは「どれくらい時間がかかるのか」でしょう。解像度別・動画の長さ別に処理時間の目安をまとめました。いずれもRTX 3090(24GB VRAM)を想定した推定値です。

解像度別(30秒の動画、5fps抽出、RTX 3090)

入力解像度COLMAP4DGS学習合計目安VRAM使用量
1080p10〜20分20〜40分約1時間8〜12GB
2K20〜40分40〜80分約2時間12〜16GB
4K40〜90分1〜3時間約4時間16〜24GB
5.7K1〜2時間3〜6時間+約8時間24GB+(ギリギリ)

動画の長さ別(1080p、5fps抽出、RTX 3090)

長さフレーム数COLMAP4DGS学習合計目安出力サイズ
5秒25枚3〜5分5〜10分約15分数十MB
30秒150枚10〜20分30〜60分約1時間100〜300MB
1分300枚20〜40分1〜2時間約2.5時間300〜600MB
5分1,500枚1〜2時間5〜10時間約半日1〜3GB
10分3,000枚3〜5時間12〜24時間約1日3〜6GB

解像度別:VRAM使用量(30秒動画、RTX 3090)

1080p
10 GB
2K
14 GB
4K
20 GB
5.7K
24 GB

解像度別:合計処理時間(30秒動画、RTX 3090)

1080p
1 時間
2K
2 時間
4K
4 時間
5.7K
8 時間

VRAMと処理時間の関係式

4DGSの処理時間とVRAM使用量は、入力解像度と動画の長さに概ね比例します。公開されている報告値を整理すると、概ね以下の関係が読み取れます。
VRAM使用量 ≒ 基準(8GB) × (解像度/1080p)² × カメラ台数補正
処理時間   ≒ 基準(1h) × (解像度/1080p)² × (動画長/30秒) × カメラ台数
要点: 解像度を2倍にすると、VRAMも処理時間も約4倍に増えます(2乗で効きます)。1080pから4Kは解像度が約2倍なので、処理時間は約4倍の4時間。5.7Kは約2.8倍なので、8倍近い8時間。「まず1080pで試す → うまくいったら2Kに上げる」というアプローチが、時間の無駄を防ぐ最も合理的な進め方です。

この表の読み方ガイド

まず5秒のクリップから試してください。目安どおりなら15分ほどで結果が出るので、設定やカメラ配置の試行錯誤が高速に回せます。 ※ 処理時間についての注意: 上記の時間は4DGS論文(CVPR 2024、NVIDIA A6000 GPUで5秒動画=約8分)を基準に推定した目安です。RTX 3090はA6000とVRAM容量(24GB vs 48GB)や演算性能が異なるため、実際の処理時間は変わります。シーンの複雑さ(動きの量、テクスチャの細かさ)や解像度によっても大幅に変動します。RTX 3090での実測データは、環境を構築でき次第追記予定です。 30秒で合計約1時間は覚悟が必要です。1回の試行に1時間かかるということは、パラメータを変えて5回やり直すと5時間。最初は短いクリップで設定を追い込んでから本番に臨む方が効率的です。 5分以上は一晩放置する前提です。就寝前に学習を開始し、翌朝に結果を確認する運用が現実的でしょう。 5.7Kフルサイズでの4DGS学習は、報告値ベースではRTX 3090でもVRAM 24GBをほぼ使い切るようです。OOM(Out of Memory)で落ちるリスクがあるので、1080p〜2Kにリサイズして処理する方が現実的です。

クラウドに任せる場合と、自前で処理する場合

項目クラウドに任せる自前処理(RTX 3090)
処理時間20〜30分1時間〜半日
コストサービス料または借りたGPUの時間料金電気代のみ(RTX 3090で約0.35kW)
最大解像度高解像度は非推奨GPUのVRAM次第(24GBで4Kまで)
データの場所クラウドに送信完全ローカル保持
カスタマイズ不可(サービス側の設定固定)パラメータ調整可能(学習率、反復回数など)
再現性サービス側のバージョンに依存コードとモデルを手元に保持
自前処理の最大のメリットは「データを外に出さなくて済む」ことです。子どもの映像や、許諾が必要な出演者の映像など、プライバシー面でクラウド送信に抵抗がある場合は、ローカル処理一択です。 逆に、「とにかく早く結果を見たい」「GPU環境がない」ならクラウドに任せるのが合理的です。ただし4DGSを丸ごと引き受けてくれるサービスはまだ無いので、当面はGPUを時間貸しで借りて自分で回す形になりそうです。

どこで見る?再生プラットフォーム比較

4DGSを作っても、再生環境がなければ意味がありません。2026年4月時点での主要な再生プラットフォームを比較します。
プラットフォームデバイス3DGS対応4DGS対応費用備考
4DGS.jp(Web)ブラウザ無料手元で生成した4DGSデータのストリーミング再生
BDViewerQuest 3無料3DGSの再生品質が高い。4DGSは実験的対応
ScaniverseQuest 3/3S×無料Nianticが開発。3DGSの閲覧に特化
WebXR(Gracia AI)Quest/Pico/Vision Pro要問合せWebXR経由で各種HMDに対応。法人向けの色が強い
Unity自作PCVR/Quest無料(開発コスト)自由度は最高だが開発スキルが必要
調べた範囲では、まず無償公開されているWebビューワーで見て、VRで見たい場合はUnityで自作するのが現状の流れのようです。 Quest 3向けのネイティブ4DGSビューワーは2026年4月時点ではまだ成熟しておらず、BDViewerの4DGS対応も実験的な段階です。 Gracia AIのWebXRは法人利用がメインですが、技術的にはQuest、Pico、Vision Proの各デバイスをWebブラウザ経由でサポートしているのが強みです。将来的にこういったプラットフォームが個人にも開放されれば、デバイスを選ばない4DGS再生が普通になるかもしれません。
スポンサーリンク

コスト vs 品質:散布図で見る各方法の立ち位置

4DGSにかかる追加費用と、得られる映像品質の関係を整理しました。

[散布図データ]

  • X軸: 追加費用(円)。PCは手持ちのものを使う前提で、カメラなど新しく買う必要のあるものだけを数えています
  • Y軸: 4D映像品質スコア(10点満点)
方法追加費用 (X)品質 (Y)備考
スマホ3台 + 100均三脚 + RTX 3090(手持ち)1,500円6三脚代のみ。コスパ最強
スマホ6台 + 三脚 + RTX 30903,000円7360度カバーで穴が減る
ミラーレス3台 + RTX 309060万円81台20万円前後×3台。すでに3台お持ちなら0円
プロスタジオ(20台+)50万円〜10放送・映画レベルの品質
品質
2
4
6
8
10
スマホ3台+三脚
スマホ6台+三脚
ミラーレス3台(新規に買うと60万円)
プロスタジオ(20台以上)
0
1,000
3,000
10,000
100,000
500,000
追加費用(円)
左上に寄るほど、少ない出費で高い品質が得られます。すでに持っている機材の費用は含みません。

散布図の読み方ガイド

  • 左上に近いほどコスパが良い方法です。追加費用が少ないのに品質が高い
  • ミラーレス3台は、右端のプロスタジオのすぐ隣にいます。5K以上で撮れる機種は1台20万円前後が多く、3台で60万円ほど。品質は8で、10のプロスタジオには届きません。費用の割に合わない位置です。すでに3台お持ちなら費用0で左端へ移りますが、ミラーレスを3台持っている方はそう多くないと思います
  • スマホ3台+三脚(1,500円)が最もバランスの良い選択肢です。品質6/10は「動きのある被写体が3D空間で見られて、角度も変えられる。ただし穴や歪みは目立つ」というレベル。個人の記録用途なら十分実用的です
  • プロスタジオ(50万円〜)は別次元です。カメラ20台以上を専用スタジオに設置し、照明・背景まで制御します。商業映像向けなので、個人が目指す必要はありません

技術的な制約と限界

4DGSは万能ではありません。2026年時点での主要な制約を把握しておくことが重要です。

動きの速さに上限がある

モーションブラー(被写体ブレ)が大きいフレームは、4DGSの学習で正しく処理できません。シャッター速度が1/60秒の場合、その間に被写体が大きく動くとフレームがぼやけ、特徴点の推定精度が落ちます。
  • 立ち位置が動かない動作(歌う、話す、手元の作業): ○ 体幹の動きが小さく、手の動きも比較的予測しやすい
  • ゆっくりした踊り(日舞、太極拳): ○ 動きが滑らかで破綻しにくい
  • 激しいダンス(ブレイクダンス、ヒップホップ): △ 手足の速い動きでゴーストが出やすい
  • スポーツ(バスケ、バドミントン): △〜× ボールやラケットの速度がシャッター速度を超える
対策としては、シャッター速度を上げる(1/250秒以上)ことです。ただし暗くなるので照明が必要です。

髪の毛・透明物体・反射面が苦手

これは3DGSから引き継いだ弱点です。髪の毛のような細い構造、ガラスや水のような透明物体、金属の反射面は、Gaussian Splattingが正しく表現しにくい。4DGS固有の問題ではありませんが、動く被写体では髪の毛の揺れが加わるので、静止時よりさらに難易度が上がります。 2026年に入って、髪の毛の表現を改善する論文(GaussianHair等)が発表されていますが、まだ実装が広く使える段階にはなっていません。

照明変化に弱い

スポットライトが明滅するステージ演出、窓から差し込む日光の変化など、撮影中に照明が変わると4DGSの品質が大幅に低下します。Gaussian Splattingは「各ガウス球の色」を学習するため、照明変化でその色が変わると整合性が取れなくなります。 なるべく均一で安定した照明下で撮影するのが理想です。

カメラ台数と死角の関係

カメラの台数が少ないと、撮影されていない角度は文字通り「穴が空く」状態です。3台で正面側120度をカバーしても、背面側240度は情報がない。4DGSのアルゴリズムはある程度補完してくれますが、見たことのない角度の品質は明らかに落ちます。

VRでのスケール感

4DGSで生成した映像をVRヘッドセットで見ると、人物のサイズが実際と異なって見えることがあるとの報告があります。カメラのキャリブレーションが正確でないと、巨人のようにも小人のようにも見えてしまう。Unity等でVRコンテンツに組み込む際は、実寸との合わせ込みが必要です。
スポンサーリンク

実用シナリオ:4DGSを何に使うか

技術として面白いだけでなく、実際にどんな場面で役立つのか。現時点で見えている用途を5つ挙げます。

1. 子どもの成長記録を空間映像で残す

写真や動画では「その時見ていた角度」からしか振り返れません。4DGSなら、子どもが歩いている姿を後から任意の角度で見返せます。5年後、10年後にVRヘッドセットで「あの頃の空間」に入り直す体験は、フラットな動画とは質的に異なるものになるでしょう。 スマホ3台+100均三脚で始められるので、コスト的にもハードルは低い。ただし、クラウドサービスに子どもの映像を送ることに抵抗がある場合は、ローカル処理を選択するのが安心です。

2. ダンス・スポーツのフォーム確認

自分の動きを正面だけでなく横や後ろから確認できます。ダンスの練習で「鏡で見た自分」と「他人から見た自分」のギャップを埋めるのに有効です。スポーツのコーチングでも、選手に「斜め後ろからの視点」を見せることで、通常のビデオ分析では伝えにくいポイントを共有できます。

3. 不動産の内覧(動く人入りバーチャルツアー)

MatterportやPolycamで作る静的な3Dツアーは増えていますが、人が動いている生活感のある空間は作れませんでした。4DGSなら、リビングで家族がくつろいでいる空間を丸ごとバーチャルツアー化できます。不動産内覧の文脈では「実際に人が暮らしている感じ」が伝わるのは大きい。

4. ライブやイベントの記録

ライブや発表会、イベントを4DGSで記録すれば、自分が座っていた席からの視点だけでなく、ステージ上の視点や真横からの視点で見返せます。ただし、出演者の肖像権・パブリシティ権への配慮が必須です。無断で4DGS化して公開することは、通常の動画撮影以上にセンシティブな問題を含みます(3Dデータは顔の立体情報を含むため)。必ず事前に出演者の許諾を取ってください。

5. VRChat等のアバター素材

4DGSで生成した人物の動きデータを、VRChat等のアバターアニメーションの参考にする使い方もあります。直接4DGSデータをアバターとして使うのは現状では難しい(メッシュ変換が必要)ですが、動きのリファレンスとしては有用です。将来的に4DGSデータをリアルタイムでストリーミング表示する技術が成熟すれば、「リアルの自分がそのままVR空間に入る」ことも視野に入ってきます。

まとめ:できるのかどうか

調べた範囲での結論は、できそうだというものです。ただし段階によって前提が変わります。
  • スマホ1台+クラウド: 構想は発表されているが、まだ提供されていない
  • スマホ3〜6台 + 自前処理: 三脚代1,500〜3,000円で品質が一段上がる。RTX 3090があればローカルで完結
  • ミラーレス3台 + タイムコード同期: 5K以上の情報量とフレーム精度の同期で、プロに迫る品質。ただし新規に買うと60万円ほどで、すでに持っている方向けです
手軽なクラウドの入口はまだ無いので、実質の出発点は中級編です。それでも三脚代だけで始められるので、まず動くかどうかを確かめてから機材を足す、という順で進められます。 まずは5秒のクリップから始めるのが良さそうです。目安どおりなら15分ほどで結果が出ます。うまくいったら30秒に伸ばす。30秒が安定したら1分、5分と広げていく。最初から5分の長回しを処理しようとすると、半日かけて失敗した時の痛手が大きい。短いクリップで設定を追い込む、これが調べた限りでの4DGSの鉄則のようです。 静止物の3Dスキャンがスマホアプリで当たり前になったように、動く人の3D記録も数年以内に「誰でもできること」になりそうです。

調べてみて、どう思ったか

意外だったのは、いちばん重いはずの処理側が、すでに手元で足りていたことでした。RTX 3090 の24GBがあれば、中級編までは自前で回せる計算でした。 足りないのはカメラ側だけです。スマホを数台と、固定するための三脚。ここは数千円の話でした。 この方法であれば、いま持っている機材で実行できそうだ、というのが調べた結論です。あとは実際にやってみるだけになりました。撮ってみたら、また記録します。
関連記事
スマホで撮った写真から3Dモデルを作る:フォトグラメトリ入門 — 静止物の3Dスキャンはこちらで整理しています。

参考にした情報

記事内で取り上げた機材

【中古】MSI GeForce RTX 3090 GAMING X TRIO 24GB

¥148,000 Amazon・2026/5/1調べ

【中古】ELSA GeForce RTX 3060 12GB

【中古】ELSA GeForce RTX 3060 12GB

¥52,800 Amazon・2026-06-22調べ

スポンサーリンク