Domaine 02 · Gaussian splatting

Des environnements 3D photoréalistes, à partir de photos

Quelques centaines de photographies suffisent : la scène est reconstruite en millions de gaussiennes, et s'affiche en temps réel avec ses reflets et ses matières.

Démonstration

Des photographies à la scène 3D navigable

Scènes réelles reconstruites à partir de photographies, comparées aux méthodes précédentes. Images de l'équipe de recherche GraphDeco (Inria, Université Côte d'Azur), à l'origine de la méthode.

  1. 01

    Avant

    Des photographies ordinaires, prises autour du sujet.

  2. 02

    Pendant

    Des millions de gaussiennes ajustées jusqu'à reproduire chaque photo.

  3. 03

    Après

    Une scène 3D libre de mouvement, affichée à plus de 100 images par seconde.

Ce que c'est

Une scène faite de millions de gaussiennes

Le Gaussian splatting décrit une scène non pas par des surfaces, mais par des millions de petits nuages colorés, flous sur les bords, qui se superposent pour former l'image.

Chaque gaussienne est un ellipsoïde défini par cinq propriétés : sa position dans l'espace ; sa forme et son orientation (on peut l'étirer en aiguille ou l'aplatir en disque) ; son opacité ; et sa couleur, qui peut varier selon l'angle de vue. C'est ce dernier point qui rend les reflets, les vernis, le métal et le verre, là où la photogrammétrie classique échoue.

Pour afficher la scène, chaque gaussienne est projetée sur l'écran sous forme de tache elliptique : c'est le splatting. Les taches sont triées de la plus lointaine à la plus proche, puis fondues les unes sur les autres. Aucun réseau de neurones n'intervient à l'affichage : c'est de la rastérisation, le travail pour lequel les cartes graphiques sont faites. D'où des performances de jeu vidéo, plus de cent images par seconde, avec une qualité photographique.

Ce que ça change par rapport aux autres méthodes

  • Face à la photogrammétrie et au maillage : la végétation, les cheveux, les surfaces brillantes ou transparentes sont restitués fidèlement, sans « fondre » en surfaces molles.
  • Face aux champs de radiance neuronaux (NeRF) : même niveau de réalisme, mais un affichage cent à mille fois plus rapide, compatible avec le web et la réalité virtuelle.
  • Face à la modélisation 3D manuelle : des jours de travail d'artiste remplacés par une capture de quelques minutes et un calcul de quelques dizaines de minutes.

Pour quoi faire

  • Des environnements 3D immersifs pour le web, les casques de réalité virtuelle et les applications.
  • Le patrimoine, l'immobilier de prestige, le tourisme : un lieu montré tel qu'il est, lumière comprise.
  • Le produit et l'e-commerce : un objet réel, tournant sous tous les angles.
  • Le cinéma et la publicité : décors réels réutilisés en production virtuelle.
  • La simulation : des jumeaux photoréalistes pour entraîner et tester robots et véhicules.

Comment c'est fait

De la capture à l'affichage temps réel

  1. 01

    Capture

    100 à 300 photographies, ou une vidéo, en tournant autour du sujet ou en parcourant le lieu. Lumière constante, fort recouvrement.

  2. 02

    Poses des caméras

    Retrouver d'où chaque image a été prise : structure from motion, ou un modèle de reconstruction directe.

  3. 03

    Initialisation

    Les points 3D obtenus deviennent les premières gaussiennes.

  4. 04

    Optimisation

    Des dizaines de milliers d'itérations sur GPU : on rend l'image, on la compare à la photo, on corrige chaque gaussienne.

  5. 05

    Densification

    Là où le détail manque, les gaussiennes se dédoublent ; les inutiles, transparentes, sont retirées.

  6. 06

    Diffusion

    Compression, puis affichage temps réel dans un navigateur, un casque ou un moteur 3D.

La capture décide de tout

La méthode n'invente rien : elle ne restitue que ce que les photos ont vu. Il faut donc couvrir chaque zone sous plusieurs angles, avec un fort recouvrement entre images, une exposition fixe et une lumière qui ne change pas pendant la prise de vue. Une vidéo lente, ou une série de photographies en cercles concentriques, suffit pour un objet ; un lieu se parcourt pièce par pièce, comme pour une visite.

Retrouver les caméras

Avant d'apprendre la scène, il faut savoir d'où chaque image a été prise. Le structure from motion apparie des milliers de détails d'une photo à l'autre et en déduit à la fois la position des caméras et un nuage de points clairsemé. Depuis 2024, des modèles de reconstruction directe produisent ce résultat en une seule passe, en quelques secondes.

L'optimisation : apprendre par comparaison

Les points de départ deviennent des gaussiennes. Puis la boucle commence : on rend l'image depuis la position d'une photo, on mesure l'écart avec la vraie photo (une combinaison d'erreur pixel à pixel et de similarité de structure), et l'on corrige chaque paramètre de chaque gaussienne dans la direction qui réduit l'écart. Le rendu étant différentiable, cette correction se calcule exactement. Quelques dizaines de milliers d'itérations, soit de quelques minutes à une heure sur une carte graphique récente, suffisent pour une scène.

Pendant l'optimisation, la scène s'adapte : là où l'erreur reste forte, les gaussiennes sont clonées ou divisées pour ajouter du détail ; celles qui deviennent transparentes sont élaguées. Une scène finale compte de quelques centaines de milliers à plusieurs millions de gaussiennes.

Compresser et diffuser

Brute, une scène pèse facilement plusieurs centaines de mégaoctets : chaque gaussienne porte une soixantaine de valeurs. La compression combine élagage, réduction des coefficients de couleur, quantification et codage par blocs, jusqu'à des tailles compatibles avec le web. L'affichage se fait alors dans le navigateur (WebGL, WebGPU), dans un casque, ou dans les moteurs de jeu grâce à des extensions dédiées.

Les limites, à connaître

  • La lumière est figée : elle est « cuite » dans la scène. Rééclairer reste un sujet de recherche.
  • L'édition est délicate : déplacer un objet ou retoucher une zone n'est pas aussi simple que sur un maillage.
  • La mesure est indirecte : pour des cotes fiables, on couple le splatting à un relevé, ou l'on en extrait une surface.
  • Hors du champ capturé, rien : une zone jamais photographiée apparaît floue ou peuplée de flotteurs.
Gaussienne 3D
Un petit nuage ellipsoïdal, flou sur les bords, défini par une position, une forme, une orientation, une opacité et une couleur.
Covariance
Ce qui donne à chaque gaussienne sa forme étirée et son orientation : une échelle sur trois axes et une rotation.
Harmoniques sphériques
Une manière de coder une couleur qui change selon l'angle de vue : reflets, brillances, matières satinées.
Splatting
« Écraser » chaque gaussienne sur l'image comme une tache elliptique, puis les superposer de l'arrière vers l'avant.
Rendu différentiable
Un rendu dont on peut calculer comment l'image change si l'on modifie un paramètre : c'est ce qui permet l'apprentissage.
Flotteurs
Des gaussiennes parasites, suspendues dans le vide, là où les photos manquaient d'information.

Recherche & évolutions 2026

Trois ans qui ont transformé le rendu 3D

Présenté à SIGGRAPH en 2023 par une équipe de l'Inria, le Gaussian splatting est devenu en moins de trois ans l'un des sujets les plus actifs de l'informatique graphique, avec des milliers de travaux dérivés. La recherche avance sur quatre fronts : la qualité (anticrénelage, reflets), la géométrie (extraire des surfaces mesurables), la compacité (des scènes diffusables) et le mouvement (des scènes qui vivent dans le temps).

Tendance 2026

Moins de photos, moins d'attente

Les modèles de reconstruction directe fournissent caméras et géométrie initiale en une passe : la capture se simplifie, et le délai entre la prise de vue et la scène se raccourcit.

Tendance 2026

Un format qui se normalise

La compression progresse vite, et des travaux de normalisation sont engagés pour que les scènes par gaussiennes circulent entre outils, comme les maillages avec glTF.

Tendance 2026

Des scènes qui bougent

Le splatting dynamique étend la méthode au temps : des scènes filmées que l'on revoit sous n'importe quel angle, vers la vidéo volumétrique.

Tendance 2026

Générer plutôt que capturer

Des modèles génératifs produisent désormais des mondes 3D directement sous forme de gaussiennes, à partir d'une image ou d'un texte : la frontière entre relevé et création s'estompe.

Les publications de référence

  • 2025
    VGGT: Visual Geometry Grounded Transformer

    J. Wang, M. Chen, N. Karaev, A. Vedaldi, C. Rupprecht, D. Novotny · CVPR 2025

    La position des caméras et la géométrie initiale prédites en une passe : l'étape la plus fragile de la chaîne, jusque-là confiée à une optimisation longue, devient quasi instantanée.

  • 2024
    Mip-Splatting: Alias-free 3D Gaussian Splatting

    Z. Yu, A. Chen, B. Huang, T. Sattler, A. Geiger · CVPR 2024

    Supprime le crénelage et les scintillements quand on zoome ou qu'on s'éloigne, grâce à un filtrage 3D et 2D des gaussiennes. Indispensable pour une visite où l'on change constamment de distance.

  • 2024
    SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction

    A. Guédon, V. Lepetit · CVPR 2024

    Travaux de l'École des Ponts ParisTech : les gaussiennes sont contraintes à se coucher sur les surfaces, ce qui permet d'en extraire un maillage éditable en quelques minutes.

  • 2024
    2D Gaussian Splatting for Geometrically Accurate Radiance Fields

    B. Huang, Z. Yu, A. Chen, A. Geiger, S. Gao · SIGGRAPH 2024

    Remplace les ellipsoïdes par des disques plats orientés : la géométrie devient cohérente d'un point de vue à l'autre, et les surfaces reconstruites nettement plus justes.

  • 2024
    Gaussian Opacity Fields: Efficient Adaptive Surface Reconstruction in Unbounded Scenes

    Z. Yu, T. Sattler, A. Geiger · SIGGRAPH Asia 2024

    Extrait directement des gaussiennes une surface détaillée, y compris pour des scènes extérieures sans limites : la mesure et le photoréalisme à partir de la même capture.

  • 2024
    Scaffold-GS: Structured 3D Gaussians for View-Adaptive Rendering

    T. Lu, M. Yu, L. Xu, Y. Xiangli, L. Wang, D. Lin, B. Dai · CVPR 2024

    Organise les gaussiennes autour d'ancres structurées : moins de redondance, un stockage réduit et une meilleure tenue aux changements de point de vue.

  • 2024
    LightGaussian: Unbounded 3D Gaussian Compression with 15× Reduction and 200+ FPS

    Z. Fan, K. Wang, K. Wen, Z. Zhu, D. Xu, Z. Wang · NeurIPS 2024

    Élagage des gaussiennes peu utiles, distillation des couleurs et quantification : une scène quinze fois plus légère, sans perte visible. La compression est ce qui rend le splatting diffusable sur le web.

  • 2024
    3D Gaussian Splatting as Markov Chain Monte Carlo

    S. Kheradmand, D. Rebain, G. Sharma, W. Sun, Y.-C. Tseng, H. Isack, A. Kar, A. Tagliasacchi, K. M. Yi · NeurIPS 2024

    Remplace les règles empiriques de densification par un cadre probabiliste : un budget de gaussiennes maîtrisé, et une qualité moins dépendante des réglages.

  • 2024
    4D Gaussian Splatting for Real-Time Dynamic Scene Rendering

    G. Wu, T. Yi, J. Fang, L. Xie, X. Zhang, W. Wei, W. Liu, Q. Tian, X. Wang · CVPR 2024

    Des gaussiennes qui se déforment dans le temps : des scènes en mouvement, filmées puis revisitées sous n'importe quel angle. La voie vers la vidéo volumétrique.

  • 2023
    3D Gaussian Splatting for Real-Time Radiance Field Rendering

    B. Kerbl, G. Kopanas, T. Leimkühler, G. Drettakis · SIGGRAPH 2023 · ACM Transactions on Graphics

    L'article fondateur, issu de l'Inria et de l'Université Côte d'Azur. Il montre qu'une scène faite de millions de gaussiennes, optimisée à partir de photos, atteint la qualité des meilleures méthodes neuronales tout en s'affichant à plus de cent images par seconde.

  • 2022
    Instant Neural Graphics Primitives with a Multiresolution Hash Encoding

    T. Müller, A. Evans, C. Schied, A. Keller · SIGGRAPH 2022 · ACM Transactions on Graphics

    Fait passer l'apprentissage d'une scène neuronale de plusieurs heures à quelques secondes. Il a prouvé que la capture par apprentissage pouvait devenir pratique.

  • 2020
    NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

    B. Mildenhall, P. P. Srinivasan, M. Tancik, J. T. Barron, R. Ramamoorthi, R. Ng · ECCV 2020

    Le prédécesseur : une scène apprise par un réseau de neurones interrogé le long de chaque rayon. Un réalisme saisissant, mais des secondes par image là où le splatting en demande quelques millisecondes.

Collaborer

Un sujet technique qui résiste ?

Faisabilité, méthode, mesure du résultat.

Proposer un projet