Incremental 3D Scene Reconstruction for Autonomous Robots

ENG: Researchers at MIT have introduced a new artificial intelligence–based mapping system designed for robots operating in large, unpredictable environments. The work is motivated by search-and-rescue scenarios, where a robot must rapidly understand its surroundings and determine its own position while navigating hazardous terrain. To address the limitations of existing vision-based methods that can process only a small number of images at once, the researchers developed a solution that efficiently scales to thousands of images and produces accurate 3D maps in real time using only onboard cameras.

Credit: MIT

The proposed system constructs the environment incrementally by generating multiple small 3D submaps from short image sequences. Each submap captures local geometric structure, allowing the learning-based model to operate within its computational limits. Instead of reconstructing an entire scene in a single step, the method combines these partial reconstructions into a global map. This design enables fast mapping of large scenes while simultaneously estimating the robot’s camera poses, which are essential for localization.

A key methodological contribution addresses the challenge of aligning submaps that may contain geometric distortions introduced by learning-based reconstruction models. Drawing on principles from classical computer vision, the researchers developed a flexible mathematical formulation that models these deformations explicitly. This allows submaps to be aligned consistently through more general transformations rather than simple rigid motions. The approach leads to low reconstruction error without requiring camera calibration or manual system tuning, and it demonstrates robust performance on complex real-world scenes, including large indoor environments captured with handheld devices.

RO: Cercetători de la MIT au dezvoltat un nou sistem de cartografiere bazat pe inteligență artificială, conceput pentru roboți care trebuie să opereze în medii extinse și imprevizibile. Studiul pornește de la situații reale de căutare și salvare, în care un robot are nevoie să își construiască rapid o imagine clară a mediului și să știe permanent unde se află, în timp ce înaintează prin zone periculoase. Pentru a depăși limitele metodelor actuale bazate pe viziune, care pot procesa doar un număr mic de imagini simultan, cercetătorii au propus o soluție capabilă să gestioneze mii de imagini și să genereze hărți 3D precise în timp real, folosind exclusiv camerele montate pe robot.

Sistemul funcționează prin construirea treptată a mediului, sub forma unor subhărți 3D de dimensiuni reduse, obținute din secvențe scurte de imagini. Fiecare subhartă descrie structura geometrică locală, astfel încât modelul de învățare să poată lucra eficient din punct de vedere computațional. Ulterior, aceste reconstrucții parțiale sunt reunite într-o hartă globală coerentă, fără a fi nevoie de reconstruirea întregii scene dintr-o singură etapă. În același timp, sistemul estimează pozițiile camerelor, informație esențială pentru localizarea robotului în spațiu.

O dificultate majoră apare la alinierea subhărților, deoarece modelele bazate pe învățare pot introduce ușoare deformări geometrice. Pentru a rezolva această problemă, cercetătorii au apelat la concepte din viziunea computerizată clasică și au dezvoltat o metodă matematică mai flexibilă, capabilă să modeleze aceste deformări. Astfel, subhărțile pot fi aliniate corect prin transformări mai generale decât simplele rotații și translații. Rezultatul este o reconstrucție 3D cu erori reduse, obținută fără calibrarea prealabilă a camerelor sau ajustări manuale, care funcționează fiabil și în scene reale complexe, inclusiv în spații interioare de mari dimensiuni.

Source (Adam Zewe, MIT News, “Teaching robots to map large environments”, 05.11.2025)

Paper: Maggio, D., Lim, H. and Carlone, L., 2025. Vggt-slam: Dense rgb slam optimized on the sl (4) manifold. arXiv preprint arXiv:2505.12549.