Reducing Bandwidth Without Sacrificing Quality in Virtual Reality

ENG: Researchers at NYU Tandon have developed a new method for streaming immersive 3D content that could significantly improve AR/VR experiences. Instead of following the traditional two-step approach, predicting where a user will look and then calculating visible content, this system directly predicts what will be visible in the scene. The method breaks 3D space into “cells” and uses a combination of transformer-based graph neural networks to understand spatial relationships and recurrent neural networks to track how visibility changes over time. This direct approach boosts accuracy and reduces the prediction errors that often come with more complex models.

Credit: NYU

One of the standout features is its ability to forecast what a user will see 2 to 5 seconds ahead, far beyond the fraction-of-a-second predictions in existing systems. That longer window makes a big difference for pre-recorded VR experiences like 3D dance instruction, allowing them to stream smoothly on standard devices without needing high-bandwidth connections. The team reports up to a 7x reduction in data requirements while still delivering high-quality visuals at over 30 frames per second. With this advancement, more responsive and accessible AR/VR content may soon become available for everyday use.

RO: Cercetătorii de la NYU Tandon au dezvoltat o nouă metodă de transmitere a conținutului 3D imersiv care ar putea îmbunătăți semnificativ experiențele AR/VR. În loc să urmeze abordarea tradițională în doi pași, prezicând unde se va uita un utilizator și apoi calculând conținutul vizibil, acest sistem prezice direct ce va fi vizibil în scenă. Metoda împarte spațiul 3D în „celule” și utilizează o combinație de rețele neuronale grafice bazate pe transformare pentru a înțelege relațiile spațiale și rețele neuronale recurente pentru a urmări modul în care vizibilitatea se modifică în timp. Această abordare directă sporește acuratețea și reduce erorile de predicție care apar adesea în modele mai complexe.

Una dintre caracteristicile remarcabile este capacitatea sa de a prognoza ce va vedea un utilizator cu 2 până la 5 secunde înainte, cu mult peste predicțiile de fracțiuni de secundă din sistemele existente. Această fereastră mai lungă face o mare diferență pentru experiențele VR preînregistrate, cum ar fi lecțiile de dans 3D, permițându-le să transmită fără probleme pe dispozitive standard, fără a avea nevoie de conexiuni cu lățime de bandă mare. Echipa raportează o reducere de până la 7 ori a cerințelor de date, furnizând în același timp imagini de înaltă calitate la peste 30 de cadre pe secundă. Datorită acestui progres, conținutul AR/VR mai receptiv și mai accesibil ar putea deveni în curând disponibil pentru utilizarea zilnică.

Source (NYU Tandon School of Engineering, “3D streaming gets leaner by seeing only what matters”, 08.04.2025)

Paper: Li, C., Zong, T., Hu, Y., Wang, Y. and Liu, Y., 2025, March. Spatial Visibility and Temporal Dynamics: Rethinking Field of View Prediction in Adaptive Point Cloud Video Streaming. In Proceedings of the 16th ACM Multimedia Systems Conference (pp. 24-34).