众力资讯网

你手里一台 iPhone 15 Pro,背面三颗摄像头;Vision Pro 两

你手里一台 iPhone 15 Pro,背面三颗摄像头;Vision Pro 两只眼睛同步看世界;光场相机一次能记几十个方向。可真到做 NeRF / 3DGS 重建时,大家的默认动作却是:挑一路,当单目视频用,剩下那几路直接扔掉。

理由是,镜头挨得太近,基线小,视差小,能提供的几何信息约等于零。

但论文《Sparse Light Field Sampling Improves Casual 3D and 4D Reconstruction》把这个"顺理成章"验了一遍,结论是:小基线不等于零信息。

哪怕 Lytro 那种只有 0.74° 的视角差,也能实实在在改善重建。收益最大的,恰好是单目最抓瞎的两种情形:只有一次曝光,以及场景在动。

单目相机在同一个瞬间只能给你一张二维投影,它分不清画面变化到底是相机动了、物体动了,还是物体几何本来就不同。想靠单目攒出视角差,就得让相机动起来、多拍几帧;单曝光等于一张图,什么角度信息都没有。多摄哪怕离得近,提供的是"同一时刻、不同方向"的观测,直接把这个纠缠解开了。所以数据上,动态场景重建的 PSNR 提升高达 7dB,是全文最狠的一档。

论文还自研了一台"复用式光场相机",故意让多路子视角的画面在传感器上重叠,原始图看着更乱,但每个子视角分到的像素反而更多、细节更保得住。

落到工程上就一条建议:以后录 3D/4D 数据,别只存主摄那一路。把全部同步流、标定、曝光参数都存下来。今天看着多余的几度视差,很可能就是未来算法解几何歧义时缺的那道约束。