B
B9
Text
Jiajun Deng1, Tianyu He2, Li Jiang3, Tianyu Wang4, Feras Dayoub1, Ian Reid1,4
3D Large Multimodal Models let a language model reason about and converse over 3D scenes, but existing systems rely on complicated pipelines - offline multi-view feature extraction, region-proposal g…