Long Zhuo

Research Engineer · ACE Robotics

Long Zhuo

Computer vision · generative modeling · embodied intelligence

I am a Research Engineer at ACE Robotics, previously at Shanghai AI Laboratory, working at the intersection of computer vision, generative modeling, and embodied intelligence. My research focuses on video generation, 3D/4D visual computing, world models, and multimodal data engines for embodied agents, with an emphasis on understanding and generating dynamic visual worlds.

My recent work spans efficient video synthesis, 4D content generation and evaluation, digital-human datasets, and human–scene interaction. I work closely with Dr. Liang Pan and Prof. Ziwei Liu.

Research interests. Video generation · 3D/4D visual computing · world models · embodied AI.

Recent updates

News

Research output

Publications

Selected papers, datasets, and benchmarks in chronological order. See the full list on Google Scholar →

arXivnew
ACE-Data-0 multimodal capture and annotation overview

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

Yukang Cao*, Haozhe Xie*, Beichen Wen*, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu

A human-centric capture system and dataset with 150 hours, 17M video frames, 200 household task categories, 50 participants, two environments, and 75,000 interaction episodes.