MIPAL

Multimodal Intelligence & Physical Application Lab

Spatial Intelligence Group (SIG), Tongji University

MIPAL (Multimodal Intelligence & Physical Application Lab) is a research group within the Spatial Intelligence Group (SIG) at Tongji University, led by Dr. Xun Jiang. Our team is also working closely with Koala URAN Ltd. towards real-world applications in spatial intelligence.

Our research spans multimodal learning, spatial intelligence (particularly from an egocentric view), and VLM/LLM reasoning enhancement. We are also highly interested in embodied multimodal spatial perception and navigation.

We are currently recruiting Master's and Doctoral students for enrollment in 2027. If you are a diligent student who enjoys multimodal research and practical robotic applications, you are highly welcome to join MIPAL and grow together with us!

  • Multimodal Learning
  • Egocentric / Spatial Intelligence
  • VLM/LLM Reasoning
  • Embodied Perception & Navigation

Join Us GitHub

News

People

Faculty & Guest Faculty

Xun Jiang
Xun Jiang
Tongji University
Jingran Zhang
Jingran Zhang
Koala URAN Ltd.
Lei Wang
Lei Wang
Tongyi Lab

PhD Students

Q
Qin Li
Ph.D Student (2026-)
C
Chen Wu
Ph.D Student (2026-)

Master’s Students

Chong Liu
Chong Liu
Master’s Student (2024-)
Shuangle Li
Shuangle Li
Master’s Student (2024-)
Pengqi Chen
Pengqi Chen
Master’s Student (2024-)
Kaiyuan Deng
Kaiyuan Deng
Master’s Student (2024-)
Y
Yufan Gu
Master’s Student (2025-)
Z
Ziheng Zhang
Master’s Student (2026-)
L
Le Bo
Master’s Student (2026-)
S
Siyuan Zeng
Master’s Student (2026-)
Jiankang Zhao
Jiankang Zhao
Master’s Student (2026-)

Visiting Members

Qichen Tan
Qichen Tan
Visiting Scholar
S
Shenshen Li
Visiting Ph.D Student
C
Chen He
Visiting Ph.D Student
S
Simiao Wang
Undergraduate
Z
Zeyang Liu
Undergraduate
K
Kaiwen Tan
Undergraduate

Applications

Publications

Selected Journal Papers

Egocentric Online Action Segmentation via Parametric Context Memory Learning

Egocentric Online Action Segmentation via Parametric Context Memory Learning

Xun Jiang, Xing Xu, Chong Liu, Zheng Wang, Jingkuan Song, Zhe Sun, Andrzej Cichocki, Heng Tao Shen

IEEE Transactions on Image Processing · TIP 2026

Egocentric Vision; Temporal Action Segmentation; Parametric Memory

Generalizable Egocentric Task Verification Via Cross-Modal Hybrid Hypergraph Matching

Generalizable Egocentric Task Verification Via Cross-Modal Hybrid Hypergraph Matching

Xun Jiang, Xing Xu, Zheng Wang, Jingkuan Song, Fumin Shen, Heng Tao Shen

IEEE Transactions on Pattern Analysis and Machine Intelligence · TPAMI 2026

Egocentric Vision, Cross-modal Task Verification, Hypergraph Learning

Egocentric Online Action Segmentation via Evidential Temporal Contextualization

Egocentric Online Action Segmentation via Evidential Temporal Contextualization

Xun Jiang, Xing Xu, Zhangye Han, Zheng Wang, Jingkuan Song, Heng Tao Shen

IEEE Transactions on Multimedia · TMM 2026

Egocentric Vision; Temporal Action Segmentation; Streaming Video Understanding

Zero-Shot Video Moment Retrieval with Angular Reconstructive Text Embeddings

Zero-Shot Video Moment Retrieval with Angular Reconstructive Text Embeddings

Xun Jiang, Xing Xu, Zailei Zhou, Yang Yang, Fumin Shen, Heng Tao Shen

IEEE Transactions on Multimedia · TMM 2024

Video Content Understanding; Weakly-Supervised Learning; CLIP

SDN: Semantic Decoupling Network for Temporal Language Grounding

SDN: Semantic Decoupling Network for Temporal Language Grounding

Xun Jiang, Xing Xu, Jingran Zhang, Fumin Shen, Zuo Cao, Heng Tao Shen

IEEE Transactions on Neural Networks and Learning Systems · TNNLS 2022

Video Content Understanding; Vision-Language; Multimodal Learning

Selected Conference Papers

Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration

Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration

Xun Jiang, Yufan Gu, Disen Hu, Yuqing Hou, Yazhou Yao, Fumin Shen, Heng Tao Shen, Xing Xu

IEEE/CVF Conference on Computer Vision and Pattern Recognition · CVPR 2026

Multimodal Learning, Low-quality Multimodal Data, Conformal Prediction

Hyper-Opinion Vagueness Quantification for Robust Multimodal Learning

Hyper-Opinion Vagueness Quantification for Robust Multimodal Learning

Disen Hu, Xun Jiang, Xiaofeng Cao, Zheng Wang, Jingkuan Song, Heng Tao Shen, Xing Xu

AAAI Conference on Artificial Intelligence · AAAI 2026

Multimodal Learning, Robust Multimodal Learning, Hyper-Opinion Vagueness

Geometric Gradient Divergence Modulation for Imbalanced Multimodal Learning

Geometric Gradient Divergence Modulation for Imbalanced Multimodal Learning

Disen Hu, Xun Jiang, Zhe Sun, Hao Yang, Chong Peng, Peng Yan, Heng Tao Shen, Xing Xu

ACM International Conference on Multimedia · ACM MM 2025

Multimodal Learning, Imbalanced Multimodal Learning, Hyperspace Polyhedron

Procedural Heterogeneous Graph Completion for Natural Language Task Verification in Egocentric Videos

Procedural Heterogeneous Graph Completion for Natural Language Task Verification in Egocentric Videos

Xun Jiang, Zhiyi Huang, Xing Xu, Jingkuan Song, Fumin Shen, Heng Tao Shen

IEEE/CVF Conference on Computer Vision and Pattern Recognition · CVPR 2025

Natural Language-based Egocentric Task Verification; Heterogeneous Graph Completion; Multimodal Learning; Procedural Task Understanding

Counterfactually Augmented Event Matching for De-biased Temporal Sentence Grounding

Counterfactually Augmented Event Matching for De-biased Temporal Sentence Grounding

Xun Jiang, Zhuoyuan Wei, Shenshen Li, Xing Xu, Jingkuan Song, Heng Tao Shen

ACM International Conference on Multimedia · ACM MM 2024

Video Content Understanding, De-biased Video Grounding; Counterfactual Reasoning; Multimodal Learning

Embracing Unimodal Aleatoric Uncertainty for Robust Multimodal Fusion

Embracing Unimodal Aleatoric Uncertainty for Robust Multimodal Fusion

Zixian Gao*, Xun Jiang*, Xing Xu, Fumin Shen, Yujie Li, Heng Tao Shen (* Equal Contribution)

IEEE/CVF Computer Vision and Pattern Recognition Conference · CVPR 2024

Multimodal Learning; Model Robustness; Uncertainty in Deep Learning

Joint Searching and Grounding: Multi-Granularity Video Content Retrieval

Joint Searching and Grounding: Multi-Granularity Video Content Retrieval

Zhiguo Chen*, Xun Jiang*, Xing Xu, Zuo Cao, Yijun Mo, Heng Tao Shen (* Equal Contribution)

ACM International Conference on Multimedia · ACM MM 2023

Multimedia Retrieval; Video Content Understanding; Multimodal Learning

Faster Video Moment Retrieval with Point-Level Supervision

Faster Video Moment Retrieval with Point-Level Supervision

Xun Jiang, Zailei Zhou, Xing Xu, Yang Yang, Guoqing Wang, Heng Tao Shen

ACM International Conference on Multimedia · ACM MM 2023

Video Content Retrieval; Point-level Supervision; Retrieval Efficiency

DHHN: Dual Hierarchical Hybrid Network for Weakly-Supervised Audio-Visual Video Parsing

DHHN: Dual Hierarchical Hybrid Network for Weakly-Supervised Audio-Visual Video Parsing

Xun Jiang, Xing Xu, Zhiguo Chen, Jingran Zhang, Jingkuan Song, Fumin Shen, Huimin Lu, Heng Tao Shen

ACM International Conference on Multimedia · ACM MM 2022

Video Content Understanding; Action Localization; Audio-Visual Learning

Semi-Supervised Video Paragraph Grounding With Contrastive Encoder

Semi-Supervised Video Paragraph Grounding With Contrastive Encoder

Xun Jiang, Xing Xu, Jingran Zhang, Fumin Shen, Zuo Cao, Heng Tao Shen

IEEE/CVF Conference on Computer Vision and Pattern Recognition · CVPR 2022

Video Content Understanding, Semi-Supervised Learning; Multimodal Learning

Recruitment

Practical Master‘s Student

Enrollment in 2027.09
"Talk is cheap, show me your code." Practical, application-oriented students may receive a much higher special scholarship and internship recommendation. Come and connect yourself to enterprises and get your offer early!

Academic Master‘s Student

Enrollment in 2027.09
“SOTA is all you need.” You may study in a relatively free and open environment during your three-year journey--with higher demands on publications. You are a pre-PhD student, actually.

Doctoral Student

Enrollment in 2027.03 or 2027.09
"The last degree you can get." A way to an endless way with unknown risks and painful study, but also with charming scenery you may never have seen before.

Visiting Members

Academic only
"Let's be better together!"--We are always open to any sincere, diligent, and optimistic friends.

Contact

xun_jiang@tongji.edu.cn
Spatial Intelligence Group (SIG)
Tongji University
Shanghai, China