Research
Our Research Interests
Our research focuses on Multimodal AI, Agentic AI, and Autonomous Driving, building intelligent systems that perceive, reason, and act across vision, language, and audio. We develop models that generalize across tasks and domains — from video understanding and multi-agent reasoning to robust perception for autonomous vehicles.
Multimodal AI
- Image Understanding
- Video Understanding
- Audio-Visual Understanding
- Multimodal Human Understanding
Agentic AI
- Adaptive Reasoning & Planning
- Multi-Agent Systems & Tool Use
- Autonomous Task Execution & Domains
Autonomous Driving
- Trajectory Prediction
- 3D Object Detection
- Pedestrian Detection