Saved in:
| Main Authors: | , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2509.14142 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| _version_ | 1866916954962395136 |
|---|---|
| author | Xu, Peng Xiong, Shengwu Zhang, Jiajun Chen, Yaxiong Zhou, Bowen Loy, Chen Change Clifton, David A. Lee, Kyoung Mu Van Gool, Luc He, Ruiming Yao, Ruilin Long, Xinwei Huang, Jirui Tian, Kai Yang, Sa Shao, Yihua Feng, Jin Zhong, Yue Zhou, Jiakai Tang, Cheng Zou, Tianyu Zhang, Yifang Liang, Junming Li, Guoyou Wang, Zhaoxiang Zhou, Qiang Zhao, Yichen Xiong, Shili Nam, Hyeongjin Lee, Jaerin Chung, Jaeyoung Park, JoonKyu Oh, Junghun Lee, Kanggeon Lee, Wooseok Ro, Juneyoung Osman, Turghun Hu, Can Liao, Chaoyang Chen, Cheng Han, Chengcheng Qiu, Chenhao Peng, Chong Xu, Cong Li, Dailin Wang, Feiyu Gao, Feng Zhu, Guibo Tang, Guopeng Lu, Haibo Fang, Han Qi, Han Wu, Hanxiao Cheng, Haobo Sun, Hongbo Chen, Hongyao Hu, Huayong Li, Hui Ma, Jiaheng Yu, Jiang Wang, Jianing Yang, Jie He, Jing Zhou, Jinglin Li, Jingxuan Kittler, Josef Zheng, Lihao Zhao, Linnan Jia, Mengxi Yan, Muyang Thien, Nguyen Thanh Luo, Pu Li, Qi Song, Shien Dong, Shijie Shao, Shuai Li, Shutao Xue, Taofeng Xu, Tianyang Gao, Tianyi Li, Tingting Zhang, Wei Su, Weiyang Dong, Xiaodong Wu, Xiao-Jun Zhou, Xiaopeng Chen, Xin Wei, Xin You, Xinyi Kang, Xudong Zhou, Xujie Liu, Xusheng Wang, Yanan Huang, Yanbin Liu, Yang Yang, Yang Deng, Yanglin Kang, Yashu Yuan, Ye Wen, Yi Tian, Yicen Tao, Yilin Tang, Yin Lin, Yipeng Wang, Yiqing Xi, Yiting Yu, Yongkang Li, Yumei Qin, Yuxin Chen, Yuying Cen, Yuzhe Zou, Zhaofan Liu, Zhaohong Shen, Zhehao Du, Zhenglin Li, Zhengyang Huang, Zhenni Shao, Zhenwei Song, Zhilong Feng, Zhiyong Wang, Zhiyu Yu, Zhou Li, Ziang Zhai, Zihan Zhang, Zijian Peng, Ziyang Xiao, Ziyun Li, Zongshu |
| author_facet | Xu, Peng Xiong, Shengwu Zhang, Jiajun Chen, Yaxiong Zhou, Bowen Loy, Chen Change Clifton, David A. Lee, Kyoung Mu Van Gool, Luc He, Ruiming Yao, Ruilin Long, Xinwei Huang, Jirui Tian, Kai Yang, Sa Shao, Yihua Feng, Jin Zhong, Yue Zhou, Jiakai Tang, Cheng Zou, Tianyu Zhang, Yifang Liang, Junming Li, Guoyou Wang, Zhaoxiang Zhou, Qiang Zhao, Yichen Xiong, Shili Nam, Hyeongjin Lee, Jaerin Chung, Jaeyoung Park, JoonKyu Oh, Junghun Lee, Kanggeon Lee, Wooseok Ro, Juneyoung Osman, Turghun Hu, Can Liao, Chaoyang Chen, Cheng Han, Chengcheng Qiu, Chenhao Peng, Chong Xu, Cong Li, Dailin Wang, Feiyu Gao, Feng Zhu, Guibo Tang, Guopeng Lu, Haibo Fang, Han Qi, Han Wu, Hanxiao Cheng, Haobo Sun, Hongbo Chen, Hongyao Hu, Huayong Li, Hui Ma, Jiaheng Yu, Jiang Wang, Jianing Yang, Jie He, Jing Zhou, Jinglin Li, Jingxuan Kittler, Josef Zheng, Lihao Zhao, Linnan Jia, Mengxi Yan, Muyang Thien, Nguyen Thanh Luo, Pu Li, Qi Song, Shien Dong, Shijie Shao, Shuai Li, Shutao Xue, Taofeng Xu, Tianyang Gao, Tianyi Li, Tingting Zhang, Wei Su, Weiyang Dong, Xiaodong Wu, Xiao-Jun Zhou, Xiaopeng Chen, Xin Wei, Xin You, Xinyi Kang, Xudong Zhou, Xujie Liu, Xusheng Wang, Yanan Huang, Yanbin Liu, Yang Yang, Yang Deng, Yanglin Kang, Yashu Yuan, Ye Wen, Yi Tian, Yicen Tao, Yilin Tang, Yin Lin, Yipeng Wang, Yiqing Xi, Yiting Yu, Yongkang Li, Yumei Qin, Yuxin Chen, Yuying Cen, Yuzhe Zou, Zhaofan Liu, Zhaohong Shen, Zhehao Du, Zhenglin Li, Zhengyang Huang, Zhenni Shao, Zhenwei Song, Zhilong Feng, Zhiyong Wang, Zhiyu Yu, Zhou Li, Ziang Zhai, Zihan Zhang, Zijian Peng, Ziyang Xiao, Ziyun Li, Zongshu |
| contents | This paper reviews the MARS2 2025 Challenge on Multimodal Reasoning. We aim to bring together different approaches in multimodal machine learning and LLMs via a large benchmark. We hope it better allows researchers to follow the state-of-the-art in this very dynamic area. Meanwhile, a growing number of testbeds have boosted the evolution of general-purpose large language models. Thus, this year's MARS2 focuses on real-world and specialized scenarios to broaden the multimodal reasoning applications of MLLMs. Our organizing team released two tailored datasets Lens and AdsQA as test sets, which support general reasoning in 12 daily scenarios and domain-specific reasoning in advertisement videos, respectively. We evaluated 40+ baselines that include both generalist MLLMs and task-specific models, and opened up three competition tracks, i.e., Visual Grounding in Real-world Scenarios (VG-RS), Visual Question Answering with Spatial Awareness (VQA-SA), and Visual Reasoning in Creative Advertisement Videos (VR-Ads). Finally, 76 teams from the renowned academic and industrial institutions have registered and 40+ valid submissions (out of 1200+) have been included in our ranking lists. Our datasets, code sets (40+ baselines and 15+ participants' methods), and rankings are publicly available on the MARS2 workshop website and our GitHub organization page https://github.com/mars2workshop/, where our updates and announcements of upcoming events will be continuously provided. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2509_14142 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook Xu, Peng Xiong, Shengwu Zhang, Jiajun Chen, Yaxiong Zhou, Bowen Loy, Chen Change Clifton, David A. Lee, Kyoung Mu Van Gool, Luc He, Ruiming Yao, Ruilin Long, Xinwei Huang, Jirui Tian, Kai Yang, Sa Shao, Yihua Feng, Jin Zhong, Yue Zhou, Jiakai Tang, Cheng Zou, Tianyu Zhang, Yifang Liang, Junming Li, Guoyou Wang, Zhaoxiang Zhou, Qiang Zhao, Yichen Xiong, Shili Nam, Hyeongjin Lee, Jaerin Chung, Jaeyoung Park, JoonKyu Oh, Junghun Lee, Kanggeon Lee, Wooseok Ro, Juneyoung Osman, Turghun Hu, Can Liao, Chaoyang Chen, Cheng Han, Chengcheng Qiu, Chenhao Peng, Chong Xu, Cong Li, Dailin Wang, Feiyu Gao, Feng Zhu, Guibo Tang, Guopeng Lu, Haibo Fang, Han Qi, Han Wu, Hanxiao Cheng, Haobo Sun, Hongbo Chen, Hongyao Hu, Huayong Li, Hui Ma, Jiaheng Yu, Jiang Wang, Jianing Yang, Jie He, Jing Zhou, Jinglin Li, Jingxuan Kittler, Josef Zheng, Lihao Zhao, Linnan Jia, Mengxi Yan, Muyang Thien, Nguyen Thanh Luo, Pu Li, Qi Song, Shien Dong, Shijie Shao, Shuai Li, Shutao Xue, Taofeng Xu, Tianyang Gao, Tianyi Li, Tingting Zhang, Wei Su, Weiyang Dong, Xiaodong Wu, Xiao-Jun Zhou, Xiaopeng Chen, Xin Wei, Xin You, Xinyi Kang, Xudong Zhou, Xujie Liu, Xusheng Wang, Yanan Huang, Yanbin Liu, Yang Yang, Yang Deng, Yanglin Kang, Yashu Yuan, Ye Wen, Yi Tian, Yicen Tao, Yilin Tang, Yin Lin, Yipeng Wang, Yiqing Xi, Yiting Yu, Yongkang Li, Yumei Qin, Yuxin Chen, Yuying Cen, Yuzhe Zou, Zhaofan Liu, Zhaohong Shen, Zhehao Du, Zhenglin Li, Zhengyang Huang, Zhenni Shao, Zhenwei Song, Zhilong Feng, Zhiyong Wang, Zhiyu Yu, Zhou Li, Ziang Zhai, Zihan Zhang, Zijian Peng, Ziyang Xiao, Ziyun Li, Zongshu Computer Vision and Pattern Recognition This paper reviews the MARS2 2025 Challenge on Multimodal Reasoning. We aim to bring together different approaches in multimodal machine learning and LLMs via a large benchmark. We hope it better allows researchers to follow the state-of-the-art in this very dynamic area. Meanwhile, a growing number of testbeds have boosted the evolution of general-purpose large language models. Thus, this year's MARS2 focuses on real-world and specialized scenarios to broaden the multimodal reasoning applications of MLLMs. Our organizing team released two tailored datasets Lens and AdsQA as test sets, which support general reasoning in 12 daily scenarios and domain-specific reasoning in advertisement videos, respectively. We evaluated 40+ baselines that include both generalist MLLMs and task-specific models, and opened up three competition tracks, i.e., Visual Grounding in Real-world Scenarios (VG-RS), Visual Question Answering with Spatial Awareness (VQA-SA), and Visual Reasoning in Creative Advertisement Videos (VR-Ads). Finally, 76 teams from the renowned academic and industrial institutions have registered and 40+ valid submissions (out of 1200+) have been included in our ranking lists. Our datasets, code sets (40+ baselines and 15+ participants' methods), and rankings are publicly available on the MARS2 workshop website and our GitHub organization page https://github.com/mars2workshop/, where our updates and announcements of upcoming events will be continuously provided. |
| title | MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook |
| topic | Computer Vision and Pattern Recognition |
| url | https://arxiv.org/abs/2509.14142 |