A Survey on Multimodal Benchmarks: In the Era of Large AI Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Lin, Chen, Guikun, Shi, Hanrong, Xiao, Jun, Chen, Long |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Survey on 3D Gaussian Splatting
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects
par: Ruan, Shulan, et autres
Publié: (2025)
par: Ruan, Shulan, et autres
Publié: (2025)
Detecting Multimedia Generated by Large AI Models: A Survey
par: Lin, Li, et autres
Publié: (2024)
par: Lin, Li, et autres
Publié: (2024)
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
par: Lin, Zixing, et autres
Publié: (2026)
par: Lin, Zixing, et autres
Publié: (2026)
Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models
par: Lin, Yuxiang, et autres
Publié: (2025)
par: Lin, Yuxiang, et autres
Publié: (2025)
Modeling Human Responses to Multimodal AI Content
par: Shen, Zhiqi, et autres
Publié: (2025)
par: Shen, Zhiqi, et autres
Publié: (2025)
Has Multimodal Learning Delivered Universal Intelligence in Healthcare? A Comprehensive Survey
par: Lin, Qika, et autres
Publié: (2024)
par: Lin, Qika, et autres
Publié: (2024)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
par: Zhang, Hanlei, et autres
Publié: (2025)
par: Zhang, Hanlei, et autres
Publié: (2025)
PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models
par: Chen, Jiangong, et autres
Publié: (2026)
par: Chen, Jiangong, et autres
Publié: (2026)
A Survey on Image-text Multimodal Models
par: Guo, Ruifeng, et autres
Publié: (2023)
par: Guo, Ruifeng, et autres
Publié: (2023)
SynthGuard: An Open Platform for Detecting AI-Generated Multimedia with Multimodal LLMs
par: Desai, Shail, et autres
Publié: (2025)
par: Desai, Shail, et autres
Publié: (2025)
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
par: Wang, Xiaohan, et autres
Publié: (2026)
par: Wang, Xiaohan, et autres
Publié: (2026)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
par: Zhang, Yao, et autres
Publié: (2025)
par: Zhang, Yao, et autres
Publié: (2025)
LLMER: Crafting Interactive Extended Reality Worlds with JSON Data Generated by Large Language Models
par: Chen, Jiangong, et autres
Publié: (2025)
par: Chen, Jiangong, et autres
Publié: (2025)
A Survey of Generative Categories and Techniques in Multimodal Generative Models
par: Han, Longzhen, et autres
Publié: (2025)
par: Han, Longzhen, et autres
Publié: (2025)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
par: Wang, Xiao, et autres
Publié: (2023)
par: Wang, Xiao, et autres
Publié: (2023)
A Survey of Foundation Models for Music Understanding
par: Li, Wenjun, et autres
Publié: (2024)
par: Li, Wenjun, et autres
Publié: (2024)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
par: Xue, Dong, et autres
Publié: (2025)
par: Xue, Dong, et autres
Publié: (2025)
How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model
par: Song, Shezheng, et autres
Publié: (2023)
par: Song, Shezheng, et autres
Publié: (2023)
Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models
par: Wen, Jinming, et autres
Publié: (2025)
par: Wen, Jinming, et autres
Publié: (2025)
WorldGPT: Empowering LLM as Multimodal World Model
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
par: Cheng, Zebang, et autres
Publié: (2024)
par: Cheng, Zebang, et autres
Publié: (2024)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
par: Liu, Shuo, et autres
Publié: (2025)
par: Liu, Shuo, et autres
Publié: (2025)
Personalized Image Generation with Large Multimodal Models
par: Xu, Yiyan, et autres
Publié: (2024)
par: Xu, Yiyan, et autres
Publié: (2024)
ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning
par: Luo, Pengfei, et autres
Publié: (2025)
par: Luo, Pengfei, et autres
Publié: (2025)
Multimodal Emotion Recognition by Fusing Video Semantic in MOOC Learning Scenarios
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
Scene Graph Generation with Role-Playing Large Language Models
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
Differential Multimodal Transformers
par: Li, Jerry, et autres
Publié: (2025)
par: Li, Jerry, et autres
Publié: (2025)
The Revolution of Multimodal Large Language Models: A Survey
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning
par: Tan, Wentao, et autres
Publié: (2025)
par: Tan, Wentao, et autres
Publié: (2025)
SEER: Semantic Enhancement and Emotional Reasoning Network for Multimodal Fake News Detection
par: Zhu, Peican, et autres
Publié: (2025)
par: Zhu, Peican, et autres
Publié: (2025)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
par: Bai, Tianyi, et autres
Publié: (2024)
par: Bai, Tianyi, et autres
Publié: (2024)
HumanVLM: Foundation for Human-Scene Vision-Language Model
par: Dai, Dawei, et autres
Publié: (2024)
par: Dai, Dawei, et autres
Publié: (2024)
A Multimedia Analytics Model for the Foundation Model Era
par: Worring, Marcel, et autres
Publié: (2025)
par: Worring, Marcel, et autres
Publié: (2025)
Unsupervised Multimodal Clustering for Semantics Discovery in Multimodal Utterances
par: Zhang, Hanlei, et autres
Publié: (2024)
par: Zhang, Hanlei, et autres
Publié: (2024)
Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey
par: Xie, Tianxin, et autres
Publié: (2024)
par: Xie, Tianxin, et autres
Publié: (2024)
Synthesizing Sentiment-Controlled Feedback For Multimodal Text and Image Data
par: Kumar, Puneet, et autres
Publié: (2024)
par: Kumar, Puneet, et autres
Publié: (2024)
Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment
par: Zeng, Delong, et autres
Publié: (2026)
par: Zeng, Delong, et autres
Publié: (2026)
TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement
par: Ma, Zhiyong, et autres
Publié: (2025)
par: Ma, Zhiyong, et autres
Publié: (2025)
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
par: Tan, Rui Yang, et autres
Publié: (2026)
par: Tan, Rui Yang, et autres
Publié: (2026)
Documents similaires
-
A Survey on 3D Gaussian Splatting
par: Chen, Guikun, et autres
Publié: (2024) -
A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects
par: Ruan, Shulan, et autres
Publié: (2025) -
Detecting Multimedia Generated by Large AI Models: A Survey
par: Lin, Li, et autres
Publié: (2024) -
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
par: Lin, Zixing, et autres
Publié: (2026) -
Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models
par: Lin, Yuxiang, et autres
Publié: (2025)