Enregistré dans:
| Auteurs principaux: | Li, Bo, Yin, Yida, Chai, Wenhao, Fu, Xingyu, Liu, Zhuang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.22155 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
par: Yang, Cheng, et autres
Publié: (2026)
par: Yang, Cheng, et autres
Publié: (2026)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
par: Li, Chenxu, et autres
Publié: (2025)
par: Li, Chenxu, et autres
Publié: (2025)
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
par: Peng, Xiangyu, et autres
Publié: (2025)
par: Peng, Xiangyu, et autres
Publié: (2025)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
par: Jiang, Yulun, et autres
Publié: (2025)
par: Jiang, Yulun, et autres
Publié: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
par: Gan, Ziliang, et autres
Publié: (2024)
par: Gan, Ziliang, et autres
Publié: (2024)
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
par: Ruan, Jiacheng, et autres
Publié: (2025)
par: Ruan, Jiacheng, et autres
Publié: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward
par: Niu, Yuwei, et autres
Publié: (2025)
par: Niu, Yuwei, et autres
Publié: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling
par: Li, Siqi, et autres
Publié: (2025)
par: Li, Siqi, et autres
Publié: (2025)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
par: Zhang, Ge, et autres
Publié: (2024)
par: Zhang, Ge, et autres
Publié: (2024)
DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
par: Zhou, Yu, et autres
Publié: (2025)
par: Zhou, Yu, et autres
Publié: (2025)
VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing
par: Su, Xiaoyan, et autres
Publié: (2026)
par: Su, Xiaoyan, et autres
Publié: (2026)
Generative Modeling of Weights: Generalization or Memorization?
par: Zeng, Boya, et autres
Publié: (2025)
par: Zeng, Boya, et autres
Publié: (2025)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models
par: Lee, Segyu, et autres
Publié: (2026)
par: Lee, Segyu, et autres
Publié: (2026)
READoc: A Unified Benchmark for Realistic Document Structured Extraction
par: Li, Zichao, et autres
Publié: (2024)
par: Li, Zichao, et autres
Publié: (2024)
MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs
par: Liu, Xuannan, et autres
Publié: (2024)
par: Liu, Xuannan, et autres
Publié: (2024)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
par: Hu, Yushi, et autres
Publié: (2024)
par: Hu, Yushi, et autres
Publié: (2024)
UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning
par: Tang, Hongxuan, et autres
Publié: (2025)
par: Tang, Hongxuan, et autres
Publié: (2025)
Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering
par: Si, Chenglei, et autres
Publié: (2024)
par: Si, Chenglei, et autres
Publié: (2024)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
par: Nie, Yiqi, et autres
Publié: (2026)
par: Nie, Yiqi, et autres
Publié: (2026)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
par: Yue, Xiang, et autres
Publié: (2023)
par: Yue, Xiang, et autres
Publié: (2023)
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
par: Chen, Xiaokang, et autres
Publié: (2025)
par: Chen, Xiaokang, et autres
Publié: (2025)
UniChange: Unifying Change Detection with Multimodal Large Language Model
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation
par: Zhou, Li, et autres
Publié: (2025)
par: Zhou, Li, et autres
Publié: (2025)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
par: Li, Shilong, et autres
Publié: (2025)
par: Li, Shilong, et autres
Publié: (2025)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
par: Yang, Zheyuan, et autres
Publié: (2026)
par: Yang, Zheyuan, et autres
Publié: (2026)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
par: Zhu, Kejian, et autres
Publié: (2025)
par: Zhu, Kejian, et autres
Publié: (2025)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
par: Li, Jiaang, et autres
Publié: (2025)
par: Li, Jiaang, et autres
Publié: (2025)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
par: Rahman, Mizanur, et autres
Publié: (2025)
par: Rahman, Mizanur, et autres
Publié: (2025)
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
par: Wang, Weizhi, et autres
Publié: (2025)
par: Wang, Weizhi, et autres
Publié: (2025)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
par: Wu, Yin, et autres
Publié: (2025)
par: Wu, Yin, et autres
Publié: (2025)
Insight-A: Attribution-aware for Multimodal Misinformation Detection
par: Wu, Junjie, et autres
Publié: (2025)
par: Wu, Junjie, et autres
Publié: (2025)
JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation
par: Ma, Yiyang, et autres
Publié: (2024)
par: Ma, Yiyang, et autres
Publié: (2024)
Documents similaires
-
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026) -
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
par: Yang, Cheng, et autres
Publié: (2026) -
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025) -
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
par: Li, Chenxu, et autres
Publié: (2025) -
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
par: Peng, Xiangyu, et autres
Publié: (2025)