Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Huan, Xiao, Lingyu, Liu, Jiangjiang, Li, Xiaofan, Feng, Ze, Yang, Sen, Wang, Jingdong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
par: Feng, Ze, et autres
Publié: (2025)
par: Feng, Ze, et autres
Publié: (2025)
EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
par: Feng, Ze, et autres
Publié: (2025)
par: Feng, Ze, et autres
Publié: (2025)
SpatialTree: How Spatial Abilities Branch Out in MLLMs
par: Xiao, Yuxi, et autres
Publié: (2025)
par: Xiao, Yuxi, et autres
Publié: (2025)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
par: Liu, Jiyao, et autres
Publié: (2025)
par: Liu, Jiyao, et autres
Publié: (2025)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
par: Xu, Zitong, et autres
Publié: (2026)
par: Xu, Zitong, et autres
Publié: (2026)
Automated Multi-level Preference for MLLMs
par: Zhang, Mengxi, et autres
Publié: (2024)
par: Zhang, Mengxi, et autres
Publié: (2024)
Dense Connector for MLLMs
par: Yao, Huanjin, et autres
Publié: (2024)
par: Yao, Huanjin, et autres
Publié: (2024)
FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs
par: Hao, Jing, et autres
Publié: (2024)
par: Hao, Jing, et autres
Publié: (2024)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
par: Chen, Mingrui, et autres
Publié: (2026)
par: Chen, Mingrui, et autres
Publié: (2026)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
par: Qiu, Yansheng, et autres
Publié: (2025)
par: Qiu, Yansheng, et autres
Publié: (2025)
HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
par: Qin, Zheng, et autres
Publié: (2025)
par: Qin, Zheng, et autres
Publié: (2025)
Exploring Effective Factors for Improving Visual In-Context Learning
par: Sun, Yanpeng, et autres
Publié: (2023)
par: Sun, Yanpeng, et autres
Publié: (2023)
Dual-Task Vision Transformer for Rapid and Accurate Intracerebral Hemorrhage CT Image Classification
par: Fan, Jialiang, et autres
Publié: (2024)
par: Fan, Jialiang, et autres
Publié: (2024)
Benchmarking Large and Small MLLMs
par: Feng, Xuelu, et autres
Publié: (2025)
par: Feng, Xuelu, et autres
Publié: (2025)
A Physical Model-Guided Framework for Underwater Image Enhancement and Depth Estimation
par: Du, Dazhao, et autres
Publié: (2024)
par: Du, Dazhao, et autres
Publié: (2024)
Trustworthy Multimodal Fusion for Sentiment Analysis in Ordinal Sentiment Space
par: Xie, Zhuyang, et autres
Publié: (2024)
par: Xie, Zhuyang, et autres
Publié: (2024)
TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
par: Zhang, Kejia, et autres
Publié: (2025)
par: Zhang, Kejia, et autres
Publié: (2025)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
Dual-stage Hyperspectral Image Classification Model with Spectral Supertoken
par: Liu, Peifu, et autres
Publié: (2024)
par: Liu, Peifu, et autres
Publié: (2024)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
par: Dai, Ming, et autres
Publié: (2025)
par: Dai, Ming, et autres
Publié: (2025)
Universal Skeleton Understanding via Differentiable Rendering and MLLMs
par: Wang, Ziyi, et autres
Publié: (2026)
par: Wang, Ziyi, et autres
Publié: (2026)
Hyperspectral Image Classification via Efficient Global Spectral Supertoken Clustering
par: Liu, Peifu, et autres
Publié: (2026)
par: Liu, Peifu, et autres
Publié: (2026)
Continual SFT Matches Multimodal RLHF with Negative Supervision
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
MGMapNet: Multi-Granularity Representation Learning for End-to-End Vectorized HD Map Construction
par: Yang, Jing, et autres
Publié: (2024)
par: Yang, Jing, et autres
Publié: (2024)
Revisit Self-supervised Depth Estimation with Local Structure-from-Motion
par: Zhu, Shengjie, et autres
Publié: (2024)
par: Zhu, Shengjie, et autres
Publié: (2024)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
par: Zhang, Bob, et autres
Publié: (2025)
par: Zhang, Bob, et autres
Publié: (2025)
When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
par: Liu, Jinming, et autres
Publié: (2025)
par: Liu, Jinming, et autres
Publié: (2025)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
par: Bao, Zhijie, et autres
Publié: (2026)
par: Bao, Zhijie, et autres
Publié: (2026)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
par: Deng, Naihao, et autres
Publié: (2024)
par: Deng, Naihao, et autres
Publié: (2024)
Revisiting Autoregressive Models for Generative Image Classification
par: Sudakov, Ilia, et autres
Publié: (2026)
par: Sudakov, Ilia, et autres
Publié: (2026)
WSD-MIL: Window Scale Decay Multiple Instance Learning for Whole Slide Image Classification
par: Feng, Le, et autres
Publié: (2025)
par: Feng, Le, et autres
Publié: (2025)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
par: Liu, Yexin, et autres
Publié: (2024)
par: Liu, Yexin, et autres
Publié: (2024)
Boosting the Generalization Ability for Hyperspectral Image Classification using Spectral-spatial Axial Aggregation Transformer
par: Zhao, Enzhe, et autres
Publié: (2023)
par: Zhao, Enzhe, et autres
Publié: (2023)
Extending Depth of Field for Varifocal Multiview Images
par: Li, Zhilong, et autres
Publié: (2024)
par: Li, Zhilong, et autres
Publié: (2024)
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
par: Zou, Xin, et autres
Publié: (2025)
par: Zou, Xin, et autres
Publié: (2025)
Revisiting Context Aggregation for Image Matting
par: Liu, Qinglin, et autres
Publié: (2023)
par: Liu, Qinglin, et autres
Publié: (2023)
Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
par: Liu, Han, et autres
Publié: (2025)
par: Liu, Han, et autres
Publié: (2025)
FreeRet: MLLMs as Training-Free Retrievers
par: Zhu, Yuhan, et autres
Publié: (2025)
par: Zhu, Yuhan, et autres
Publié: (2025)
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
par: Sun, Yanpeng, et autres
Publié: (2024)
par: Sun, Yanpeng, et autres
Publié: (2024)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)
par: Wang, Haicheng, et autres
Publié: (2026)
Documents similaires
-
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
par: Feng, Ze, et autres
Publié: (2025) -
EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
par: Feng, Ze, et autres
Publié: (2025) -
SpatialTree: How Spatial Abilities Branch Out in MLLMs
par: Xiao, Yuxi, et autres
Publié: (2025) -
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
par: Liu, Jiyao, et autres
Publié: (2025) -
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
par: Xu, Zitong, et autres
Publié: (2026)