DenseMLLM: Standard Multimodal LLMs for Dense Prediction
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yi, Shen, Hongze, Tang, Lexiang, Li, Xin, Ding, Xinpeng, Liu, Yinsong, Jiang, Deqiang, Sun, Xing, Li, Xiaomeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Token Activation Map to Visually Explain Multimodal LLMs
di: Li, Yi, et al.
Pubblicazione: (2025)
di: Li, Yi, et al.
Pubblicazione: (2025)
BiDense: Binarization for Dense Prediction
di: Yin, Rui, et al.
Pubblicazione: (2024)
di: Yin, Rui, et al.
Pubblicazione: (2024)
HRVDA: High-Resolution Visual Document Assistant
di: Liu, Chaohu, et al.
Pubblicazione: (2024)
di: Liu, Chaohu, et al.
Pubblicazione: (2024)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
Unified Dense Prediction of Video Diffusion
di: Yang, Lehan, et al.
Pubblicazione: (2025)
di: Yang, Lehan, et al.
Pubblicazione: (2025)
DREAM: Document Reconstruction via End-to-end Autoregressive Model
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
DPBridge: Latent Diffusion Bridge for Dense Prediction
di: Ji, Haorui, et al.
Pubblicazione: (2024)
di: Ji, Haorui, et al.
Pubblicazione: (2024)
TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs
di: Kan, Zhehan, et al.
Pubblicazione: (2025)
di: Kan, Zhehan, et al.
Pubblicazione: (2025)
DenseSR: Image Shadow Removal as Dense Prediction
di: Lin, Yu-Fan, et al.
Pubblicazione: (2025)
di: Lin, Yu-Fan, et al.
Pubblicazione: (2025)
Efficient Sparse-to-Dense Visual Localization via Compact Gaussian Scene Representation and Accelerated Dense Pose Estimation
di: Li, Zizhuo, et al.
Pubblicazione: (2026)
di: Li, Zizhuo, et al.
Pubblicazione: (2026)
Multimodal Collaboration Networks for Geospatial Vehicle Detection in Dense, Occluded, and Large-Scale Events
di: Wu, Xin, et al.
Pubblicazione: (2024)
di: Wu, Xin, et al.
Pubblicazione: (2024)
Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification
di: Hu, Lexiang, et al.
Pubblicazione: (2026)
di: Hu, Lexiang, et al.
Pubblicazione: (2026)
Dense360: Dense Understanding from Omnidirectional Panoramas
di: Zhou, Yikang, et al.
Pubblicazione: (2025)
di: Zhou, Yikang, et al.
Pubblicazione: (2025)
DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World
di: Li, Xiangtai, et al.
Pubblicazione: (2025)
di: Li, Xiangtai, et al.
Pubblicazione: (2025)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
di: Li, Yunheng, et al.
Pubblicazione: (2024)
di: Li, Yunheng, et al.
Pubblicazione: (2024)
Multi-Task Dense Prediction via Mixture of Low-Rank Experts
di: Yang, Yuqi, et al.
Pubblicazione: (2024)
di: Yang, Yuqi, et al.
Pubblicazione: (2024)
BFMD: A Full-Match Badminton Dense Dataset for Dense Shot Captioning
di: Ding, Ning, et al.
Pubblicazione: (2026)
di: Ding, Ning, et al.
Pubblicazione: (2026)
HiLM-D: Enhancing MLLMs with Multi-Scale High-Resolution Details for Autonomous Driving
di: Ding, Xinpeng, et al.
Pubblicazione: (2023)
di: Ding, Xinpeng, et al.
Pubblicazione: (2023)
HERM: Benchmarking and Enhancing Multimodal LLMs for Human-Centric Understanding
di: Li, Keliang, et al.
Pubblicazione: (2024)
di: Li, Keliang, et al.
Pubblicazione: (2024)
Learning Where to Focus: Density-Driven Guidance for Detecting Dense Tiny Objects
di: Zhao, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zhicheng, et al.
Pubblicazione: (2025)
Dense Connector for MLLMs
di: Yao, Huanjin, et al.
Pubblicazione: (2024)
di: Yao, Huanjin, et al.
Pubblicazione: (2024)
Multi-Task Label Discovery via Hierarchical Task Tokens for Partially Annotated Dense Predictions
di: Zhang, Jingdong, et al.
Pubblicazione: (2024)
di: Zhang, Jingdong, et al.
Pubblicazione: (2024)
Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking
di: Zhu, Yabin, et al.
Pubblicazione: (2026)
di: Zhu, Yabin, et al.
Pubblicazione: (2026)
Task Indicating Transformer for Task-conditional Dense Predictions
di: Lu, Yuxiang, et al.
Pubblicazione: (2024)
di: Lu, Yuxiang, et al.
Pubblicazione: (2024)
Dense Matchers for Dense Tracking
di: Jelínek, Tomáš, et al.
Pubblicazione: (2024)
di: Jelínek, Tomáš, et al.
Pubblicazione: (2024)
Dense-Face: Personalized Face Generation Model via Dense Annotation Prediction
di: Guo, Xiao, et al.
Pubblicazione: (2024)
di: Guo, Xiao, et al.
Pubblicazione: (2024)
Dense Multimodal Alignment for Open-Vocabulary 3D Scene Understanding
di: Li, Ruihuang, et al.
Pubblicazione: (2024)
di: Li, Ruihuang, et al.
Pubblicazione: (2024)
Vision Transformers: From Semantic Segmentation to Dense Prediction
di: Zhang, Li, et al.
Pubblicazione: (2022)
di: Zhang, Li, et al.
Pubblicazione: (2022)
Frequency Dynamic Convolution for Dense Image Prediction
di: Chen, Linwei, et al.
Pubblicazione: (2025)
di: Chen, Linwei, et al.
Pubblicazione: (2025)
HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
di: Li, Keliang, et al.
Pubblicazione: (2025)
di: Li, Keliang, et al.
Pubblicazione: (2025)
Dense Road Surface Grip Map Prediction from Multimodal Image Data
di: Maanpää, Jyri, et al.
Pubblicazione: (2024)
di: Maanpää, Jyri, et al.
Pubblicazione: (2024)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
di: Ge, Mingji, et al.
Pubblicazione: (2026)
di: Ge, Mingji, et al.
Pubblicazione: (2026)
Deep Learning in Concealed Dense Prediction
di: Zhao, Pancheng, et al.
Pubblicazione: (2025)
di: Zhao, Pancheng, et al.
Pubblicazione: (2025)
SHED Light on Segmentation for Dense Prediction
di: Lee, Seung Hyun, et al.
Pubblicazione: (2026)
di: Lee, Seung Hyun, et al.
Pubblicazione: (2026)
Exploring Sparse Visual Prompt for Domain Adaptive Dense Prediction
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
Enhancing Mamba Decoder with Bidirectional Interaction in Multi-Task Dense Prediction
di: Cao, Mang, et al.
Pubblicazione: (2025)
di: Cao, Mang, et al.
Pubblicazione: (2025)
Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction
di: He, Jing, et al.
Pubblicazione: (2024)
di: He, Jing, et al.
Pubblicazione: (2024)
$\mathcal{B}^{3}$-Net: Controlled Posterior Bridge Learning for Multi-Task Dense Prediction
di: Zhou, Meihua, et al.
Pubblicazione: (2026)
di: Zhou, Meihua, et al.
Pubblicazione: (2026)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model
di: He, Jing, et al.
Pubblicazione: (2025)
di: He, Jing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Token Activation Map to Visually Explain Multimodal LLMs
di: Li, Yi, et al.
Pubblicazione: (2025) -
BiDense: Binarization for Dense Prediction
di: Yin, Rui, et al.
Pubblicazione: (2024) -
HRVDA: High-Resolution Visual Document Assistant
di: Liu, Chaohu, et al.
Pubblicazione: (2024) -
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
di: Li, Xin, et al.
Pubblicazione: (2024) -
Unified Dense Prediction of Video Diffusion
di: Yang, Lehan, et al.
Pubblicazione: (2025)