Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiao, Yang, Chen, Shaoxiang, Jie, Zequn, Chen, Jingjing, Ma, Lin, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
por: Jiao, Yang, et al.
Publicado: (2025)
por: Jiao, Yang, et al.
Publicado: (2025)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
por: Chen, Shaoxiang, et al.
Publicado: (2024)
por: Chen, Shaoxiang, et al.
Publicado: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning
por: Han, Feng, et al.
Publicado: (2025)
por: Han, Feng, et al.
Publicado: (2025)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
por: Huang, Zhijian, et al.
Publicado: (2024)
por: Huang, Zhijian, et al.
Publicado: (2024)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
por: Li, Yian, et al.
Publicado: (2026)
por: Li, Yian, et al.
Publicado: (2026)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
por: Chen, Lei, et al.
Publicado: (2024)
por: Chen, Lei, et al.
Publicado: (2024)
Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure
por: Fu, Luxuan, et al.
Publicado: (2026)
por: Fu, Luxuan, et al.
Publicado: (2026)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
por: Yin, Yuehao, et al.
Publicado: (2023)
por: Yin, Yuehao, et al.
Publicado: (2023)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
por: Zheng, Xiangxi, et al.
Publicado: (2025)
por: Zheng, Xiangxi, et al.
Publicado: (2025)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
por: Li, Hengzhuang, et al.
Publicado: (2025)
por: Li, Hengzhuang, et al.
Publicado: (2025)
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
por: Fang, Rongyao, et al.
Publicado: (2025)
por: Fang, Rongyao, et al.
Publicado: (2025)
Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
por: Tang, Ziyao, et al.
Publicado: (2026)
por: Tang, Ziyao, et al.
Publicado: (2026)
EventHallusion: Diagnosing Event Hallucinations in Video LLMs
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
por: Sun, Yiming, et al.
Publicado: (2024)
por: Sun, Yiming, et al.
Publicado: (2024)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
por: Yue, Tongtian, et al.
Publicado: (2024)
por: Yue, Tongtian, et al.
Publicado: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
por: Lan, Xiaohan, et al.
Publicado: (2024)
por: Lan, Xiaohan, et al.
Publicado: (2024)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
por: Lin, Junyan, et al.
Publicado: (2026)
por: Lin, Junyan, et al.
Publicado: (2026)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
por: Wang, Yunnan, et al.
Publicado: (2025)
por: Wang, Yunnan, et al.
Publicado: (2025)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2024)
por: Zhan, Yufei, et al.
Publicado: (2024)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
por: Huang, Wenxuan, et al.
Publicado: (2026)
por: Huang, Wenxuan, et al.
Publicado: (2026)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
por: Qian, Tianwen, et al.
Publicado: (2023)
por: Qian, Tianwen, et al.
Publicado: (2023)
Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization
por: Li, Jinlong, et al.
Publicado: (2024)
por: Li, Jinlong, et al.
Publicado: (2024)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
por: Feng, Hao, et al.
Publicado: (2023)
por: Feng, Hao, et al.
Publicado: (2023)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
por: Chen, Yitong, et al.
Publicado: (2025)
por: Chen, Yitong, et al.
Publicado: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2024)
por: Wang, Ruofan, et al.
Publicado: (2024)
TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models
por: Wang, Xin, et al.
Publicado: (2026)
por: Wang, Xin, et al.
Publicado: (2026)
FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models
por: Zhai, Kun, et al.
Publicado: (2025)
por: Zhai, Kun, et al.
Publicado: (2025)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
por: Huang, Zhijian, et al.
Publicado: (2024)
por: Huang, Zhijian, et al.
Publicado: (2024)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
por: Yu, JiangYong, et al.
Publicado: (2025)
por: Yu, JiangYong, et al.
Publicado: (2025)
Domain Expansion and Boundary Growth for Open-Set Single-Source Domain Generalization
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
por: Peng, Yi-Xing, et al.
Publicado: (2025)
por: Peng, Yi-Xing, et al.
Publicado: (2025)
An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
por: Zhou, Gengze, et al.
Publicado: (2024)
por: Zhou, Gengze, et al.
Publicado: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
por: Sun, Yanpeng, et al.
Publicado: (2024)
por: Sun, Yanpeng, et al.
Publicado: (2024)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
por: Jiang, Jingjing, et al.
Publicado: (2025)
por: Jiang, Jingjing, et al.
Publicado: (2025)
Ejemplares similares
-
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
por: Jiao, Yang, et al.
Publicado: (2025) -
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
por: Zhang, Jiacheng, et al.
Publicado: (2024) -
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
por: Chen, Shaoxiang, et al.
Publicado: (2024) -
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024) -
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
por: Wang, Jiayu, et al.
Publicado: (2025)