Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Hengzhuang, Zhang, Xinsong, Peng, Qiming, Luo, Bin, Hu, Han, Jiang, Dengyang, Ye, Han-Jia, Zhang, Teng, Jin, Hai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
par: Fang, Rongyao, et autres
Publié: (2025)
par: Fang, Rongyao, et autres
Publié: (2025)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
par: Jiao, Yang, et autres
Publié: (2024)
par: Jiao, Yang, et autres
Publié: (2024)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2026)
par: Lin, Junyan, et autres
Publié: (2026)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
par: Zhang, Xinsong, et autres
Publié: (2025)
par: Zhang, Xinsong, et autres
Publié: (2025)
AffordanceSAM: Segment Anything Once More in Affordance Grounding
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
par: Fu, Teng, et autres
Publié: (2025)
par: Fu, Teng, et autres
Publié: (2025)
Outlier Synthesis via Hamiltonian Monte Carlo for Out-of-Distribution Detection
par: Li, Hengzhuang, et autres
Publié: (2025)
par: Li, Hengzhuang, et autres
Publié: (2025)
Visual Representation Alignment for Multimodal Large Language Models
par: Yoon, Heeji, et autres
Publié: (2025)
par: Yoon, Heeji, et autres
Publié: (2025)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
par: Liu, Jiahang, et autres
Publié: (2025)
par: Liu, Jiahang, et autres
Publié: (2025)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
par: Jia, Hongrui, et autres
Publié: (2025)
par: Jia, Hongrui, et autres
Publié: (2025)
LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation
par: Shi, Hengyu, et autres
Publié: (2025)
par: Shi, Hengyu, et autres
Publié: (2025)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
par: Xie, Xing, et autres
Publié: (2025)
par: Xie, Xing, et autres
Publié: (2025)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
par: Wang, Xianfeng, et autres
Publié: (2026)
par: Wang, Xianfeng, et autres
Publié: (2026)
Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning
par: Sun, Hai-Long, et autres
Publié: (2025)
par: Sun, Hai-Long, et autres
Publié: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure
par: Fu, Luxuan, et autres
Publié: (2026)
par: Fu, Luxuan, et autres
Publié: (2026)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
par: Hua, Jiacheng, et autres
Publié: (2026)
par: Hua, Jiacheng, et autres
Publié: (2026)
Period-LLM: Extending the Periodic Capability of Multimodal Large Language Model
par: Zhang, Yuting, et autres
Publié: (2025)
par: Zhang, Yuting, et autres
Publié: (2025)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
par: Cai, Chengyi, et autres
Publié: (2026)
par: Cai, Chengyi, et autres
Publié: (2026)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Distribution Matching Distillation Meets Reinforcement Learning
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
par: Jin, Peng, et autres
Publié: (2023)
par: Jin, Peng, et autres
Publié: (2023)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
par: Yu, JiangYong, et autres
Publié: (2025)
par: Yu, JiangYong, et autres
Publié: (2025)
Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
par: Li, Qiming, et autres
Publié: (2025)
par: Li, Qiming, et autres
Publié: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
par: Han, Yuhang, et autres
Publié: (2026)
par: Han, Yuhang, et autres
Publié: (2026)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026)
par: Dong, Xinpeng, et autres
Publié: (2026)
GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
par: Hu, Xiangdong, et autres
Publié: (2026)
par: Hu, Xiangdong, et autres
Publié: (2026)
Unleashing the Power of Generic Segmentation Models: A Simple Baseline for Infrared Small Target Detection
par: Zhang, Mingjin, et autres
Publié: (2024)
par: Zhang, Mingjin, et autres
Publié: (2024)
Can Multimodal Large Language Models Truly Understand Small Objects?
par: Han, Fujun, et autres
Publié: (2026)
par: Han, Fujun, et autres
Publié: (2026)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
par: Zhang, Yiming, et autres
Publié: (2026)
par: Zhang, Yiming, et autres
Publié: (2026)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
par: Yi, Chao, et autres
Publié: (2024)
par: Yi, Chao, et autres
Publié: (2024)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
par: Tang, Jianting, et autres
Publié: (2025)
par: Tang, Jianting, et autres
Publié: (2025)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
par: Lin, Bin, et autres
Publié: (2023)
par: Lin, Bin, et autres
Publié: (2023)
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
Documents similaires
-
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
par: Fang, Rongyao, et autres
Publié: (2025) -
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
par: Jiao, Yang, et autres
Publié: (2024) -
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2026) -
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
par: Zhang, Xinsong, et autres
Publié: (2025) -
AffordanceSAM: Segment Anything Once More in Affordance Grounding
par: Jiang, Dengyang, et autres
Publié: (2025)