Vision-Centric Activation and Coordination for Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yunnan, Lu, Fan, Zheng, Kecheng, Huang, Ziyuan, Li, Ziqiang, Zeng, Wenjun, Jin, Xin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Graph-based Unsupervised Disentangled Representation Learning via Multimodal Large Language Models
por: Xie, Baao, et al.
Publicado: (2024)
por: Xie, Baao, et al.
Publicado: (2024)
Scene Graph Disentanglement and Composition for Generalizable Complex Image Generation
por: Wang, Yunnan, et al.
Publicado: (2024)
por: Wang, Yunnan, et al.
Publicado: (2024)
SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations
por: Wang, Yunnan, et al.
Publicado: (2026)
por: Wang, Yunnan, et al.
Publicado: (2026)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2024)
por: Zhan, Yufei, et al.
Publicado: (2024)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
por: Zhang, Wenyao, et al.
Publicado: (2025)
por: Zhang, Wenyao, et al.
Publicado: (2025)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
por: Zheng, Xiangxi, et al.
Publicado: (2025)
por: Zheng, Xiangxi, et al.
Publicado: (2025)
MTAttack: Multi-Target Backdoor Attacks against Large Vision-Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
por: Zeng, Weili, et al.
Publicado: (2025)
por: Zeng, Weili, et al.
Publicado: (2025)
Knowledge Regularized Negative Feature Tuning of Vision-Language Models for Out-of-Distribution Detection
por: Zhu, Wenjie, et al.
Publicado: (2025)
por: Zhu, Wenjie, et al.
Publicado: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
por: Lu, Fan, et al.
Publicado: (2024)
por: Lu, Fan, et al.
Publicado: (2024)
Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation
por: Zhang, Wenyao, et al.
Publicado: (2025)
por: Zhang, Wenyao, et al.
Publicado: (2025)
Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion
por: Li, Bohan, et al.
Publicado: (2023)
por: Li, Bohan, et al.
Publicado: (2023)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
por: Jiao, Yang, et al.
Publicado: (2024)
por: Jiao, Yang, et al.
Publicado: (2024)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
por: Ren, Xiyu, et al.
Publicado: (2026)
por: Ren, Xiyu, et al.
Publicado: (2026)
Accelerating Pre-training of Multimodal LLMs via Chain-of-Sight
por: Huang, Ziyuan, et al.
Publicado: (2024)
por: Huang, Ziyuan, et al.
Publicado: (2024)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)
por: Yan, Ziang, et al.
Publicado: (2024)
MePT: Multi-Representation Guided Prompt Tuning for Vision-Language Model
por: Wang, Xinyang, et al.
Publicado: (2024)
por: Wang, Xinyang, et al.
Publicado: (2024)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
por: Meng, Fanqing, et al.
Publicado: (2024)
por: Meng, Fanqing, et al.
Publicado: (2024)
DreamLIP: Language-Image Pre-training with Long Captions
por: Zheng, Kecheng, et al.
Publicado: (2024)
por: Zheng, Kecheng, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
por: Wu, Jiulong, et al.
Publicado: (2025)
por: Wu, Jiulong, et al.
Publicado: (2025)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
por: Ai, Hao, et al.
Publicado: (2025)
por: Ai, Hao, et al.
Publicado: (2025)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
por: Yin, Jianghao, et al.
Publicado: (2026)
por: Yin, Jianghao, et al.
Publicado: (2026)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
por: Gong, Biao, et al.
Publicado: (2023)
por: Gong, Biao, et al.
Publicado: (2023)
Vision-Language Models for Vision Tasks: A Survey
por: Zhang, Jingyi, et al.
Publicado: (2023)
por: Zhang, Jingyi, et al.
Publicado: (2023)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
por: Wu, Jiannan, et al.
Publicado: (2024)
por: Wu, Jiannan, et al.
Publicado: (2024)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024)
por: Lei, Xuanyu, et al.
Publicado: (2024)
Contextual AD Narration with Interleaved Multimodal Sequence
por: Wang, Hanlin, et al.
Publicado: (2024)
por: Wang, Hanlin, et al.
Publicado: (2024)
Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation
por: Jin, Jiongchao, et al.
Publicado: (2025)
por: Jin, Jiongchao, et al.
Publicado: (2025)
Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation
por: Yu, Wenjun, et al.
Publicado: (2025)
por: Yu, Wenjun, et al.
Publicado: (2025)
SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem
por: Shi, Ziqiang, et al.
Publicado: (2026)
por: Shi, Ziqiang, et al.
Publicado: (2026)
Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
por: Zhang, Fan, et al.
Publicado: (2025)
por: Zhang, Fan, et al.
Publicado: (2025)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
por: Zhang, YiFan, et al.
Publicado: (2024)
por: Zhang, YiFan, et al.
Publicado: (2024)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
por: Huang, Zhipeng, et al.
Publicado: (2024)
por: Huang, Zhipeng, et al.
Publicado: (2024)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
por: Liu, Yuansen, et al.
Publicado: (2025)
por: Liu, Yuansen, et al.
Publicado: (2025)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
por: Zhang, Jinrui, et al.
Publicado: (2024)
por: Zhang, Jinrui, et al.
Publicado: (2024)
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
por: Zheng, Xinye, et al.
Publicado: (2026)
por: Zheng, Xinye, et al.
Publicado: (2026)
Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
por: Wu, Sihao, et al.
Publicado: (2025)
por: Wu, Sihao, et al.
Publicado: (2025)
Ejemplares similares
-
Graph-based Unsupervised Disentangled Representation Learning via Multimodal Large Language Models
por: Xie, Baao, et al.
Publicado: (2024) -
Scene Graph Disentanglement and Composition for Generalizable Complex Image Generation
por: Wang, Yunnan, et al.
Publicado: (2024) -
SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations
por: Wang, Yunnan, et al.
Publicado: (2026) -
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2024) -
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
por: Zhang, Wenyao, et al.
Publicado: (2025)