Semantic Alignment for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Tao, Li, Mengze, Chen, Jingyuan, Ji, Wei, Lin, Wang, Gao, Jinyang, Kuang, Kun, Zhao, Zhou, Wu, Fei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026)
par: Dong, Xinpeng, et autres
Publié: (2026)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
par: Zheng, Xinye, et autres
Publié: (2026)
par: Zheng, Xinye, et autres
Publié: (2026)
Panoptic Scene Graph Generation with Semantics-Prototype Learning
par: Li, Li, et autres
Publié: (2023)
par: Li, Li, et autres
Publié: (2023)
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
par: Chen, Tao, et autres
Publié: (2025)
par: Chen, Tao, et autres
Publié: (2025)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
par: Chen, Lin, et autres
Publié: (2026)
par: Chen, Lin, et autres
Publié: (2026)
MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios
par: Fan, Jiaqi, et autres
Publié: (2024)
par: Fan, Jiaqi, et autres
Publié: (2024)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
par: Wu, Ruijia, et autres
Publié: (2025)
par: Wu, Ruijia, et autres
Publié: (2025)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
par: Zhao, Yaqi, et autres
Publié: (2026)
par: Zhao, Yaqi, et autres
Publié: (2026)
Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment
par: Cui, Feng-Qi, et autres
Publié: (2025)
par: Cui, Feng-Qi, et autres
Publié: (2025)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
par: Wu, Mingrui, et autres
Publié: (2024)
par: Wu, Mingrui, et autres
Publié: (2024)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
par: Li, Jiale, et autres
Publié: (2025)
par: Li, Jiale, et autres
Publié: (2025)
MetaCoCo: A New Few-Shot Classification Benchmark with Spurious Correlation
par: Zhang, Min, et autres
Publié: (2024)
par: Zhang, Min, et autres
Publié: (2024)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
par: Hu, Lulu, et autres
Publié: (2026)
par: Hu, Lulu, et autres
Publié: (2026)
Test-Time Computing for Referring Multimodal Large Language Models
par: Wu, Mingrui, et autres
Publié: (2026)
par: Wu, Mingrui, et autres
Publié: (2026)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
par: Liu, Shaoyu, et autres
Publié: (2024)
par: Liu, Shaoyu, et autres
Publié: (2024)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
Large Language Model-Guided Semantic Alignment for Human Activity Recognition
par: Yan, Hua, et autres
Publié: (2024)
par: Yan, Hua, et autres
Publié: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025)
par: Wu, Qiong, et autres
Publié: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
par: Wu, Jianlong, et autres
Publié: (2025)
par: Wu, Jianlong, et autres
Publié: (2025)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
par: E, Shaojun, et autres
Publié: (2025)
par: E, Shaojun, et autres
Publié: (2025)
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
par: Lin, Tao, et autres
Publié: (2025)
par: Lin, Tao, et autres
Publié: (2025)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
par: Zhou, Yiyun, et autres
Publié: (2025)
par: Zhou, Yiyun, et autres
Publié: (2025)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
par: Shi, Zhelun, et autres
Publié: (2024)
par: Shi, Zhelun, et autres
Publié: (2024)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
par: Huang, Zhijian, et autres
Publié: (2024)
par: Huang, Zhijian, et autres
Publié: (2024)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
par: Yang, Zuopeng, et autres
Publié: (2025)
par: Yang, Zuopeng, et autres
Publié: (2025)
Visual Representation Alignment for Multimodal Large Language Models
par: Yoon, Heeji, et autres
Publié: (2025)
par: Yoon, Heeji, et autres
Publié: (2025)
PMR: Physical Model-Driven Multi-Stage Restoration of Turbulent Dynamic Videos
par: Wu, Tao, et autres
Publié: (2025)
par: Wu, Tao, et autres
Publié: (2025)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
par: Xu, Mingjie, et autres
Publié: (2025)
par: Xu, Mingjie, et autres
Publié: (2025)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
par: Zhou, Ziyin, et autres
Publié: (2025)
par: Zhou, Ziyin, et autres
Publié: (2025)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
par: Song, Jiafei, et autres
Publié: (2026)
par: Song, Jiafei, et autres
Publié: (2026)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
par: Zhong, Yunshan, et autres
Publié: (2024)
par: Zhong, Yunshan, et autres
Publié: (2024)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
par: Xing, Shangyu, et autres
Publié: (2024)
par: Xing, Shangyu, et autres
Publié: (2024)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
par: Fu, Chaoyou, et autres
Publié: (2023)
par: Fu, Chaoyou, et autres
Publié: (2023)
Non-confusing Generation of Customized Concepts in Diffusion Models
par: Lin, Wang, et autres
Publié: (2024)
par: Lin, Wang, et autres
Publié: (2024)
Documents similaires
-
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026) -
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024) -
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
par: Zheng, Xinye, et autres
Publié: (2026) -
Panoptic Scene Graph Generation with Semantics-Prototype Learning
par: Li, Li, et autres
Publié: (2023) -
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
par: Chen, Tao, et autres
Publié: (2025)