Semantic Alignment for Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Tao, Li, Mengze, Chen, Jingyuan, Ji, Wei, Lin, Wang, Gao, Jinyang, Kuang, Kun, Zhao, Zhou, Wu, Fei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
di: Zheng, Xinye, et al.
Pubblicazione: (2026)
di: Zheng, Xinye, et al.
Pubblicazione: (2026)
Panoptic Scene Graph Generation with Semantics-Prototype Learning
di: Li, Li, et al.
Pubblicazione: (2023)
di: Li, Li, et al.
Pubblicazione: (2023)
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
di: Chen, Tao, et al.
Pubblicazione: (2025)
di: Chen, Tao, et al.
Pubblicazione: (2025)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
di: Chen, Lin, et al.
Pubblicazione: (2026)
di: Chen, Lin, et al.
Pubblicazione: (2026)
MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios
di: Fan, Jiaqi, et al.
Pubblicazione: (2024)
di: Fan, Jiaqi, et al.
Pubblicazione: (2024)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
di: Wu, Ruijia, et al.
Pubblicazione: (2025)
di: Wu, Ruijia, et al.
Pubblicazione: (2025)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
di: Wu, Mingrui, et al.
Pubblicazione: (2024)
di: Wu, Mingrui, et al.
Pubblicazione: (2024)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
di: Li, Jiale, et al.
Pubblicazione: (2025)
di: Li, Jiale, et al.
Pubblicazione: (2025)
MetaCoCo: A New Few-Shot Classification Benchmark with Spurious Correlation
di: Zhang, Min, et al.
Pubblicazione: (2024)
di: Zhang, Min, et al.
Pubblicazione: (2024)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
di: Hu, Lulu, et al.
Pubblicazione: (2026)
di: Hu, Lulu, et al.
Pubblicazione: (2026)
Test-Time Computing for Referring Multimodal Large Language Models
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
Large Language Model-Guided Semantic Alignment for Human Activity Recognition
di: Yan, Hua, et al.
Pubblicazione: (2024)
di: Yan, Hua, et al.
Pubblicazione: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
di: E, Shaojun, et al.
Pubblicazione: (2025)
di: E, Shaojun, et al.
Pubblicazione: (2025)
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
di: Lin, Tao, et al.
Pubblicazione: (2025)
di: Lin, Tao, et al.
Pubblicazione: (2025)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
di: Wu, Wentao, et al.
Pubblicazione: (2025)
di: Wu, Wentao, et al.
Pubblicazione: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
di: Shi, Zhelun, et al.
Pubblicazione: (2024)
di: Shi, Zhelun, et al.
Pubblicazione: (2024)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
di: Yang, Zuopeng, et al.
Pubblicazione: (2025)
di: Yang, Zuopeng, et al.
Pubblicazione: (2025)
Visual Representation Alignment for Multimodal Large Language Models
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
PMR: Physical Model-Driven Multi-Stage Restoration of Turbulent Dynamic Videos
di: Wu, Tao, et al.
Pubblicazione: (2025)
di: Wu, Tao, et al.
Pubblicazione: (2025)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
di: Xu, Mingjie, et al.
Pubblicazione: (2025)
di: Xu, Mingjie, et al.
Pubblicazione: (2025)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
di: Zhou, Ziyin, et al.
Pubblicazione: (2025)
di: Zhou, Ziyin, et al.
Pubblicazione: (2025)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
di: Song, Jiafei, et al.
Pubblicazione: (2026)
di: Song, Jiafei, et al.
Pubblicazione: (2026)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
di: Zhong, Yunshan, et al.
Pubblicazione: (2024)
di: Zhong, Yunshan, et al.
Pubblicazione: (2024)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
di: Xing, Shangyu, et al.
Pubblicazione: (2024)
di: Xing, Shangyu, et al.
Pubblicazione: (2024)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
Non-confusing Generation of Customized Concepts in Diffusion Models
di: Lin, Wang, et al.
Pubblicazione: (2024)
di: Lin, Wang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
di: Dong, Xinpeng, et al.
Pubblicazione: (2026) -
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024) -
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
di: Zheng, Xinye, et al.
Pubblicazione: (2026) -
Panoptic Scene Graph Generation with Semantics-Prototype Learning
di: Li, Li, et al.
Pubblicazione: (2023) -
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
di: Chen, Tao, et al.
Pubblicazione: (2025)