Semantic Alignment for Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Tao, Li, Mengze, Chen, Jingyuan, Ji, Wei, Lin, Wang, Gao, Jinyang, Kuang, Kun, Zhao, Zhou, Wu, Fei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
von: Dong, Xinpeng, et al.
Veröffentlicht: (2026)
von: Dong, Xinpeng, et al.
Veröffentlicht: (2026)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
von: Li, Yifan, et al.
Veröffentlicht: (2024)
von: Li, Yifan, et al.
Veröffentlicht: (2024)
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
von: Zheng, Xinye, et al.
Veröffentlicht: (2026)
von: Zheng, Xinye, et al.
Veröffentlicht: (2026)
Panoptic Scene Graph Generation with Semantics-Prototype Learning
von: Li, Li, et al.
Veröffentlicht: (2023)
von: Li, Li, et al.
Veröffentlicht: (2023)
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
von: Chen, Tao, et al.
Veröffentlicht: (2025)
von: Chen, Tao, et al.
Veröffentlicht: (2025)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
von: Chen, Tao, et al.
Veröffentlicht: (2026)
von: Chen, Tao, et al.
Veröffentlicht: (2026)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
von: Chen, Lin, et al.
Veröffentlicht: (2026)
von: Chen, Lin, et al.
Veröffentlicht: (2026)
MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios
von: Fan, Jiaqi, et al.
Veröffentlicht: (2024)
von: Fan, Jiaqi, et al.
Veröffentlicht: (2024)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
von: Wu, Ruijia, et al.
Veröffentlicht: (2025)
von: Wu, Ruijia, et al.
Veröffentlicht: (2025)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
von: Zhao, Yaqi, et al.
Veröffentlicht: (2026)
von: Zhao, Yaqi, et al.
Veröffentlicht: (2026)
Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2025)
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2025)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
von: Wu, Mingrui, et al.
Veröffentlicht: (2024)
von: Wu, Mingrui, et al.
Veröffentlicht: (2024)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
von: Li, Jiale, et al.
Veröffentlicht: (2025)
von: Li, Jiale, et al.
Veröffentlicht: (2025)
MetaCoCo: A New Few-Shot Classification Benchmark with Spurious Correlation
von: Zhang, Min, et al.
Veröffentlicht: (2024)
von: Zhang, Min, et al.
Veröffentlicht: (2024)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
von: Hu, Lulu, et al.
Veröffentlicht: (2026)
von: Hu, Lulu, et al.
Veröffentlicht: (2026)
Test-Time Computing for Referring Multimodal Large Language Models
von: Wu, Mingrui, et al.
Veröffentlicht: (2026)
von: Wu, Mingrui, et al.
Veröffentlicht: (2026)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
von: Liu, Shaoyu, et al.
Veröffentlicht: (2024)
von: Liu, Shaoyu, et al.
Veröffentlicht: (2024)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
von: Wu, Shengqiong, et al.
Veröffentlicht: (2024)
von: Wu, Shengqiong, et al.
Veröffentlicht: (2024)
Large Language Model-Guided Semantic Alignment for Human Activity Recognition
von: Yan, Hua, et al.
Veröffentlicht: (2024)
von: Yan, Hua, et al.
Veröffentlicht: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
von: Wu, Jianlong, et al.
Veröffentlicht: (2025)
von: Wu, Jianlong, et al.
Veröffentlicht: (2025)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
von: E, Shaojun, et al.
Veröffentlicht: (2025)
von: E, Shaojun, et al.
Veröffentlicht: (2025)
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
von: Lin, Tao, et al.
Veröffentlicht: (2025)
von: Lin, Tao, et al.
Veröffentlicht: (2025)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
von: Zhou, Yiyun, et al.
Veröffentlicht: (2025)
von: Zhou, Yiyun, et al.
Veröffentlicht: (2025)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
von: Wu, Wentao, et al.
Veröffentlicht: (2025)
von: Wu, Wentao, et al.
Veröffentlicht: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
von: Shi, Zhelun, et al.
Veröffentlicht: (2024)
von: Shi, Zhelun, et al.
Veröffentlicht: (2024)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
von: Huang, Zhijian, et al.
Veröffentlicht: (2024)
von: Huang, Zhijian, et al.
Veröffentlicht: (2024)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
von: Yang, Zuopeng, et al.
Veröffentlicht: (2025)
von: Yang, Zuopeng, et al.
Veröffentlicht: (2025)
Visual Representation Alignment for Multimodal Large Language Models
von: Yoon, Heeji, et al.
Veröffentlicht: (2025)
von: Yoon, Heeji, et al.
Veröffentlicht: (2025)
PMR: Physical Model-Driven Multi-Stage Restoration of Turbulent Dynamic Videos
von: Wu, Tao, et al.
Veröffentlicht: (2025)
von: Wu, Tao, et al.
Veröffentlicht: (2025)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
von: Zhou, Ziyin, et al.
Veröffentlicht: (2025)
von: Zhou, Ziyin, et al.
Veröffentlicht: (2025)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
von: Song, Jiafei, et al.
Veröffentlicht: (2026)
von: Song, Jiafei, et al.
Veröffentlicht: (2026)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
von: Wu, Jianzong, et al.
Veröffentlicht: (2024)
von: Wu, Jianzong, et al.
Veröffentlicht: (2024)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
von: Zhong, Yunshan, et al.
Veröffentlicht: (2024)
von: Zhong, Yunshan, et al.
Veröffentlicht: (2024)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
von: Xing, Shangyu, et al.
Veröffentlicht: (2024)
von: Xing, Shangyu, et al.
Veröffentlicht: (2024)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
Non-confusing Generation of Customized Concepts in Diffusion Models
von: Lin, Wang, et al.
Veröffentlicht: (2024)
von: Lin, Wang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
von: Dong, Xinpeng, et al.
Veröffentlicht: (2026) -
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
von: Li, Yifan, et al.
Veröffentlicht: (2024) -
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
von: Zheng, Xinye, et al.
Veröffentlicht: (2026) -
Panoptic Scene Graph Generation with Semantics-Prototype Learning
von: Li, Li, et al.
Veröffentlicht: (2023) -
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
von: Chen, Tao, et al.
Veröffentlicht: (2025)