HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Zijian, Wu, Xuecheng, Huang, Danlei, Yan, Siyu, Peng, Chong, Cao, Xuezhi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Contrastive Knowledge Distillation for Robust Multimodal Sentiment Analysis
por: Sang, Zhongyi, et al.
Publicado: (2024)
por: Sang, Zhongyi, et al.
Publicado: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
por: Xue, Junxiao, et al.
Publicado: (2025)
por: Xue, Junxiao, et al.
Publicado: (2025)
FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter
por: Wang, Junxi, et al.
Publicado: (2025)
por: Wang, Junxi, et al.
Publicado: (2025)
Dark Side of Modalities: Reinforced Multimodal Distillation for Multimodal Knowledge Graph Reasoning
por: Zhao, Yu, et al.
Publicado: (2025)
por: Zhao, Yu, et al.
Publicado: (2025)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
por: Ding, Peng, et al.
Publicado: (2024)
por: Ding, Peng, et al.
Publicado: (2024)
State-Anchored Complete-View Distillation for Robust Conversational Multimodal Emotion Recognition
por: Pan, Zhaoyan, et al.
Publicado: (2026)
por: Pan, Zhaoyan, et al.
Publicado: (2026)
EmoVLM-KD: Fusing Distilled Expertise with Vision-Language Models for Visual Emotion Analysis
por: Lee, SangEun, et al.
Publicado: (2025)
por: Lee, SangEun, et al.
Publicado: (2025)
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
por: Liu, Shuhang, et al.
Publicado: (2025)
por: Liu, Shuhang, et al.
Publicado: (2025)
Hybrid CNN-Mamba Enhancement Network for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
por: Cui, Shiyao, et al.
Publicado: (2025)
por: Cui, Shiyao, et al.
Publicado: (2025)
Multi-source Knowledge Enhanced Graph Attention Networks for Multimodal Fact Verification
por: Cao, Han, et al.
Publicado: (2024)
por: Cao, Han, et al.
Publicado: (2024)
Multi-MLLM Knowledge Distillation for Out-of-Context News Detection
por: Gu, Yimeng, et al.
Publicado: (2025)
por: Gu, Yimeng, et al.
Publicado: (2025)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
por: Cui, Yang, et al.
Publicado: (2025)
por: Cui, Yang, et al.
Publicado: (2025)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
por: Cao, Jiajun, et al.
Publicado: (2025)
por: Cao, Jiajun, et al.
Publicado: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
por: Zhang, Bo, et al.
Publicado: (2024)
por: Zhang, Bo, et al.
Publicado: (2024)
Multimodal Fusion via Hypergraph Autoencoder and Contrastive Learning for Emotion Recognition in Conversation
por: Yi, Zijian, et al.
Publicado: (2024)
por: Yi, Zijian, et al.
Publicado: (2024)
FeatDistill: A Feature Distillation Enhanced Multi-Expert Ensemble Framework for Robust AI-generated Image Detection
por: Tu, Zhilin, et al.
Publicado: (2026)
por: Tu, Zhilin, et al.
Publicado: (2026)
Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion
por: Zhang, Ying, et al.
Publicado: (2025)
por: Zhang, Ying, et al.
Publicado: (2025)
Robust Multi-generation Learned Compression of Point Cloud Attribute
por: Liu, Xiangzuo, et al.
Publicado: (2025)
por: Liu, Xiangzuo, et al.
Publicado: (2025)
Towards Multimodal Emotional Support Conversation Systems
por: Chu, Yuqi, et al.
Publicado: (2024)
por: Chu, Yuqi, et al.
Publicado: (2024)
Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
por: Zhao, Zijian, et al.
Publicado: (2025)
por: Zhao, Zijian, et al.
Publicado: (2025)
Multimodal Classification and Out-of-distribution Detection for Multimodal Intent Understanding
por: Zhang, Hanlei, et al.
Publicado: (2024)
por: Zhang, Hanlei, et al.
Publicado: (2024)
Towards Alleviating Text-to-Image Retrieval Hallucination for CLIP in Zero-shot Learning
por: Wang, Hanyao, et al.
Publicado: (2024)
por: Wang, Hanyao, et al.
Publicado: (2024)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
por: Chen, Junzhe, et al.
Publicado: (2025)
por: Chen, Junzhe, et al.
Publicado: (2025)
Hallucination Localization in Video Captioning
por: Nakada, Shota, et al.
Publicado: (2025)
por: Nakada, Shota, et al.
Publicado: (2025)
A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization
por: Kapuriya, Janak, et al.
Publicado: (2025)
por: Kapuriya, Janak, et al.
Publicado: (2025)
KEN: Knowledge Augmentation and Emotion Guidance Network for Multimodal Fake News Detection
por: Zhu, Peican, et al.
Publicado: (2025)
por: Zhu, Peican, et al.
Publicado: (2025)
TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis with Missing and Noisy Modalities
por: Zhuang, Yan, et al.
Publicado: (2025)
por: Zhuang, Yan, et al.
Publicado: (2025)
Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization
por: Li, Qingcao, et al.
Publicado: (2026)
por: Li, Qingcao, et al.
Publicado: (2026)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
por: Cheng, Zhi-Qi, et al.
Publicado: (2024)
por: Cheng, Zhi-Qi, et al.
Publicado: (2024)
Exploring the Role of Audio in Multimodal Misinformation Detection
por: Liu, Moyang, et al.
Publicado: (2024)
por: Liu, Moyang, et al.
Publicado: (2024)
Multimodal LLM-based Query Paraphrasing for Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
por: Li, Fu, et al.
Publicado: (2025)
por: Li, Fu, et al.
Publicado: (2025)
InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection
por: Li, Zongyi, et al.
Publicado: (2025)
por: Li, Zongyi, et al.
Publicado: (2025)
Graph-based Interaction Augmentation Network for Robust Multimodal Sentiment Analysis
por: Zhangfeng, Hu, et al.
Publicado: (2025)
por: Zhangfeng, Hu, et al.
Publicado: (2025)
Mixture of Disentangled Experts with Missing Modalities for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
Unified Hallucination Detection for Multimodal Large Language Models
por: Chen, Xiang, et al.
Publicado: (2024)
por: Chen, Xiang, et al.
Publicado: (2024)
TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection
por: Yan, Zehong, et al.
Publicado: (2025)
por: Yan, Zehong, et al.
Publicado: (2025)
Multimodal Multi-turn Conversation Stance Detection: A Challenge Dataset and Effective Model
por: Niu, Fuqiang, et al.
Publicado: (2024)
por: Niu, Fuqiang, et al.
Publicado: (2024)
Contribution-Guided Asymmetric Learning for Robust Multimodal Fusion under Imbalance and Noise
por: Xu, Zijing, et al.
Publicado: (2025)
por: Xu, Zijing, et al.
Publicado: (2025)
Ejemplares similares
-
Contrastive Knowledge Distillation for Robust Multimodal Sentiment Analysis
por: Sang, Zhongyi, et al.
Publicado: (2024) -
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
por: Xue, Junxiao, et al.
Publicado: (2025) -
FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter
por: Wang, Junxi, et al.
Publicado: (2025) -
Dark Side of Modalities: Reinforced Multimodal Distillation for Multimodal Knowledge Graph Reasoning
por: Zhao, Yu, et al.
Publicado: (2025) -
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
por: Ding, Peng, et al.
Publicado: (2024)