Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Junjie, Liu, Xuyang, Huang, Subin, Zhang, Linfeng, Yu, Hang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning
par: Li, Zhu, et autres
Publié: (2026)
par: Li, Zhu, et autres
Publié: (2026)
Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue
par: Ouyang, Kun, et autres
Publié: (2024)
par: Ouyang, Kun, et autres
Publié: (2024)
Multimodal Misinformation Detection using Large Vision-Language Models
par: Tahmasebi, Sahar, et autres
Publié: (2024)
par: Tahmasebi, Sahar, et autres
Publié: (2024)
InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection
par: Chen, Junjie, et autres
Publié: (2024)
par: Chen, Junjie, et autres
Publié: (2024)
URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection
par: Wang, Zhenyu, et autres
Publié: (2026)
par: Wang, Zhenyu, et autres
Publié: (2026)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
Muse-it: A Tool for Analyzing Music Discourse on Reddit
par: Agarwala, Jatin, et autres
Publié: (2025)
par: Agarwala, Jatin, et autres
Publié: (2025)
Enhancing Fake News Detection in Social Media via Label Propagation on Cross-modal Tweet Graph
par: Zhao, Wanqing, et autres
Publié: (2024)
par: Zhao, Wanqing, et autres
Publié: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
par: Wu, Jiaying, et autres
Publié: (2025)
par: Wu, Jiaying, et autres
Publié: (2025)
HateSieve: A Contrastive Learning Framework for Detecting and Segmenting Hateful Content in Multimodal Memes
par: Su, Xuanyu, et autres
Publié: (2024)
par: Su, Xuanyu, et autres
Publié: (2024)
Unified Hallucination Detection for Multimodal Large Language Models
par: Chen, Xiang, et autres
Publié: (2024)
par: Chen, Xiang, et autres
Publié: (2024)
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
par: Wei, Tianxin, et autres
Publié: (2024)
par: Wei, Tianxin, et autres
Publié: (2024)
Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition
par: Wu, Daiqing, et autres
Publié: (2024)
par: Wu, Daiqing, et autres
Publié: (2024)
Exploring Bengali Religious Dialect Biases in Large Language Models with Evaluation Perspectives
par: Wasi, Azmine Toushik, et autres
Publié: (2024)
par: Wasi, Azmine Toushik, et autres
Publié: (2024)
More than Memes: A Multimodal Topic Modeling Approach to Conspiracy Theories on Telegram
par: Steffen, Elisabeth
Publié: (2024)
par: Steffen, Elisabeth
Publié: (2024)
Automating Steering for Safe Multimodal Large Language Models
par: Wu, Lyucheng, et autres
Publié: (2025)
par: Wu, Lyucheng, et autres
Publié: (2025)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
par: Zhao, Haochen, et autres
Publié: (2025)
par: Zhao, Haochen, et autres
Publié: (2025)
MSM-BD: Multimodal Social Media Bot Detection Using Heterogeneous Information
par: Wu, Tingxuan, et autres
Publié: (2024)
par: Wu, Tingxuan, et autres
Publié: (2024)
Verifying Cross-modal Entity Consistency in News using Vision-language Models
par: Tahmasebi, Sahar, et autres
Publié: (2025)
par: Tahmasebi, Sahar, et autres
Publié: (2025)
VGA: Vision and Graph Fused Attention Network for Rumor Detection
par: Bai, Lin, et autres
Publié: (2024)
par: Bai, Lin, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Visual Authority and the Rhetoric of Health Misinformation: A Multimodal Analysis of Social Media Videos
par: Zarei, Mohammad Reza, et autres
Publié: (2025)
par: Zarei, Mohammad Reza, et autres
Publié: (2025)
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
par: Lu, Xingyu, et autres
Publié: (2025)
par: Lu, Xingyu, et autres
Publié: (2025)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
par: Zhang, Yazhou, et autres
Publié: (2024)
par: Zhang, Yazhou, et autres
Publié: (2024)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
par: Wang, Zihang, et autres
Publié: (2026)
par: Wang, Zihang, et autres
Publié: (2026)
SoMeLVLM: A Large Vision Language Model for Social Media Processing
par: Zhang, Xinnong, et autres
Publié: (2024)
par: Zhang, Xinnong, et autres
Publié: (2024)
Multi-Modal Discussion Transformer: Integrating Text, Images and Graph Transformers to Detect Hate Speech on Social Media
par: Hebert, Liam, et autres
Publié: (2023)
par: Hebert, Liam, et autres
Publié: (2023)
Let Community Rules Be Reflected in Online Content Moderation
par: Xin, Wangjiaxuan, et autres
Publié: (2024)
par: Xin, Wangjiaxuan, et autres
Publié: (2024)
A New Dataset and Benchmark for Grounding Multimodal Misinformation
par: Yang, Bingjian, et autres
Publié: (2025)
par: Yang, Bingjian, et autres
Publié: (2025)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
par: Hu, Anwen, et autres
Publié: (2023)
par: Hu, Anwen, et autres
Publié: (2023)
ChartAdapter: Large Vision-Language Model for Chart Summarization
par: Xu, Peixin, et autres
Publié: (2024)
par: Xu, Peixin, et autres
Publié: (2024)
MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
Television Discourse Decoded: Comprehensive Multimodal Analytics at Scale
par: Agarwal, Anmol, et autres
Publié: (2024)
par: Agarwal, Anmol, et autres
Publié: (2024)
SMTPD: A New Benchmark for Temporal Prediction of Social Media Popularity
par: Xu, Yijie, et autres
Publié: (2025)
par: Xu, Yijie, et autres
Publié: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
Short-video Propagation Influence Rating: A New Real-world Dataset and A New Large Graph Model
par: Xue, Dizhan, et autres
Publié: (2025)
par: Xue, Dizhan, et autres
Publié: (2025)
On the Robustness of Cover Version Identification Models: A Study Using Cover Versions from YouTube
par: Hachmeier, Simon, et autres
Publié: (2025)
par: Hachmeier, Simon, et autres
Publié: (2025)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Documents similaires
-
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
par: Li, Zhu, et autres
Publié: (2025) -
SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning
par: Li, Zhu, et autres
Publié: (2026) -
Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue
par: Ouyang, Kun, et autres
Publié: (2024) -
Multimodal Misinformation Detection using Large Vision-Language Models
par: Tahmasebi, Sahar, et autres
Publié: (2024) -
InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection
par: Chen, Junjie, et autres
Publié: (2024)