Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aggarwal, Sajal, Pandey, Ananya, Vishwakarma, Dinesh Kumar |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VyAnG-Net: A Novel Multi-Modal Sarcasm Recognition Model by Uncovering Visual, Acoustic and Glossary Features
par: Pandey, Ananya, et autres
Publié: (2024)
par: Pandey, Ananya, et autres
Publié: (2024)
Target-Dependent Multimodal Sentiment Analysis Via Employing Visual-to Emotional-Caption Translation Network using Visual-Caption Pairs
par: Pandey, Ananya, et autres
Publié: (2024)
par: Pandey, Ananya, et autres
Publié: (2024)
Contrastive Learning-based Multi Modal Architecture for Emoticon Prediction by Employing Image-Text Pairs
par: Pandey, Ananya, et autres
Publié: (2024)
par: Pandey, Ananya, et autres
Publié: (2024)
Multi-View Incongruity Learning for Multimodal Sarcasm Detection
par: Guo, Diandian, et autres
Publié: (2024)
par: Guo, Diandian, et autres
Publié: (2024)
A Visually Attentive Splice Localization Network with Multi-Domain Feature Extractor and Multi-Receptive Field Upsampler
par: Yadav, Ankit, et autres
Publié: (2024)
par: Yadav, Ankit, et autres
Publié: (2024)
Detecting Emotional Incongruity of Sarcasm by Commonsense Reasoning
par: Qiu, Ziqi, et autres
Publié: (2024)
par: Qiu, Ziqi, et autres
Publié: (2024)
A Noise and Edge extraction-based dual-branch method for Shallowfake and Deepfake Localization
par: Dagar, Deepak, et autres
Publié: (2024)
par: Dagar, Deepak, et autres
Publié: (2024)
Towards Effective Image Forensics via A Novel Computationally Efficient Framework and A New Image Splice Dataset
par: Yadav, Ankit, et autres
Publié: (2024)
par: Yadav, Ankit, et autres
Publié: (2024)
SemIRNet: A Semantic Irony Recognition Network for Multimodal Sarcasm Detection
par: Zhou, Jingxuan, et autres
Publié: (2025)
par: Zhou, Jingxuan, et autres
Publié: (2025)
Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval
par: Zhang, Guosheng, et autres
Publié: (2026)
par: Zhang, Guosheng, et autres
Publié: (2026)
CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning
par: Meng, Chunlei, et autres
Publié: (2026)
par: Meng, Chunlei, et autres
Publié: (2026)
MHS-STMA: Multimodal Hate Speech Detection via Scalable Transformer-Based Multilevel Attention Framework
par: Chhabra, Anusha, et autres
Publié: (2024)
par: Chhabra, Anusha, et autres
Publié: (2024)
Examining Modality Incongruity in Multimodal Federated Learning for Medical Vision and Language-based Disease Detection
par: Saha, Pramit, et autres
Publié: (2024)
par: Saha, Pramit, et autres
Publié: (2024)
Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency
par: Li, Zihan, et autres
Publié: (2025)
par: Li, Zihan, et autres
Publié: (2025)
Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction
par: Jia, Mingda, et autres
Publié: (2025)
par: Jia, Mingda, et autres
Publié: (2025)
UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer
par: Sharma, Dhruv, et autres
Publié: (2024)
par: Sharma, Dhruv, et autres
Publié: (2024)
New Encoder Learning for Captioning Heavy Rain Images via Semantic Visual Feature Matching
par: Son, Chang-Hwan, et autres
Publié: (2021)
par: Son, Chang-Hwan, et autres
Publié: (2021)
Discovering Meaningful Units with Visually Grounded Semantics from Image Captions
par: Behjati, Melika, et autres
Publié: (2025)
par: Behjati, Melika, et autres
Publié: (2025)
StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation
par: Li, Bingyu, et autres
Publié: (2024)
par: Li, Bingyu, et autres
Publié: (2024)
Semantic Image Synthesis via Class-Adaptive Cross-Attention
par: Fontanini, Tomaso, et autres
Publié: (2023)
par: Fontanini, Tomaso, et autres
Publié: (2023)
SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention
par: Xiao, Feng, et autres
Publié: (2024)
par: Xiao, Feng, et autres
Publié: (2024)
Gait Recognition with Temporal Kolmogorov-Arnold Networks
par: Asad, Mohammed, et autres
Publié: (2026)
par: Asad, Mohammed, et autres
Publié: (2026)
Datasets, Clues and State-of-the-Arts for Multimedia Forensics: An Extensive Review
par: Yadav, Ankit, et autres
Publié: (2024)
par: Yadav, Ankit, et autres
Publié: (2024)
Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching
par: Chen, Wenjing
Publié: (2024)
par: Chen, Wenjing
Publié: (2024)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
par: Zhao, Haochen, et autres
Publié: (2025)
par: Zhao, Haochen, et autres
Publié: (2025)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
par: Zheng, Yuze, et autres
Publié: (2024)
par: Zheng, Yuze, et autres
Publié: (2024)
Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations
par: Sen, Souptik, et autres
Publié: (2026)
par: Sen, Souptik, et autres
Publié: (2026)
Semantic-CC: Boosting Remote Sensing Image Change Captioning via Foundational Knowledge and Semantic Guidance
par: Zhu, Yongshuo, et autres
Publié: (2024)
par: Zhu, Yongshuo, et autres
Publié: (2024)
Dual-Stream Cross-Modal Representation Learning via Residual Semantic Decorrelation
par: Li, Xuecheng, et autres
Publié: (2025)
par: Li, Xuecheng, et autres
Publié: (2025)
Tex-ViT: A Generalizable, Robust, Texture-based dual-branch cross-attention deepfake detector
par: Dagar, Deepak, et autres
Publié: (2024)
par: Dagar, Deepak, et autres
Publié: (2024)
Top-Down Semantic Refinement for Image Captioning
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Cross-Modal Scene Semantic Alignment for Image Complexity Assessment
par: Luo, Yuqing, et autres
Publié: (2025)
par: Luo, Yuqing, et autres
Publié: (2025)
Enhancing Multimodal Unified Representations for Cross Modal Generalization
par: Huang, Hai, et autres
Publié: (2024)
par: Huang, Hai, et autres
Publié: (2024)
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
par: Kim, Jeonghyeon, et autres
Publié: (2025)
par: Kim, Jeonghyeon, et autres
Publié: (2025)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
par: He, Xiang, et autres
Publié: (2025)
par: He, Xiang, et autres
Publié: (2025)
Semantic-Guided Natural Language and Visual Fusion for Cross-Modal Interaction Based on Tiny Object Detection
par: Huang, Xian-Hong, et autres
Publié: (2025)
par: Huang, Xian-Hong, et autres
Publié: (2025)
SemanticMIM: Marring Masked Image Modeling with Semantics Compression for General Visual Representation
par: Yuan, Yike, et autres
Publié: (2024)
par: Yuan, Yike, et autres
Publié: (2024)
Multi-Scale Representations by Varying Window Attention for Semantic Segmentation
par: Yan, Haotian, et autres
Publié: (2024)
par: Yan, Haotian, et autres
Publié: (2024)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
par: Li, Zhuowan, et autres
Publié: (2022)
par: Li, Zhuowan, et autres
Publié: (2022)
Semantic-Enhanced Cross-Modal Place Recognition for Robust Robot Localization
par: Lin, Yujia, et autres
Publié: (2025)
par: Lin, Yujia, et autres
Publié: (2025)
Documents similaires
-
VyAnG-Net: A Novel Multi-Modal Sarcasm Recognition Model by Uncovering Visual, Acoustic and Glossary Features
par: Pandey, Ananya, et autres
Publié: (2024) -
Target-Dependent Multimodal Sentiment Analysis Via Employing Visual-to Emotional-Caption Translation Network using Visual-Caption Pairs
par: Pandey, Ananya, et autres
Publié: (2024) -
Contrastive Learning-based Multi Modal Architecture for Emoticon Prediction by Employing Image-Text Pairs
par: Pandey, Ananya, et autres
Publié: (2024) -
Multi-View Incongruity Learning for Multimodal Sarcasm Detection
par: Guo, Diandian, et autres
Publié: (2024) -
A Visually Attentive Splice Localization Network with Multi-Domain Feature Extractor and Multi-Receptive Field Upsampler
par: Yadav, Ankit, et autres
Publié: (2024)