Hateful Meme Detection through Context-Sensitive Prompting and Fine-Grained Labeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ouyang, Rongxin, Jaidka, Kokil, Mukerjee, Subhayan, Cui, Guangyu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
Does CLIP perceive art the same way we do?
par: Asperti, Andrea, et autres
Publié: (2025)
par: Asperti, Andrea, et autres
Publié: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Labels or Input? Rethinking Augmentation in Multimodal Hate Detection
par: Singh, Sahajpreet, et autres
Publié: (2025)
par: Singh, Sahajpreet, et autres
Publié: (2025)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)
par: Viveiros, André G., et autres
Publié: (2025)
A Survey on Vision-Language-Action Models for Embodied AI
par: Ma, Yueen, et autres
Publié: (2024)
par: Ma, Yueen, et autres
Publié: (2024)
TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding
par: Zhang, Junwen, et autres
Publié: (2025)
par: Zhang, Junwen, et autres
Publié: (2025)
Biomedical Visual Instruction Tuning with Clinician Preference Alignment
par: Cui, Hejie, et autres
Publié: (2024)
par: Cui, Hejie, et autres
Publié: (2024)
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
par: Yim, Wen-wai, et autres
Publié: (2025)
par: Yim, Wen-wai, et autres
Publié: (2025)
ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
par: Huo, Dongjie, et autres
Publié: (2026)
par: Huo, Dongjie, et autres
Publié: (2026)
Context-Dependent Affordance Computation in Vision-Language Models
par: Farzulla, Murad
Publié: (2026)
par: Farzulla, Murad
Publié: (2026)
PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
par: Agarwal, Amit, et autres
Publié: (2025)
par: Agarwal, Amit, et autres
Publié: (2025)
Semantic2Graph: Graph-based Multi-modal Feature Fusion for Action Segmentation in Videos
par: Zhang, Junbin, et autres
Publié: (2022)
par: Zhang, Junbin, et autres
Publié: (2022)
PDFMathTranslate: Scientific Document Translation Preserving Layouts
par: Ouyang, Rongxin, et autres
Publié: (2025)
par: Ouyang, Rongxin, et autres
Publié: (2025)
MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation
par: Qi, Dekang, et autres
Publié: (2026)
par: Qi, Dekang, et autres
Publié: (2026)
Spectral Integrated Gradients for Coarse-to-Fine Feature Attribution
par: Kim, Soyeon, et autres
Publié: (2026)
par: Kim, Soyeon, et autres
Publié: (2026)
Short-Window Sliding Learning for Real-Time Violence Detection via LLM-based Auto-Labeling
par: Jung, Seoik, et autres
Publié: (2025)
par: Jung, Seoik, et autres
Publié: (2025)
RACAS: Controlling Diverse Robots With a Single Agentic System
par: Ashley, Dylan R., et autres
Publié: (2026)
par: Ashley, Dylan R., et autres
Publié: (2026)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
The MSR-Video to Text Dataset with Clean Annotations
par: Chen, Haoran, et autres
Publié: (2021)
par: Chen, Haoran, et autres
Publié: (2021)
Beyond RNNs: Benchmarking Attention-Based Image Captioning Models
par: Yanambakkam, Hemanth Teja, et autres
Publié: (2025)
par: Yanambakkam, Hemanth Teja, et autres
Publié: (2025)
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
par: Malikussaid, et autres
Publié: (2026)
par: Malikussaid, et autres
Publié: (2026)
Predictive Modeling of Maritime Radar Data Using Transformer Architecture
par: Qesaraku, Bjorna, et autres
Publié: (2025)
par: Qesaraku, Bjorna, et autres
Publié: (2025)
Multi-Agent Object Detection Framework Based on Raspberry Pi YOLO Detector and Slack-Ollama Natural Language Interface
par: Kalušev, Vladimir, et autres
Publié: (2026)
par: Kalušev, Vladimir, et autres
Publié: (2026)
MB-DSMIL-CL-PL: Scalable Weakly Supervised Ovarian Cancer Subtype Classification and Localisation Using Contrastive and Prototype Learning with Frozen Patch Features
par: Jenkins, Marcus, et autres
Publié: (2026)
par: Jenkins, Marcus, et autres
Publié: (2026)
Manifold-Aligned Guided Integrated Gradients for Reliable Feature Attribution
par: Kim, Soyeon, et autres
Publié: (2026)
par: Kim, Soyeon, et autres
Publié: (2026)
Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video
par: Moore, Alexander, et autres
Publié: (2025)
par: Moore, Alexander, et autres
Publié: (2025)
Method of UAV Inspection of Photovoltaic Modules Using Thermal and RGB Data Fusion
par: Lysyi, Andrii, et autres
Publié: (2025)
par: Lysyi, Andrii, et autres
Publié: (2025)
A Landmark-Aware Visual Navigation Dataset
par: Johnson, Faith, et autres
Publié: (2024)
par: Johnson, Faith, et autres
Publié: (2024)
DOD-SA: Infrared-Visible Decoupled Object Detection with Single-Modality Annotations
par: Jin, Hang, et autres
Publié: (2025)
par: Jin, Hang, et autres
Publié: (2025)
Rethinking Visual Intelligence: Insights from Video Pretraining
par: Acuaviva, Pablo, et autres
Publié: (2025)
par: Acuaviva, Pablo, et autres
Publié: (2025)
Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces
par: Gkountouras, John, et autres
Publié: (2025)
par: Gkountouras, John, et autres
Publié: (2025)
JVLGS: Joint Vision-Language Gas Leak Segmentation
par: Zhao, Xinlong, et autres
Publié: (2025)
par: Zhao, Xinlong, et autres
Publié: (2025)
Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
Balanced conic rectified flow
par: Kim, Shin Seong, et autres
Publié: (2025)
par: Kim, Shin Seong, et autres
Publié: (2025)
Polarization-Based Eye Tracking with Personalized Siamese Architectures
par: Kalkanli, Beyza, et autres
Publié: (2026)
par: Kalkanli, Beyza, et autres
Publié: (2026)
CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method
par: Koh, Hyunseo, et autres
Publié: (2026)
par: Koh, Hyunseo, et autres
Publié: (2026)
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
par: Patel, Urjitkumar, et autres
Publié: (2025)
par: Patel, Urjitkumar, et autres
Publié: (2025)
Documents similaires
-
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025) -
Does CLIP perceive art the same way we do?
par: Asperti, Andrea, et autres
Publié: (2025) -
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025) -
Labels or Input? Rethinking Augmentation in Multimodal Hate Detection
par: Singh, Sahajpreet, et autres
Publié: (2025) -
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)