When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yanhui, Zhou, Qi, Xu, Zhihong, Guo, Huizhong, Wang, Wenhai, Wang, Dongxia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios
par: Wang, Bing, et autres
Publié: (2026)
par: Wang, Bing, et autres
Publié: (2026)
Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators
par: Jo, Claire Wonjeong, et autres
Publié: (2024)
par: Jo, Claire Wonjeong, et autres
Publié: (2024)
Failures to Surface Harmful Contents in Video Large Language Models
par: Cao, Yuxin, et autres
Publié: (2025)
par: Cao, Yuxin, et autres
Publié: (2025)
Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
par: Chen, Guangke, et autres
Publié: (2025)
par: Chen, Guangke, et autres
Publié: (2025)
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
par: Saha, Anisha, et autres
Publié: (2026)
par: Saha, Anisha, et autres
Publié: (2026)
Modeling Human Responses to Multimodal AI Content
par: Shen, Zhiqi, et autres
Publié: (2025)
par: Shen, Zhiqi, et autres
Publié: (2025)
A Multi-modal Fusion Network for Terrain Perception Based on Illumination Aware
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
par: Li, Haitian, et autres
Publié: (2026)
par: Li, Haitian, et autres
Publié: (2026)
A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects
par: Ruan, Shulan, et autres
Publié: (2025)
par: Ruan, Shulan, et autres
Publié: (2025)
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides
par: Zhao, Jinghua, et autres
Publié: (2025)
par: Zhao, Jinghua, et autres
Publié: (2025)
When Synthetic Traces Hide Real Content: Analysis of Stable Diffusion Image Laundering
par: Mandelli, Sara, et autres
Publié: (2024)
par: Mandelli, Sara, et autres
Publié: (2024)
Open-Vocabulary Audio-Visual Semantic Segmentation
par: Guo, Ruohao, et autres
Publié: (2024)
par: Guo, Ruohao, et autres
Publié: (2024)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
par: Zhang, Miaosen, et autres
Publié: (2025)
par: Zhang, Miaosen, et autres
Publié: (2025)
WorldGPT: Empowering LLM as Multimodal World Model
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
par: Cheng, Zebang, et autres
Publié: (2024)
par: Cheng, Zebang, et autres
Publié: (2024)
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
par: Wang, Dali, et autres
Publié: (2026)
par: Wang, Dali, et autres
Publié: (2026)
Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models
par: Lin, Yuxiang, et autres
Publié: (2025)
par: Lin, Yuxiang, et autres
Publié: (2025)
AniME: Adaptive Multi-Agent Planning for Long Animation Generation
par: Zhang, Lisai, et autres
Publié: (2025)
par: Zhang, Lisai, et autres
Publié: (2025)
Semantic Communication-Enabled Cloud-Edge-End-collaborative Metaverse Services Architecure
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
par: Ma, Jianzhe, et autres
Publié: (2026)
par: Ma, Jianzhe, et autres
Publié: (2026)
LLM-Guided Semantic Relational Reasoning for Multimodal Intent Recognition
par: Zhou, Qianrui, et autres
Publié: (2025)
par: Zhou, Qianrui, et autres
Publié: (2025)
Metamorphic Testing for Audio Content Moderation Software
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
par: Yan, Xin, et autres
Publié: (2024)
par: Yan, Xin, et autres
Publié: (2024)
Semantic-Guided Unsupervised Video Summarization
par: Liu, Haizhou, et autres
Publié: (2026)
par: Liu, Haizhou, et autres
Publié: (2026)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
par: Chen, Liangyu, et autres
Publié: (2024)
par: Chen, Liangyu, et autres
Publié: (2024)
MindFuse: Towards GenAI Explainability in Marketing Strategy Co-Creation
par: Farseev, Aleksandr, et autres
Publié: (2025)
par: Farseev, Aleksandr, et autres
Publié: (2025)
KEN: Knowledge Augmentation and Emotion Guidance Network for Multimodal Fake News Detection
par: Zhu, Peican, et autres
Publié: (2025)
par: Zhu, Peican, et autres
Publié: (2025)
MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning
par: Zheng, Xinhan, et autres
Publié: (2025)
par: Zheng, Xinhan, et autres
Publié: (2025)
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
par: Wang, Xiaohan, et autres
Publié: (2026)
par: Wang, Xiaohan, et autres
Publié: (2026)
Think2Sing: Orchestrating Structured Motion Subtitles for Singing-Driven 3D Head Animation
par: Huang, Zikai, et autres
Publié: (2025)
par: Huang, Zikai, et autres
Publié: (2025)
Stage Light is Sequence$^2$: Multi-Light Control via Imitation Learning
par: Zhao, Zijian, et autres
Publié: (2026)
par: Zhao, Zijian, et autres
Publié: (2026)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
par: Xu, Pengju, et autres
Publié: (2025)
par: Xu, Pengju, et autres
Publié: (2025)
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
par: Zeng, Wei, et autres
Publié: (2025)
par: Zeng, Wei, et autres
Publié: (2025)
MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding
par: Wang, Xuanchen, et autres
Publié: (2025)
par: Wang, Xuanchen, et autres
Publié: (2025)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
par: Xu, Danni, et autres
Publié: (2026)
par: Xu, Danni, et autres
Publié: (2026)
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
par: Jin, Zeyu, et autres
Publié: (2026)
par: Jin, Zeyu, et autres
Publié: (2026)
SocialDF: Benchmark Dataset and Detection Model for Mitigating Harmful Deepfake Content on Social Media Platforms
par: Batra, Arnesh, et autres
Publié: (2025)
par: Batra, Arnesh, et autres
Publié: (2025)
Detecting Misinformation in Multimedia Content through Cross-Modal Entity Consistency: A Dual Learning Approach
par: Fu, Zhe, et autres
Publié: (2024)
par: Fu, Zhe, et autres
Publié: (2024)
HumanVLM: Foundation for Human-Scene Vision-Language Model
par: Dai, Dawei, et autres
Publié: (2024)
par: Dai, Dawei, et autres
Publié: (2024)
Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos
par: Tian, Chong, et autres
Publié: (2026)
par: Tian, Chong, et autres
Publié: (2026)
Documents similaires
-
Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios
par: Wang, Bing, et autres
Publié: (2026) -
Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators
par: Jo, Claire Wonjeong, et autres
Publié: (2024) -
Failures to Surface Harmful Contents in Video Large Language Models
par: Cao, Yuxin, et autres
Publié: (2025) -
Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
par: Chen, Guangke, et autres
Publié: (2025) -
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
par: Saha, Anisha, et autres
Publié: (2026)