Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Jinjie, Wang, Yaxiong, Cheng, Lechao, Pu, Nan, Zhong, Zhun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL
by: Shen, Jinjie, et al.
Published: (2026)
by: Shen, Jinjie, et al.
Published: (2026)
Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline
by: Li, Haiyang, et al.
Published: (2025)
by: Li, Haiyang, et al.
Published: (2025)
OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics
by: Shen, Jinjie, et al.
Published: (2026)
by: Shen, Jinjie, et al.
Published: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
by: Zhang, Zhenxing, et al.
Published: (2024)
by: Zhang, Zhenxing, et al.
Published: (2024)
TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
by: Wang, Qihang, et al.
Published: (2025)
by: Wang, Qihang, et al.
Published: (2025)
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning
by: Wang, Yaxiong, et al.
Published: (2024)
by: Wang, Yaxiong, et al.
Published: (2024)
Towards Micro-Action Recognition with Limited Annotations: An Asynchronous Pseudo Labeling and Training Approach
by: Zhang, Yan, et al.
Published: (2025)
by: Zhang, Yan, et al.
Published: (2025)
Towards Fine-Grained Emotion Understanding via Skeleton-Based Micro-Gesture Recognition
by: Xu, Hao, et al.
Published: (2025)
by: Xu, Hao, et al.
Published: (2025)
Knowledge Swapping via Learning and Unlearning
by: Xing, Mingyu, et al.
Published: (2025)
by: Xing, Mingyu, et al.
Published: (2025)
SSAM: Self-Supervised Association Modeling for Test-Time Adaption
by: Wang, Yaxiong, et al.
Published: (2025)
by: Wang, Yaxiong, et al.
Published: (2025)
FoCLIP: A Feature-Space Misalignment Framework for CLIP-Based Image Manipulation and Detection
by: Chen, Yulin, et al.
Published: (2025)
by: Chen, Yulin, et al.
Published: (2025)
FedHPL: Efficient Heterogeneous Federated Learning with Prompt Tuning and Logit Distillation
by: Ma, Yuting, et al.
Published: (2024)
by: Ma, Yuting, et al.
Published: (2024)
MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment
by: Li, Juan, et al.
Published: (2026)
by: Li, Juan, et al.
Published: (2026)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
by: Zhou, Jun, et al.
Published: (2026)
by: Zhou, Jun, et al.
Published: (2026)
ChangeDiff: A Multi-Temporal Change Detection Data Generator with Flexible Text Prompts via Diffusion Model
by: Zang, Qi, et al.
Published: (2024)
by: Zang, Qi, et al.
Published: (2024)
Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline
by: Lian, Jingchun, et al.
Published: (2024)
by: Lian, Jingchun, et al.
Published: (2024)
Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision
by: Kim, Jiyeong, et al.
Published: (2026)
by: Kim, Jiyeong, et al.
Published: (2026)
Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions
by: Lu, Zhiyang, et al.
Published: (2026)
by: Lu, Zhiyang, et al.
Published: (2026)
CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment
by: Shao, Maoyuan, et al.
Published: (2026)
by: Shao, Maoyuan, et al.
Published: (2026)
Detection of On-Ground Chestnuts Using Artificial Intelligence Toward Automated Picking
by: Fang, Kaixuan, et al.
Published: (2026)
by: Fang, Kaixuan, et al.
Published: (2026)
A Large-scale Universal Evaluation Benchmark For Face Forgery Detection
by: Bei, Yijun, et al.
Published: (2024)
by: Bei, Yijun, et al.
Published: (2024)
Semantic Manipulation Localization
by: Tan, Zhenshan, et al.
Published: (2026)
by: Tan, Zhenshan, et al.
Published: (2026)
World-Grounded Human Motion Recovery via Gravity-View Coordinates
by: Shen, Zehong, et al.
Published: (2024)
by: Shen, Zehong, et al.
Published: (2024)
A-MESS: Anchor based Multimodal Embedding with Semantic Synchronization for Multimodal Intent Recognition
by: Shen, Yaomin, et al.
Published: (2025)
by: Shen, Yaomin, et al.
Published: (2025)
VMID: A Multimodal Fusion LLM Framework for Detecting and Identifying Misinformation of Short Videos
by: Zhong, Weihao, et al.
Published: (2024)
by: Zhong, Weihao, et al.
Published: (2024)
Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
by: Wang, Suyuchen, et al.
Published: (2025)
by: Wang, Suyuchen, et al.
Published: (2025)
Leveraging Hierarchical Image-Text Misalignment for Universal Fake Image Detection
by: Zhang, Daichi, et al.
Published: (2025)
by: Zhang, Daichi, et al.
Published: (2025)
Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering
by: Wang, Xu, et al.
Published: (2025)
by: Wang, Xu, et al.
Published: (2025)
Beyond Known Clusters: Probe New Prototypes for Efficient Generalized Class Discovery
by: Wang, Ye, et al.
Published: (2024)
by: Wang, Ye, et al.
Published: (2024)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
by: He, Jinlong, et al.
Published: (2024)
by: He, Jinlong, et al.
Published: (2024)
Neighborhood Commonality-aware Evolution Network for Continuous Generalized Category Discovery
by: Wang, Ye, et al.
Published: (2024)
by: Wang, Ye, et al.
Published: (2024)
Knowledge Adaptation Network for Few-Shot Class-Incremental Learning
by: Wang, Ye, et al.
Published: (2024)
by: Wang, Ye, et al.
Published: (2024)
ReMamber: Referring Image Segmentation with Mamba Twister
by: Yang, Yuhuan, et al.
Published: (2024)
by: Yang, Yuhuan, et al.
Published: (2024)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
by: Yu, Mingyu, et al.
Published: (2026)
by: Yu, Mingyu, et al.
Published: (2026)
FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation
by: Zeng, Huajian, et al.
Published: (2026)
by: Zeng, Huajian, et al.
Published: (2026)
Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles
by: Liao, Haicheng, et al.
Published: (2025)
by: Liao, Haicheng, et al.
Published: (2025)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
by: Huang, Zhengchao, et al.
Published: (2024)
by: Huang, Zhengchao, et al.
Published: (2024)
Beyond Human-prompting: Adaptive Prompt Tuning with Semantic Alignment for Anomaly Detection
by: Chen, Pi-Wei, et al.
Published: (2025)
by: Chen, Pi-Wei, et al.
Published: (2025)
Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection
by: Liu, Jiaxin, et al.
Published: (2025)
by: Liu, Jiaxin, et al.
Published: (2025)
Diffusion-Guided Semantic Consistency for Multimodal Heterogeneity
by: Liu, Jing, et al.
Published: (2026)
by: Liu, Jing, et al.
Published: (2026)
Similar Items
-
OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL
by: Shen, Jinjie, et al.
Published: (2026) -
Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline
by: Li, Haiyang, et al.
Published: (2025) -
OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics
by: Shen, Jinjie, et al.
Published: (2026) -
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
by: Zhang, Zhenxing, et al.
Published: (2024) -
TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
by: Wang, Qihang, et al.
Published: (2025)