When Visual Privacy Protection Meets Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Hui, Xiaofei, Wu, Qian, Qu, Haoxuan, Mirmehdi, Majid, Rahmani, Hossein, Liu, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
An Image-like Diffusion Method for Human-Object Interaction Detection
by: Hui, Xiaofei, et al.
Published: (2025)
by: Hui, Xiaofei, et al.
Published: (2025)
Learning to Generate Cross-Task Unexploitable Examples
by: Qu, Haoxuan, et al.
Published: (2025)
by: Qu, Haoxuan, et al.
Published: (2025)
MicroscopyMatching: Towards a Ready-to-use Framework for Microscopy Image Analysis in Diverse Conditions
by: Hui, Xiaofei, et al.
Published: (2026)
by: Hui, Xiaofei, et al.
Published: (2026)
Translating Signals to Languages for sEMG-Based Activity Recognition
by: Wang, Ming, et al.
Published: (2026)
by: Wang, Ming, et al.
Published: (2026)
DisC-GS: Discontinuity-aware Gaussian Splatting
by: Qu, Haoxuan, et al.
Published: (2024)
by: Qu, Haoxuan, et al.
Published: (2024)
Recent Advances of Continual Learning in Computer Vision: An Overview
by: Qu, Haoxuan, et al.
Published: (2021)
by: Qu, Haoxuan, et al.
Published: (2021)
Visual-textual Dermatoglyphic Animal Biometrics: A First Case Study on Panthera tigris
by: Li, Wenshuo, et al.
Published: (2025)
by: Li, Wenshuo, et al.
Published: (2025)
A Mixed-Primitive-based Gaussian Splatting Method for Surface Reconstruction
by: Qu, Haoxuan, et al.
Published: (2025)
by: Qu, Haoxuan, et al.
Published: (2025)
ToolFG: Towards Well-Grounded Fine-Grained Image Classification
by: Xue, Yu, et al.
Published: (2026)
by: Xue, Yu, et al.
Published: (2026)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
by: Yang, Qu, et al.
Published: (2024)
by: Yang, Qu, et al.
Published: (2024)
Co-STAR: Collaborative Curriculum Self-Training with Adaptive Regularization for Source-Free Video Domain Adaptation
by: Dadashzadeh, Amirhossein, et al.
Published: (2025)
by: Dadashzadeh, Amirhossein, et al.
Published: (2025)
Unsupervised View-Invariant Human Posture Representation
by: Sardari, Faegheh, et al.
Published: (2021)
by: Sardari, Faegheh, et al.
Published: (2021)
Prediction of Thrombectomy Functional Outcomes using Multimodal Data
by: Samak, Zeynel A., et al.
Published: (2020)
by: Samak, Zeynel A., et al.
Published: (2020)
LLaFS: When Large Language Models Meet Few-Shot Segmentation
by: Zhu, Lanyun, et al.
Published: (2023)
by: Zhu, Lanyun, et al.
Published: (2023)
TranSOP: Transformer-based Multimodal Classification for Stroke Treatment Outcome Prediction
by: Samak, Zeynel A., et al.
Published: (2023)
by: Samak, Zeynel A., et al.
Published: (2023)
TSTMotion: Training-free Scene-aware Text-to-motion Generation
by: Guo, Ziyan, et al.
Published: (2025)
by: Guo, Ziyan, et al.
Published: (2025)
When Privacy Meets Recovery: The Overlooked Half of Surrogate-Driven Privacy Preservation for MLLM Editing
by: Xu, Siyuan, et al.
Published: (2025)
by: Xu, Siyuan, et al.
Published: (2025)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
by: Shen, Yuxiang, et al.
Published: (2026)
by: Shen, Yuxiang, et al.
Published: (2026)
Trajectory-guided Motion Perception for Facial Expression Quality Assessment in Neurological Disorders
by: Duan, Shuchao, et al.
Published: (2025)
by: Duan, Shuchao, et al.
Published: (2025)
Skeleton-Snippet Contrastive Learning with Multiscale Feature Fusion for Action Localization
by: Cheng, Qiushuo, et al.
Published: (2025)
by: Cheng, Qiushuo, et al.
Published: (2025)
AI-Generated Content (AIGC) for Various Data Modalities: A Survey
by: Foo, Lin Geng, et al.
Published: (2023)
by: Foo, Lin Geng, et al.
Published: (2023)
LLMs are Good Action Recognizers
by: Qu, Haoxuan, et al.
Published: (2024)
by: Qu, Haoxuan, et al.
Published: (2024)
GPT-Connect: Interaction between Text-Driven Human Motion Generator and 3D Scenes in a Training-free Manner
by: Qu, Haoxuan, et al.
Published: (2024)
by: Qu, Haoxuan, et al.
Published: (2024)
When Large Vision-Language Models Meet Person Re-Identification
by: Wang, Qizao, et al.
Published: (2024)
by: Wang, Qizao, et al.
Published: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
by: Zhang, Pingping, et al.
Published: (2024)
by: Zhang, Pingping, et al.
Published: (2024)
Unsupervised Cross-Domain 3D Human Pose Estimation via Pseudo-Label-Guided Global Transforms
by: Liu, Jingjing, et al.
Published: (2025)
by: Liu, Jingjing, et al.
Published: (2025)
Diff-Tracker: Text-to-Image Diffusion Models are Unsupervised Trackers
by: Zhang, Zhengbo, et al.
Published: (2024)
by: Zhang, Zhengbo, et al.
Published: (2024)
LongDiff: Training-Free Long Video Generation in One Go
by: Li, Zhuoling, et al.
Published: (2025)
by: Li, Zhuoling, et al.
Published: (2025)
Automatic Prediction of Stroke Treatment Outcomes: Latest Advances and Perspectives
by: Samak, Zeynel A., et al.
Published: (2024)
by: Samak, Zeynel A., et al.
Published: (2024)
LLMs are Good Sign Language Translators
by: Gong, Jia, et al.
Published: (2024)
by: Gong, Jia, et al.
Published: (2024)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
by: Zhao, Shiji, et al.
Published: (2025)
by: Zhao, Shiji, et al.
Published: (2025)
Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
by: Zhang, Fan, et al.
Published: (2025)
by: Zhang, Fan, et al.
Published: (2025)
Hyper-YOLO: When Visual Object Detection Meets Hypergraph Computation
by: Feng, Yifan, et al.
Published: (2024)
by: Feng, Yifan, et al.
Published: (2024)
Action Detection via an Image Diffusion Process
by: Foo, Lin Geng, et al.
Published: (2024)
by: Foo, Lin Geng, et al.
Published: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
by: Liu, Haogeng, et al.
Published: (2024)
by: Liu, Haogeng, et al.
Published: (2024)
6D-Diff: A Keypoint Diffusion Framework for 6D Object Pose Estimation
by: Xu, Li, et al.
Published: (2023)
by: Xu, Li, et al.
Published: (2023)
CMMLoc: Advancing Text-to-PointCloud Localization with Cauchy-Mixture-Model Based Framework
by: Xu, Yanlong, et al.
Published: (2025)
by: Xu, Yanlong, et al.
Published: (2025)
Improving Visual Storytelling with Multimodal Large Language Models
by: Lin, Xiaochuan, et al.
Published: (2024)
by: Lin, Xiaochuan, et al.
Published: (2024)
Visual Representation Alignment for Multimodal Large Language Models
by: Yoon, Heeji, et al.
Published: (2025)
by: Yoon, Heeji, et al.
Published: (2025)
Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
by: Rostamkhani, Mohammadmostafa, et al.
Published: (2024)
by: Rostamkhani, Mohammadmostafa, et al.
Published: (2024)
Similar Items
-
An Image-like Diffusion Method for Human-Object Interaction Detection
by: Hui, Xiaofei, et al.
Published: (2025) -
Learning to Generate Cross-Task Unexploitable Examples
by: Qu, Haoxuan, et al.
Published: (2025) -
MicroscopyMatching: Towards a Ready-to-use Framework for Microscopy Image Analysis in Diverse Conditions
by: Hui, Xiaofei, et al.
Published: (2026) -
Translating Signals to Languages for sEMG-Based Activity Recognition
by: Wang, Ming, et al.
Published: (2026) -
DisC-GS: Discontinuity-aware Gaussian Splatting
by: Qu, Haoxuan, et al.
Published: (2024)