Enregistré dans:
| Auteurs principaux: | Yuan, Xu, Zhang, Zheng, Wang, Xunguang, Wu, Lin |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2310.14637 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
par: Ouyang, Pengxiang, et autres
Publié: (2025)
par: Ouyang, Pengxiang, et autres
Publié: (2025)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
par: Pu, Ruitao, et autres
Publié: (2025)
par: Pu, Ruitao, et autres
Publié: (2025)
InvZW: Invariant Feature Learning via Noise-Adversarial Training for Robust Image Zero-Watermarking
par: Tanvir, Abdullah All, et autres
Publié: (2025)
par: Tanvir, Abdullah All, et autres
Publié: (2025)
SGAT4PASS: Spherical Geometry-Aware Transformer for PAnoramic Semantic Segmentation
par: Li, Xuewei, et autres
Publié: (2023)
par: Li, Xuewei, et autres
Publié: (2023)
Adversarially Robust Deepfake Detection via Adversarial Feature Similarity Learning
par: Khan, Sarwar
Publié: (2024)
par: Khan, Sarwar
Publié: (2024)
Knowledge Bridger: Towards Training-free Missing Modality Completion
par: Ke, Guanzhou, et autres
Publié: (2025)
par: Ke, Guanzhou, et autres
Publié: (2025)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
par: Chen, Junyi, et autres
Publié: (2023)
par: Chen, Junyi, et autres
Publié: (2023)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
BadCM: Invisible Backdoor Attack Against Cross-Modal Learning
par: Zhang, Zheng, et autres
Publié: (2024)
par: Zhang, Zheng, et autres
Publié: (2024)
Learning from Mistakes: Self-Regularizing Hierarchical Representations in Point Cloud Semantic Segmentation
par: Camuffo, Elena, et autres
Publié: (2023)
par: Camuffo, Elena, et autres
Publié: (2023)
VIVAT: Virtuous Improving VAE Training through Artifact Mitigation
par: Novitskiy, Lev, et autres
Publié: (2025)
par: Novitskiy, Lev, et autres
Publié: (2025)
M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention
par: Panta, Sanjeev, et autres
Publié: (2026)
par: Panta, Sanjeev, et autres
Publié: (2026)
Deep Learning-based Text-in-Image Watermarking
par: Karki, Bishwa, et autres
Publié: (2024)
par: Karki, Bishwa, et autres
Publié: (2024)
Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling
par: Singh, Jaskirat, et autres
Publié: (2025)
par: Singh, Jaskirat, et autres
Publié: (2025)
Clean Image May be Dangerous: Data Poisoning Attacks Against Deep Hashing
par: Li, Shuai, et autres
Publié: (2025)
par: Li, Shuai, et autres
Publié: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
Omnidirectional Video Super-Resolution using Deep Learning
par: Baniya, Arbind Agrahari, et autres
Publié: (2025)
par: Baniya, Arbind Agrahari, et autres
Publié: (2025)
Improving Generative Adversarial Network Generalization for Facial Expression Synthesis
par: Akram, Arbish, et autres
Publié: (2026)
par: Akram, Arbish, et autres
Publié: (2026)
360VFI: A Dataset and Benchmark for Omnidirectional Video Frame Interpolation
par: Lu, Wenxuan, et autres
Publié: (2024)
par: Lu, Wenxuan, et autres
Publié: (2024)
Residual Prior-driven Frequency-aware Network for Image Fusion
par: Zheng, Guan, et autres
Publié: (2025)
par: Zheng, Guan, et autres
Publié: (2025)
NAIMA: Semantics Aware RGB Guided Depth Super-Resolution
par: Nasir, Tayyab, et autres
Publié: (2026)
par: Nasir, Tayyab, et autres
Publié: (2026)
End-to-end Semantic-centric Video-based Multimodal Affective Computing
par: Lin, Ronghao, et autres
Publié: (2024)
par: Lin, Ronghao, et autres
Publié: (2024)
Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization
par: Wang, Tianyu, et autres
Publié: (2026)
par: Wang, Tianyu, et autres
Publié: (2026)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
par: Fan, Yunfeng, et autres
Publié: (2023)
par: Fan, Yunfeng, et autres
Publié: (2023)
Regularized Contrastive Partial Multi-view Outlier Detection
par: Wang, Yijia, et autres
Publié: (2024)
par: Wang, Yijia, et autres
Publié: (2024)
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
Detection of Cyberbullying in GIF using AI
par: Dave, Pal, et autres
Publié: (2025)
par: Dave, Pal, et autres
Publié: (2025)
Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection
par: Fan, Yunfeng, et autres
Publié: (2023)
par: Fan, Yunfeng, et autres
Publié: (2023)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
par: Liu, Luping, et autres
Publié: (2024)
par: Liu, Luping, et autres
Publié: (2024)
4D Multimodal Co-attention Fusion Network with Latent Contrastive Alignment for Alzheimer's Diagnosis
par: Wei, Yuxiang, et autres
Publié: (2025)
par: Wei, Yuxiang, et autres
Publié: (2025)
Semantic-Aware Adaptive Video Streaming Using Latent Diffusion Models for Wireless Networks
par: Yan, Zijiang, et autres
Publié: (2025)
par: Yan, Zijiang, et autres
Publié: (2025)
MVP: Winning Solution to SMP Challenge 2025 Video Track
par: Ye, Liliang, et autres
Publié: (2025)
par: Ye, Liliang, et autres
Publié: (2025)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
par: Gao, Lishuai, et autres
Publié: (2024)
par: Gao, Lishuai, et autres
Publié: (2024)
MTCAE-DFER: Multi-Task Cascaded Autoencoder for Dynamic Facial Expression Recognition
par: Xiang, Peihao, et autres
Publié: (2024)
par: Xiang, Peihao, et autres
Publié: (2024)
Generalized Jersey Number Recognition Using Multi-task Learning With Orientation-guided Weight Refinement
par: Lin, Yung-Hui, et autres
Publié: (2024)
par: Lin, Yung-Hui, et autres
Publié: (2024)
DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
par: Yin, Xiangchen, et autres
Publié: (2025)
par: Yin, Xiangchen, et autres
Publié: (2025)
Adv-KD: Adversarial Knowledge Distillation for Faster Diffusion Sampling
par: Mekonnen, Kidist Amde, et autres
Publié: (2024)
par: Mekonnen, Kidist Amde, et autres
Publié: (2024)
SCENE: Semantic-aware Codec Enhancement with Neural Embeddings
par: Lin, Han-Yu, et autres
Publié: (2026)
par: Lin, Han-Yu, et autres
Publié: (2026)
Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models
par: Williams-Lekuona, Mikel, et autres
Publié: (2025)
par: Williams-Lekuona, Mikel, et autres
Publié: (2025)
Lightning Fast Video Anomaly Detection via Adversarial Knowledge Distillation
par: Croitoru, Florinel-Alin, et autres
Publié: (2022)
par: Croitoru, Florinel-Alin, et autres
Publié: (2022)
Documents similaires
-
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
par: Ouyang, Pengxiang, et autres
Publié: (2025) -
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
par: Pu, Ruitao, et autres
Publié: (2025) -
InvZW: Invariant Feature Learning via Noise-Adversarial Training for Robust Image Zero-Watermarking
par: Tanvir, Abdullah All, et autres
Publié: (2025) -
SGAT4PASS: Spherical Geometry-Aware Transformer for PAnoramic Semantic Segmentation
par: Li, Xuewei, et autres
Publié: (2023) -
Adversarially Robust Deepfake Detection via Adversarial Feature Similarity Learning
par: Khan, Sarwar
Publié: (2024)