HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Xuecheng, Huang, Danlei, Sun, Heli, Yin, Xinyi, Wang, Yifan, Wang, Hao, Zhang, Jia, Wang, Fei, Guo, Peihao, Xing, Suyu, Xue, Junxiao, He, Liang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
par: Wu, Xuecheng, et autres
Publié: (2025)
par: Wu, Xuecheng, et autres
Publié: (2025)
3A-YOLO: New Real-Time Object Detectors with Triple Discriminative Awareness and Coordinated Representations
par: Wu, Xuecheng, et autres
Publié: (2024)
par: Wu, Xuecheng, et autres
Publié: (2024)
FAMNet: Integrating 2D and 3D Features for Micro-expression Recognition via Multi-task Learning and Hierarchical Attention
par: Fu, Liangyu, et autres
Publié: (2025)
par: Fu, Liangyu, et autres
Publié: (2025)
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
par: Wu, Xuecheng, et autres
Publié: (2025)
par: Wu, Xuecheng, et autres
Publié: (2025)
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
par: Chen, Shi, et autres
Publié: (2026)
par: Chen, Shi, et autres
Publié: (2026)
TACR-YOLO: A Real-time Detection Framework for Abnormal Human Behaviors Enhanced with Coordinate and Task-Aware Representations
par: Yin, Xinyi, et autres
Publié: (2025)
par: Yin, Xinyi, et autres
Publié: (2025)
InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
MooD: Perception-Enhanced Efficient Affective Image Editing via Continuous Valence-Arousal Modeling
par: Yin, Xinyi, et autres
Publié: (2026)
par: Yin, Xinyi, et autres
Publié: (2026)
Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline
par: Wu, Xuecheng, et autres
Publié: (2023)
par: Wu, Xuecheng, et autres
Publié: (2023)
Wav2DF-TSL: Two-stage Learning with Efficient Pre-training and Hierarchical Experts Fusion for Robust Audio Deepfake Detection
par: Hao, Yunqi, et autres
Publié: (2025)
par: Hao, Yunqi, et autres
Publié: (2025)
Affective Video Content Analysis: Decade Review and New Perspectives
par: Xue, Junxiao, et autres
Publié: (2023)
par: Xue, Junxiao, et autres
Publié: (2023)
Disentangling Hardness from Noise: An Uncertainty-Driven Model-Agnostic Framework for Long-Tailed Remote Sensing Classification
par: Ding, Chi, et autres
Publié: (2026)
par: Ding, Chi, et autres
Publié: (2026)
End4: End-to-end Denoising Diffusion for Diffusion-Based Inpainting Detection
par: Wang, Fei, et autres
Publié: (2025)
par: Wang, Fei, et autres
Publié: (2025)
HierCon: Hierarchical Contrastive Attention for Audio Deepfake Detection
par: Liang, Zhili Nicholas, et autres
Publié: (2026)
par: Liang, Zhili Nicholas, et autres
Publié: (2026)
ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations
par: Wu, Xuecheng, et autres
Publié: (2025)
par: Wu, Xuecheng, et autres
Publié: (2025)
LLMs on a Budget? Say HOLA
par: Siddiqui, Zohaib Hasan, et autres
Publié: (2025)
par: Siddiqui, Zohaib Hasan, et autres
Publié: (2025)
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
par: Xue, Junxiao, et autres
Publié: (2026)
par: Xue, Junxiao, et autres
Publié: (2026)
A Trustworthy Method for Multimodal Emotion Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing
par: Xue, Fengjian, et autres
Publié: (2026)
par: Xue, Fengjian, et autres
Publié: (2026)
Trusted Fake Audio Detection Based on Dirichlet Distribution
par: Ding, Chi, et autres
Publié: (2025)
par: Ding, Chi, et autres
Publié: (2025)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
par: Shahzad, Sahibzada Adil, et autres
Publié: (2026)
par: Shahzad, Sahibzada Adil, et autres
Publié: (2026)
Audio Deepfake Verification
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
Statistics-aware Audio-visual Deepfake Detector
par: Astrid, Marcella, et autres
Publié: (2024)
par: Astrid, Marcella, et autres
Publié: (2024)
TiKMiX: Take Data Influence into Dynamic Mixture for Language Model Pre-training
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
MedFILIP: Medical Fine-grained Language-Image Pre-training
par: Liang, Xinjie, et autres
Publié: (2025)
par: Liang, Xinjie, et autres
Publié: (2025)
Unified Video-Language Pre-training with Synchronized Audio
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
Generalizable Audio Deepfake Detection via Hierarchical Structure Learning and Feature Whitening in Poincaré sphere
par: Yang, Mingru, et autres
Publié: (2025)
par: Yang, Mingru, et autres
Publié: (2025)
Investigating the Sensitivity of Pre-trained Audio Embeddings to Common Effects
par: Deng, Victor, et autres
Publié: (2025)
par: Deng, Victor, et autres
Publié: (2025)
Continuous Multi-Task Pre-training for Malicious URL Detection and Webpage Classification
par: Li, Yujie, et autres
Publié: (2024)
par: Li, Yujie, et autres
Publié: (2024)
Advancing Multi-grained Alignment for Contrastive Language-Audio Pre-training
par: Li, Yiming, et autres
Publié: (2024)
par: Li, Yiming, et autres
Publié: (2024)
Audio-visual aids and vocational training
par: Henry Nozet
Publié: (1952)
par: Henry Nozet
Publié: (1952)
Lucia: A Temporal Computing Platform for Contextual Intelligence
par: Lin, Weizhe, et autres
Publié: (2024)
par: Lin, Weizhe, et autres
Publié: (2024)
Global solution of 2D hyperbolic liquid crystal system for small initial data
par: Wang, Xuecheng
Publié: (2024)
par: Wang, Xuecheng
Publié: (2024)
B-cos LM: Efficiently Transforming Pre-trained Language Models for Improved Explainability
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
Documents similaires
-
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025) -
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
par: Wu, Xuecheng, et autres
Publié: (2025) -
3A-YOLO: New Real-Time Object Detectors with Triple Discriminative Awareness and Coordinated Representations
par: Wu, Xuecheng, et autres
Publié: (2024) -
FAMNet: Integrating 2D and 3D Features for Micro-expression Recognition via Multi-task Learning and Hierarchical Attention
par: Fu, Liangyu, et autres
Publié: (2025) -
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
par: Wu, Xuecheng, et autres
Publié: (2025)