Leveraging large multimodal models for audio-video deepfake detection: a pilot study
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Songjun, Li, Yuqi, Luo, Yunpeng, Yin, Jianjun, Ma, Long |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Contract-Driven QoE Auditing for Speech and Singing Services: From MOS Regression to Service Graphs
par: Du, Wenzhang
Publié: (2025)
par: Du, Wenzhang
Publié: (2025)
StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation
par: Merugu, Ranjith, et autres
Publié: (2025)
par: Merugu, Ranjith, et autres
Publié: (2025)
Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement
par: Cao, Bryan Bo, et autres
Publié: (2024)
par: Cao, Bryan Bo, et autres
Publié: (2024)
Graph Connectionist Temporal Classification for Phoneme Recognition
par: Grafé, Henry, et autres
Publié: (2025)
par: Grafé, Henry, et autres
Publié: (2025)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)
par: Viveiros, André G., et autres
Publié: (2025)
Logits-Constrained Framework with RoBERTa for Ancient Chinese NER
par: Hua, Wenjie, et autres
Publié: (2025)
par: Hua, Wenjie, et autres
Publié: (2025)
CVCM Track Circuits Pre-emptive Failure Diagnostics for Predictive Maintenance Using Deep Neural Networks
par: Mukherjee, Debdeep, et autres
Publié: (2025)
par: Mukherjee, Debdeep, et autres
Publié: (2025)
Heart Failure Prediction using Modal Decomposition and Masked Autoencoders for Scarce Echocardiography Databases
par: Bell-Navas, Andrés, et autres
Publié: (2025)
par: Bell-Navas, Andrés, et autres
Publié: (2025)
Deep Spectral Meshes: Multi-Frequency Facial Mesh Processing with Graph Neural Networks
par: Kosk, Robert, et autres
Publié: (2024)
par: Kosk, Robert, et autres
Publié: (2024)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
par: Andreyev, Allison
Publié: (2025)
par: Andreyev, Allison
Publié: (2025)
Proficiency-Aware Adaptation and Data Augmentation for Robust L2 ASR
par: Sun, Ling, et autres
Publié: (2025)
par: Sun, Ling, et autres
Publié: (2025)
Scalable, Technology-Agnostic Diagnosis and Predictive Maintenance for Point Machine using Deep Learning
par: Di Santi, Eduardo, et autres
Publié: (2025)
par: Di Santi, Eduardo, et autres
Publié: (2025)
Skullptor: High Fidelity 3D Head Reconstruction in Seconds with Multi-View Normal Prediction
par: Artru, Noé, et autres
Publié: (2026)
par: Artru, Noé, et autres
Publié: (2026)
Benchmarking Catastrophic Forgetting Mitigation Methods in Federated Time Series Forecasting
par: Hallak, Khaled, et autres
Publié: (2025)
par: Hallak, Khaled, et autres
Publié: (2025)
Can Agentic AI Match the Performance of Human Data Scientists?
par: Luo, An, et autres
Publié: (2025)
par: Luo, An, et autres
Publié: (2025)
AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science
par: Luo, An, et autres
Publié: (2026)
par: Luo, An, et autres
Publié: (2026)
HieraEdgeNet: A Multi-Scale Edge-Enhanced Framework for Automated Pollen Recognition
par: Long, Yuchong, et autres
Publié: (2025)
par: Long, Yuchong, et autres
Publié: (2025)
Transforming faces into video stories -- VideoFace2.0
par: Brkljač, Branko, et autres
Publié: (2025)
par: Brkljač, Branko, et autres
Publié: (2025)
Polarization-Based Eye Tracking with Personalized Siamese Architectures
par: Kalkanli, Beyza, et autres
Publié: (2026)
par: Kalkanli, Beyza, et autres
Publié: (2026)
Learning Association via Track-Detection Matching for Multi-Object Tracking
par: Adžemović, Momir
Publié: (2025)
par: Adžemović, Momir
Publié: (2025)
Learning Sign Language Representation using CNN LSTM, 3DCNN, CNN RNN LSTM and CCN TD
par: Louison, Nikita, et autres
Publié: (2024)
par: Louison, Nikita, et autres
Publié: (2024)
See What You Need: Query-Aware Visual Intelligence through Reasoning-Perception Loops
par: Dong, Zixuan, et autres
Publié: (2025)
par: Dong, Zixuan, et autres
Publié: (2025)
Transfer learning with generative models for object detection on limited datasets
par: Paiano, Matteo, et autres
Publié: (2024)
par: Paiano, Matteo, et autres
Publié: (2024)
AssistedDS: Benchmarking How External Domain Knowledge Assists LLMs in Automated Data Science
par: Luo, An, et autres
Publié: (2025)
par: Luo, An, et autres
Publié: (2025)
Semantically Guided Adversarial Testing of Vision Models Using Language Models
par: Filus, Katarzyna, et autres
Publié: (2025)
par: Filus, Katarzyna, et autres
Publié: (2025)
Application of deep learning approaches for medieval historical documents transcription
par: Voloshchuk, Maksym, et autres
Publié: (2025)
par: Voloshchuk, Maksym, et autres
Publié: (2025)
Identifying Autism-Related Neurobiomarkers Using Hybrid Deep Learning Models
par: Chen, Ashley
Publié: (2025)
par: Chen, Ashley
Publié: (2025)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
MVTamperBench: Evaluating Robustness of Vision-Language Models
par: Agarwal, Amit, et autres
Publié: (2024)
par: Agarwal, Amit, et autres
Publié: (2024)
Kolmogorov-Arnold Attention: Is Learnable Attention Better For Vision Transformers?
par: Maity, Subhajit, et autres
Publié: (2025)
par: Maity, Subhajit, et autres
Publié: (2025)
torchsom: The Reference PyTorch Library for Self-Organizing Maps
par: Berthier, Louis, et autres
Publié: (2025)
par: Berthier, Louis, et autres
Publié: (2025)
Archival Faces: Detection of Faces in Digitized Historical Documents
par: Vaško, Marek, et autres
Publié: (2025)
par: Vaško, Marek, et autres
Publié: (2025)
Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection
par: Kang, Xueyang, et autres
Publié: (2026)
par: Kang, Xueyang, et autres
Publié: (2026)
Evaluating Prompting Strategies for Chart Question Answering with Large Language Models
par: Naikar, Ruthuparna, et autres
Publié: (2026)
par: Naikar, Ruthuparna, et autres
Publié: (2026)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
par: Bhadra, Dipayan, et autres
Publié: (2025)
par: Bhadra, Dipayan, et autres
Publié: (2025)
Handling Out-of-Distribution Data: A Survey
par: Tamang, Lakpa, et autres
Publié: (2025)
par: Tamang, Lakpa, et autres
Publié: (2025)
Wafer Map Defect Classification Using Autoencoder-Based Data Augmentation and Convolutional Neural Network
par: Bao, Yin-Yin, et autres
Publié: (2024)
par: Bao, Yin-Yin, et autres
Publié: (2024)
Prevailing Research Areas for Music AI in the Era of Foundation Models
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
Parametric Digital Twins for Preserving Historic Buildings: A Case Study at Löfstad Castle in Östergötland, Sweden
par: Ni, Zhongjun, et autres
Publié: (2024)
par: Ni, Zhongjun, et autres
Publié: (2024)
The Impact of Image Resolution on Face Detection: A Comparative Analysis of MTCNN, YOLOv XI and YOLOv XII models
par: Ömercikoğlu, Ahmet Can, et autres
Publié: (2025)
par: Ömercikoğlu, Ahmet Can, et autres
Publié: (2025)
Documents similaires
-
Contract-Driven QoE Auditing for Speech and Singing Services: From MOS Regression to Service Graphs
par: Du, Wenzhang
Publié: (2025) -
StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation
par: Merugu, Ranjith, et autres
Publié: (2025) -
Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement
par: Cao, Bryan Bo, et autres
Publié: (2024) -
Graph Connectionist Temporal Classification for Phoneme Recognition
par: Grafé, Henry, et autres
Publié: (2025) -
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)