Salvato in:
| Autore principale: | Sulun, Serkan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.07063 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment
di: Hong, Jiaying, et al.
Pubblicazione: (2025)
di: Hong, Jiaying, et al.
Pubblicazione: (2025)
VEMOCLAP: A video emotion classification web application
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
Video Soundtrack Generation by Aligning Emotions and Temporal Boundaries
di: Sulun, Serkan, et al.
Pubblicazione: (2025)
di: Sulun, Serkan, et al.
Pubblicazione: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2026)
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2026)
Multimodal Real-Time Anomaly Detection and Industrial Applications
di: Verma, Aman, et al.
Pubblicazione: (2025)
di: Verma, Aman, et al.
Pubblicazione: (2025)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026)
di: Cui, Zijun, et al.
Pubblicazione: (2026)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
di: Tan, Weiting, et al.
Pubblicazione: (2026)
di: Tan, Weiting, et al.
Pubblicazione: (2026)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
V2Meow: Meowing to the Visual Beat via Video-to-Music Generation
di: Su, Kun, et al.
Pubblicazione: (2023)
di: Su, Kun, et al.
Pubblicazione: (2023)
Movie Trailer Genre Classification Using Multimodal Pretrained Features
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
Vision-to-Music Generation: A Survey
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Understanding Audiovisual Deepfake Detection: Techniques, Challenges, Human Factors and Perceptual Insights
di: Hashmi, Ammarah, et al.
Pubblicazione: (2024)
di: Hashmi, Ammarah, et al.
Pubblicazione: (2024)
3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation
di: Yao, Yao, et al.
Pubblicazione: (2023)
di: Yao, Yao, et al.
Pubblicazione: (2023)
Multimodal Sentiment Analysis based on Video and Audio Inputs
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation
di: Im, Jaekwon, et al.
Pubblicazione: (2026)
di: Im, Jaekwon, et al.
Pubblicazione: (2026)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control
di: Weng, Yuzhe, et al.
Pubblicazione: (2026)
di: Weng, Yuzhe, et al.
Pubblicazione: (2026)
VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026) -
Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment
di: Hong, Jiaying, et al.
Pubblicazione: (2025) -
VEMOCLAP: A video emotion classification web application
di: Sulun, Serkan, et al.
Pubblicazione: (2024) -
Video Soundtrack Generation by Aligning Emotions and Temporal Boundaries
di: Sulun, Serkan, et al.
Pubblicazione: (2025) -
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
di: Tian, Zeyue, et al.
Pubblicazione: (2024)