Guardado en:
| Autores principales: | Chen, Hao, Hou, Yuqi, Qu, Chenyuan, Testini, Irene, Hong, Xiaohan, Jiao, Jianbo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2404.00989 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
por: Liu, Shansong, et al.
Publicado: (2023)
por: Liu, Shansong, et al.
Publicado: (2023)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
por: Liu, Shansong, et al.
Publicado: (2024)
por: Liu, Shansong, et al.
Publicado: (2024)
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
por: Devaney, Johanna, et al.
Publicado: (2024)
por: Devaney, Johanna, et al.
Publicado: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
Efficient Video to Audio Mapper with Visual Scene Detection
por: Yi, Mingjing, et al.
Publicado: (2024)
por: Yi, Mingjing, et al.
Publicado: (2024)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
por: Guo, Wei, et al.
Publicado: (2024)
por: Guo, Wei, et al.
Publicado: (2024)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
por: Li, Bingliang, et al.
Publicado: (2024)
por: Li, Bingliang, et al.
Publicado: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
por: Chen, Zihao, et al.
Publicado: (2024)
por: Chen, Zihao, et al.
Publicado: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
por: Wang, Anna, et al.
Publicado: (2024)
por: Wang, Anna, et al.
Publicado: (2024)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
por: Xie, Siyi, et al.
Publicado: (2025)
por: Xie, Siyi, et al.
Publicado: (2025)
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
MMSD-Net: Towards Multi-modal Stuttering Detection
por: Nie, Liangyu, et al.
Publicado: (2024)
por: Nie, Liangyu, et al.
Publicado: (2024)
POLIPHONE: A Dataset for Smartphone Model Identification from Audio Recordings
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
por: Koh, Junyoung, et al.
Publicado: (2025)
por: Koh, Junyoung, et al.
Publicado: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
por: Salganik, Rebecca, et al.
Publicado: (2026)
por: Salganik, Rebecca, et al.
Publicado: (2026)
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
por: Li, Yupei, et al.
Publicado: (2024)
por: Li, Yupei, et al.
Publicado: (2024)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
por: Zhao, Qihao, et al.
Publicado: (2026)
por: Zhao, Qihao, et al.
Publicado: (2026)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
por: Zang, Yongyi, et al.
Publicado: (2024)
por: Zang, Yongyi, et al.
Publicado: (2024)
Estimating Indoor Scene Depth Maps from Ultrasonic Echoes
por: Honma, Junpei, et al.
Publicado: (2024)
por: Honma, Junpei, et al.
Publicado: (2024)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
por: Li, Wenyu, et al.
Publicado: (2025)
por: Li, Wenyu, et al.
Publicado: (2025)
A Unified Framework for Modality-Agnostic Deepfakes Detection
por: Yu, Cai, et al.
Publicado: (2023)
por: Yu, Cai, et al.
Publicado: (2023)
Trusted Fake Audio Detection Based on Dirichlet Distribution
por: Ding, Chi, et al.
Publicado: (2025)
por: Ding, Chi, et al.
Publicado: (2025)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
por: Lv, Yishan, et al.
Publicado: (2026)
por: Lv, Yishan, et al.
Publicado: (2026)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
por: Shen, Lipeng, et al.
Publicado: (2024)
por: Shen, Lipeng, et al.
Publicado: (2024)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
por: Kim, Haven, et al.
Publicado: (2025)
por: Kim, Haven, et al.
Publicado: (2025)
Building Audio-Visual Digital Twins with Smartphones
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
DiffSSD: A Diffusion-Based Dataset For Speech Forensics
por: Bhagtani, Kratika, et al.
Publicado: (2024)
por: Bhagtani, Kratika, et al.
Publicado: (2024)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
por: Chi, Xiaowei, et al.
Publicado: (2024)
por: Chi, Xiaowei, et al.
Publicado: (2024)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
por: Chen, Ziyang, et al.
Publicado: (2024)
por: Chen, Ziyang, et al.
Publicado: (2024)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
por: He, Jiajun, et al.
Publicado: (2024)
por: He, Jiajun, et al.
Publicado: (2024)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
por: Sun, Luoyi, et al.
Publicado: (2023)
por: Sun, Luoyi, et al.
Publicado: (2023)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
por: Ren, Yong, et al.
Publicado: (2025)
por: Ren, Yong, et al.
Publicado: (2025)
Ejemplares similares
-
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
por: Liu, Shansong, et al.
Publicado: (2023) -
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
por: Liu, Shansong, et al.
Publicado: (2024) -
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
por: Devaney, Johanna, et al.
Publicado: (2024) -
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025) -
Efficient Video to Audio Mapper with Visual Scene Detection
por: Yi, Mingjing, et al.
Publicado: (2024)