Gespeichert in:
| Hauptverfasser: | Chen, Liyang, Chen, Hongkai, Cai, Yujun, Li, Sifan, Ye, Qingwen, Wang, Yiwei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2510.08078 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
OptiSQL: Executable SQL Generation from Optical Tokens
von: Li, Sifan, et al.
Veröffentlicht: (2026)
von: Li, Sifan, et al.
Veröffentlicht: (2026)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
von: Li, Sifan, et al.
Veröffentlicht: (2025)
von: Li, Sifan, et al.
Veröffentlicht: (2025)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
von: Li, Bingliang, et al.
Veröffentlicht: (2024)
von: Li, Bingliang, et al.
Veröffentlicht: (2024)
Training-Free Multimodal Guidance for Video to Audio Generation
von: Grassucci, Eleonora, et al.
Veröffentlicht: (2025)
von: Grassucci, Eleonora, et al.
Veröffentlicht: (2025)
Towards Trustworthy Audio Deepfake Detection: A Systematic Framework for Diagnosing and Mitigating Gender Bias
von: Fursule, Aishwarya, et al.
Veröffentlicht: (2026)
von: Fursule, Aishwarya, et al.
Veröffentlicht: (2026)
Audio Super-Resolution with Latent Bridge Models
von: Li, Chang, et al.
Veröffentlicht: (2025)
von: Li, Chang, et al.
Veröffentlicht: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
von: Ishii, Masato, et al.
Veröffentlicht: (2025)
von: Ishii, Masato, et al.
Veröffentlicht: (2025)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
von: Xiao, Yixuan, et al.
Veröffentlicht: (2026)
von: Xiao, Yixuan, et al.
Veröffentlicht: (2026)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox
von: Pang, Jiacheng, et al.
Veröffentlicht: (2026)
von: Pang, Jiacheng, et al.
Veröffentlicht: (2026)
Does Audio Deepfake Detection Generalize?
von: Müller, Nicolas M., et al.
Veröffentlicht: (2022)
von: Müller, Nicolas M., et al.
Veröffentlicht: (2022)
STEP: Detecting Audio Backdoor Attacks via Stability-based Trigger Exposure Profiling
von: Wang, Kun, et al.
Veröffentlicht: (2026)
von: Wang, Kun, et al.
Veröffentlicht: (2026)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
von: Wu, Daiqing, et al.
Veröffentlicht: (2026)
von: Wu, Daiqing, et al.
Veröffentlicht: (2026)
PACE: Pretrained Audio Continual Learning
von: Li, Chang, et al.
Veröffentlicht: (2026)
von: Li, Chang, et al.
Veröffentlicht: (2026)
SoundReactor: Frame-level Online Video-to-Audio Generation
von: Saito, Koichi, et al.
Veröffentlicht: (2025)
von: Saito, Koichi, et al.
Veröffentlicht: (2025)
An Enhanced Audio Feature Tailored for Anomalous Sound Detection Based on Pre-trained Models
von: Zhong, Guirui, et al.
Veröffentlicht: (2025)
von: Zhong, Guirui, et al.
Veröffentlicht: (2025)
SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos
von: Dellali, Amir, et al.
Veröffentlicht: (2025)
von: Dellali, Amir, et al.
Veröffentlicht: (2025)
Transformer Based Machine Fault Detection From Audio Input
von: Holla, Kiran Voderhobli
Veröffentlicht: (2026)
von: Holla, Kiran Voderhobli
Veröffentlicht: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
von: Wang, Lu, et al.
Veröffentlicht: (2025)
von: Wang, Lu, et al.
Veröffentlicht: (2025)
Mitigating Sex Bias in Audio Data-driven COPD and COVID-19 Breathing Pattern Detection Models
von: Pfeifer, Rachel, et al.
Veröffentlicht: (2024)
von: Pfeifer, Rachel, et al.
Veröffentlicht: (2024)
ADD 2022: the First Audio Deep Synthesis Detection Challenge
von: Yi, Jiangyan, et al.
Veröffentlicht: (2022)
von: Yi, Jiangyan, et al.
Veröffentlicht: (2022)
Investigating the Impact of Speech Enhancement on Audio Deepfake Detection in Noisy Environments
von: Anacin, et al.
Veröffentlicht: (2026)
von: Anacin, et al.
Veröffentlicht: (2026)
SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model
von: Li, Yan, et al.
Veröffentlicht: (2024)
von: Li, Yan, et al.
Veröffentlicht: (2024)
GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation
von: Li, Sifan, et al.
Veröffentlicht: (2026)
von: Li, Sifan, et al.
Veröffentlicht: (2026)
Structured-Noise Masked Modeling for Video, Audio and Beyond
von: Bhowmik, Aritra, et al.
Veröffentlicht: (2025)
von: Bhowmik, Aritra, et al.
Veröffentlicht: (2025)
ADNAC: Audio Denoiser using Neural Audio Codec
von: Jimon, Daniel, et al.
Veröffentlicht: (2025)
von: Jimon, Daniel, et al.
Veröffentlicht: (2025)
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2025)
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2025)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
von: Fedorishin, Dennis, et al.
Veröffentlicht: (2024)
von: Fedorishin, Dennis, et al.
Veröffentlicht: (2024)
Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training
von: Wu, Yanru, et al.
Veröffentlicht: (2026)
von: Wu, Yanru, et al.
Veröffentlicht: (2026)
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
Subtractive Training for Music Stem Insertion using Latent Diffusion Models
von: Villa-Renteria, Ivan, et al.
Veröffentlicht: (2024)
von: Villa-Renteria, Ivan, et al.
Veröffentlicht: (2024)
A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation
von: Ishii, Masato, et al.
Veröffentlicht: (2024)
von: Ishii, Masato, et al.
Veröffentlicht: (2024)
Improving Out-of-Domain Audio Deepfake Detection via Layer Selection and Fusion of SSL-Based Countermeasures
von: Serrano, Pierre, et al.
Veröffentlicht: (2025)
von: Serrano, Pierre, et al.
Veröffentlicht: (2025)
Unleashing the Power of Natural Audio Featuring Multiple Sound Sources
von: Cheng, Xize, et al.
Veröffentlicht: (2025)
von: Cheng, Xize, et al.
Veröffentlicht: (2025)
A Generalized Bandsplit Neural Network for Cinematic Audio Source Separation
von: Watcharasupat, Karn N., et al.
Veröffentlicht: (2023)
von: Watcharasupat, Karn N., et al.
Veröffentlicht: (2023)
AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds
von: Wang, Qizhou, et al.
Veröffentlicht: (2025)
von: Wang, Qizhou, et al.
Veröffentlicht: (2025)
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
Virtual Consistency for Audio Editing
von: Cervera, Matthieu, et al.
Veröffentlicht: (2025)
von: Cervera, Matthieu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
von: Chen, Liyang, et al.
Veröffentlicht: (2026) -
OptiSQL: Executable SQL Generation from Optical Tokens
von: Li, Sifan, et al.
Veröffentlicht: (2026) -
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
von: Li, Sifan, et al.
Veröffentlicht: (2025) -
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
von: Li, Bingliang, et al.
Veröffentlicht: (2024) -
Training-Free Multimodal Guidance for Video to Audio Generation
von: Grassucci, Eleonora, et al.
Veröffentlicht: (2025)