As Good as It KAN Get: High-Fidelity Audio Representation
Fuente:
arXiv
Guardado en:
| Autores principales: | Marszałek, Patryk, Rut, Maciej, Kawa, Piotr, Spurek, Przemysław, Syga, Piotr |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Are audio DeepFake detection models polyglots?
por: Marek, Bartłomiej, et al.
Publicado: (2024)
por: Marek, Bartłomiej, et al.
Publicado: (2024)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
por: Shan, Sizhe, et al.
Publicado: (2025)
por: Shan, Sizhe, et al.
Publicado: (2025)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
por: Müller, Nicolas M., et al.
Publicado: (2024)
por: Müller, Nicolas M., et al.
Publicado: (2024)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
por: Bai, Detao, et al.
Publicado: (2025)
por: Bai, Detao, et al.
Publicado: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
por: Chen, Tianxiang, et al.
Publicado: (2024)
por: Chen, Tianxiang, et al.
Publicado: (2024)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
por: Chen, Yuanhong, et al.
Publicado: (2025)
por: Chen, Yuanhong, et al.
Publicado: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
por: Tian, Jingqi, et al.
Publicado: (2025)
por: Tian, Jingqi, et al.
Publicado: (2025)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
por: Krishnamurthy, Sudha
Publicado: (2024)
por: Krishnamurthy, Sudha
Publicado: (2024)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
por: Nakada, Shota, et al.
Publicado: (2024)
por: Nakada, Shota, et al.
Publicado: (2024)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
por: Chen, Gongyu, et al.
Publicado: (2024)
por: Chen, Gongyu, et al.
Publicado: (2024)
Learning to Highlight Audio by Watching Movies
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
por: Zhang, Haomin, et al.
Publicado: (2025)
por: Zhang, Haomin, et al.
Publicado: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
por: Sun, Luoyi, et al.
Publicado: (2023)
por: Sun, Luoyi, et al.
Publicado: (2023)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
por: Tseng, Yuan, et al.
Publicado: (2023)
por: Tseng, Yuan, et al.
Publicado: (2023)
ZeroSep: Separate Anything in Audio with Zero Training
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
por: Lin, Yan-Bo, et al.
Publicado: (2024)
por: Lin, Yan-Bo, et al.
Publicado: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
por: Kwon, Mingi, et al.
Publicado: (2025)
por: Kwon, Mingi, et al.
Publicado: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
por: Feng, Tao, et al.
Publicado: (2025)
por: Feng, Tao, et al.
Publicado: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
por: Fu, Ao, et al.
Publicado: (2025)
por: Fu, Ao, et al.
Publicado: (2025)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
por: Korbar, Bruno, et al.
Publicado: (2024)
por: Korbar, Bruno, et al.
Publicado: (2024)
SONNET: Enhancing Time Delay Estimation by Leveraging Simulated Audio
por: Tegler, Erik, et al.
Publicado: (2024)
por: Tegler, Erik, et al.
Publicado: (2024)
Deep Active Audio Feature Learning in Resource-Constrained Environments
por: Mohaimenuzzaman, Md, et al.
Publicado: (2023)
por: Mohaimenuzzaman, Md, et al.
Publicado: (2023)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
por: Berghi, Davide, et al.
Publicado: (2024)
por: Berghi, Davide, et al.
Publicado: (2024)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
por: Lai, Yung-Hsuan, et al.
Publicado: (2025)
por: Lai, Yung-Hsuan, et al.
Publicado: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
por: Barik, Ayush, et al.
Publicado: (2026)
por: Barik, Ayush, et al.
Publicado: (2026)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
por: Majumder, Sagnik, et al.
Publicado: (2023)
por: Majumder, Sagnik, et al.
Publicado: (2023)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
por: Li, Zeyu, et al.
Publicado: (2024)
por: Li, Zeyu, et al.
Publicado: (2024)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
por: Klein, Nicholas, et al.
Publicado: (2025)
por: Klein, Nicholas, et al.
Publicado: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
por: Rajasekhar, Gnana Praveen, et al.
Publicado: (2025)
por: Rajasekhar, Gnana Praveen, et al.
Publicado: (2025)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
por: Lee, Seung-jae, et al.
Publicado: (2025)
por: Lee, Seung-jae, et al.
Publicado: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
por: Anand, et al.
Publicado: (2025)
por: Anand, et al.
Publicado: (2025)
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
por: Praveen, R. Gnana, et al.
Publicado: (2024)
por: Praveen, R. Gnana, et al.
Publicado: (2024)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
por: Atito, Sara, et al.
Publicado: (2022)
por: Atito, Sara, et al.
Publicado: (2022)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
por: Sun, Peiwen, et al.
Publicado: (2024)
por: Sun, Peiwen, et al.
Publicado: (2024)
Ejemplares similares
-
Are audio DeepFake detection models polyglots?
por: Marek, Bartłomiej, et al.
Publicado: (2024) -
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
por: Shan, Sizhe, et al.
Publicado: (2025) -
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
por: Müller, Nicolas M., et al.
Publicado: (2024) -
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
por: Bai, Detao, et al.
Publicado: (2025) -
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
por: Chen, Tianxiang, et al.
Publicado: (2024)