As Good as It KAN Get: High-Fidelity Audio Representation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Marszałek, Patryk, Rut, Maciej, Kawa, Piotr, Spurek, Przemysław, Syga, Piotr |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Are audio DeepFake detection models polyglots?
par: Marek, Bartłomiej, et autres
Publié: (2024)
par: Marek, Bartłomiej, et autres
Publié: (2024)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
par: Müller, Nicolas M., et autres
Publié: (2024)
par: Müller, Nicolas M., et autres
Publié: (2024)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
par: Bai, Detao, et autres
Publié: (2025)
par: Bai, Detao, et autres
Publié: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)
par: Chen, Tianxiang, et autres
Publié: (2024)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025)
par: Chen, Yuanhong, et autres
Publié: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
par: Krishnamurthy, Sudha
Publié: (2024)
par: Krishnamurthy, Sudha
Publié: (2024)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
par: Nakada, Shota, et autres
Publié: (2024)
par: Nakada, Shota, et autres
Publié: (2024)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024)
par: Chen, Gongyu, et autres
Publié: (2024)
Learning to Highlight Audio by Watching Movies
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
par: Sun, Luoyi, et autres
Publié: (2023)
par: Sun, Luoyi, et autres
Publié: (2023)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
par: Tseng, Yuan, et autres
Publié: (2023)
par: Tseng, Yuan, et autres
Publié: (2023)
ZeroSep: Separate Anything in Audio with Zero Training
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
par: Kwon, Mingi, et autres
Publié: (2025)
par: Kwon, Mingi, et autres
Publié: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
par: Fu, Ao, et autres
Publié: (2025)
par: Fu, Ao, et autres
Publié: (2025)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
par: Korbar, Bruno, et autres
Publié: (2024)
par: Korbar, Bruno, et autres
Publié: (2024)
SONNET: Enhancing Time Delay Estimation by Leveraging Simulated Audio
par: Tegler, Erik, et autres
Publié: (2024)
par: Tegler, Erik, et autres
Publié: (2024)
Deep Active Audio Feature Learning in Resource-Constrained Environments
par: Mohaimenuzzaman, Md, et autres
Publié: (2023)
par: Mohaimenuzzaman, Md, et autres
Publié: (2023)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
par: Berghi, Davide, et autres
Publié: (2024)
par: Berghi, Davide, et autres
Publié: (2024)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
par: Barik, Ayush, et autres
Publié: (2026)
par: Barik, Ayush, et autres
Publié: (2026)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023)
par: Majumder, Sagnik, et autres
Publié: (2023)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
par: Li, Zeyu, et autres
Publié: (2024)
par: Li, Zeyu, et autres
Publié: (2024)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
par: Klein, Nicholas, et autres
Publié: (2025)
par: Klein, Nicholas, et autres
Publié: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
par: Lee, Seung-jae, et autres
Publié: (2025)
par: Lee, Seung-jae, et autres
Publié: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
par: Atito, Sara, et autres
Publié: (2022)
par: Atito, Sara, et autres
Publié: (2022)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
par: Sun, Peiwen, et autres
Publié: (2024)
par: Sun, Peiwen, et autres
Publié: (2024)
Documents similaires
-
Are audio DeepFake detection models polyglots?
par: Marek, Bartłomiej, et autres
Publié: (2024) -
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025) -
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
par: Müller, Nicolas M., et autres
Publié: (2024) -
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
par: Bai, Detao, et autres
Publié: (2025) -
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)