Audio-Vision Contrastive Learning for Phonological Class Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Daiqi, Arias-Vergara, Tomás, Hutter, Jana, Maier, Andreas, Pérez-Toro, Paula Andrea |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
por: Liu, Shengqiang, et al.
Publicado: (2024)
por: Liu, Shengqiang, et al.
Publicado: (2024)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
por: Zhang, Xiaohui, et al.
Publicado: (2024)
por: Zhang, Xiaohui, et al.
Publicado: (2024)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
por: Yu, Fan, et al.
Publicado: (2024)
por: Yu, Fan, et al.
Publicado: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024)
por: Liu, Qianhui, et al.
Publicado: (2024)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
por: Stewart, Shanti, et al.
Publicado: (2024)
por: Stewart, Shanti, et al.
Publicado: (2024)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
por: Su, Fei, et al.
Publicado: (2026)
por: Su, Fei, et al.
Publicado: (2026)
Audio-Visual Speech Separation via Bottleneck Iterative Network
por: Zhang, Sidong, et al.
Publicado: (2025)
por: Zhang, Sidong, et al.
Publicado: (2025)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
por: Ren, Yong, et al.
Publicado: (2025)
por: Ren, Yong, et al.
Publicado: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
Emotion-Aligned Contrastive Learning Between Images and Music
por: Stewart, Shanti, et al.
Publicado: (2023)
por: Stewart, Shanti, et al.
Publicado: (2023)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
por: Yao, Dong, et al.
Publicado: (2023)
por: Yao, Dong, et al.
Publicado: (2023)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
por: Mao, Yuxin, et al.
Publicado: (2023)
por: Mao, Yuxin, et al.
Publicado: (2023)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Building Audio-Visual Digital Twins with Smartphones
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
Trusted Fake Audio Detection Based on Dirichlet Distribution
por: Ding, Chi, et al.
Publicado: (2025)
por: Ding, Chi, et al.
Publicado: (2025)
LoVA: Long-form Video-to-Audio Generation
por: Cheng, Xin, et al.
Publicado: (2024)
por: Cheng, Xin, et al.
Publicado: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
por: Shimada, Kazuki, et al.
Publicado: (2024)
por: Shimada, Kazuki, et al.
Publicado: (2024)
Resource-Efficient Reference-Free Evaluation of Audio Captions
por: Mahfuz, Rehana, et al.
Publicado: (2024)
por: Mahfuz, Rehana, et al.
Publicado: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
por: Yi, Mingjing, et al.
Publicado: (2024)
por: Yi, Mingjing, et al.
Publicado: (2024)
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026)
por: Zhang, Kang, et al.
Publicado: (2026)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
por: Zhao, Jinzheng, et al.
Publicado: (2023)
por: Zhao, Jinzheng, et al.
Publicado: (2023)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
por: Li, Xiaolou, et al.
Publicado: (2024)
por: Li, Xiaolou, et al.
Publicado: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
por: Huang, Lian, et al.
Publicado: (2024)
por: Huang, Lian, et al.
Publicado: (2024)
POLIPHONE: A Dataset for Smartphone Model Identification from Audio Recordings
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
por: Oh, Hyunwoo, et al.
Publicado: (2025)
por: Oh, Hyunwoo, et al.
Publicado: (2025)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
por: Liu, Che, et al.
Publicado: (2025)
por: Liu, Che, et al.
Publicado: (2025)
Sequential Contrastive Audio-Visual Learning
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
por: Jin, Ruinan, et al.
Publicado: (2026)
por: Jin, Ruinan, et al.
Publicado: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
por: Ren, Yong, et al.
Publicado: (2024)
por: Ren, Yong, et al.
Publicado: (2024)
Ejemplares similares
-
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
por: Liu, Shengqiang, et al.
Publicado: (2024) -
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
por: Zhang, Xiaohui, et al.
Publicado: (2024) -
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
por: Yu, Fan, et al.
Publicado: (2024) -
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024) -
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
por: Stewart, Shanti, et al.
Publicado: (2024)