Pre-training with Synthetic Patterns for Audio
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ishikawa, Yuchi, Komatsu, Tatsuya, Aoki, Yoshimitsu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Listening without Looking: Modality Bias in Audio-Visual Captioning
par: Ishikawa, Yuchi, et autres
Publié: (2025)
par: Ishikawa, Yuchi, et autres
Publié: (2025)
Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
par: Ishikawa, Yuchi, et autres
Publié: (2025)
par: Ishikawa, Yuchi, et autres
Publié: (2025)
BGM2Pose: Active 3D Human Pose Estimation with Non-Stationary Sounds
par: Shibata, Yuto, et autres
Publié: (2025)
par: Shibata, Yuto, et autres
Publié: (2025)
ProLAP: Probabilistic Language-Audio Pre-Training
par: Manabe, Toranosuke, et autres
Publié: (2025)
par: Manabe, Toranosuke, et autres
Publié: (2025)
Unified Video-Language Pre-training with Synchronized Audio
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
par: Nakada, Shota, et autres
Publié: (2024)
par: Nakada, Shota, et autres
Publié: (2024)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity
par: Pascual, Santiago, et autres
Publié: (2024)
par: Pascual, Santiago, et autres
Publié: (2024)
Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks
par: Moussa, Denise, et autres
Publié: (2022)
par: Moussa, Denise, et autres
Publié: (2022)
SAVE: Segment Audio-Visual Easy way using Segment Anything Model
par: Nguyen, Khanh-Binh, et autres
Publié: (2024)
par: Nguyen, Khanh-Binh, et autres
Publié: (2024)
From Vision to Sound: Advancing Audio Anomaly Detection with Vision-Based Algorithms
par: Barusco, Manuel, et autres
Publié: (2025)
par: Barusco, Manuel, et autres
Publié: (2025)
Unified Cross-modal Translation of Score Images, Symbolic Music, and Performance Audio
par: Jung, Jongmin, et autres
Publié: (2025)
par: Jung, Jongmin, et autres
Publié: (2025)
Enriching Multimodal Sentiment Analysis through Textual Emotional Descriptions of Visual-Audio Content
par: Wu, Sheng, et autres
Publié: (2024)
par: Wu, Sheng, et autres
Publié: (2024)
Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual Segmentation
par: Yang, Qi, et autres
Publié: (2023)
par: Yang, Qi, et autres
Publié: (2023)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
Data Augmentation Using Neural Acoustic Fields With Retrieval-Augmented Pre-training
par: Ick, Christopher, et autres
Publié: (2025)
par: Ick, Christopher, et autres
Publié: (2025)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
par: Joo, Seohyun, et autres
Publié: (2026)
par: Joo, Seohyun, et autres
Publié: (2026)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
par: Kang, Minjae, et autres
Publié: (2025)
par: Kang, Minjae, et autres
Publié: (2025)
GaussianSpeech: Audio-Driven Gaussian Avatars
par: Aneja, Shivangi, et autres
Publié: (2024)
par: Aneja, Shivangi, et autres
Publié: (2024)
VGGSounder: Audio-Visual Evaluations for Foundation Models
par: Zverev, Daniil, et autres
Publié: (2025)
par: Zverev, Daniil, et autres
Publié: (2025)
TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
par: Liu, Jinxiang, et autres
Publié: (2024)
par: Liu, Jinxiang, et autres
Publié: (2024)
Multimodal Sentiment Analysis based on Video and Audio Inputs
par: Fernandez, Antonio, et autres
Publié: (2024)
par: Fernandez, Antonio, et autres
Publié: (2024)
Object-AVEdit: An Object-level Audio-Visual Editing Model
par: Fu, Youquan, et autres
Publié: (2025)
par: Fu, Youquan, et autres
Publié: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
par: Xie, Liuyue, et autres
Publié: (2025)
par: Xie, Liuyue, et autres
Publié: (2025)
Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs
par: Chowdhury, Sanjoy, et autres
Publié: (2025)
par: Chowdhury, Sanjoy, et autres
Publié: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
par: Chowdhury, Sanjoy, et autres
Publié: (2024)
par: Chowdhury, Sanjoy, et autres
Publié: (2024)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
par: Liang, Yingshan, et autres
Publié: (2025)
par: Liang, Yingshan, et autres
Publié: (2025)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
par: Burchi, Maxime, et autres
Publié: (2024)
par: Burchi, Maxime, et autres
Publié: (2024)
ManiWAV: Learning Robot Manipulation from In-the-Wild Audio-Visual Data
par: Liu, Zeyi, et autres
Publié: (2024)
par: Liu, Zeyi, et autres
Publié: (2024)
A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning
par: Vilaca, Luis, et autres
Publié: (2024)
par: Vilaca, Luis, et autres
Publié: (2024)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
par: Choi, Hahyeon, et autres
Publié: (2025)
par: Choi, Hahyeon, et autres
Publié: (2025)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
par: Aneja, Shivangi, et autres
Publié: (2023)
par: Aneja, Shivangi, et autres
Publié: (2023)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
par: Zhao, Lei, et autres
Publié: (2025)
par: Zhao, Lei, et autres
Publié: (2025)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
par: Qiang, Chunyu, et autres
Publié: (2026)
par: Qiang, Chunyu, et autres
Publié: (2026)
Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion
par: Lim, DongHoon, et autres
Publié: (2025)
par: Lim, DongHoon, et autres
Publié: (2025)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
par: Qian, Xinyuan, et autres
Publié: (2024)
par: Qian, Xinyuan, et autres
Publié: (2024)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
Documents similaires
-
Listening without Looking: Modality Bias in Audio-Visual Captioning
par: Ishikawa, Yuchi, et autres
Publié: (2025) -
Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
par: Ishikawa, Yuchi, et autres
Publié: (2025) -
BGM2Pose: Active 3D Human Pose Estimation with Non-Stationary Sounds
par: Shibata, Yuto, et autres
Publié: (2025) -
ProLAP: Probabilistic Language-Audio Pre-Training
par: Manabe, Toranosuke, et autres
Publié: (2025) -
Unified Video-Language Pre-training with Synchronized Audio
par: Mo, Shentong, et autres
Publié: (2024)