Event2Audio: Event-Based Optical Vibration Sensing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cai, Mingxuan, Galor, Dekel, Kohli, Amit Pal Singh, Yates, Jacob L., Waller, Laura |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Noise2Image: Noise-Enabled Static Scene Recovery for Event Cameras
par: Cao, Ruiming, et autres
Publié: (2024)
par: Cao, Ruiming, et autres
Publié: (2024)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
par: Eliav, Amit, et autres
Publié: (2024)
par: Eliav, Amit, et autres
Publié: (2024)
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
par: Aris, William, et autres
Publié: (2023)
par: Aris, William, et autres
Publié: (2023)
Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
par: Ishikawa, Yuchi, et autres
Publié: (2025)
par: Ishikawa, Yuchi, et autres
Publié: (2025)
Spoken question answering for visual queries
par: Shabtay, Nimrod, et autres
Publié: (2025)
par: Shabtay, Nimrod, et autres
Publié: (2025)
BUT System Description for CHiME-9 MCoRec Challenge
par: Klement, Dominik, et autres
Publié: (2026)
par: Klement, Dominik, et autres
Publié: (2026)
Listening without Looking: Modality Bias in Audio-Visual Captioning
par: Ishikawa, Yuchi, et autres
Publié: (2025)
par: Ishikawa, Yuchi, et autres
Publié: (2025)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
par: Salaj, Ina, et autres
Publié: (2025)
par: Salaj, Ina, et autres
Publié: (2025)
Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification
par: Shimada, Kazuki, et autres
Publié: (2025)
par: Shimada, Kazuki, et autres
Publié: (2025)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
par: Cao, Yuqin, et autres
Publié: (2024)
par: Cao, Yuqin, et autres
Publié: (2024)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model
par: Yeo, Jeong Hun, et autres
Publié: (2023)
par: Yeo, Jeong Hun, et autres
Publié: (2023)
Leveraging Reverberation and Visual Depth Cues for Sound Event Localization and Detection with Distance Estimation
par: Berghi, Davide, et autres
Publié: (2024)
par: Berghi, Davide, et autres
Publié: (2024)
Spatial and Semantic Embedding Integration for Stereo Sound Event Localization and Detection in Regular Videos
par: Berghi, Davide, et autres
Publié: (2025)
par: Berghi, Davide, et autres
Publié: (2025)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
par: Mingote, Victoria, et autres
Publié: (2024)
par: Mingote, Victoria, et autres
Publié: (2024)
Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2021)
par: Praveen, R. Gnana, et autres
Publié: (2021)
DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming
par: Wen, Shuide, et autres
Publié: (2026)
par: Wen, Shuide, et autres
Publié: (2026)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
par: Yang, Wenhao, et autres
Publié: (2025)
par: Yang, Wenhao, et autres
Publié: (2025)
Bounds on Agreement between Subjective and Objective Measurements
par: Pieper, Jaden, et autres
Publié: (2026)
par: Pieper, Jaden, et autres
Publié: (2026)
TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization
par: Malard, Hugo, et autres
Publié: (2024)
par: Malard, Hugo, et autres
Publié: (2024)
Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
par: Yue, Xianghu, et autres
Publié: (2024)
par: Yue, Xianghu, et autres
Publié: (2024)
ToS: A Team of Specialists ensemble framework for Stereo Sound Event Localization and Detection with distance estimation in Video
par: Berghi, Davide, et autres
Publié: (2026)
par: Berghi, Davide, et autres
Publié: (2026)
TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos
par: Berghi, Davide, et autres
Publié: (2025)
par: Berghi, Davide, et autres
Publié: (2025)
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
par: Farhadipour, Aref, et autres
Publié: (2025)
par: Farhadipour, Aref, et autres
Publié: (2025)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
par: Zhou, Huali, et autres
Publié: (2024)
par: Zhou, Huali, et autres
Publié: (2024)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
par: Park, Jay, et autres
Publié: (2025)
par: Park, Jay, et autres
Publié: (2025)
Improvement Of Audiovisual Quality Estimation Using A Nonlinear Autoregressive Exogenous Neural Network And Bitstream Parameters
par: Kossi, Koffi, et autres
Publié: (2024)
par: Kossi, Koffi, et autres
Publié: (2024)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
par: Wen, Liuyuan
Publié: (2024)
par: Wen, Liuyuan
Publié: (2024)
StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation
par: Min, Dongchan, et autres
Publié: (2022)
par: Min, Dongchan, et autres
Publié: (2022)
Robust Residual Finite Scalar Quantization for Neural Compression
par: Zhu, Xiaoxu, et autres
Publié: (2025)
par: Zhu, Xiaoxu, et autres
Publié: (2025)
Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation
par: Chen, Jiajun, et autres
Publié: (2023)
par: Chen, Jiajun, et autres
Publié: (2023)
Multimodal sensor fusion for real-time location-dependent defect detection in laser-directed energy deposition
par: Chen, Lequn, et autres
Publié: (2023)
par: Chen, Lequn, et autres
Publié: (2023)
Machine Perceptual Quality: Evaluating the Impact of Severe Lossy Compression on Audio and Image Models
par: Jacobellis, Dan, et autres
Publié: (2024)
par: Jacobellis, Dan, et autres
Publié: (2024)
Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition
par: Kim, Sungnyun, et autres
Publié: (2024)
par: Kim, Sungnyun, et autres
Publié: (2024)
RestoreGrad: Signal Restoration Using Conditional Denoising Diffusion Models with Jointly Learned Prior
par: Lee, Ching-Hua, et autres
Publié: (2025)
par: Lee, Ching-Hua, et autres
Publié: (2025)
Documents similaires
-
Noise2Image: Noise-Enabled Static Scene Recovery for Event Cameras
par: Cao, Ruiming, et autres
Publié: (2024) -
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
par: Eliav, Amit, et autres
Publié: (2024) -
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
par: Aris, William, et autres
Publié: (2023) -
Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
par: Ishikawa, Yuchi, et autres
Publié: (2025) -
Spoken question answering for visual queries
par: Shabtay, Nimrod, et autres
Publié: (2025)