Estimating Indoor Scene Depth Maps from Ultrasonic Echoes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Honma, Junpei, Kimura, Akisato, Irie, Go |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BGM2Pose: Active 3D Human Pose Estimation with Non-Stationary Sounds
par: Shibata, Yuto, et autres
Publié: (2025)
par: Shibata, Yuto, et autres
Publié: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
par: Yang, Shiqi, et autres
Publié: (2024)
par: Yang, Shiqi, et autres
Publié: (2024)
AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification
par: Xiao, Zhenyuan, et autres
Publié: (2024)
par: Xiao, Zhenyuan, et autres
Publié: (2024)
Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection
par: PN, Aravinda Reddy, et autres
Publié: (2024)
par: PN, Aravinda Reddy, et autres
Publié: (2024)
Read, Watch and Scream! Sound Generation from Text and Video
par: Jeong, Yujin, et autres
Publié: (2024)
par: Jeong, Yujin, et autres
Publié: (2024)
The Sound of Water: Inferring Physical Properties from Pouring Liquids
par: Bagad, Piyush, et autres
Publié: (2024)
par: Bagad, Piyush, et autres
Publié: (2024)
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
par: Chen, Changan, et autres
Publié: (2024)
par: Chen, Changan, et autres
Publié: (2024)
Reverse the auditory processing pathway: Coarse-to-fine audio reconstruction from fMRI
par: Liu, Che, et autres
Publié: (2024)
par: Liu, Che, et autres
Publié: (2024)
Learning to Visually Localize Sound Sources from Mixtures without Prior Source Knowledge
par: Kim, Dongjin, et autres
Publié: (2024)
par: Kim, Dongjin, et autres
Publié: (2024)
Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
par: Gupta, Akshita, et autres
Publié: (2024)
par: Gupta, Akshita, et autres
Publié: (2024)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
par: Rinaldi, Ivan, et autres
Publié: (2024)
par: Rinaldi, Ivan, et autres
Publié: (2024)
3D Audio-Visual Segmentation
par: Sokolov, Artem, et autres
Publié: (2024)
par: Sokolov, Artem, et autres
Publié: (2024)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Visual and audio scene classification for detecting discrepancies in video: a baseline method and experimental protocol
par: Apostolidis, Konstantinos, et autres
Publié: (2024)
par: Apostolidis, Konstantinos, et autres
Publié: (2024)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
par: Yu, Fei, et autres
Publié: (2024)
par: Yu, Fei, et autres
Publié: (2024)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
par: Krishnamurthy, Sudha
Publié: (2024)
par: Krishnamurthy, Sudha
Publié: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Comparative Analysis of Modality Fusion Approaches for Audio-Visual Person Identification and Verification
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024)
par: Cappellazzo, Umberto, et autres
Publié: (2024)
M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment
par: Nguyen-Phuoc, Long, et autres
Publié: (2024)
par: Nguyen-Phuoc, Long, et autres
Publié: (2024)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
par: He, Yuhang, et autres
Publié: (2024)
par: He, Yuhang, et autres
Publié: (2024)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
par: Chi, Xiaowei, et autres
Publié: (2024)
par: Chi, Xiaowei, et autres
Publié: (2024)
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
par: Chen, Honglie, et autres
Publié: (2024)
par: Chen, Honglie, et autres
Publié: (2024)
Benchmarking Cross-Domain Audio-Visual Deception Detection
par: Guo, Xiaobao, et autres
Publié: (2024)
par: Guo, Xiaobao, et autres
Publié: (2024)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
par: Wang, Baisen, et autres
Publié: (2024)
par: Wang, Baisen, et autres
Publié: (2024)
MCDubber: Multimodal Context-Aware Expressive Video Dubbing
par: Zhao, Yuan, et autres
Publié: (2024)
par: Zhao, Yuan, et autres
Publié: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
par: Xing, Yazhou, et autres
Publié: (2024)
par: Xing, Yazhou, et autres
Publié: (2024)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
par: Li, Bingliang, et autres
Publié: (2024)
par: Li, Bingliang, et autres
Publié: (2024)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
par: Li, Shufan, et autres
Publié: (2024)
par: Li, Shufan, et autres
Publié: (2024)
Towards Accurate Lip-to-Speech Synthesis in-the-Wild
par: Hegde, Sindhu, et autres
Publié: (2024)
par: Hegde, Sindhu, et autres
Publié: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
par: Mahmud, Tanvir, et autres
Publié: (2024)
par: Mahmud, Tanvir, et autres
Publié: (2024)
SemiPL: A Semi-supervised Method for Event Sound Source Localization
par: Li, Yue, et autres
Publié: (2024)
par: Li, Yue, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
par: Nakada, Shota, et autres
Publié: (2024)
par: Nakada, Shota, et autres
Publié: (2024)
Documents similaires
-
BGM2Pose: Active 3D Human Pose Estimation with Non-Stationary Sounds
par: Shibata, Yuto, et autres
Publié: (2025) -
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
par: Yang, Shiqi, et autres
Publié: (2024) -
AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification
par: Xiao, Zhenyuan, et autres
Publié: (2024) -
Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection
par: PN, Aravinda Reddy, et autres
Publié: (2024) -
Read, Watch and Scream! Sound Generation from Text and Video
par: Jeong, Yujin, et autres
Publié: (2024)