SonicSense: Object Perception from In-Hand Acoustic Vibration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jiaxun, Chen, Boyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
par: Xie, Siyi, et autres
Publié: (2025)
par: Xie, Siyi, et autres
Publié: (2025)
SonicVisionLM: Playing Sound with Vision Language Models
par: Xie, Zhifeng, et autres
Publié: (2024)
par: Xie, Zhifeng, et autres
Publié: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
par: Lv, Yishan, et autres
Publié: (2026)
par: Lv, Yishan, et autres
Publié: (2026)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
Teaching Physical Awareness to LLMs through Sounds
par: Wang, Weiguo, et autres
Publié: (2025)
par: Wang, Weiguo, et autres
Publié: (2025)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
par: Ji, Xiaozhong, et autres
Publié: (2024)
par: Ji, Xiaozhong, et autres
Publié: (2024)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
par: Li, Xiaolou, et autres
Publié: (2024)
par: Li, Xiaolou, et autres
Publié: (2024)
Intelligent Text-Conditioned Music Generation
par: Xie, Zhouyao, et autres
Publié: (2024)
par: Xie, Zhouyao, et autres
Publié: (2024)
Multimodal Fish Feeding Intensity Assessment in Aquaculture
par: Cui, Meng, et autres
Publié: (2023)
par: Cui, Meng, et autres
Publié: (2023)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
par: Yuan, Yi, et autres
Publié: (2024)
par: Yuan, Yi, et autres
Publié: (2024)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
par: Ren, Yong, et autres
Publié: (2025)
par: Ren, Yong, et autres
Publié: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
par: Tian, Wenjie, et autres
Publié: (2025)
par: Tian, Wenjie, et autres
Publié: (2025)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
A Unified Framework for Modality-Agnostic Deepfakes Detection
par: Yu, Cai, et autres
Publié: (2023)
par: Yu, Cai, et autres
Publié: (2023)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
par: Liu, Shengqiang, et autres
Publié: (2024)
par: Liu, Shengqiang, et autres
Publié: (2024)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
par: Wang, Anna, et autres
Publié: (2024)
par: Wang, Anna, et autres
Publié: (2024)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
par: Liu, Haohe, et autres
Publié: (2024)
par: Liu, Haohe, et autres
Publié: (2024)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
par: Guo, Hongming, et autres
Publié: (2024)
par: Guo, Hongming, et autres
Publié: (2024)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
par: Salganik, Rebecca, et autres
Publié: (2026)
par: Salganik, Rebecca, et autres
Publié: (2026)
An automatic mixing speech enhancement system for multi-track audio
par: Liu, Xiaojing, et autres
Publié: (2024)
par: Liu, Xiaojing, et autres
Publié: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
par: Chen, Gehui, et autres
Publié: (2024)
par: Chen, Gehui, et autres
Publié: (2024)
Visual-based spatial audio generation system for multi-speaker environments
par: Liu, Xiaojing, et autres
Publié: (2025)
par: Liu, Xiaojing, et autres
Publié: (2025)
Singer separation for karaoke content generation
par: Lin, Hsuan-Yu, et autres
Publié: (2021)
par: Lin, Hsuan-Yu, et autres
Publié: (2021)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
par: Deng, Jiajun, et autres
Publié: (2025)
par: Deng, Jiajun, et autres
Publié: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
par: Liu, Shansong, et autres
Publié: (2024)
par: Liu, Shansong, et autres
Publié: (2024)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
par: Liu, Shansong, et autres
Publié: (2023)
par: Liu, Shansong, et autres
Publié: (2023)
SonicBoom: Contact Localization Using Array of Microphones
par: Lee, Moonyoung, et autres
Publié: (2024)
par: Lee, Moonyoung, et autres
Publié: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
MEGADance: Mixture-of-Experts Architecture for Genre-Aware 3D Dance Generation
par: Yang, Kaixing, et autres
Publié: (2025)
par: Yang, Kaixing, et autres
Publié: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
par: Jiang, Ziyang, et autres
Publié: (2024)
par: Jiang, Ziyang, et autres
Publié: (2024)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024)
par: Yang, Kaixing, et autres
Publié: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
Effectively obtaining acoustic, visual and textual data from videos
par: León, Jorge E., et autres
Publié: (2025)
par: León, Jorge E., et autres
Publié: (2025)
Documents similaires
-
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
par: Xie, Siyi, et autres
Publié: (2025) -
SonicVisionLM: Playing Sound with Vision Language Models
par: Xie, Zhifeng, et autres
Publié: (2024) -
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025) -
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
par: Lv, Yishan, et autres
Publié: (2026) -
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)