SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Changan, Ashutosh, Kumar, Girdhar, Rohit, Harwath, David, Grauman, Kristen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos
par: Chen, Changan, et autres
Publié: (2024)
par: Chen, Changan, et autres
Publié: (2024)
Video-Guided Foley Sound Generation with Multimodal Controls
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024)
par: Chen, Zihao, et autres
Publié: (2024)
Read, Watch and Scream! Sound Generation from Text and Video
par: Jeong, Yujin, et autres
Publié: (2024)
par: Jeong, Yujin, et autres
Publié: (2024)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
par: Senocak, Arda, et autres
Publié: (2024)
par: Senocak, Arda, et autres
Publié: (2024)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
par: Krishnamurthy, Sudha
Publié: (2024)
par: Krishnamurthy, Sudha
Publié: (2024)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023)
par: Majumder, Sagnik, et autres
Publié: (2023)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024)
par: Rai, Aashish, et autres
Publié: (2024)
Learning to Visually Localize Sound Sources from Mixtures without Prior Source Knowledge
par: Kim, Dongjin, et autres
Publié: (2024)
par: Kim, Dongjin, et autres
Publié: (2024)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
par: He, Yuhang, et autres
Publié: (2024)
par: He, Yuhang, et autres
Publié: (2024)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
par: Lee, Junwon, et autres
Publié: (2024)
par: Lee, Junwon, et autres
Publié: (2024)
The Sound of Water: Inferring Physical Properties from Pouring Liquids
par: Bagad, Piyush, et autres
Publié: (2024)
par: Bagad, Piyush, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
SemiPL: A Semi-supervised Method for Event Sound Source Localization
par: Li, Yue, et autres
Publié: (2024)
par: Li, Yue, et autres
Publié: (2024)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
par: Guo, Wei, et autres
Publié: (2024)
par: Guo, Wei, et autres
Publié: (2024)
Soundify: Matching Sound Effects to Video
par: Lin, David Chuan-En, et autres
Publié: (2021)
par: Lin, David Chuan-En, et autres
Publié: (2021)
Segmenting Collision Sound Sources in Egocentric Videos
par: Parida, Kranti Kumar, et autres
Publié: (2025)
par: Parida, Kranti Kumar, et autres
Publié: (2025)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
Images that Sound: Composing Images and Sounds on a Single Canvas
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
par: Choi, Hahyeon, et autres
Publié: (2025)
par: Choi, Hahyeon, et autres
Publié: (2025)
Seeing Sound, Hearing Sight: Uncovering Modality Bias and Conflict of AI models in Sound Localization
par: Jia, Yanhao, et autres
Publié: (2025)
par: Jia, Yanhao, et autres
Publié: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
par: Joo, Seohyun, et autres
Publié: (2026)
par: Joo, Seohyun, et autres
Publié: (2026)
Continual Audio-Visual Sound Separation
par: Pian, Weiguo, et autres
Publié: (2024)
par: Pian, Weiguo, et autres
Publié: (2024)
ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling
par: Somayazulu, Arjun, et autres
Publié: (2024)
par: Somayazulu, Arjun, et autres
Publié: (2024)
Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification
par: Shimada, Kazuki, et autres
Publié: (2025)
par: Shimada, Kazuki, et autres
Publié: (2025)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning
par: Singh, Nikhil, et autres
Publié: (2023)
par: Singh, Nikhil, et autres
Publié: (2023)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
par: Wang, Yaoting, et autres
Publié: (2023)
par: Wang, Yaoting, et autres
Publié: (2023)
Multi-scale Multi-instance Visual Sound Localization and Segmentation
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
par: Li, Tingle, et autres
Publié: (2025)
par: Li, Tingle, et autres
Publié: (2025)
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2024)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
par: Tseng, Yuan, et autres
Publié: (2023)
par: Tseng, Yuan, et autres
Publié: (2023)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
Temporally Aligned Audio for Video with Autoregression
par: Viertola, Ilpo, et autres
Publié: (2024)
par: Viertola, Ilpo, et autres
Publié: (2024)
Diffusion Models as Masked Audio-Video Learners
par: Nunez, Elvis, et autres
Publié: (2023)
par: Nunez, Elvis, et autres
Publié: (2023)
MCDubber: Multimodal Context-Aware Expressive Video Dubbing
par: Zhao, Yuan, et autres
Publié: (2024)
par: Zhao, Yuan, et autres
Publié: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
par: Low, Chetwin, et autres
Publié: (2025)
par: Low, Chetwin, et autres
Publié: (2025)
Documents similaires
-
Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos
par: Chen, Changan, et autres
Publié: (2024) -
Video-Guided Foley Sound Generation with Multimodal Controls
par: Chen, Ziyang, et autres
Publié: (2024) -
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024) -
Read, Watch and Scream! Sound Generation from Text and Video
par: Jeong, Yujin, et autres
Publié: (2024) -
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
par: Senocak, Arda, et autres
Publié: (2024)