Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping
Fuente:
arXiv
Salvato in:
| Autori principali: | Khanal, Subash, Sastry, Srikumar, Dhakal, Aayush, Ahmad, Adeel, Stylianou, Abby, Jacobs, Nathan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PSM: Learning Probabilistic Embeddings for Multi-scale Zero-Shot Soundscape Mapping
di: Khanal, Subash, et al.
Pubblicazione: (2024)
di: Khanal, Subash, et al.
Pubblicazione: (2024)
Sat2Cap: Mapping Fine-Grained Textual Descriptions from Satellite Images
di: Dhakal, Aayush, et al.
Pubblicazione: (2023)
di: Dhakal, Aayush, et al.
Pubblicazione: (2023)
TaxaBind: A Unified Embedding Space for Ecological Applications
di: Sastry, Srikumar, et al.
Pubblicazione: (2024)
di: Sastry, Srikumar, et al.
Pubblicazione: (2024)
GeoSynth: Contextually-Aware High-Resolution Satellite Image Synthesis
di: Sastry, Srikumar, et al.
Pubblicazione: (2024)
di: Sastry, Srikumar, et al.
Pubblicazione: (2024)
LD-SDM: Language-Driven Hierarchical Species Distribution Modeling
di: Sastry, Srikumar, et al.
Pubblicazione: (2023)
di: Sastry, Srikumar, et al.
Pubblicazione: (2023)
RANGE: Retrieval Augmented Neural Fields for Multi-Resolution Geo-Embeddings
di: Dhakal, Aayush, et al.
Pubblicazione: (2025)
di: Dhakal, Aayush, et al.
Pubblicazione: (2025)
Global and Local Entailment Learning for Natural World Imagery
di: Sastry, Srikumar, et al.
Pubblicazione: (2025)
di: Sastry, Srikumar, et al.
Pubblicazione: (2025)
GEOBIND: Binding Text, Image, and Audio through Satellite Images
di: Dhakal, Aayush, et al.
Pubblicazione: (2024)
di: Dhakal, Aayush, et al.
Pubblicazione: (2024)
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
di: Sastry, Srikumar, et al.
Pubblicazione: (2025)
di: Sastry, Srikumar, et al.
Pubblicazione: (2025)
GeoDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis
di: Sastry, Srikumar, et al.
Pubblicazione: (2026)
di: Sastry, Srikumar, et al.
Pubblicazione: (2026)
SimLBR: Learning to Detect Fake Images by Learning to Detect Real Images
di: Dhakal, Aayush, et al.
Pubblicazione: (2026)
di: Dhakal, Aayush, et al.
Pubblicazione: (2026)
DiffVAS: Diffusion-Guided Visual Active Search in Partially Observable Environments
di: Sarkar, Anindya, et al.
Pubblicazione: (2026)
di: Sarkar, Anindya, et al.
Pubblicazione: (2026)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
di: Kang, Minjae, et al.
Pubblicazione: (2025)
di: Kang, Minjae, et al.
Pubblicazione: (2025)
good4cir: Generating Detailed Synthetic Captions for Composed Image Retrieval
di: Kolouju, Pranavi, et al.
Pubblicazione: (2025)
di: Kolouju, Pranavi, et al.
Pubblicazione: (2025)
GOMAA-Geo: GOal Modality Agnostic Active Geo-localization
di: Sarkar, Anindya, et al.
Pubblicazione: (2024)
di: Sarkar, Anindya, et al.
Pubblicazione: (2024)
Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation
di: Nie, Chang, et al.
Pubblicazione: (2026)
di: Nie, Chang, et al.
Pubblicazione: (2026)
VectorSynth: Fine-Grained Satellite Image Synthesis with Structured Semantics
di: Cher, Daniel, et al.
Pubblicazione: (2025)
di: Cher, Daniel, et al.
Pubblicazione: (2025)
Graph Propagated Projection Unlearning: A Unified Framework for Vision and Audio Discriminative Models
di: Pathak, Shreyansh, et al.
Pubblicazione: (2026)
di: Pathak, Shreyansh, et al.
Pubblicazione: (2026)
QuARI: Query Adaptive Retrieval Improvement
di: Xing, Eric, et al.
Pubblicazione: (2025)
di: Xing, Eric, et al.
Pubblicazione: (2025)
SoundVista: Novel-View Ambient Sound Synthesis via Visual-Acoustic Binding
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
Definition-independent Formalization of Soundscapes: Towards a Formal Methodology
di: Jedrusiak, Mikel D., et al.
Pubblicazione: (2023)
di: Jedrusiak, Mikel D., et al.
Pubblicazione: (2023)
Will It Zero-Shot?: Predicting Zero-Shot Classification Performance For Arbitrary Queries
di: Robbins, Kevin, et al.
Pubblicazione: (2026)
di: Robbins, Kevin, et al.
Pubblicazione: (2026)
SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound
di: Dagli, Rishit, et al.
Pubblicazione: (2024)
di: Dagli, Rishit, et al.
Pubblicazione: (2024)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
di: Rong, Yan, et al.
Pubblicazione: (2024)
di: Rong, Yan, et al.
Pubblicazione: (2024)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
Mixed-View Panorama Synthesis using Geospatially Guided Diffusion
di: Xiong, Zhexiao, et al.
Pubblicazione: (2024)
di: Xiong, Zhexiao, et al.
Pubblicazione: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
di: Li, Tingle, et al.
Pubblicazione: (2024)
di: Li, Tingle, et al.
Pubblicazione: (2024)
ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval
di: Xing, Eric, et al.
Pubblicazione: (2025)
di: Xing, Eric, et al.
Pubblicazione: (2025)
VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning
di: Cheng, Xin, et al.
Pubblicazione: (2025)
di: Cheng, Xin, et al.
Pubblicazione: (2025)
When Vision Speaks for Sound
di: Wen, Xiaofei, et al.
Pubblicazione: (2026)
di: Wen, Xiaofei, et al.
Pubblicazione: (2026)
Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
An Automated Pipeline for Few-Shot Bird Call Classification: A Case Study with the Tooth-Billed Pigeon
di: Jana, Abhishek, et al.
Pubblicazione: (2025)
di: Jana, Abhishek, et al.
Pubblicazione: (2025)
Improving Sound Source Localization with Joint Slot Attention on Image and Audio
di: Kim, Inho, et al.
Pubblicazione: (2025)
di: Kim, Inho, et al.
Pubblicazione: (2025)
DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Factorized Discrete Flow Matching
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2025)
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2025)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
di: Lee, Seung-jae, et al.
Pubblicazione: (2025)
di: Lee, Seung-jae, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PSM: Learning Probabilistic Embeddings for Multi-scale Zero-Shot Soundscape Mapping
di: Khanal, Subash, et al.
Pubblicazione: (2024) -
Sat2Cap: Mapping Fine-Grained Textual Descriptions from Satellite Images
di: Dhakal, Aayush, et al.
Pubblicazione: (2023) -
TaxaBind: A Unified Embedding Space for Ecological Applications
di: Sastry, Srikumar, et al.
Pubblicazione: (2024) -
GeoSynth: Contextually-Aware High-Resolution Satellite Image Synthesis
di: Sastry, Srikumar, et al.
Pubblicazione: (2024) -
LD-SDM: Language-Driven Hierarchical Species Distribution Modeling
di: Sastry, Srikumar, et al.
Pubblicazione: (2023)