EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Jiacheng, Chen, Jiajun, Peng, Kunyu, He, Xuan, Li, Zhiyong, Stiefelhagen, Rainer, Yang, Kailun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation
por: Chen, Jiajun, et al.
Publicado: (2023)
por: Chen, Jiajun, et al.
Publicado: (2023)
DHFP-PE: Dual-Precision Hybrid Floating Point Processing Element for AI Acceleration
por: Kumar, Shubham, et al.
Publicado: (2026)
por: Kumar, Shubham, et al.
Publicado: (2026)
DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming
por: Wen, Shuide, et al.
Publicado: (2026)
por: Wen, Shuide, et al.
Publicado: (2026)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
por: Eliav, Amit, et al.
Publicado: (2024)
por: Eliav, Amit, et al.
Publicado: (2024)
BUT System Description for CHiME-9 MCoRec Challenge
por: Klement, Dominik, et al.
Publicado: (2026)
por: Klement, Dominik, et al.
Publicado: (2026)
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
por: Yang, Wenhao, et al.
Publicado: (2025)
por: Yang, Wenhao, et al.
Publicado: (2025)
Bounds on Agreement between Subjective and Objective Measurements
por: Pieper, Jaden, et al.
Publicado: (2026)
por: Pieper, Jaden, et al.
Publicado: (2026)
OmniTrack++: Omnidirectional Multi-Object Tracking by Learning Large-FoV Trajectory Feedback
por: Luo, Kai, et al.
Publicado: (2025)
por: Luo, Kai, et al.
Publicado: (2025)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
por: Cao, Yuqin, et al.
Publicado: (2024)
por: Cao, Yuqin, et al.
Publicado: (2024)
NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving
por: Luo, Kai, et al.
Publicado: (2026)
por: Luo, Kai, et al.
Publicado: (2026)
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
por: Farhadipour, Aref, et al.
Publicado: (2025)
por: Farhadipour, Aref, et al.
Publicado: (2025)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
por: Zhou, Huali, et al.
Publicado: (2024)
por: Zhou, Huali, et al.
Publicado: (2024)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
por: Salaj, Ina, et al.
Publicado: (2025)
por: Salaj, Ina, et al.
Publicado: (2025)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
por: Park, Jay, et al.
Publicado: (2025)
por: Park, Jay, et al.
Publicado: (2025)
Improvement Of Audiovisual Quality Estimation Using A Nonlinear Autoregressive Exogenous Neural Network And Bitstream Parameters
por: Kossi, Koffi, et al.
Publicado: (2024)
por: Kossi, Koffi, et al.
Publicado: (2024)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
por: Aris, William, et al.
Publicado: (2023)
por: Aris, William, et al.
Publicado: (2023)
Multimodal sensor fusion for real-time location-dependent defect detection in laser-directed energy deposition
por: Chen, Lequn, et al.
Publicado: (2023)
por: Chen, Lequn, et al.
Publicado: (2023)
OAFuser: Towards Omni-Aperture Fusion for Light Field Semantic Segmentation
por: Teng, Fei, et al.
Publicado: (2023)
por: Teng, Fei, et al.
Publicado: (2023)
Spoken question answering for visual queries
por: Shabtay, Nimrod, et al.
Publicado: (2025)
por: Shabtay, Nimrod, et al.
Publicado: (2025)
RestoreGrad: Signal Restoration Using Conditional Denoising Diffusion Models with Jointly Learned Prior
por: Lee, Ching-Hua, et al.
Publicado: (2025)
por: Lee, Ching-Hua, et al.
Publicado: (2025)
Efficient Test-Time Adaptation through Latent Subspace Coefficients Search
por: Luo, Xinyu, et al.
Publicado: (2025)
por: Luo, Xinyu, et al.
Publicado: (2025)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
por: Yue, Xianghu, et al.
Publicado: (2024)
por: Yue, Xianghu, et al.
Publicado: (2024)
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
por: Ragano, Alessandro, et al.
Publicado: (2024)
por: Ragano, Alessandro, et al.
Publicado: (2024)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
por: Buitrago, Pol, et al.
Publicado: (2026)
por: Buitrago, Pol, et al.
Publicado: (2026)
TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization
por: Malard, Hugo, et al.
Publicado: (2024)
por: Malard, Hugo, et al.
Publicado: (2024)
A Smart-Glasses for Emergency Medical Services via Multimodal Multitask Learning
por: Jin, Liuyi, et al.
Publicado: (2025)
por: Jin, Liuyi, et al.
Publicado: (2025)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
por: Mingote, Victoria, et al.
Publicado: (2024)
por: Mingote, Victoria, et al.
Publicado: (2024)
Omnidirectional Multi-Object Tracking
por: Luo, Kai, et al.
Publicado: (2025)
por: Luo, Kai, et al.
Publicado: (2025)
W4S4: WaLRUS Meets S4 for Long-Range Sequence Modeling
por: Babaei, Hossein, et al.
Publicado: (2025)
por: Babaei, Hossein, et al.
Publicado: (2025)
SoundSil-DS: Deep Denoising and Segmentation of Sound-field Images with Silhouettes
por: Tanigawa, Risako, et al.
Publicado: (2024)
por: Tanigawa, Risako, et al.
Publicado: (2024)
A multi-modal approach for identifying schizophrenia using cross-modal attention
por: Premananth, Gowtham, et al.
Publicado: (2023)
por: Premananth, Gowtham, et al.
Publicado: (2023)
Multimodal Biomarkers for Schizophrenia: Towards Individual Symptom Severity Estimation
por: Premananth, Gowtham, et al.
Publicado: (2025)
por: Premananth, Gowtham, et al.
Publicado: (2025)
Fast Swap-Based Element Selection for Multiplication-Free Dimension Reduction
por: Ono, Nobutaka
Publicado: (2026)
por: Ono, Nobutaka
Publicado: (2026)
Leveraging Reverberation and Visual Depth Cues for Sound Event Localization and Detection with Distance Estimation
por: Berghi, Davide, et al.
Publicado: (2024)
por: Berghi, Davide, et al.
Publicado: (2024)
Spatial and Semantic Embedding Integration for Stereo Sound Event Localization and Detection in Regular Videos
por: Berghi, Davide, et al.
Publicado: (2025)
por: Berghi, Davide, et al.
Publicado: (2025)
SaFARi: State-Space Models for Frame-Agnostic Representation
por: Babaei, Hossein, et al.
Publicado: (2025)
por: Babaei, Hossein, et al.
Publicado: (2025)
Multimodal Marvels of Deep Learning in Medical Diagnosis: A Comprehensive Review of COVID-19 Detection
por: Islam, Md Shofiqul, et al.
Publicado: (2025)
por: Islam, Md Shofiqul, et al.
Publicado: (2025)
End-to-end audio-visual learning for cochlear implant sound coding simulations in noisy environments
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
Ejemplares similares
-
Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation
por: Chen, Jiajun, et al.
Publicado: (2023) -
DHFP-PE: Dual-Precision Hybrid Floating Point Processing Element for AI Acceleration
por: Kumar, Shubham, et al.
Publicado: (2026) -
DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming
por: Wen, Shuide, et al.
Publicado: (2026) -
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
por: Tao, Ruijie, et al.
Publicado: (2024) -
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
por: Eliav, Amit, et al.
Publicado: (2024)