EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
Fuente:
arXiv
Guardado en:
| Autores principales: | Qian, Xinyuan, Zhu, Xinjia, Brutti, Alessio, Liang, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
por: Rai, Aashish, et al.
Publicado: (2024)
por: Rai, Aashish, et al.
Publicado: (2024)
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
Robust Active Speaker Detection in Noisy Environments
por: Vasireddy, Siva Sai Nagender, et al.
Publicado: (2024)
por: Vasireddy, Siva Sai Nagender, et al.
Publicado: (2024)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)
por: Araujo, Edson, et al.
Publicado: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
por: Yang, Jianxuan, et al.
Publicado: (2026)
por: Yang, Jianxuan, et al.
Publicado: (2026)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
por: Rinaldi, Ivan, et al.
Publicado: (2026)
por: Rinaldi, Ivan, et al.
Publicado: (2026)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
por: Li, Qifei, et al.
Publicado: (2024)
por: Li, Qifei, et al.
Publicado: (2024)
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
por: Dai, Yusheng, et al.
Publicado: (2024)
por: Dai, Yusheng, et al.
Publicado: (2024)
Anomaly Detection and Localization for Speech Deepfakes via Feature Pyramid Matching
por: Coletta, Emma, et al.
Publicado: (2025)
por: Coletta, Emma, et al.
Publicado: (2025)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
por: Li, Chunyu, et al.
Publicado: (2026)
por: Li, Chunyu, et al.
Publicado: (2026)
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
por: Chen, Chenglizhao, et al.
Publicado: (2026)
por: Chen, Chenglizhao, et al.
Publicado: (2026)
VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin
por: Ai, Zhiqi, et al.
Publicado: (2025)
por: Ai, Zhiqi, et al.
Publicado: (2025)
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
por: Chen, Changan, et al.
Publicado: (2024)
por: Chen, Changan, et al.
Publicado: (2024)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
por: Su, Yaofeng, et al.
Publicado: (2026)
por: Su, Yaofeng, et al.
Publicado: (2026)
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
por: Cong, Gaoxiang, et al.
Publicado: (2026)
por: Cong, Gaoxiang, et al.
Publicado: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
EgoForge: Goal-Directed Egocentric World Simulator
por: Shen, Yifan, et al.
Publicado: (2026)
por: Shen, Yifan, et al.
Publicado: (2026)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
por: Liu, Tengfei, et al.
Publicado: (2026)
por: Liu, Tengfei, et al.
Publicado: (2026)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
por: Liu, Xiangyu, et al.
Publicado: (2026)
por: Liu, Xiangyu, et al.
Publicado: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
por: Dai, Yusheng, et al.
Publicado: (2026)
por: Dai, Yusheng, et al.
Publicado: (2026)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
por: Liao, Junchao, et al.
Publicado: (2026)
por: Liao, Junchao, et al.
Publicado: (2026)
Ensembling Synchronisation-based and Face-Voice Association Paradigms for Robust Active Speaker Detection in Egocentric Recordings
por: Clarke, Jason, et al.
Publicado: (2025)
por: Clarke, Jason, et al.
Publicado: (2025)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
por: Xu, Weihan, et al.
Publicado: (2025)
por: Xu, Weihan, et al.
Publicado: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
por: Sun, Haoqin, et al.
Publicado: (2024)
por: Sun, Haoqin, et al.
Publicado: (2024)
Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
por: Saleh, Mohamed, et al.
Publicado: (2026)
por: Saleh, Mohamed, et al.
Publicado: (2026)
SonoWorld: From One Image to a 3D Audio-Visual Scene
por: Jin, Derong, et al.
Publicado: (2026)
por: Jin, Derong, et al.
Publicado: (2026)
Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy
por: Kim, Geewook, et al.
Publicado: (2025)
por: Kim, Geewook, et al.
Publicado: (2025)
AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
por: Jiang, Zhonghua, et al.
Publicado: (2025)
por: Jiang, Zhonghua, et al.
Publicado: (2025)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
por: Guo, Xinyue, et al.
Publicado: (2025)
por: Guo, Xinyue, et al.
Publicado: (2025)
PAVAS: Physics-Aware Video-to-Audio Synthesis
por: Hyun-Bin, Oh, et al.
Publicado: (2025)
por: Hyun-Bin, Oh, et al.
Publicado: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
por: Pian, Weiguo, et al.
Publicado: (2026)
por: Pian, Weiguo, et al.
Publicado: (2026)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
por: Lyu, Guangtao, et al.
Publicado: (2025)
por: Lyu, Guangtao, et al.
Publicado: (2025)
IsoSignVid2Aud: Sign Language Video to Audio Conversion without Text Intermediaries
por: Kavediya, Harsh, et al.
Publicado: (2025)
por: Kavediya, Harsh, et al.
Publicado: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
por: Liu, Kai, et al.
Publicado: (2026)
por: Liu, Kai, et al.
Publicado: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
por: Yang, Jianxuan, et al.
Publicado: (2025)
por: Yang, Jianxuan, et al.
Publicado: (2025)
Ejemplares similares
-
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
por: Rai, Aashish, et al.
Publicado: (2024) -
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
por: Cappellazzo, Umberto, et al.
Publicado: (2025) -
Robust Active Speaker Detection in Noisy Environments
por: Vasireddy, Siva Sai Nagender, et al.
Publicado: (2024) -
Large Language Models are Strong Audio-Visual Speech Recognition Learners
por: Cappellazzo, Umberto, et al.
Publicado: (2024) -
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)