EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yu, Ha, Juhyung, Crandall, David J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EgoVIS@CVPR: What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
di: Kung, Chi-Hsi, et al.
Pubblicazione: (2025)
di: Kung, Chi-Hsi, et al.
Pubblicazione: (2025)
GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
EgoAVU: Egocentric Audio-Visual Understanding
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
di: Fu, Zhiheng, et al.
Pubblicazione: (2026)
di: Fu, Zhiheng, et al.
Pubblicazione: (2026)
LoCoNet: Long-Short Context Network for Active Speaker Detection
di: Wang, Xizi, et al.
Pubblicazione: (2023)
di: Wang, Xizi, et al.
Pubblicazione: (2023)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge
di: Chen, Zhiwei, et al.
Pubblicazione: (2026)
di: Chen, Zhiwei, et al.
Pubblicazione: (2026)
EgoM2P: Egocentric Multimodal Multitask Pretraining
di: Li, Gen, et al.
Pubblicazione: (2025)
di: Li, Gen, et al.
Pubblicazione: (2025)
Multi-resolution Guided 3D GANs for Medical Image Translation
di: Ha, Juhyung, et al.
Pubblicazione: (2024)
di: Ha, Juhyung, et al.
Pubblicazione: (2024)
SeaVIS: Sound-Enhanced Association for Online Audio-Visual Instance Segmentation
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
di: Kung, Chi-Hsi, et al.
Pubblicazione: (2025)
di: Kung, Chi-Hsi, et al.
Pubblicazione: (2025)
EgoBlind: Towards Egocentric Visual Assistance for the Blind
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
PROFUSEme: PROstate Cancer Biochemical Recurrence Prediction via FUSEd Multi-modal Embeddings
di: You, Suhang, et al.
Pubblicazione: (2025)
di: You, Suhang, et al.
Pubblicazione: (2025)
EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models
di: Bai, Yu, et al.
Pubblicazione: (2026)
di: Bai, Yu, et al.
Pubblicazione: (2026)
OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026
di: Li, Zixu, et al.
Pubblicazione: (2026)
di: Li, Zixu, et al.
Pubblicazione: (2026)
EgoLife: Towards Egocentric Life Assistant
di: Yang, Jingkang, et al.
Pubblicazione: (2025)
di: Yang, Jingkang, et al.
Pubblicazione: (2025)
STNet: Deep Audio-Visual Fusion Network for Robust Speaker Tracking
di: Li, Yidi, et al.
Pubblicazione: (2024)
di: Li, Yidi, et al.
Pubblicazione: (2024)
EgoMimic: Scaling Imitation Learning via Egocentric Video
di: Kareer, Simar, et al.
Pubblicazione: (2024)
di: Kareer, Simar, et al.
Pubblicazione: (2024)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
EgoPrompt: Prompt Learning for Egocentric Action Recognition
di: Lyu, Huaihai, et al.
Pubblicazione: (2025)
di: Lyu, Huaihai, et al.
Pubblicazione: (2025)
EgoCast: Forecasting Egocentric Human Pose in the Wild
di: Escobar, Maria, et al.
Pubblicazione: (2024)
di: Escobar, Maria, et al.
Pubblicazione: (2024)
EgoPoints: Advancing Point Tracking for Egocentric Videos
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
TeleEgo: Benchmarking Egocentric AI Assistants in the Wild
di: Yan, Jiaqi, et al.
Pubblicazione: (2025)
di: Yan, Jiaqi, et al.
Pubblicazione: (2025)
EgoForge: Goal-Directed Egocentric World Simulator
di: Shen, Yifan, et al.
Pubblicazione: (2026)
di: Shen, Yifan, et al.
Pubblicazione: (2026)
EgoForce: Robust Online Egocentric Motion Reconstruction via Diffusion Forcing
di: Hwang, Inwoo, et al.
Pubblicazione: (2026)
di: Hwang, Inwoo, et al.
Pubblicazione: (2026)
Spherical World-Locking for Audio-Visual Localization in Egocentric Videos
di: Yun, Heeseung, et al.
Pubblicazione: (2024)
di: Yun, Heeseung, et al.
Pubblicazione: (2024)
The Audio-Visual Conversational Graph: From an Egocentric-Exocentric Perspective
di: Jia, Wenqi, et al.
Pubblicazione: (2023)
di: Jia, Wenqi, et al.
Pubblicazione: (2023)
Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation
di: Lai, Bolin, et al.
Pubblicazione: (2023)
di: Lai, Bolin, et al.
Pubblicazione: (2023)
SAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
EgoQR: Efficient QR Code Reading in Egocentric Settings
di: Moslehpour, Mohsen, et al.
Pubblicazione: (2024)
di: Moslehpour, Mohsen, et al.
Pubblicazione: (2024)
EgoLCD: Egocentric Video Generation with Long Context Diffusion
di: Zhang, Liuzhou, et al.
Pubblicazione: (2025)
di: Zhang, Liuzhou, et al.
Pubblicazione: (2025)
EgoNav: Egocentric Scene-aware Human Trajectory Prediction
di: Wang, Weizhuo, et al.
Pubblicazione: (2024)
di: Wang, Weizhuo, et al.
Pubblicazione: (2024)
EgoLM: Multi-Modal Language Model of Egocentric Motions
di: Hong, Fangzhou, et al.
Pubblicazione: (2024)
di: Hong, Fangzhou, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EgoVIS@CVPR: What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
di: Kung, Chi-Hsi, et al.
Pubblicazione: (2025) -
GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection
di: Wang, Yu, et al.
Pubblicazione: (2025) -
EgoAVU: Egocentric Audio-Visual Understanding
di: Seth, Ashish, et al.
Pubblicazione: (2026) -
EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
di: Fu, Zhiheng, et al.
Pubblicazione: (2026) -
LoCoNet: Long-Short Context Network for Active Speaker Detection
di: Wang, Xizi, et al.
Pubblicazione: (2023)