MTGA: Multi-View Temporal Granularity Aligned Aggregation for Event-Based Lip-Reading
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Wenhao, Wang, Jun, Luo, Yong, Yu, Lei, Yu, Wei, He, Zheng, Shen, Jialie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
MSP-MVS: Multi-Granularity Segmentation Prior Guided Multi-View Stereo
par: Yuan, Zhenlong, et autres
Publié: (2024)
par: Yuan, Zhenlong, et autres
Publié: (2024)
Wasserstein-Aligned Hyperbolic Multi-View Clustering
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
Event-based Motion Deblurring via Multi-Temporal Granularity Fusion
par: Lin, Xiaopeng, et autres
Publié: (2024)
par: Lin, Xiaopeng, et autres
Publié: (2024)
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
par: Zhu, Yinglian, et autres
Publié: (2025)
par: Zhu, Yinglian, et autres
Publié: (2025)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
par: Zhou, Ziheng, et autres
Publié: (2024)
par: Zhou, Ziheng, et autres
Publié: (2024)
Template-Based Feature Aggregation Network for Industrial Anomaly Detection
par: Luo, Wei, et autres
Publié: (2026)
par: Luo, Wei, et autres
Publié: (2026)
EventMamba: Enhancing Spatio-Temporal Locality with State Space Models for Event-Based Video Reconstruction
par: Ge, Chengjie, et autres
Publié: (2025)
par: Ge, Chengjie, et autres
Publié: (2025)
Multi-Granularity Hand Action Detection
par: Zhe, Ting, et autres
Publié: (2023)
par: Zhe, Ting, et autres
Publié: (2023)
VALLR: Visual ASR Language Model for Lip Reading
par: Thomas, Marshall, et autres
Publié: (2025)
par: Thomas, Marshall, et autres
Publié: (2025)
RaCMC: Residual-Aware Compensation Network with Multi-Granularity Constraints for Fake News Detection
par: Yu, Xinquan, et autres
Publié: (2024)
par: Yu, Xinquan, et autres
Publié: (2024)
Lips Are Lying: Spotting the Temporal Inconsistency between Audio and Visual in Lip-Syncing DeepFakes
par: Liu, Weifeng, et autres
Publié: (2024)
par: Liu, Weifeng, et autres
Publié: (2024)
GoMVS: Geometrically Consistent Cost Aggregation for Multi-View Stereo
par: Wu, Jiang, et autres
Publié: (2024)
par: Wu, Jiang, et autres
Publié: (2024)
Rethinking Event-Based Object Dtection through Representation-Level Temporal Aggregation and Model-Level Hypergraph Reasoning
par: Wang, Meisen, et autres
Publié: (2026)
par: Wang, Meisen, et autres
Publié: (2026)
LASER: Lip Landmark Assisted Speaker Detection for Robustness
par: Nguyen, Le Thien Phuc, et autres
Publié: (2025)
par: Nguyen, Le Thien Phuc, et autres
Publié: (2025)
Interactive Multimodal Fusion with Temporal Modeling
par: Yu, Jun, et autres
Publié: (2025)
par: Yu, Jun, et autres
Publié: (2025)
Optimized View and Geometry Distillation from Multi-view Diffuser
par: Zhang, Youjia, et autres
Publié: (2023)
par: Zhang, Youjia, et autres
Publié: (2023)
View Transformation Robustness for Multi-View 3D Object Reconstruction with Reconstruction Error-Guided View Selection
par: Zhang, Qi, et autres
Publié: (2024)
par: Zhang, Qi, et autres
Publié: (2024)
MVReward: Better Aligning and Evaluating Multi-View Diffusion Models with Human Preferences
par: Wang, Weitao, et autres
Publié: (2024)
par: Wang, Weitao, et autres
Publié: (2024)
Entangled View-Epipolar Information Aggregation for Generalizable Neural Radiance Fields
par: Min, Zhiyuan, et autres
Publié: (2023)
par: Min, Zhiyuan, et autres
Publié: (2023)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
par: Xu, Wenhao, et autres
Publié: (2025)
par: Xu, Wenhao, et autres
Publié: (2025)
Hierarchical Granularity Alignment and State Space Modeling for Robust Multimodal AU Detection in the Wild
par: Yu, Jun, et autres
Publié: (2026)
par: Yu, Jun, et autres
Publié: (2026)
Landmark-Guided Cross-Speaker Lip Reading with Mutual Information Regularization
par: Wu, Linzhi, et autres
Publié: (2024)
par: Wu, Linzhi, et autres
Publié: (2024)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
par: Park, Young-Hu, et autres
Publié: (2025)
par: Park, Young-Hu, et autres
Publié: (2025)
Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language
par: Yeo, Jeong Hun, et autres
Publié: (2024)
par: Yeo, Jeong Hun, et autres
Publié: (2024)
AlignCVC: Aligning Cross-View Consistency for Single-Image-to-3D Generation
par: Liang, Xinyue, et autres
Publié: (2025)
par: Liang, Xinyue, et autres
Publié: (2025)
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
par: Yuan, Yuqian, et autres
Publié: (2025)
par: Yuan, Yuqian, et autres
Publié: (2025)
VFM-Loc: Zero-Shot Cross-View Geo-Localization via Aligning Discriminative Visual Hierarchies
par: Lu, Jun, et autres
Publié: (2026)
par: Lu, Jun, et autres
Publié: (2026)
Image Quality Assessment: Investigating Causal Perceptual Effects with Abductive Counterfactual Inference
par: Shen, Wenhao, et autres
Publié: (2024)
par: Shen, Wenhao, et autres
Publié: (2024)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
par: Liu, Qinying, et autres
Publié: (2023)
par: Liu, Qinying, et autres
Publié: (2023)
SAUGE: Taming SAM for Uncertainty-Aligned Multi-Granularity Edge Detection
par: Liufu, Xing, et autres
Publié: (2024)
par: Liufu, Xing, et autres
Publié: (2024)
Removing Averaging: Personalized Lip-Sync Driven Characters Based on Identity Adapter
par: Zhu, Yanyu, et autres
Publié: (2025)
par: Zhu, Yanyu, et autres
Publié: (2025)
Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos
par: Wei, Dingkun, et autres
Publié: (2026)
par: Wei, Dingkun, et autres
Publié: (2026)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
par: Li, Yuhao, et autres
Publié: (2024)
par: Li, Yuhao, et autres
Publié: (2024)
Detecting Lip-Syncing Deepfakes: Vision Temporal Transformer for Analyzing Mouth Inconsistencies
par: Datta, Soumyya Kanti, et autres
Publié: (2025)
par: Datta, Soumyya Kanti, et autres
Publié: (2025)
Exploring Spectral Characteristics for Single Image Reflection Removal
par: Guo, Pengbo, et autres
Publié: (2025)
par: Guo, Pengbo, et autres
Publié: (2025)
Learning Parallax for Stereo Event-based Motion Deblurring
par: Lin, Mingyuan, et autres
Publié: (2023)
par: Lin, Mingyuan, et autres
Publié: (2023)
Multi-Focus Temporal Shifting for Precise Event Spotting in Sports Videos
par: Xu, Hao, et autres
Publié: (2025)
par: Xu, Hao, et autres
Publié: (2025)
Learning to Fuse and Reconstruct Multi-View Graphs for Diabetic Retinopathy Grading
par: Li, Haoran, et autres
Publié: (2026)
par: Li, Haoran, et autres
Publié: (2026)
Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression
par: Zhang, Haotian, et autres
Publié: (2026)
par: Zhang, Haotian, et autres
Publié: (2026)
Documents similaires
-
Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder
par: Wang, He, et autres
Publié: (2024) -
MSP-MVS: Multi-Granularity Segmentation Prior Guided Multi-View Stereo
par: Yuan, Zhenlong, et autres
Publié: (2024) -
Wasserstein-Aligned Hyperbolic Multi-View Clustering
par: Wang, Rui, et autres
Publié: (2025) -
Event-based Motion Deblurring via Multi-Temporal Granularity Fusion
par: Lin, Xiaopeng, et autres
Publié: (2024) -
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
par: Zhu, Yinglian, et autres
Publié: (2025)