T-MASK: Temporal Masking for Probing Foundation Models across Camera Views in Driver Monitoring
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ponbagavathi, Thinesh Thiyakesan, Peng, Kunyu, Roitberg, Alina |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2024)
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2024)
Order Matters: On Parameter-Efficient Image-to-Video Probing for Recognizing Nearly Symmetric Actions
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025)
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025)
Structured Relational Reasoning for Group Activity Assessment
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025)
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025)
Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2026)
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2026)
Deep Learning for Metabolic Rate Estimation from Biosignals: A Comparative Study of Architectures and Signal Selection
par: Babakhani, Sarvenaz, et autres
Publié: (2025)
par: Babakhani, Sarvenaz, et autres
Publié: (2025)
TransKD: Transformer Knowledge Distillation for Efficient Semantic Segmentation
par: Liu, Ruiping, et autres
Publié: (2022)
par: Liu, Ruiping, et autres
Publié: (2022)
Advancing Open-Set Domain Generalization Using Evidential Bi-Level Hardest Domain Scheduler
par: Peng, Kunyu, et autres
Publié: (2024)
par: Peng, Kunyu, et autres
Publié: (2024)
Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention
par: Ma, Yiming, et autres
Publié: (2023)
par: Ma, Yiming, et autres
Publié: (2023)
[MASK] is All You Need
par: Hu, Vincent Tao, et autres
Publié: (2024)
par: Hu, Vincent Tao, et autres
Publié: (2024)
Probing into Camera Control of Video Models
par: Hou, Chen, et autres
Publié: (2026)
par: Hou, Chen, et autres
Publié: (2026)
Camera Perspective Transformation to Bird's Eye View via Spatial Transformer Model for Road Intersection Monitoring
par: Prajapati, Rukesh, et autres
Publié: (2024)
par: Prajapati, Rukesh, et autres
Publié: (2024)
Occlusion-aware Driver Monitoring System using the Driver Monitoring Dataset
par: Cañas, Paola Natalia, et autres
Publié: (2025)
par: Cañas, Paola Natalia, et autres
Publié: (2025)
Towards Activated Muscle Group Estimation in the Wild
par: Peng, Kunyu, et autres
Publié: (2023)
par: Peng, Kunyu, et autres
Publié: (2023)
Towards Temporal Fusion Beyond the Field of View for Camera-based Semantic Scene Completion
par: Bae, Jongseong, et autres
Publié: (2025)
par: Bae, Jongseong, et autres
Publié: (2025)
EventMamba: Enhancing Spatio-Temporal Locality with State Space Models for Event-Based Video Reconstruction
par: Ge, Chengjie, et autres
Publié: (2025)
par: Ge, Chengjie, et autres
Publié: (2025)
MC-BEVRO: Multi-Camera Bird Eye View Road Occupancy Detection for Traffic Monitoring
par: Vaghela, Arpitsinh, et autres
Publié: (2025)
par: Vaghela, Arpitsinh, et autres
Publié: (2025)
Elevating Skeleton-Based Action Recognition with Efficient Multi-Modality Self-Supervision
par: Wei, Yiping, et autres
Publié: (2023)
par: Wei, Yiping, et autres
Publié: (2023)
Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset
par: Lerch, David J., et autres
Publié: (2026)
par: Lerch, David J., et autres
Publié: (2026)
Exploring Few-Shot Adaptation for Activity Recognition on Diverse Domains
par: Peng, Kunyu, et autres
Publié: (2023)
par: Peng, Kunyu, et autres
Publié: (2023)
Multi-View Foundation Models
par: Segre, Leo, et autres
Publié: (2025)
par: Segre, Leo, et autres
Publié: (2025)
Skeleton-Based Human Action Recognition with Noisy Labels
par: Xu, Yi, et autres
Publié: (2024)
par: Xu, Yi, et autres
Publié: (2024)
Towards Synthetic Data Generation for Improved Pain Recognition in Videos under Patient Constraints
par: Nasimzada, Jonas, et autres
Publié: (2024)
par: Nasimzada, Jonas, et autres
Publié: (2024)
Cross-View Cross-Modal Unsupervised Domain Adaptation for Driver Monitoring System
par: Bhalla, Aditi, et autres
Publié: (2025)
par: Bhalla, Aditi, et autres
Publié: (2025)
Dynamic View Synthesis from Small Camera Motion Videos
par: Sun, Huiqiang, et autres
Publié: (2025)
par: Sun, Huiqiang, et autres
Publié: (2025)
Stable Virtual Camera: Generative View Synthesis with Diffusion Models
par: Zhou, Jensen, et autres
Publié: (2025)
par: Zhou, Jensen, et autres
Publié: (2025)
Camera Splatting for Continuous View Optimization
par: Lee, Gahye, et autres
Publié: (2025)
par: Lee, Gahye, et autres
Publié: (2025)
Data-efficient Event Camera Pre-training via Disentangled Masked Modeling
par: Huang, Zhenpeng, et autres
Publié: (2024)
par: Huang, Zhenpeng, et autres
Publié: (2024)
MV2MAE: Multi-View Video Masked Autoencoders
par: Shah, Ketul, et autres
Publié: (2024)
par: Shah, Ketul, et autres
Publié: (2024)
Multiview Self-Representation Learning across Heterogeneous Views
par: Chen, Jie, et autres
Publié: (2026)
par: Chen, Jie, et autres
Publié: (2026)
Exploring Self-supervised Skeleton-based Action Recognition in Occluded Environments
par: Chen, Yifei, et autres
Publié: (2023)
par: Chen, Yifei, et autres
Publié: (2023)
OnlineBEV: Recurrent Temporal Fusion in Bird's Eye View Representations for Multi-Camera 3D Perception
par: Koh, Junho, et autres
Publié: (2025)
par: Koh, Junho, et autres
Publié: (2025)
CalibAnyView: Beyond Single-View Camera Calibration in the Wild
par: Li, Boying, et autres
Publié: (2026)
par: Li, Boying, et autres
Publié: (2026)
Boosting Multi-View Stereo with Depth Foundation Model in the Absence of Real-World Labels
par: Zhu, Jie, et autres
Publié: (2025)
par: Zhu, Jie, et autres
Publié: (2025)
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
par: Zhao, Zhiyu, et autres
Publié: (2023)
par: Zhao, Zhiyu, et autres
Publié: (2023)
Temporal-Mapping Photography for Event Cameras
par: Bao, Yuhan, et autres
Publié: (2024)
par: Bao, Yuhan, et autres
Publié: (2024)
MaskControl: Spatio-Temporal Control for Masked Motion Synthesis
par: Pinyoanuntapong, Ekkasit, et autres
Publié: (2024)
par: Pinyoanuntapong, Ekkasit, et autres
Publié: (2024)
ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Diffusion Models
par: Zhu, Ruishu, et autres
Publié: (2025)
par: Zhu, Ruishu, et autres
Publié: (2025)
UMAMI: Unifying Masked Autoregressive Models and Deterministic Rendering for View Synthesis
par: Le, Thanh-Tung, et autres
Publié: (2025)
par: Le, Thanh-Tung, et autres
Publié: (2025)
Mitigating Label Noise using Prompt-Based Hyperbolic Meta-Learning in Open-Set Domain Generalization
par: Peng, Kunyu, et autres
Publié: (2024)
par: Peng, Kunyu, et autres
Publié: (2024)
AnyCalib: On-Manifold Learning for Model-Agnostic Single-View Camera Calibration
par: Tirado-Garín, Javier, et autres
Publié: (2025)
par: Tirado-Garín, Javier, et autres
Publié: (2025)
Documents similaires
-
Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2024) -
Order Matters: On Parameter-Efficient Image-to-Video Probing for Recognizing Nearly Symmetric Actions
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025) -
Structured Relational Reasoning for Group Activity Assessment
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025) -
Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2026) -
Deep Learning for Metabolic Rate Estimation from Biosignals: A Comparative Study of Architectures and Signal Selection
par: Babakhani, Sarvenaz, et autres
Publié: (2025)