Contrastive learning-based video quality assessment-jointed video vision transformer for video recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Jian, Mahoor, Mohammad H. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MC-ViViT: Multi-branch Classifier-ViViT to detect Mild Cognitive Impairment in older adults using facial videos
di: Sun, Jian, et al.
Pubblicazione: (2023)
di: Sun, Jian, et al.
Pubblicazione: (2023)
Multi-model learning by sequential reading of untrimmed videos for action recognition
di: Kamiya, Kodai, et al.
Pubblicazione: (2024)
di: Kamiya, Kodai, et al.
Pubblicazione: (2024)
Machine vision-aware quality metrics for compressed image and video assessment
di: Dremin, Mikhail, et al.
Pubblicazione: (2024)
di: Dremin, Mikhail, et al.
Pubblicazione: (2024)
A benchmark for video-based laparoscopic skill analysis and assessment
di: Funke, Isabel, et al.
Pubblicazione: (2026)
di: Funke, Isabel, et al.
Pubblicazione: (2026)
VideoGameBunny: Towards vision assistants for video games
di: Taesiri, Mohammad Reza, et al.
Pubblicazione: (2024)
di: Taesiri, Mohammad Reza, et al.
Pubblicazione: (2024)
ST-Gait++: Leveraging spatio-temporal convolutions for gait-based emotion recognition on videos
di: Lima, Maria Luísa, et al.
Pubblicazione: (2024)
di: Lima, Maria Luísa, et al.
Pubblicazione: (2024)
Deep video representation learning: a survey
di: Ravanbakhsh, Elham, et al.
Pubblicazione: (2024)
di: Ravanbakhsh, Elham, et al.
Pubblicazione: (2024)
Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators
di: Lunia, Harsh
Pubblicazione: (2024)
di: Lunia, Harsh
Pubblicazione: (2024)
An interpretable approach to automating the assessment of biofouling in video footage
di: Mannix, Evelyn J., et al.
Pubblicazione: (2025)
di: Mannix, Evelyn J., et al.
Pubblicazione: (2025)
Deep learning for action spotting in association football videos
di: Giancola, Silvio, et al.
Pubblicazione: (2024)
di: Giancola, Silvio, et al.
Pubblicazione: (2024)
CFE-PPAR: Compression-friendly encryption for privacy-preserving action recognition leveraging video transformers
di: Lin, Haiwei, et al.
Pubblicazione: (2026)
di: Lin, Haiwei, et al.
Pubblicazione: (2026)
VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing
di: Aitrouga, Abdelilah, et al.
Pubblicazione: (2025)
di: Aitrouga, Abdelilah, et al.
Pubblicazione: (2025)
Breast tumor classification based on self-supervised contrastive learning from ultrasound videos
di: Tang, Yunxin, et al.
Pubblicazione: (2024)
di: Tang, Yunxin, et al.
Pubblicazione: (2024)
ADHD diagnosis based on action characteristics recorded in videos using machine learning
di: Li, Yichun, et al.
Pubblicazione: (2024)
di: Li, Yichun, et al.
Pubblicazione: (2024)
SalFormer360: a transformer-based saliency estimation model for 360-degree videos
di: Wahba, Mahmoud Z. A., et al.
Pubblicazione: (2026)
di: Wahba, Mahmoud Z. A., et al.
Pubblicazione: (2026)
Smooth regularization for efficient video recognition
di: Goldman, Gil, et al.
Pubblicazione: (2025)
di: Goldman, Gil, et al.
Pubblicazione: (2025)
Large-scale visual SLAM for in-the-wild videos
di: Sun, Shuo, et al.
Pubblicazione: (2025)
di: Sun, Shuo, et al.
Pubblicazione: (2025)
Emotion recognition in talking-face videos using persistent entropy and neural networks
di: Paluzo-Hidalgo, Eduardo, et al.
Pubblicazione: (2021)
di: Paluzo-Hidalgo, Eduardo, et al.
Pubblicazione: (2021)
From Macro to Micro: Boosting micro-expression recognition via pre-training on macro-expression videos
di: Li, Hanting, et al.
Pubblicazione: (2024)
di: Li, Hanting, et al.
Pubblicazione: (2024)
Physical prior guided cooperative learning framework for joint turbulence degradation estimation and infrared video restoration
di: Zhang, Ziran, et al.
Pubblicazione: (2024)
di: Zhang, Ziran, et al.
Pubblicazione: (2024)
General surgery vision transformer: A video pre-trained foundation model for general surgery
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
Developing emotion recognition for video conference software to support people with autism
di: Franzen, Marc, et al.
Pubblicazione: (2021)
di: Franzen, Marc, et al.
Pubblicazione: (2021)
Real time anomalies detection on video
di: Poirier, Fabien
Pubblicazione: (2024)
di: Poirier, Fabien
Pubblicazione: (2024)
Generative deep learning for foundational video translation in ultrasound
di: Tomic, Nikolina, et al.
Pubblicazione: (2025)
di: Tomic, Nikolina, et al.
Pubblicazione: (2025)
Can video generation replace cinematographers? Research on the cinematic language of generated video
di: Li, Xiaozhe, et al.
Pubblicazione: (2024)
di: Li, Xiaozhe, et al.
Pubblicazione: (2024)
Two-Stream temporal transformer for video action classification
di: Kurpukdee, Nattapong, et al.
Pubblicazione: (2026)
di: Kurpukdee, Nattapong, et al.
Pubblicazione: (2026)
Is ImageNet worth 1 video? Learning strong image encoders from 1 long unlabelled video
di: Venkataramanan, Shashanka, et al.
Pubblicazione: (2023)
di: Venkataramanan, Shashanka, et al.
Pubblicazione: (2023)
DiTraj: training-free trajectory control for video diffusion transformer
di: Lei, Cheng, et al.
Pubblicazione: (2025)
di: Lei, Cheng, et al.
Pubblicazione: (2025)
A vision-language model and platform for temporally mapping surgery from video
di: Kiyasseh, Dani
Pubblicazione: (2026)
di: Kiyasseh, Dani
Pubblicazione: (2026)
DLM-VMTL:A Double Layer Mapper for heterogeneous data video Multi-task prompt learning
di: Bo, Zeyi, et al.
Pubblicazione: (2024)
di: Bo, Zeyi, et al.
Pubblicazione: (2024)
Transformer with Leveraged Masked Autoencoder for video-based Pain Assessment
di: Nguyen, Minh-Duc, et al.
Pubblicazione: (2024)
di: Nguyen, Minh-Duc, et al.
Pubblicazione: (2024)
Koala: Key frame-conditioned long video-LLM
di: Tan, Reuben, et al.
Pubblicazione: (2024)
di: Tan, Reuben, et al.
Pubblicazione: (2024)
XnODR and XnIDR: Two Accurate and Fast Fully Connected Layers For Convolutional Neural Networks
di: Sun, Jian, et al.
Pubblicazione: (2021)
di: Sun, Jian, et al.
Pubblicazione: (2021)
OmViD: Omni-supervised active learning for video action detection
di: Rana, Aayush, et al.
Pubblicazione: (2025)
di: Rana, Aayush, et al.
Pubblicazione: (2025)
Online pre-training with long-form videos
di: Kato, Itsuki, et al.
Pubblicazione: (2024)
di: Kato, Itsuki, et al.
Pubblicazione: (2024)
Restereo: Diffusion stereo video generation and restoration
di: Huang, Xingchang, et al.
Pubblicazione: (2025)
di: Huang, Xingchang, et al.
Pubblicazione: (2025)
Towards motion from video diffusion models
di: Janson, Paul, et al.
Pubblicazione: (2024)
di: Janson, Paul, et al.
Pubblicazione: (2024)
Action-conditioned video data improves predictability
di: Sarkar, Meenakshi, et al.
Pubblicazione: (2024)
di: Sarkar, Meenakshi, et al.
Pubblicazione: (2024)
Shift and matching queries for video semantic segmentation
di: Mizuno, Tsubasa, et al.
Pubblicazione: (2024)
di: Mizuno, Tsubasa, et al.
Pubblicazione: (2024)
Space evaluation based on pitch control using drone video in Ultimate
di: Iwashita, Shunsuke, et al.
Pubblicazione: (2024)
di: Iwashita, Shunsuke, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MC-ViViT: Multi-branch Classifier-ViViT to detect Mild Cognitive Impairment in older adults using facial videos
di: Sun, Jian, et al.
Pubblicazione: (2023) -
Multi-model learning by sequential reading of untrimmed videos for action recognition
di: Kamiya, Kodai, et al.
Pubblicazione: (2024) -
Machine vision-aware quality metrics for compressed image and video assessment
di: Dremin, Mikhail, et al.
Pubblicazione: (2024) -
A benchmark for video-based laparoscopic skill analysis and assessment
di: Funke, Isabel, et al.
Pubblicazione: (2026) -
VideoGameBunny: Towards vision assistants for video games
di: Taesiri, Mohammad Reza, et al.
Pubblicazione: (2024)