Made to Order: Discovering monotonic temporal changes via self-supervised video ordering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Charig, Xie, Weidi, Zisserman, Andrew |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Moving Object Segmentation: All You Need Is SAM (and Flow)
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
Inferring Dynamic Physical Properties from Video Foundation Models
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Synchformer: Efficient Synchronization from Sparse Cues
par: Iashin, Vladimir, et autres
Publié: (2024)
par: Iashin, Vladimir, et autres
Publié: (2024)
Appearance-Based Refinement for Object-Centric Motion Segmentation
par: Xie, Junyu, et autres
Publié: (2023)
par: Xie, Junyu, et autres
Publié: (2023)
Self-supervised Learning on Camera Trap Footage Yields a Strong Universal Face Embedder
par: Iashin, Vladimir, et autres
Publié: (2025)
par: Iashin, Vladimir, et autres
Publié: (2025)
PooDLe: Pooled and dense self-supervised learning from naturalistic videos
par: Wang, Alex N., et autres
Publié: (2024)
par: Wang, Alex N., et autres
Publié: (2024)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
par: Xie, Junyu, et autres
Publié: (2026)
par: Xie, Junyu, et autres
Publié: (2026)
Discovering Global False Negatives On the Fly for Self-supervised Contrastive Learning
par: Balmaseda, Vicente, et autres
Publié: (2025)
par: Balmaseda, Vicente, et autres
Publié: (2025)
Amodal Ground Truth and Completion in the Wild
par: Zhan, Guanqi, et autres
Publié: (2023)
par: Zhan, Guanqi, et autres
Publié: (2023)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
par: Zhan, Guanqi, et autres
Publié: (2023)
par: Zhan, Guanqi, et autres
Publié: (2023)
Character-Centric Understanding of Animated Movies
par: Gui, Zhongrui, et autres
Publié: (2025)
par: Gui, Zhongrui, et autres
Publié: (2025)
Systematic comparison of semi-supervised and self-supervised learning for medical image classification
par: Huang, Zhe, et autres
Publié: (2023)
par: Huang, Zhe, et autres
Publié: (2023)
A filtering scheme for confocal laser endomicroscopy (CLE)-video sequences for self-supervised learning
par: Porsche, Nils, et autres
Publié: (2025)
par: Porsche, Nils, et autres
Publié: (2025)
Character-aware audio-visual subtitling in context
par: Huh, Jaesung, et autres
Publié: (2024)
par: Huh, Jaesung, et autres
Publié: (2024)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language
par: Hamilton, Mark, et autres
Publié: (2024)
par: Hamilton, Mark, et autres
Publié: (2024)
Competing for pixels: a self-play algorithm for weakly-supervised segmentation
par: Saeed, Shaheer U., et autres
Publié: (2024)
par: Saeed, Shaheer U., et autres
Publié: (2024)
OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
par: Heyward, Joseph, et autres
Publié: (2024)
par: Heyward, Joseph, et autres
Publié: (2024)
Comparison of self-supervised in-domain and supervised out-domain transfer learning for bird species recognition
par: Ghaffari, Houtan, et autres
Publié: (2024)
par: Ghaffari, Houtan, et autres
Publié: (2024)
Consistency Models Made Easy
par: Geng, Zhengyang, et autres
Publié: (2024)
par: Geng, Zhengyang, et autres
Publié: (2024)
ExpPoint-MAE: Better interpretability and performance for self-supervised point cloud transformers
par: Romanelis, Ioannis, et autres
Publié: (2023)
par: Romanelis, Ioannis, et autres
Publié: (2023)
deepTerra -- AI Land Classification Made Easy
par: Wilkinson, Andrew Keith
Publié: (2025)
par: Wilkinson, Andrew Keith
Publié: (2025)
AutoAD III: The Prequel -- Back to the Pixels
par: Han, Tengda, et autres
Publié: (2024)
par: Han, Tengda, et autres
Publié: (2024)
Investigating self-supervised representations for audio-visual deepfake detection
par: Boldisor, Dragos-Alexandru, et autres
Publié: (2025)
par: Boldisor, Dragos-Alexandru, et autres
Publié: (2025)
BaCon: Boosting Imbalanced Semi-supervised Learning via Balanced Feature-Level Contrastive Learning
par: Feng, Qianhan, et autres
Publié: (2024)
par: Feng, Qianhan, et autres
Publié: (2024)
Self-supervised learning unveils change in urban housing from street-level images
par: Stalder, Steven, et autres
Publié: (2023)
par: Stalder, Steven, et autres
Publié: (2023)
A Short Note on Evaluating RepNet for Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
Two-Stream temporal transformer for video action classification
par: Kurpukdee, Nattapong, et autres
Publié: (2026)
par: Kurpukdee, Nattapong, et autres
Publié: (2026)
Discovering Intersectional Bias via Directional Alignment in Face Recognition Embeddings
par: Serna, Ignacio
Publié: (2025)
par: Serna, Ignacio
Publié: (2025)
Reducing self-supervised learning complexity improves weakly-supervised classification performance in computational pathology
par: Lenz, Tim, et autres
Publié: (2024)
par: Lenz, Tim, et autres
Publié: (2024)
Discovering Concept Directions from Diffusion-based Counterfactuals via Latent Clustering
par: Varshney, Payal, et autres
Publié: (2025)
par: Varshney, Payal, et autres
Publié: (2025)
A self-supervised framework for learning whole slide representations
par: Hou, Xinhai, et autres
Publié: (2024)
par: Hou, Xinhai, et autres
Publié: (2024)
Detection of diabetic retinopathy using longitudinal self-supervised learning
par: Zeghlache, Rachid, et autres
Publié: (2022)
par: Zeghlache, Rachid, et autres
Publié: (2022)
Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models
par: Szokalski, Adam, et autres
Publié: (2026)
par: Szokalski, Adam, et autres
Publié: (2026)
Unsupervised Machine Learning for Detecting and Locating Human-Made Objects in 3D Point Cloud
par: Zhao, Hong, et autres
Publié: (2024)
par: Zhao, Hong, et autres
Publié: (2024)
BootsTAP: Bootstrapped Training for Tracking-Any-Point
par: Doersch, Carl, et autres
Publié: (2024)
par: Doersch, Carl, et autres
Publié: (2024)
RelationMatch: Matching In-batch Relationships for Semi-supervised Learning
par: Zhang, Yifan, et autres
Publié: (2023)
par: Zhang, Yifan, et autres
Publié: (2023)
Self-supervised video pretraining yields robust and more human-aligned visual representations
par: Parthasarathy, Nikhil, et autres
Publié: (2022)
par: Parthasarathy, Nikhil, et autres
Publié: (2022)
Documents similaires
-
Moving Object Segmentation: All You Need Is SAM (and Flow)
par: Xie, Junyu, et autres
Publié: (2024) -
Inferring Dynamic Physical Properties from Video Foundation Models
par: Zhan, Guanqi, et autres
Publié: (2025) -
Synchformer: Efficient Synchronization from Sparse Cues
par: Iashin, Vladimir, et autres
Publié: (2024) -
Appearance-Based Refinement for Object-Centric Motion Segmentation
par: Xie, Junyu, et autres
Publié: (2023) -
Self-supervised Learning on Camera Trap Footage Yields a Strong Universal Face Embedder
par: Iashin, Vladimir, et autres
Publié: (2025)