SIGMA: Sinkhorn-Guided Masked Video Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Salehi, Mohammadreza, Dorkenwald, Michael, Thoker, Fida Mohammad, Gavves, Efstratios, Snoek, Cees G. M., Asano, Yuki M. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
par: Salehi, Mohammadreza, et autres
Publié: (2024)
par: Salehi, Mohammadreza, et autres
Publié: (2024)
GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features
par: Sträter, Luc P. J., et autres
Publié: (2024)
par: Sträter, Luc P. J., et autres
Publié: (2024)
MoSiC: Optimal-Transport Motion Trajectory for Dense Self-Supervised Learning
par: Salehi, Mohammadreza, et autres
Publié: (2025)
par: Salehi, Mohammadreza, et autres
Publié: (2025)
LocoMotion: Learning Motion-Focused Video-Language Representations
par: Doughty, Hazel, et autres
Publié: (2024)
par: Doughty, Hazel, et autres
Publié: (2024)
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
par: Dorkenwald, Michael, et autres
Publié: (2024)
par: Dorkenwald, Michael, et autres
Publié: (2024)
Lost in Time: A New Temporal Benchmark for VideoLLMs
par: Cores, Daniel, et autres
Publié: (2024)
par: Cores, Daniel, et autres
Publié: (2024)
Elastic ViTs from Pretrained Models without Retraining
par: Simoncini, Walter, et autres
Publié: (2025)
par: Simoncini, Walter, et autres
Publié: (2025)
Dual Guidance Semi-Supervised Action Detection
par: Singh, Ankit, et autres
Publié: (2025)
par: Singh, Ankit, et autres
Publié: (2025)
SEVERE++: Evaluating Benchmark Sensitivity in Generalization of Video Representation Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection
par: Salehi, Alireza, et autres
Publié: (2025)
par: Salehi, Alireza, et autres
Publié: (2025)
SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
SelEx: Self-Expertise in Fine-Grained Generalized Category Discovery
par: Rastegar, Sarah, et autres
Publié: (2024)
par: Rastegar, Sarah, et autres
Publié: (2024)
TrackMAE: Video Representation Learning via Track Mask and Predict
par: Vandeghen, Renaud, et autres
Publié: (2026)
par: Vandeghen, Renaud, et autres
Publié: (2026)
Segment Any 3D-Part in a Scene from a Sentence
par: Wu, Hongyu, et autres
Publié: (2025)
par: Wu, Hongyu, et autres
Publié: (2025)
Geometric Neural Process Fields
par: Yin, Wenzhe, et autres
Publié: (2025)
par: Yin, Wenzhe, et autres
Publié: (2025)
TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning
par: Bhowmik, Aritra, et autres
Publié: (2024)
par: Bhowmik, Aritra, et autres
Publié: (2024)
TULIP: Token-length Upgraded CLIP
par: Najdenkoska, Ivona, et autres
Publié: (2024)
par: Najdenkoska, Ivona, et autres
Publié: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
par: Liu, Huabin, et autres
Publié: (2025)
par: Liu, Huabin, et autres
Publié: (2025)
Low-Resource Vision Challenges for Foundation Models
par: Zhang, Yunhua, et autres
Publié: (2024)
par: Zhang, Yunhua, et autres
Publié: (2024)
CaPo: Cooperative Plan Optimization for Efficient Embodied Multi-Agent Cooperation
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
par: Bhowmik, Aritra, et autres
Publié: (2025)
par: Bhowmik, Aritra, et autres
Publié: (2025)
Self-supervised visual learning in the low-data regime: a comparative evaluation
par: Konstantakos, Sotirios, et autres
Publié: (2024)
par: Konstantakos, Sotirios, et autres
Publié: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
par: Chen, Aozhu, et autres
Publié: (2024)
par: Chen, Aozhu, et autres
Publié: (2024)
IPO: Interpretable Prompt Optimization for Vision-Language Models
par: Du, Yingjun, et autres
Publié: (2024)
par: Du, Yingjun, et autres
Publié: (2024)
Near, far: Patch-ordering enhances vision foundation models' scene understanding
par: Pariza, Valentinos, et autres
Publié: (2024)
par: Pariza, Valentinos, et autres
Publié: (2024)
Structured-Noise Masked Modeling for Video, Audio and Beyond
par: Bhowmik, Aritra, et autres
Publié: (2025)
par: Bhowmik, Aritra, et autres
Publié: (2025)
Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis
par: Lilova, Valentina, et autres
Publié: (2025)
par: Lilova, Valentina, et autres
Publié: (2025)
R-MAE: Regions Meet Masked Autoencoders
par: Nguyen, Duy-Kien, et autres
Publié: (2023)
par: Nguyen, Duy-Kien, et autres
Publié: (2023)
SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-Tail
par: Du, Yingjun, et autres
Publié: (2023)
par: Du, Yingjun, et autres
Publié: (2023)
SimPLR: A Simple and Plain Transformer for Efficient Object Detection and Segmentation
par: Nguyen, Duy-Kien, et autres
Publié: (2023)
par: Nguyen, Duy-Kien, et autres
Publié: (2023)
Any-Shift Prompting for Generalization over Distributions
par: Xiao, Zehao, et autres
Publié: (2024)
par: Xiao, Zehao, et autres
Publié: (2024)
NeoBabel: A Multilingual Open Tower for Visual Generation
par: Derakhshani, Mohammad Mahdi, et autres
Publié: (2025)
par: Derakhshani, Mohammad Mahdi, et autres
Publié: (2025)
VISA: Reasoning Video Object Segmentation via Large Language Models
par: Yan, Cilin, et autres
Publié: (2024)
par: Yan, Cilin, et autres
Publié: (2024)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
par: Sun, Wenfang, et autres
Publié: (2026)
par: Sun, Wenfang, et autres
Publié: (2026)
Training-Free Semantic Segmentation via LLM-Supervision
par: Sun, Wenfang, et autres
Publié: (2024)
par: Sun, Wenfang, et autres
Publié: (2024)
Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
Self-Masking Networks for Unsupervised Adaptation
par: Warmerdam, Alfonso Taboada, et autres
Publié: (2024)
par: Warmerdam, Alfonso Taboada, et autres
Publié: (2024)
Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning
par: Venkataramanan, Shashanka, et autres
Publié: (2025)
par: Venkataramanan, Shashanka, et autres
Publié: (2025)
Self-supervised Learning of Echocardiographic Video Representations via Online Cluster Distillation
par: Mishra, Divyanshu, et autres
Publié: (2025)
par: Mishra, Divyanshu, et autres
Publié: (2025)
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
par: Sun, Wenfang, et autres
Publié: (2024)
par: Sun, Wenfang, et autres
Publié: (2024)
Documents similaires
-
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
par: Salehi, Mohammadreza, et autres
Publié: (2024) -
GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features
par: Sträter, Luc P. J., et autres
Publié: (2024) -
MoSiC: Optimal-Transport Motion Trajectory for Dense Self-Supervised Learning
par: Salehi, Mohammadreza, et autres
Publié: (2025) -
LocoMotion: Learning Motion-Focused Video-Language Representations
par: Doughty, Hazel, et autres
Publié: (2024) -
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
par: Dorkenwald, Michael, et autres
Publié: (2024)