SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kakogeorgiou, Ioannis, Gidaris, Spyros, Karantzalos, Konstantinos, Komodakis, Nikos |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Advancing Semantic Future Prediction through Multimodal Visual Sequence Transformers
par: Karypidis, Efstathios, et autres
Publié: (2025)
par: Karypidis, Efstathios, et autres
Publié: (2025)
DINO-Foresight: Looking into the Future with DINO
par: Karypidis, Efstathios, et autres
Publié: (2024)
par: Karypidis, Efstathios, et autres
Publié: (2024)
Boosting Generative Image Modeling via Joint Image-Feature Synthesis
par: Kouzelis, Theodoros, et autres
Publié: (2025)
par: Kouzelis, Theodoros, et autres
Publié: (2025)
Coevolving Representations in Joint Image-Feature Diffusion
par: Kouzelis, Theodoros, et autres
Publié: (2026)
par: Kouzelis, Theodoros, et autres
Publié: (2026)
Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction
par: Karypidis, Efstathios, et autres
Publié: (2026)
par: Karypidis, Efstathios, et autres
Publié: (2026)
Multi-Token Prediction Needs Registers
par: Gerontopoulos, Anastasios, et autres
Publié: (2025)
par: Gerontopoulos, Anastasios, et autres
Publié: (2025)
Attention, Please! Revisiting Attentive Probing Through the Lens of Efficiency
par: Psomas, Bill, et autres
Publié: (2025)
par: Psomas, Bill, et autres
Publié: (2025)
Composed Image Retrieval for Remote Sensing
par: Psomas, Bill, et autres
Publié: (2024)
par: Psomas, Bill, et autres
Publié: (2024)
MOCA: Self-supervised Representation Learning by Predicting Masked Online Codebook Assignments
par: Gidaris, Spyros, et autres
Publié: (2023)
par: Gidaris, Spyros, et autres
Publié: (2023)
EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling
par: Kouzelis, Theodoros, et autres
Publié: (2025)
par: Kouzelis, Theodoros, et autres
Publié: (2025)
Benchmarking Composed Image Retrieval for Applied Earth Observation
par: Psomas, Bill, et autres
Publié: (2026)
par: Psomas, Bill, et autres
Publié: (2026)
Unsupervised Object Localization in the Era of Self-Supervised ViTs: A Survey
par: Siméoni, Oriane, et autres
Publié: (2023)
par: Siméoni, Oriane, et autres
Publié: (2023)
No Train, all Gain: Self-Supervised Gradients Improve Deep Frozen Representations
par: Simoncini, Walter, et autres
Publié: (2024)
par: Simoncini, Walter, et autres
Publié: (2024)
Composed Image Retrieval for Training-Free Domain Conversion
par: Efthymiadis, Nikos, et autres
Publié: (2024)
par: Efthymiadis, Nikos, et autres
Publié: (2024)
Transformer-based assignment decision network for multiple object tracking
par: Psalta, Athena, et autres
Publié: (2022)
par: Psalta, Athena, et autres
Publié: (2022)
Boosting Visual Instruction Tuning with Self-Supervised Guidance
par: Sirko-Galouchenko, Sophia, et autres
Publié: (2026)
par: Sirko-Galouchenko, Sophia, et autres
Publié: (2026)
What really matters for person re-identification? A Mixture-of-Experts Framework for Semantic Attribute Importance
par: Psalta, Athena, et autres
Publié: (2025)
par: Psalta, Athena, et autres
Publié: (2025)
TRACE: Transformer-based Risk Assessment for Clinical Evaluation
par: Christopoulos, Dionysis, et autres
Publié: (2024)
par: Christopoulos, Dionysis, et autres
Publié: (2024)
Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?
par: Aravanis, Tilemachos, et autres
Publié: (2026)
par: Aravanis, Tilemachos, et autres
Publié: (2026)
DIP: Unsupervised Dense In-Context Post-training of Visual Representations
par: Sirko-Galouchenko, Sophia, et autres
Publié: (2025)
par: Sirko-Galouchenko, Sophia, et autres
Publié: (2025)
Addressing single object tracking in satellite imagery through prompt-engineered solutions
par: Psalta, Athena, et autres
Publié: (2024)
par: Psalta, Athena, et autres
Publié: (2024)
Context Matters: Learning Global Semantics via Object-Centric Representation
par: Zhong, Jike, et autres
Publié: (2025)
par: Zhong, Jike, et autres
Publié: (2025)
Object-Centric Action-Enhanced Representations for Robot Visuo-Motor Policy Learning
par: Giannakakis, Nikos, et autres
Publié: (2025)
par: Giannakakis, Nikos, et autres
Publié: (2025)
Vanilla ViT for Automotive Point Cloud Semantic Segmentation
par: Puy, Gilles, et autres
Publié: (2026)
par: Puy, Gilles, et autres
Publié: (2026)
OccFeat: Self-supervised Occupancy Feature Prediction for Pretraining BEV Segmentation Networks
par: Sirko-Galouchenko, Sophia, et autres
Publié: (2024)
par: Sirko-Galouchenko, Sophia, et autres
Publié: (2024)
Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning
par: Venkataramanan, Shashanka, et autres
Publié: (2025)
par: Venkataramanan, Shashanka, et autres
Publié: (2025)
REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion
par: Petsangourakis, Giorgos, et autres
Publié: (2025)
par: Petsangourakis, Giorgos, et autres
Publié: (2025)
FLOGA: A machine learning ready dataset, a benchmark and a novel deep learning model for burnt area mapping with Sentinel-2
par: Sdraka, Maria, et autres
Publié: (2023)
par: Sdraka, Maria, et autres
Publié: (2023)
Drive&Segment: Unsupervised Semantic Segmentation of Urban Scenes via Cross-modal Distillation
par: Vobecky, Antonin, et autres
Publié: (2022)
par: Vobecky, Antonin, et autres
Publié: (2022)
POP-3D: Open-Vocabulary 3D Occupancy Prediction from Images
par: Vobecky, Antonin, et autres
Publié: (2024)
par: Vobecky, Antonin, et autres
Publié: (2024)
Higher-Order Adversarial Patches for Real-Time Object Detectors
par: Bayer, Jens, et autres
Publié: (2026)
par: Bayer, Jens, et autres
Publié: (2026)
ToNNO: Tomographic Reconstruction of a Neural Network's Output for Weakly Supervised Segmentation of 3D Medical Images
par: Schmidt-Mengin, Marius, et autres
Publié: (2024)
par: Schmidt-Mengin, Marius, et autres
Publié: (2024)
Object-Centric Temporal Consistency via Conditional Autoregressive Inductive Biases
par: Meo, Cristian, et autres
Publié: (2024)
par: Meo, Cristian, et autres
Publié: (2024)
Skin Lesion Phenotyping via Nested Multi-modal Contrastive Learning
par: Christopoulos, Dionysis, et autres
Publié: (2025)
par: Christopoulos, Dionysis, et autres
Publié: (2025)
Next Patch Prediction for Autoregressive Visual Generation
par: Pang, Yatian, et autres
Publié: (2024)
par: Pang, Yatian, et autres
Publié: (2024)
Three Pillars improving Vision Foundation Model Distillation for Lidar
par: Puy, Gilles, et autres
Publié: (2023)
par: Puy, Gilles, et autres
Publié: (2023)
Inlier-Centric Post-Training Quantization for Object Detection Models
par: Kim, Minsu, et autres
Publié: (2026)
par: Kim, Minsu, et autres
Publié: (2026)
PanSR: An Object-Centric Mask Transformer for Panoptic Segmentation
par: Žust, Lojze, et autres
Publié: (2024)
par: Žust, Lojze, et autres
Publié: (2024)
Aligned Unsupervised Pretraining of Object Detectors with Self-training
par: Metaxas, Ioannis Maniadis, et autres
Publié: (2023)
par: Metaxas, Ioannis Maniadis, et autres
Publié: (2023)
SPOT!: Map-Guided LLM Agent for Unsupervised Multi-CCTV Dynamic Object Tracking
par: Roh, Yujin, et autres
Publié: (2025)
par: Roh, Yujin, et autres
Publié: (2025)
Documents similaires
-
Advancing Semantic Future Prediction through Multimodal Visual Sequence Transformers
par: Karypidis, Efstathios, et autres
Publié: (2025) -
DINO-Foresight: Looking into the Future with DINO
par: Karypidis, Efstathios, et autres
Publié: (2024) -
Boosting Generative Image Modeling via Joint Image-Feature Synthesis
par: Kouzelis, Theodoros, et autres
Publié: (2025) -
Coevolving Representations in Joint Image-Feature Diffusion
par: Kouzelis, Theodoros, et autres
Publié: (2026) -
Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction
par: Karypidis, Efstathios, et autres
Publié: (2026)