Multiscale Vision Transformers meet Bipartite Matching for efficient single-stage Action Localization
Fuente:
arXiv
Salvato in:
| Autori principali: | Ntinou, Ioanna, Sanchez, Enrique, Tzimiropoulos, Georgios |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MeMSVD: Long-Range Temporal Structure Capturing Using Incremental SVD
di: Ntinou, Ioanna, et al.
Pubblicazione: (2024)
di: Ntinou, Ioanna, et al.
Pubblicazione: (2024)
Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions
di: Ntinou, Ioanna, et al.
Pubblicazione: (2025)
di: Ntinou, Ioanna, et al.
Pubblicazione: (2025)
VLLMs Provide Better Context for Emotion Understanding Through Common Sense Reasoning
di: Xenos, Alexandros, et al.
Pubblicazione: (2024)
di: Xenos, Alexandros, et al.
Pubblicazione: (2024)
CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs
di: Ouali, Yassine, et al.
Pubblicazione: (2024)
di: Ouali, Yassine, et al.
Pubblicazione: (2024)
Hierarchical Image Tokenization for Multi-Scale Image Super Resolution
di: Hadji, Isma, et al.
Pubblicazione: (2026)
di: Hadji, Isma, et al.
Pubblicazione: (2026)
FFF: Fixing Flawed Foundations in contrastive pre-training results in very strong Vision-Language models
di: Bulat, Adrian, et al.
Pubblicazione: (2024)
di: Bulat, Adrian, et al.
Pubblicazione: (2024)
CLIPCleaner: Cleaning Noisy Labels with CLIP
di: Feng, Chen, et al.
Pubblicazione: (2024)
di: Feng, Chen, et al.
Pubblicazione: (2024)
Multi-scale Image Super Resolution with a Single Auto-Regressive Model
di: Sanchez, Enrique, et al.
Pubblicazione: (2025)
di: Sanchez, Enrique, et al.
Pubblicazione: (2025)
Efficient Unsupervised Visual Representation Learning with Explicit Cluster Balancing
di: Metaxas, Ioannis Maniadis, et al.
Pubblicazione: (2024)
di: Metaxas, Ioannis Maniadis, et al.
Pubblicazione: (2024)
CemiFace: Center-based Semi-hard Synthetic Face Generation for Face Recognition
di: Sun, Zhonglin, et al.
Pubblicazione: (2024)
di: Sun, Zhonglin, et al.
Pubblicazione: (2024)
MM2Latent: Text-to-facial image generation and editing in GANs with multimodal assistance
di: Meng, Debin, et al.
Pubblicazione: (2024)
di: Meng, Debin, et al.
Pubblicazione: (2024)
SSR: An Efficient and Robust Framework for Learning with Unknown Label Noise
di: Feng, Chen, et al.
Pubblicazione: (2021)
di: Feng, Chen, et al.
Pubblicazione: (2021)
ViTALS: Vision Transformer for Action Localization in Surgical Nephrectomy
di: Chandra, Soumyadeep, et al.
Pubblicazione: (2024)
di: Chandra, Soumyadeep, et al.
Pubblicazione: (2024)
Bipartite Mode Matching for Vision Training Set Search from a Hierarchical Data Server
di: Yao, Yue, et al.
Pubblicazione: (2026)
di: Yao, Yue, et al.
Pubblicazione: (2026)
You Only Need One Step: Fast Super-Resolution with Stable Diffusion via Scale Distillation
di: Noroozi, Mehdi, et al.
Pubblicazione: (2024)
di: Noroozi, Mehdi, et al.
Pubblicazione: (2024)
Knowledge Distillation Meets Open-Set Semi-Supervised Learning
di: Yang, Jing, et al.
Pubblicazione: (2022)
di: Yang, Jing, et al.
Pubblicazione: (2022)
One-shot Neural Face Reenactment via Finding Directions in GAN's Latent Space
di: Bounareli, Stella, et al.
Pubblicazione: (2024)
di: Bounareli, Stella, et al.
Pubblicazione: (2024)
Fwd2Bot: LVLM Visual Token Compression with Double Forward Bottleneck
di: Bulat, Adrian, et al.
Pubblicazione: (2025)
di: Bulat, Adrian, et al.
Pubblicazione: (2025)
VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
di: Bulat, Adrian, et al.
Pubblicazione: (2026)
di: Bulat, Adrian, et al.
Pubblicazione: (2026)
LAFS: Landmark-based Facial Self-supervised Learning for Face Recognition
di: Sun, Zhonglin, et al.
Pubblicazione: (2024)
di: Sun, Zhonglin, et al.
Pubblicazione: (2024)
Skeleton-Snippet Contrastive Learning with Multiscale Feature Fusion for Action Localization
di: Cheng, Qiushuo, et al.
Pubblicazione: (2025)
di: Cheng, Qiushuo, et al.
Pubblicazione: (2025)
Aligned Unsupervised Pretraining of Object Detectors with Self-training
di: Metaxas, Ioannis Maniadis, et al.
Pubblicazione: (2023)
di: Metaxas, Ioannis Maniadis, et al.
Pubblicazione: (2023)
Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration
di: Chen, I-Hsiang, et al.
Pubblicazione: (2026)
di: Chen, I-Hsiang, et al.
Pubblicazione: (2026)
Localizing Anomalies via Multiscale Score Matching Analysis
di: Mahmood, Ahsan, et al.
Pubblicazione: (2024)
di: Mahmood, Ahsan, et al.
Pubblicazione: (2024)
Edge-SD-SR: Low Latency and Parameter Efficient On-device Super-Resolution with Stable Diffusion via Bidirectional Conditioning
di: Noroozi, Mehdi, et al.
Pubblicazione: (2024)
di: Noroozi, Mehdi, et al.
Pubblicazione: (2024)
ROI-Aware Multiscale Cross-Attention Vision Transformer for Pest Image Identification
di: Kim, Ga-Eun, et al.
Pubblicazione: (2023)
di: Kim, Ga-Eun, et al.
Pubblicazione: (2023)
DiffusionAct: Controllable Diffusion Autoencoder for One-shot Face Reenactment
di: Bounareli, Stella, et al.
Pubblicazione: (2024)
di: Bounareli, Stella, et al.
Pubblicazione: (2024)
Locality-Attending Vision Transformer
di: Hajimiri, Sina, et al.
Pubblicazione: (2026)
di: Hajimiri, Sina, et al.
Pubblicazione: (2026)
LocalViT: Analyzing Locality in Vision Transformers
di: Li, Yawei, et al.
Pubblicazione: (2021)
di: Li, Yawei, et al.
Pubblicazione: (2021)
Improved Multiscale Structural Mapping with Supervertex Vision Transformer for the Detection of Alzheimer's Disease Neurodegeneration
di: Baek, Geonwoo, et al.
Pubblicazione: (2026)
di: Baek, Geonwoo, et al.
Pubblicazione: (2026)
Semi-supervised Multiscale Matching for SAR-Optical Image
di: Gai, Jingze, et al.
Pubblicazione: (2025)
di: Gai, Jingze, et al.
Pubblicazione: (2025)
The Multiscale Surface Vision Transformer
di: Dahan, Simon, et al.
Pubblicazione: (2023)
di: Dahan, Simon, et al.
Pubblicazione: (2023)
Online Temporal Action Localization with Memory-Augmented Transformer
di: Song, Youngkil, et al.
Pubblicazione: (2024)
di: Song, Youngkil, et al.
Pubblicazione: (2024)
FAM Diffusion: Frequency and Attention Modulation for High-Resolution Image Generation with Stable Diffusion
di: Yang, Haosen, et al.
Pubblicazione: (2024)
di: Yang, Haosen, et al.
Pubblicazione: (2024)
More Images, More Problems? A Controlled Analysis of VLM Failure Modes
di: Das, Anurag, et al.
Pubblicazione: (2026)
di: Das, Anurag, et al.
Pubblicazione: (2026)
Masked Diffusion Vision-Language Models for Temporal Action Localization
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning
di: Krestenitis, Marios, et al.
Pubblicazione: (2026)
di: Krestenitis, Marios, et al.
Pubblicazione: (2026)
PRE: Vision-Language Prompt Learning with Reparameterization Encoder
di: Pham, Thi Minh Anh, et al.
Pubblicazione: (2023)
di: Pham, Thi Minh Anh, et al.
Pubblicazione: (2023)
VITA: Vision-to-Action Flow Matching Policy
di: Gao, Dechen, et al.
Pubblicazione: (2025)
di: Gao, Dechen, et al.
Pubblicazione: (2025)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
di: Shi, Yiran, et al.
Pubblicazione: (2026)
di: Shi, Yiran, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MeMSVD: Long-Range Temporal Structure Capturing Using Incremental SVD
di: Ntinou, Ioanna, et al.
Pubblicazione: (2024) -
Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions
di: Ntinou, Ioanna, et al.
Pubblicazione: (2025) -
VLLMs Provide Better Context for Emotion Understanding Through Common Sense Reasoning
di: Xenos, Alexandros, et al.
Pubblicazione: (2024) -
CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs
di: Ouali, Yassine, et al.
Pubblicazione: (2024) -
Hierarchical Image Tokenization for Multi-Scale Image Super Resolution
di: Hadji, Isma, et al.
Pubblicazione: (2026)