Geometrically Constrained and Token-Based Probabilistic Spatial Transformers
Fuente:
arXiv
Saved in:
| Main Authors: | Schmidt, Johann, Stober, Sebastian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Robust Canonicalization through Bootstrapped Data Re-Alignment
by: Schmidt, Johann, et al.
Published: (2025)
by: Schmidt, Johann, et al.
Published: (2025)
Saccadic Vision for Fine-Grained Visual Classification
by: Schmidt, Johann, et al.
Published: (2025)
by: Schmidt, Johann, et al.
Published: (2025)
Tilt your Head: Activating the Hidden Spatial-Invariance of Classifiers
by: Schmidt, Johann, et al.
Published: (2024)
by: Schmidt, Johann, et al.
Published: (2024)
Geometrically-Constrained Agent for Spatial Reasoning
by: Chen, Zeren, et al.
Published: (2025)
by: Chen, Zeren, et al.
Published: (2025)
StyleX: A Trainable Metric for X-ray Style Distances
by: Eckert, Dominik, et al.
Published: (2024)
by: Eckert, Dominik, et al.
Published: (2024)
Texture Image Synthesis Using Spatial GAN Based on Vision Transformers
by: Salari, Elahe, et al.
Published: (2025)
by: Salari, Elahe, et al.
Published: (2025)
Geometrical Properties of Text Token Embeddings for Strong Semantic Binding in Text-to-Image Generation
by: Seo, Hoigi, et al.
Published: (2025)
by: Seo, Hoigi, et al.
Published: (2025)
ENAT: Rethinking Spatial-temporal Interactions in Token-based Image Synthesis
by: Ni, Zanlin, et al.
Published: (2024)
by: Ni, Zanlin, et al.
Published: (2024)
Frequency-Aware Token Reduction for Efficient Vision Transformer
by: Lee, Dong-Jae, et al.
Published: (2025)
by: Lee, Dong-Jae, et al.
Published: (2025)
Online Handwritten Signature Verification Based on Temporal-Spatial Graph Attention Transformer
by: Yuan, Hai-jie, et al.
Published: (2025)
by: Yuan, Hai-jie, et al.
Published: (2025)
SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition
by: Pay, Quan Bi, et al.
Published: (2025)
by: Pay, Quan Bi, et al.
Published: (2025)
Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation
by: Li, Yuchen, et al.
Published: (2026)
by: Li, Yuchen, et al.
Published: (2026)
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
by: Tan, Zhentao, et al.
Published: (2024)
by: Tan, Zhentao, et al.
Published: (2024)
Accelerating Transformer-Based Monocular SLAM via Geometric Utility Scoring
by: Xiong, Xinmiao, et al.
Published: (2026)
by: Xiong, Xinmiao, et al.
Published: (2026)
AT-SNN: Adaptive Tokens for Vision Transformer on Spiking Neural Network
by: Kang, Donghwa, et al.
Published: (2024)
by: Kang, Donghwa, et al.
Published: (2024)
DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers
by: Shi, Minglei, et al.
Published: (2025)
by: Shi, Minglei, et al.
Published: (2025)
TinyDrop: Tiny Model Guided Token Dropping for Vision Transformers
by: Wang, Guoxin, et al.
Published: (2025)
by: Wang, Guoxin, et al.
Published: (2025)
Detecting Regional Spurious Correlations in Vision Transformers via Token Discarding
by: Kang, Solha, et al.
Published: (2025)
by: Kang, Solha, et al.
Published: (2025)
Token Pruning using a Lightweight Background Aware Vision Transformer
by: Sah, Sudhakar, et al.
Published: (2024)
by: Sah, Sudhakar, et al.
Published: (2024)
Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers
by: Lee, Dong Hoon, et al.
Published: (2024)
by: Lee, Dong Hoon, et al.
Published: (2024)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
by: Liu, Junming, et al.
Published: (2026)
by: Liu, Junming, et al.
Published: (2026)
Resolving Token-Space Gradient Conflicts: Token Space Manipulation for Transformer-Based Multi-Task Learning
by: Jeong, Wooseong, et al.
Published: (2025)
by: Jeong, Wooseong, et al.
Published: (2025)
Compressing Vision Transformers in Geospatial Transfer Learning with Manifold-Constrained Optimization
by: Snyder, Thomas, et al.
Published: (2026)
by: Snyder, Thomas, et al.
Published: (2026)
Bridging Implicit and Explicit Geometric Transformation for Single-Image View Synthesis
by: Park, Byeongjun, et al.
Published: (2022)
by: Park, Byeongjun, et al.
Published: (2022)
Identifying Critical Tokens for Accurate Predictions in Transformer-based Medical Imaging Models
by: Kang, Solha, et al.
Published: (2025)
by: Kang, Solha, et al.
Published: (2025)
Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning
by: Huang, Yihong, et al.
Published: (2026)
by: Huang, Yihong, et al.
Published: (2026)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
by: Xu, Xuwei, et al.
Published: (2023)
by: Xu, Xuwei, et al.
Published: (2023)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
by: Li, Yueying, et al.
Published: (2026)
by: Li, Yueying, et al.
Published: (2026)
Transformer-based Spatial Grounding: A Comprehensive Survey
by: Haq, Ijazul, et al.
Published: (2025)
by: Haq, Ijazul, et al.
Published: (2025)
From Lines to Shapes: Geometric-Constrained Segmentation of X-Ray Collimators via Hough Transform
by: El-Zein, Benjamin, et al.
Published: (2025)
by: El-Zein, Benjamin, et al.
Published: (2025)
ULTra: Unveiling Latent Token Interpretability in Transformer-Based Understanding and Segmentation
by: Hosseini, Hesam, et al.
Published: (2024)
by: Hosseini, Hesam, et al.
Published: (2024)
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
by: Tian, Yunjie, et al.
Published: (2022)
by: Tian, Yunjie, et al.
Published: (2022)
Human-Centric Video Anomaly Detection Through Spatio-Temporal Pose Tokenization and Transformer
by: Noghre, Ghazal Alinezhad, et al.
Published: (2024)
by: Noghre, Ghazal Alinezhad, et al.
Published: (2024)
Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
by: Kancheti, Sai Srinivas, et al.
Published: (2026)
by: Kancheti, Sai Srinivas, et al.
Published: (2026)
FASTer: Focal Token Acquiring-and-Scaling Transformer for Long-term 3D Object Detection
by: Dang, Chenxu, et al.
Published: (2025)
by: Dang, Chenxu, et al.
Published: (2025)
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
by: Wu, Meihan, et al.
Published: (2024)
by: Wu, Meihan, et al.
Published: (2024)
Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation
by: Li, Wenhao, et al.
Published: (2023)
by: Li, Wenhao, et al.
Published: (2023)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
by: Luo, Bingjun, et al.
Published: (2026)
by: Luo, Bingjun, et al.
Published: (2026)
Taming Outlier Tokens in Diffusion Transformers
by: Wu, Xiaoyu, et al.
Published: (2026)
by: Wu, Xiaoyu, et al.
Published: (2026)
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
by: Yeh, Chun-Hsiao, et al.
Published: (2026)
by: Yeh, Chun-Hsiao, et al.
Published: (2026)
Similar Items
-
Robust Canonicalization through Bootstrapped Data Re-Alignment
by: Schmidt, Johann, et al.
Published: (2025) -
Saccadic Vision for Fine-Grained Visual Classification
by: Schmidt, Johann, et al.
Published: (2025) -
Tilt your Head: Activating the Hidden Spatial-Invariance of Classifiers
by: Schmidt, Johann, et al.
Published: (2024) -
Geometrically-Constrained Agent for Spatial Reasoning
by: Chen, Zeren, et al.
Published: (2025) -
StyleX: A Trainable Metric for X-ray Style Distances
by: Eckert, Dominik, et al.
Published: (2024)