Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Yutao, Zhao, Cheng, Mittal, Gaurav, Kukkala, Rohith, Chellappa, Rama, Peng, Cheng, Chen, Mei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation
by: Sun, Su, et al.
Published: (2025)
by: Sun, Su, et al.
Published: (2025)
MS-GS: Multi-Appearance Sparse-View 3D Gaussian Splatting in the Wild
by: Li, Deming, et al.
Published: (2025)
by: Li, Deming, et al.
Published: (2025)
BAGS: Blur Agnostic Gaussian Splatting through Multi-Scale Kernel Modeling
by: Peng, Cheng, et al.
Published: (2024)
by: Peng, Cheng, et al.
Published: (2024)
DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos
by: Lu, Zijia, et al.
Published: (2025)
by: Lu, Zijia, et al.
Published: (2025)
An Immersive Multi-Elevation Multi-Seasonal Dataset for 3D Reconstruction and Visualization
by: Liu, Xijun, et al.
Published: (2024)
by: Liu, Xijun, et al.
Published: (2024)
CAM3R: Camera-Agnostic Model for 3D Reconstruction
by: Guruprasad, Namitha, et al.
Published: (2026)
by: Guruprasad, Namitha, et al.
Published: (2026)
SyncFix: Fixing 3D Reconstructions via Multi-View Synchronization
by: Li, Deming, et al.
Published: (2026)
by: Li, Deming, et al.
Published: (2026)
FusionRF: High-Fidelity Satellite Neural Radiance Fields from Multispectral and Panchromatic Acquisitions
by: Sprintson, Michael, et al.
Published: (2024)
by: Sprintson, Michael, et al.
Published: (2024)
LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens
by: Li, Zekun, et al.
Published: (2026)
by: Li, Zekun, et al.
Published: (2026)
Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling
by: Huang, Hongzhi, et al.
Published: (2025)
by: Huang, Hongzhi, et al.
Published: (2025)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
by: Wei, Guoyizhe, et al.
Published: (2025)
by: Wei, Guoyizhe, et al.
Published: (2025)
Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction
by: Yin, Ruihong, et al.
Published: (2025)
by: Yin, Ruihong, et al.
Published: (2025)
Template-based Multi-Domain Face Recognition
by: Nanduri, Anirudh, et al.
Published: (2024)
by: Nanduri, Anirudh, et al.
Published: (2024)
SPIDER: Spatial Image CorresponDence Estimator for Robust Calibration
by: Shao, Zhimin, et al.
Published: (2025)
by: Shao, Zhimin, et al.
Published: (2025)
Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale
by: Wei, Dongxu, et al.
Published: (2026)
by: Wei, Dongxu, et al.
Published: (2026)
SAM-Guided Masked Token Prediction for 3D Scene Understanding
by: Chen, Zhimin, et al.
Published: (2024)
by: Chen, Zhimin, et al.
Published: (2024)
Learning to Prompt Your Domain for Vision-Language Models
by: Wei, Guoyizhe, et al.
Published: (2023)
by: Wei, Guoyizhe, et al.
Published: (2023)
DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
by: Zhuo, Dong, et al.
Published: (2026)
by: Zhuo, Dong, et al.
Published: (2026)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
by: Zeng, Fanhu, et al.
Published: (2025)
by: Zeng, Fanhu, et al.
Published: (2025)
MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers
by: Bae, Jongseong, et al.
Published: (2024)
by: Bae, Jongseong, et al.
Published: (2024)
HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization
by: Qiu, Xuerui, et al.
Published: (2026)
by: Qiu, Xuerui, et al.
Published: (2026)
Multi-Token Enhancing for Vision Representation Learning
by: Li, Zhong-Yu, et al.
Published: (2024)
by: Li, Zhong-Yu, et al.
Published: (2024)
Uncertainty-quantified Pulse Signal Recovery from Facial Video using Regularized Stochastic Interpolants
by: Shenoy, Vineet R., et al.
Published: (2026)
by: Shenoy, Vineet R., et al.
Published: (2026)
LP-3DGS: Learning to Prune 3D Gaussian Splatting
by: Zhang, Zhaoliang, et al.
Published: (2024)
by: Zhang, Zhaoliang, et al.
Published: (2024)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
by: Wang, Ziyao, et al.
Published: (2026)
by: Wang, Ziyao, et al.
Published: (2026)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
by: Li, Tenghui, et al.
Published: (2024)
by: Li, Tenghui, et al.
Published: (2024)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
by: Jia, Baoxiong, et al.
Published: (2024)
by: Jia, Baoxiong, et al.
Published: (2024)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
by: Cao, Jianjian, et al.
Published: (2024)
by: Cao, Jianjian, et al.
Published: (2024)
Exploring Token-Level Augmentation in Vision Transformer for Semi-Supervised Semantic Segmentation
by: Zhang, Dengke, et al.
Published: (2025)
by: Zhang, Dengke, et al.
Published: (2025)
Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models
by: Thomas, Hugues, et al.
Published: (2025)
by: Thomas, Hugues, et al.
Published: (2025)
Attention Debiasing for Token Pruning in Vision Language Models
by: Zhao, Kai, et al.
Published: (2025)
by: Zhao, Kai, et al.
Published: (2025)
KunlunBaize: LLM with Multi-Scale Convolution and Multi-Token Prediction Under TransformerX Framework
by: Li, Cheng, et al.
Published: (2025)
by: Li, Cheng, et al.
Published: (2025)
AraToken: Optimizing Arabic Tokenization with Normalization Pipeline and Language Extension for Qwen3
by: Kashirskiy, Mark, et al.
Published: (2025)
by: Kashirskiy, Mark, et al.
Published: (2025)
Token Pruning for In-Context Generation in Diffusion Transformers
by: Lin, Junqing, et al.
Published: (2026)
by: Lin, Junqing, et al.
Published: (2026)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
by: Peng, Shuai, et al.
Published: (2024)
by: Peng, Shuai, et al.
Published: (2024)
VILLS -- Video-Image Learning to Learn Semantics for Person Re-Identification
by: Huang, Siyuan, et al.
Published: (2023)
by: Huang, Siyuan, et al.
Published: (2023)
Multi-Domain Biometric Recognition using Body Embeddings
by: Nanduri, Anirudh, et al.
Published: (2025)
by: Nanduri, Anirudh, et al.
Published: (2025)
TokenFormer: Rethinking Transformer Scaling with Tokenized Model Parameters
by: Wang, Haiyang, et al.
Published: (2024)
by: Wang, Haiyang, et al.
Published: (2024)
DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning
by: Pal, Basudha, et al.
Published: (2026)
by: Pal, Basudha, et al.
Published: (2026)
MimicGait: A Model Agnostic approach for Occluded Gait Recognition using Correlational Knowledge Distillation
by: Gupta, Ayush, et al.
Published: (2025)
by: Gupta, Ayush, et al.
Published: (2025)
Similar Items
-
Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation
by: Sun, Su, et al.
Published: (2025) -
MS-GS: Multi-Appearance Sparse-View 3D Gaussian Splatting in the Wild
by: Li, Deming, et al.
Published: (2025) -
BAGS: Blur Agnostic Gaussian Splatting through Multi-Scale Kernel Modeling
by: Peng, Cheng, et al.
Published: (2024) -
DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos
by: Lu, Zijia, et al.
Published: (2025) -
An Immersive Multi-Elevation Multi-Seasonal Dataset for 3D Reconstruction and Visualization
by: Liu, Xijun, et al.
Published: (2024)