Parallel Sequence Modeling via Generalized Spatial Propagation Network
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Hongjun, Byeon, Wonmin, Xu, Jiarui, Gu, Jinwei, Cheung, Ka Chun, Wang, Xiaolong, Han, Kai, Kautz, Jan, Liu, Sifei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GSPN-2: Efficient Parallel Sequence Modeling
by: Wang, Hongjun, et al.
Published: (2025)
by: Wang, Hongjun, et al.
Published: (2025)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
by: Jiang, Yitong, et al.
Published: (2026)
by: Jiang, Yitong, et al.
Published: (2026)
RegionGPT: Towards Region Understanding Vision Language Model
by: Guo, Qiushan, et al.
Published: (2024)
by: Guo, Qiushan, et al.
Published: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
by: Cheng, An-Chieh, et al.
Published: (2024)
by: Cheng, An-Chieh, et al.
Published: (2024)
COLMAP-Free 3D Gaussian Splatting
by: Fu, Yang, et al.
Published: (2023)
by: Fu, Yang, et al.
Published: (2023)
One-Minute Video Generation with Test-Time Training
by: Dalal, Karan, et al.
Published: (2025)
by: Dalal, Karan, et al.
Published: (2025)
SPTNet: An Efficient Alternative Framework for Generalized Category Discovery with Spatial Prompt Tuning
by: Wang, Hongjun, et al.
Published: (2024)
by: Wang, Hongjun, et al.
Published: (2024)
CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation
by: Xu, Dejia, et al.
Published: (2024)
by: Xu, Dejia, et al.
Published: (2024)
Feature-based Graph Attention Networks Improve Online Continual Learning
by: Sim, Adjovi, et al.
Published: (2025)
by: Sim, Adjovi, et al.
Published: (2025)
MEVG: Multi-event Video Generation with Text-to-Video Models
by: Oh, Gyeongrok, et al.
Published: (2023)
by: Oh, Gyeongrok, et al.
Published: (2023)
Stateful Token Reduction for Long-Video Hybrid VLMs
by: Jiang, Jindong, et al.
Published: (2026)
by: Jiang, Jindong, et al.
Published: (2026)
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos
by: Xia, Hongchi, et al.
Published: (2024)
by: Xia, Hongchi, et al.
Published: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
by: Cheng, An-Chieh, et al.
Published: (2026)
by: Cheng, An-Chieh, et al.
Published: (2026)
HiLo: A Learning Framework for Generalized Category Discovery Robust to Domain Shifts
by: Wang, Hongjun, et al.
Published: (2024)
by: Wang, Hongjun, et al.
Published: (2024)
3D Aware Region Prompted Vision Language Model
by: Cheng, An-Chieh, et al.
Published: (2025)
by: Cheng, An-Chieh, et al.
Published: (2025)
Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models
by: Wang, Hongjun, et al.
Published: (2026)
by: Wang, Hongjun, et al.
Published: (2026)
M3: 3D-Spatial MultiModal Memory
by: Zou, Xueyan, et al.
Published: (2025)
by: Zou, Xueyan, et al.
Published: (2025)
HOIDiffusion: Generating Realistic 3D Hand-Object Interaction Data
by: Zhang, Mengqi, et al.
Published: (2024)
by: Zhang, Mengqi, et al.
Published: (2024)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
by: Cheng, An-Chieh, et al.
Published: (2024)
by: Cheng, An-Chieh, et al.
Published: (2024)
Fin3R: Fine-tuning Feed-forward 3D Reconstruction Models via Monocular Knowledge Distillation
by: Ren, Weining, et al.
Published: (2025)
by: Ren, Weining, et al.
Published: (2025)
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
by: Zhen, Haoyu, et al.
Published: (2026)
by: Zhen, Haoyu, et al.
Published: (2026)
Dissecting Out-of-Distribution Detection and Open-Set Recognition: A Critical Analysis of Methods and Benchmarks
by: Wang, Hongjun, et al.
Published: (2024)
by: Wang, Hongjun, et al.
Published: (2024)
LoRA-TTT: Low-Rank Test-Time Training for Vision-Language Models
by: Kojima, Yuto, et al.
Published: (2025)
by: Kojima, Yuto, et al.
Published: (2025)
ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation
by: Luo, Ziyuan, et al.
Published: (2025)
by: Luo, Ziyuan, et al.
Published: (2025)
Protecting NeRFs' Copyright via Plug-And-Play Watermarking Base Model
by: Song, Qi, et al.
Published: (2024)
by: Song, Qi, et al.
Published: (2024)
Masked Spatial Propagation Network for Sparsity-Adaptive Depth Refinement
by: Jun, Jinyoung, et al.
Published: (2024)
by: Jun, Jinyoung, et al.
Published: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
by: Jiang, Jindong, et al.
Published: (2025)
by: Jiang, Jindong, et al.
Published: (2025)
Towards Automating the Retrospective Generation of BIM Models: A Unified Framework for 3D Semantic Reconstruction of the Built Environment
by: Cheung, Ka Lung, et al.
Published: (2024)
by: Cheung, Ka Lung, et al.
Published: (2024)
GeometrySticker: Enabling Ownership Claim of Recolorized Neural Radiance Fields
by: Huang, Xiufeng, et al.
Published: (2024)
by: Huang, Xiufeng, et al.
Published: (2024)
HEXST: Hexagonal Shifted-Window Transformer for Spatial Transcriptomics Gene Expression Prediction
by: Byeon, Keunho, et al.
Published: (2026)
by: Byeon, Keunho, et al.
Published: (2026)
GenAR: Next-Scale Autoregressive Generation for Spatial Gene Expression Prediction
by: Ouyang, Jiarui, et al.
Published: (2025)
by: Ouyang, Jiarui, et al.
Published: (2025)
Scaling Vision Pre-Training to 4K Resolution
by: Shi, Baifeng, et al.
Published: (2025)
by: Shi, Baifeng, et al.
Published: (2025)
GaussianMarker: Uncertainty-Aware Copyright Protection of 3D Gaussian Splatting
by: Huang, Xiufeng, et al.
Published: (2024)
by: Huang, Xiufeng, et al.
Published: (2024)
Panoptic Captioning: An Equivalence Bridge for Image and Text
by: Lin, Kun-Yu, et al.
Published: (2025)
by: Lin, Kun-Yu, et al.
Published: (2025)
HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction
by: Bao, Chen, et al.
Published: (2024)
by: Bao, Chen, et al.
Published: (2024)
Align 3D Representation and Text Embedding for 3D Content Personalization
by: Song, Qi, et al.
Published: (2025)
by: Song, Qi, et al.
Published: (2025)
Stereo-GS: Multi-View Stereo Vision Model for Generalizable 3D Gaussian Splatting Reconstruction
by: Huang, Xiufeng, et al.
Published: (2025)
by: Huang, Xiufeng, et al.
Published: (2025)
Geometry Cloak: Preventing TGS-based 3D Reconstruction from Copyrighted Images
by: Song, Qi, et al.
Published: (2024)
by: Song, Qi, et al.
Published: (2024)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
by: Guo, Jiajie, et al.
Published: (2025)
by: Guo, Jiajie, et al.
Published: (2025)
ARCH2S: Dataset, Benchmark and Challenges for Learning Exterior Architectural Structures from Point Clouds
by: Cheung, Ka Lung, et al.
Published: (2024)
by: Cheung, Ka Lung, et al.
Published: (2024)
Similar Items
-
GSPN-2: Efficient Parallel Sequence Modeling
by: Wang, Hongjun, et al.
Published: (2025) -
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
by: Jiang, Yitong, et al.
Published: (2026) -
RegionGPT: Towards Region Understanding Vision Language Model
by: Guo, Qiushan, et al.
Published: (2024) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
by: Cheng, An-Chieh, et al.
Published: (2024) -
COLMAP-Free 3D Gaussian Splatting
by: Fu, Yang, et al.
Published: (2023)