Parallel Sequence Modeling via Generalized Spatial Propagation Network
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Hongjun, Byeon, Wonmin, Xu, Jiarui, Gu, Jinwei, Cheung, Ka Chun, Wang, Xiaolong, Han, Kai, Kautz, Jan, Liu, Sifei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GSPN-2: Efficient Parallel Sequence Modeling
von: Wang, Hongjun, et al.
Veröffentlicht: (2025)
von: Wang, Hongjun, et al.
Veröffentlicht: (2025)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
von: Jiang, Yitong, et al.
Veröffentlicht: (2026)
von: Jiang, Yitong, et al.
Veröffentlicht: (2026)
RegionGPT: Towards Region Understanding Vision Language Model
von: Guo, Qiushan, et al.
Veröffentlicht: (2024)
von: Guo, Qiushan, et al.
Veröffentlicht: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
COLMAP-Free 3D Gaussian Splatting
von: Fu, Yang, et al.
Veröffentlicht: (2023)
von: Fu, Yang, et al.
Veröffentlicht: (2023)
One-Minute Video Generation with Test-Time Training
von: Dalal, Karan, et al.
Veröffentlicht: (2025)
von: Dalal, Karan, et al.
Veröffentlicht: (2025)
SPTNet: An Efficient Alternative Framework for Generalized Category Discovery with Spatial Prompt Tuning
von: Wang, Hongjun, et al.
Veröffentlicht: (2024)
von: Wang, Hongjun, et al.
Veröffentlicht: (2024)
CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation
von: Xu, Dejia, et al.
Veröffentlicht: (2024)
von: Xu, Dejia, et al.
Veröffentlicht: (2024)
Feature-based Graph Attention Networks Improve Online Continual Learning
von: Sim, Adjovi, et al.
Veröffentlicht: (2025)
von: Sim, Adjovi, et al.
Veröffentlicht: (2025)
MEVG: Multi-event Video Generation with Text-to-Video Models
von: Oh, Gyeongrok, et al.
Veröffentlicht: (2023)
von: Oh, Gyeongrok, et al.
Veröffentlicht: (2023)
Stateful Token Reduction for Long-Video Hybrid VLMs
von: Jiang, Jindong, et al.
Veröffentlicht: (2026)
von: Jiang, Jindong, et al.
Veröffentlicht: (2026)
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos
von: Xia, Hongchi, et al.
Veröffentlicht: (2024)
von: Xia, Hongchi, et al.
Veröffentlicht: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
HiLo: A Learning Framework for Generalized Category Discovery Robust to Domain Shifts
von: Wang, Hongjun, et al.
Veröffentlicht: (2024)
von: Wang, Hongjun, et al.
Veröffentlicht: (2024)
3D Aware Region Prompted Vision Language Model
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models
von: Wang, Hongjun, et al.
Veröffentlicht: (2026)
von: Wang, Hongjun, et al.
Veröffentlicht: (2026)
M3: 3D-Spatial MultiModal Memory
von: Zou, Xueyan, et al.
Veröffentlicht: (2025)
von: Zou, Xueyan, et al.
Veröffentlicht: (2025)
HOIDiffusion: Generating Realistic 3D Hand-Object Interaction Data
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
Fin3R: Fine-tuning Feed-forward 3D Reconstruction Models via Monocular Knowledge Distillation
von: Ren, Weining, et al.
Veröffentlicht: (2025)
von: Ren, Weining, et al.
Veröffentlicht: (2025)
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
von: Zhen, Haoyu, et al.
Veröffentlicht: (2026)
von: Zhen, Haoyu, et al.
Veröffentlicht: (2026)
Dissecting Out-of-Distribution Detection and Open-Set Recognition: A Critical Analysis of Methods and Benchmarks
von: Wang, Hongjun, et al.
Veröffentlicht: (2024)
von: Wang, Hongjun, et al.
Veröffentlicht: (2024)
LoRA-TTT: Low-Rank Test-Time Training for Vision-Language Models
von: Kojima, Yuto, et al.
Veröffentlicht: (2025)
von: Kojima, Yuto, et al.
Veröffentlicht: (2025)
ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation
von: Luo, Ziyuan, et al.
Veröffentlicht: (2025)
von: Luo, Ziyuan, et al.
Veröffentlicht: (2025)
Protecting NeRFs' Copyright via Plug-And-Play Watermarking Base Model
von: Song, Qi, et al.
Veröffentlicht: (2024)
von: Song, Qi, et al.
Veröffentlicht: (2024)
Masked Spatial Propagation Network for Sparsity-Adaptive Depth Refinement
von: Jun, Jinyoung, et al.
Veröffentlicht: (2024)
von: Jun, Jinyoung, et al.
Veröffentlicht: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
von: Jiang, Jindong, et al.
Veröffentlicht: (2025)
von: Jiang, Jindong, et al.
Veröffentlicht: (2025)
Towards Automating the Retrospective Generation of BIM Models: A Unified Framework for 3D Semantic Reconstruction of the Built Environment
von: Cheung, Ka Lung, et al.
Veröffentlicht: (2024)
von: Cheung, Ka Lung, et al.
Veröffentlicht: (2024)
GeometrySticker: Enabling Ownership Claim of Recolorized Neural Radiance Fields
von: Huang, Xiufeng, et al.
Veröffentlicht: (2024)
von: Huang, Xiufeng, et al.
Veröffentlicht: (2024)
HEXST: Hexagonal Shifted-Window Transformer for Spatial Transcriptomics Gene Expression Prediction
von: Byeon, Keunho, et al.
Veröffentlicht: (2026)
von: Byeon, Keunho, et al.
Veröffentlicht: (2026)
GenAR: Next-Scale Autoregressive Generation for Spatial Gene Expression Prediction
von: Ouyang, Jiarui, et al.
Veröffentlicht: (2025)
von: Ouyang, Jiarui, et al.
Veröffentlicht: (2025)
Scaling Vision Pre-Training to 4K Resolution
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
GaussianMarker: Uncertainty-Aware Copyright Protection of 3D Gaussian Splatting
von: Huang, Xiufeng, et al.
Veröffentlicht: (2024)
von: Huang, Xiufeng, et al.
Veröffentlicht: (2024)
Panoptic Captioning: An Equivalence Bridge for Image and Text
von: Lin, Kun-Yu, et al.
Veröffentlicht: (2025)
von: Lin, Kun-Yu, et al.
Veröffentlicht: (2025)
HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction
von: Bao, Chen, et al.
Veröffentlicht: (2024)
von: Bao, Chen, et al.
Veröffentlicht: (2024)
Align 3D Representation and Text Embedding for 3D Content Personalization
von: Song, Qi, et al.
Veröffentlicht: (2025)
von: Song, Qi, et al.
Veröffentlicht: (2025)
Stereo-GS: Multi-View Stereo Vision Model for Generalizable 3D Gaussian Splatting Reconstruction
von: Huang, Xiufeng, et al.
Veröffentlicht: (2025)
von: Huang, Xiufeng, et al.
Veröffentlicht: (2025)
Geometry Cloak: Preventing TGS-based 3D Reconstruction from Copyrighted Images
von: Song, Qi, et al.
Veröffentlicht: (2024)
von: Song, Qi, et al.
Veröffentlicht: (2024)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
von: Guo, Jiajie, et al.
Veröffentlicht: (2025)
von: Guo, Jiajie, et al.
Veröffentlicht: (2025)
ARCH2S: Dataset, Benchmark and Challenges for Learning Exterior Architectural Structures from Point Clouds
von: Cheung, Ka Lung, et al.
Veröffentlicht: (2024)
von: Cheung, Ka Lung, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
GSPN-2: Efficient Parallel Sequence Modeling
von: Wang, Hongjun, et al.
Veröffentlicht: (2025) -
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
von: Jiang, Yitong, et al.
Veröffentlicht: (2026) -
RegionGPT: Towards Region Understanding Vision Language Model
von: Guo, Qiushan, et al.
Veröffentlicht: (2024) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024) -
COLMAP-Free 3D Gaussian Splatting
von: Fu, Yang, et al.
Veröffentlicht: (2023)