SAMPO:Scale-wise Autoregression with Motion PrOmpt for generative world models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Sen, Tian, Jingyi, Wang, Le, Liao, Zhimin, Li, Jiayi, Dong, Huaiyi, Xia, Kun, Zhou, Sanping, Tang, Wei, Gang, Hua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation
por: Tian, Jingyi, et al.
Publicado: (2025)
por: Tian, Jingyi, et al.
Publicado: (2025)
Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning
por: Wang, Sen, et al.
Publicado: (2026)
por: Wang, Sen, et al.
Publicado: (2026)
Boosting Semi-Supervised Temporal Action Localization by Learning from Non-Target Classes
por: Xia, Kun, et al.
Publicado: (2024)
por: Xia, Kun, et al.
Publicado: (2024)
FlowRAM: Grounding Flow Matching Policy with Region-Aware Mamba Framework for Robotic Manipulation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding
por: Sun, Xiaolong, et al.
Publicado: (2024)
por: Sun, Xiaolong, et al.
Publicado: (2024)
Moment Quantization for Video Temporal Grounding
por: Sun, Xiaolong, et al.
Publicado: (2025)
por: Sun, Xiaolong, et al.
Publicado: (2025)
Recurrent Aligned Network for Generalized Pedestrian Trajectory Prediction
por: Dong, Yonghao, et al.
Publicado: (2024)
por: Dong, Yonghao, et al.
Publicado: (2024)
RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation
por: Qin, Zheng, et al.
Publicado: (2025)
por: Qin, Zheng, et al.
Publicado: (2025)
Towards Generalizable Multi-Object Tracking
por: Qin, Zheng, et al.
Publicado: (2024)
por: Qin, Zheng, et al.
Publicado: (2024)
LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
por: Wu, Yuxuan, et al.
Publicado: (2025)
por: Wu, Yuxuan, et al.
Publicado: (2025)
Embracing Aleatoric Uncertainty: Generating Diverse 3D Human Motion
por: Qin, Zheng, et al.
Publicado: (2025)
por: Qin, Zheng, et al.
Publicado: (2025)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
por: Zhou, Gengze, et al.
Publicado: (2025)
por: Zhou, Gengze, et al.
Publicado: (2025)
SCALAR: Scale-wise Controllable Visual Autoregressive Learning
por: Xu, Ryan, et al.
Publicado: (2025)
por: Xu, Ryan, et al.
Publicado: (2025)
LayerPeeler: Autoregressive Peeling for Layer-wise Image Vectorization
por: Wu, Ronghuan, et al.
Publicado: (2025)
por: Wu, Ronghuan, et al.
Publicado: (2025)
SAMPO-Path: Segmentation Intent-Aligned Preference Optimization for Pathology Foundation Model Segmentation
por: Wu, Yonghuang, et al.
Publicado: (2025)
por: Wu, Yonghuang, et al.
Publicado: (2025)
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
por: Liu, Zeyang, et al.
Publicado: (2025)
por: Liu, Zeyang, et al.
Publicado: (2025)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
Autoregressive Images Watermarking through Lexical Biasing: An Approach Resistant to Regeneration Attack
por: Hui, Siqi, et al.
Publicado: (2025)
por: Hui, Siqi, et al.
Publicado: (2025)
ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation
por: Hwang, Inwoo, et al.
Publicado: (2026)
por: Hwang, Inwoo, et al.
Publicado: (2026)
PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning
por: Li, Yizhe, et al.
Publicado: (2025)
por: Li, Yizhe, et al.
Publicado: (2025)
PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation
por: Gao, Ning, et al.
Publicado: (2024)
por: Gao, Ning, et al.
Publicado: (2024)
Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection
por: Tang, Canhui, et al.
Publicado: (2025)
por: Tang, Canhui, et al.
Publicado: (2025)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
A Training-Free Style-aligned Image Generation with Scale-wise Autoregressive Model
por: Park, Jihun, et al.
Publicado: (2025)
por: Park, Jihun, et al.
Publicado: (2025)
ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation Model
por: Lu, Shunlin, et al.
Publicado: (2024)
por: Lu, Shunlin, et al.
Publicado: (2024)
Next-Scale Autoregressive Models for Text-to-Motion Generation
por: Zheng, Zhiwei, et al.
Publicado: (2026)
por: Zheng, Zhiwei, et al.
Publicado: (2026)
Markovian Scale Prediction: A New Era of Visual Autoregressive Generation
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
por: Li, Bohan, et al.
Publicado: (2025)
por: Li, Bohan, et al.
Publicado: (2025)
GATS: Gaussian Aware Temporal Scaling Transformer for Invariant 4D Spatio-Temporal Point Cloud Representation
por: Tian, Jiayi, et al.
Publicado: (2026)
por: Tian, Jiayi, et al.
Publicado: (2026)
Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity
por: Tian, Jiahao, et al.
Publicado: (2026)
por: Tian, Jiahao, et al.
Publicado: (2026)
Referencing Where to Focus: Improving VisualGrounding with Referential Query
por: Wang, Yabing, et al.
Publicado: (2024)
por: Wang, Yabing, et al.
Publicado: (2024)
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
por: Wang, Yabing, et al.
Publicado: (2025)
por: Wang, Yabing, et al.
Publicado: (2025)
MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent
por: Liao, Xinyao, et al.
Publicado: (2025)
por: Liao, Xinyao, et al.
Publicado: (2025)
Not Bowing Down Thine Ear: Underestimating Observers' Impression After Seeking Help From People With Less Competence
por: Tian Qiu, et al.
Publicado: (2025)
por: Tian Qiu, et al.
Publicado: (2025)
Coordinate-Based Dual-Constrained Autoregressive Motion Generation
por: Ding, Kang, et al.
Publicado: (2026)
por: Ding, Kang, et al.
Publicado: (2026)
A model of mass generation
por: Xia, Li-Gang
Publicado: (2025)
por: Xia, Li-Gang
Publicado: (2025)
BAMM: Bidirectional Autoregressive Motion Model
por: Pinyoanuntapong, Ekkasit, et al.
Publicado: (2024)
por: Pinyoanuntapong, Ekkasit, et al.
Publicado: (2024)
Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
por: Niu, Ye, et al.
Publicado: (2025)
por: Niu, Ye, et al.
Publicado: (2025)
Advancing Pre-trained Teacher: Towards Robust Feature Discrepancy for Anomaly Detection
por: Tang, Canhui, et al.
Publicado: (2024)
por: Tang, Canhui, et al.
Publicado: (2024)
Ejemplares similares
-
DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation
por: Tian, Jingyi, et al.
Publicado: (2025) -
Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning
por: Wang, Sen, et al.
Publicado: (2026) -
Boosting Semi-Supervised Temporal Action Localization by Learning from Non-Target Classes
por: Xia, Kun, et al.
Publicado: (2024) -
FlowRAM: Grounding Flow Matching Policy with Region-Aware Mamba Framework for Robotic Manipulation
por: Wang, Sen, et al.
Publicado: (2025) -
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
por: Wang, Yu, et al.
Publicado: (2024)