Geometry-Aware Rotary Position Embedding for Consistent Video World Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiang, Chendong, Liu, Jiajun, Zhang, Jintao, Yang, Xiao, Fang, Zhengwei, Wang, Shizun, Wang, Zijun, Zou, Yingtian, Su, Hang, Zhu, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DoPE: Denoising Rotary Position Embedding
por: Xiong, Jing, et al.
Publicado: (2025)
por: Xiong, Jing, et al.
Publicado: (2025)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
MrRoPE: Mixed-radix Rotary Position Embedding
por: Tian, Qingyuan, et al.
Publicado: (2026)
por: Tian, Qingyuan, et al.
Publicado: (2026)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
por: Wei, Xilin, et al.
Publicado: (2025)
por: Wei, Xilin, et al.
Publicado: (2025)
Selective Rotary Position Embedding
por: Movahedi, Sajad, et al.
Publicado: (2025)
por: Movahedi, Sajad, et al.
Publicado: (2025)
GFlow: Recovering 4D World from Monocular Video
por: Wang, Shizun, et al.
Publicado: (2024)
por: Wang, Shizun, et al.
Publicado: (2024)
Rotary Position Embedding for Vision Transformer
por: Heo, Byeongho, et al.
Publicado: (2024)
por: Heo, Byeongho, et al.
Publicado: (2024)
Context-aware Rotary Position Embedding
por: Veisi, Ali, et al.
Publicado: (2025)
por: Veisi, Ali, et al.
Publicado: (2025)
VRoPE: Rotary Position Embedding for Video Large Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization
por: Wang, Xiaoqi, et al.
Publicado: (2025)
por: Wang, Xiaoqi, et al.
Publicado: (2025)
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
por: Wu, Haoyu, et al.
Publicado: (2026)
por: Wu, Haoyu, et al.
Publicado: (2026)
Efficient Matrix Implementation for Rotary Position Embedding
por: Minqi, Chen, et al.
Publicado: (2026)
por: Minqi, Chen, et al.
Publicado: (2026)
Geometry-Aware Implicit Memory for Video World Models
por: Wei, Zhengxuan, et al.
Publicado: (2026)
por: Wei, Zhengxuan, et al.
Publicado: (2026)
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
por: Liu, Haoyu, et al.
Publicado: (2026)
por: Liu, Haoyu, et al.
Publicado: (2026)
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
por: Feng, Yao, et al.
Publicado: (2025)
por: Feng, Yao, et al.
Publicado: (2025)
Benchmarking Rotary Position Embeddings for Automatic Speech Recognition
por: Zhang, Shucong, et al.
Publicado: (2025)
por: Zhang, Shucong, et al.
Publicado: (2025)
CRoPE: Efficient Parametrization of Rotary Positional Embedding
por: Lou, Beicheng, et al.
Publicado: (2026)
por: Lou, Beicheng, et al.
Publicado: (2026)
Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
por: Bao, Fan, et al.
Publicado: (2024)
por: Bao, Fan, et al.
Publicado: (2024)
DRoPE: Directional Rotary Position Embedding for Efficient Agent Interaction Modeling
por: Zhao, Jianbo, et al.
Publicado: (2025)
por: Zhao, Jianbo, et al.
Publicado: (2025)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
por: Yang, Xiao, et al.
Publicado: (2025)
por: Yang, Xiao, et al.
Publicado: (2025)
Make Geometry Matter for Spatial Reasoning
por: Zhang, Shihua, et al.
Publicado: (2026)
por: Zhang, Shihua, et al.
Publicado: (2026)
PanoWorld: Geometry-Consistent Panoramic Video World Modeling
por: Jiang, Le, et al.
Publicado: (2026)
por: Jiang, Le, et al.
Publicado: (2026)
Cross-Axis Transformer with 3D Rotary Positional Embeddings
por: Erickson, Lily
Publicado: (2023)
por: Erickson, Lily
Publicado: (2023)
GemDepth: Geometry-Embedded Features for 3D-Consistent Video Depth
por: Liu, Yuecheng, et al.
Publicado: (2026)
por: Liu, Yuecheng, et al.
Publicado: (2026)
A Grooved Disk Rotary Coupler for Brushless Excitation in 15 kW Wound‐Field Synchronous Machines
por: Pan Sun, et al.
Publicado: (2026)
por: Pan Sun, et al.
Publicado: (2026)
RoTHP: Rotary Position Embedding-based Transformer Hawkes Process
por: Gao, Anningzhe, et al.
Publicado: (2024)
por: Gao, Anningzhe, et al.
Publicado: (2024)
RoPETR: Improving Temporal Camera-Only 3D Detection by Integrating Enhanced Rotary Position Embedding
por: Ji, Hang, et al.
Publicado: (2025)
por: Ji, Hang, et al.
Publicado: (2025)
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
por: Zhao, Min, et al.
Publicado: (2024)
por: Zhao, Min, et al.
Publicado: (2024)
StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
por: Xing, Ke, et al.
Publicado: (2025)
por: Xing, Ke, et al.
Publicado: (2025)
Vidarc: Embodied Video Diffusion Model for Closed-loop Control
por: Feng, Yao, et al.
Publicado: (2025)
por: Feng, Yao, et al.
Publicado: (2025)
WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
por: Fang, Shaoheng, et al.
Publicado: (2025)
por: Fang, Shaoheng, et al.
Publicado: (2025)
A$^2$ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantization
por: He, Junhui, et al.
Publicado: (2025)
por: He, Junhui, et al.
Publicado: (2025)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
por: Zhang, Jintao, et al.
Publicado: (2025)
por: Zhang, Jintao, et al.
Publicado: (2025)
FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception
por: Ahuja, Rahul, et al.
Publicado: (2026)
por: Ahuja, Rahul, et al.
Publicado: (2026)
RotorMap and Quantum Fingerprints of DNA Sequences via Rotary Position Embeddings
por: Yakymenko, Danylo, et al.
Publicado: (2026)
por: Yakymenko, Danylo, et al.
Publicado: (2026)
Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs
por: Liu, Xiaoran, et al.
Publicado: (2025)
por: Liu, Xiaoran, et al.
Publicado: (2025)
Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)
por: Kung, Gustavo Chau Loo, et al.
Publicado: (2026)
por: Kung, Gustavo Chau Loo, et al.
Publicado: (2026)
CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model
por: Wang, Zhengyi, et al.
Publicado: (2024)
por: Wang, Zhengyi, et al.
Publicado: (2024)
Rotary Position Encodings for Graphs
por: Reid, Isaac, et al.
Publicado: (2025)
por: Reid, Isaac, et al.
Publicado: (2025)
FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction
por: Dai, Yixiang, et al.
Publicado: (2025)
por: Dai, Yixiang, et al.
Publicado: (2025)
Ejemplares similares
-
DoPE: Denoising Rotary Position Embedding
por: Xiong, Jing, et al.
Publicado: (2025) -
Length-Aware Rotary Position Embedding for Text-Speech Alignment
por: Kim, Hyeongju, et al.
Publicado: (2025) -
MrRoPE: Mixed-radix Rotary Position Embedding
por: Tian, Qingyuan, et al.
Publicado: (2026) -
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
por: Wei, Xilin, et al.
Publicado: (2025) -
Selective Rotary Position Embedding
por: Movahedi, Sajad, et al.
Publicado: (2025)