Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Haodong, Liu, Shaoteng, Lin, Zhe, Chandraker, Manmohan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tuned Contrastive Learning
par: Animesh, Chaitanya, et autres
Publié: (2023)
par: Animesh, Chaitanya, et autres
Publié: (2023)
Tell, Don't Show!: Language Guidance Eases Transfer Across Domains in Images and Videos
par: Kalluri, Tarun, et autres
Publié: (2024)
par: Kalluri, Tarun, et autres
Publié: (2024)
HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
Locally Orderless Images for Optimization in Differentiable Rendering
par: Mehta, Ishit, et autres
Publié: (2025)
par: Mehta, Ishit, et autres
Publié: (2025)
Drive-1-to-3: Enriching Diffusion Priors for Novel View Synthesis of Real Vehicles
par: Lin, Chuang, et autres
Publié: (2024)
par: Lin, Chuang, et autres
Publié: (2024)
UDA-Bench: Revisiting Common Assumptions in Unsupervised Domain Adaptation Using a Standardized Framework
par: Kalluri, Tarun, et autres
Publié: (2024)
par: Kalluri, Tarun, et autres
Publié: (2024)
Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement
par: Khan, Zaid, et autres
Publié: (2024)
par: Khan, Zaid, et autres
Publié: (2024)
Instantaneous Perception of Moving Objects in 3D
par: Liu, Di, et autres
Publié: (2024)
par: Liu, Di, et autres
Publié: (2024)
Progressive Token Length Scaling in Transformer Encoders for Efficient Universal Segmentation
par: Aich, Abhishek, et autres
Publié: (2024)
par: Aich, Abhishek, et autres
Publié: (2024)
Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
par: Liu, Kunhao, et autres
Publié: (2025)
par: Liu, Kunhao, et autres
Publié: (2025)
Taming Self-Training for Open-Vocabulary Object Detection
par: Zhao, Shiyu, et autres
Publié: (2023)
par: Zhao, Shiyu, et autres
Publié: (2023)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
par: Huang, Xun, et autres
Publié: (2025)
par: Huang, Xun, et autres
Publié: (2025)
HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes
par: Soroco, Mauricio, et autres
Publié: (2026)
par: Soroco, Mauricio, et autres
Publié: (2026)
AutoScape: Geometry-Consistent Long-Horizon Scene Generation
par: Chen, Jiacheng, et autres
Publié: (2025)
par: Chen, Jiacheng, et autres
Publié: (2025)
What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs
par: Aich, Abhishek, et autres
Publié: (2026)
par: Aich, Abhishek, et autres
Publié: (2026)
DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
par: Ye, Bo, et autres
Publié: (2026)
par: Ye, Bo, et autres
Publié: (2026)
LidaRF: Delving into Lidar for Neural Radiance Field on Street Scenes
par: Sun, Shanlin, et autres
Publié: (2024)
par: Sun, Shanlin, et autres
Publié: (2024)
PhyCo: Learning Controllable Physical Priors for Generative Motion
par: Narayanan, Sriram, et autres
Publié: (2026)
par: Narayanan, Sriram, et autres
Publié: (2026)
iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
par: Yao, Manyi, et autres
Publié: (2025)
par: Yao, Manyi, et autres
Publié: (2025)
Open-world Instance Segmentation: Top-down Learning with Bottom-up Supervision
par: Kalluri, Tarun, et autres
Publié: (2023)
par: Kalluri, Tarun, et autres
Publié: (2023)
Train Short, Inference Long: Training-free Horizon Extension for Autoregressive Video Generation
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
Generating Enhanced Negatives for Training Language-Based Object Detectors
par: Zhao, Shiyu, et autres
Publié: (2023)
par: Zhao, Shiyu, et autres
Publié: (2023)
LLM-Assist: Enhancing Closed-Loop Planning with Language-Based Reasoning
par: Sharan, S P, et autres
Publié: (2023)
par: Sharan, S P, et autres
Publié: (2023)
RAD-LAD: Rule and Language Grounded Autonomous Driving in Real-Time
par: Ghosh, Anurag, et autres
Publié: (2026)
par: Ghosh, Anurag, et autres
Publié: (2026)
LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents
par: He, Yun, et autres
Publié: (2025)
par: He, Yun, et autres
Publié: (2025)
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
par: Guo, Yuwei, et autres
Publié: (2025)
par: Guo, Yuwei, et autres
Publié: (2025)
Training-Free Open-Ended Object Detection and Segmentation via Attention as Prompts
par: Lin, Zhiwei, et autres
Publié: (2024)
par: Lin, Zhiwei, et autres
Publié: (2024)
NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code
par: Jain, Seemandhar, et autres
Publié: (2026)
par: Jain, Seemandhar, et autres
Publié: (2026)
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
par: Hu, Panwen, et autres
Publié: (2025)
par: Hu, Panwen, et autres
Publié: (2025)
Image-Specific Adaptation of Transformer Encoders for Compute-Efficient Segmentation
par: Yao, Manyi, et autres
Publié: (2024)
par: Yao, Manyi, et autres
Publié: (2024)
Pathwise Test-Time Correction for Autoregressive Long Video Generation
par: Xiang, Xunzhi, et autres
Publié: (2026)
par: Xiang, Xunzhi, et autres
Publié: (2026)
Generative Video Propagation
par: Liu, Shaoteng, et autres
Publié: (2024)
par: Liu, Shaoteng, et autres
Publié: (2024)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
par: Liu, Ye, et autres
Publié: (2024)
par: Liu, Ye, et autres
Publié: (2024)
Training-Free Efficient Video Generation via Dynamic Token Carving
par: Zhang, Yuechen, et autres
Publié: (2025)
par: Zhang, Yuechen, et autres
Publié: (2025)
Efficient Autoregressive Video Diffusion with Dummy Head
par: Guo, Hang, et autres
Publié: (2026)
par: Guo, Hang, et autres
Publié: (2026)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
par: Chen, Xiuyuan, et autres
Publié: (2023)
par: Chen, Xiuyuan, et autres
Publié: (2023)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
par: Liang, Tianming, et autres
Publié: (2024)
par: Liang, Tianming, et autres
Publié: (2024)
Entropy-Guided k-Guard Sampling for Long-Horizon Autoregressive Video Generation
par: Han, Yizhao, et autres
Publié: (2026)
par: Han, Yizhao, et autres
Publié: (2026)
SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries
par: Chang, Wei-Jer, et autres
Publié: (2023)
par: Chang, Wei-Jer, et autres
Publié: (2023)
Single Image Rolling Shutter Removal with Diffusion Models
par: Yang, Zhanglei, et autres
Publié: (2024)
par: Yang, Zhanglei, et autres
Publié: (2024)
Documents similaires
-
Tuned Contrastive Learning
par: Animesh, Chaitanya, et autres
Publié: (2023) -
Tell, Don't Show!: Language Guidance Eases Transfer Across Domains in Images and Videos
par: Kalluri, Tarun, et autres
Publié: (2024) -
HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles
par: Wang, Yifan, et autres
Publié: (2026) -
Locally Orderless Images for Optimization in Differentiable Rendering
par: Mehta, Ishit, et autres
Publié: (2025) -
Drive-1-to-3: Enriching Diffusion Priors for Novel View Synthesis of Real Vehicles
par: Lin, Chuang, et autres
Publié: (2024)