Enregistré dans:
| Auteurs principaux: | Liu, Mingxin, Ma, Shuran, Meng, Shibei, Zhao, Xiangyu, Zhang, Zicheng, Zhang, Shaofeng, Zhong, Zhihang, Chen, Peixian, Cao, Haoyu, Sun, Xing, Duan, Haodong, Yang, Xue |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.05986 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026)
par: Liu, Xiaolin, et autres
Publié: (2026)
Streaming Video Instruction Tuning
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
DreamWorld: Unified World Modeling in Video Generation
par: Tan, Boming, et autres
Publié: (2026)
par: Tan, Boming, et autres
Publié: (2026)
An Empirical Study on How Video-LLMs Answer Video Questions
par: Gou, Chenhui, et autres
Publié: (2025)
par: Gou, Chenhui, et autres
Publié: (2025)
VersusQ: Pairwise Margin Reasoning for Generalizable Video Quality Assessment
par: Meng, Shibei, et autres
Publié: (2026)
par: Meng, Shibei, et autres
Publié: (2026)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models
par: Duan, Zicheng, et autres
Publié: (2026)
par: Duan, Zicheng, et autres
Publié: (2026)
RISE: Self-Improving Robot Policy with Compositional World Model
par: Yang, Jiazhi, et autres
Publié: (2026)
par: Yang, Jiazhi, et autres
Publié: (2026)
VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models
par: Zhang, Xiangdong, et autres
Publié: (2025)
par: Zhang, Xiangdong, et autres
Publié: (2025)
Fast Encoding and Decoding for Implicit Video Representation
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Velocity Disambiguation for Video Frame Interpolation
par: Zhong, Zhihang, et autres
Publié: (2023)
par: Zhong, Zhihang, et autres
Publié: (2023)
iVideoGPT: Interactive VideoGPTs are Scalable World Models
par: Wu, Jialong, et autres
Publié: (2024)
par: Wu, Jialong, et autres
Publié: (2024)
Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
RISE: Rule-Driven SQL Dialect Translation via Query Reduction
par: Xie, Xudong, et autres
Publié: (2026)
par: Xie, Xudong, et autres
Publié: (2026)
SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation
par: Tan, Shanwen, et autres
Publié: (2026)
par: Tan, Shanwen, et autres
Publié: (2026)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
par: Meng, Jiahao, et autres
Publié: (2026)
par: Meng, Jiahao, et autres
Publié: (2026)
Let Your Video Listen to Your Music!
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
Unified Video Action Model
par: Li, Shuang, et autres
Publié: (2025)
par: Li, Shuang, et autres
Publié: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation
par: Zhang, Xiangjun, et autres
Publié: (2025)
par: Zhang, Xiangjun, et autres
Publié: (2025)
GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing
par: Liu, Mingxin, et autres
Publié: (2026)
par: Liu, Mingxin, et autres
Publié: (2026)
Graph2Video: Leveraging Video Models to Model Dynamic Graph Evolution
par: Liu, Hua, et autres
Publié: (2026)
par: Liu, Hua, et autres
Publié: (2026)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
par: Li, Yunhao, et autres
Publié: (2026)
par: Li, Yunhao, et autres
Publié: (2026)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
par: Wei, Xilin, et autres
Publié: (2025)
par: Wei, Xilin, et autres
Publié: (2025)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
par: Liang, Junbang, et autres
Publié: (2024)
par: Liang, Junbang, et autres
Publié: (2024)
Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints
par: Meng, Hao, et autres
Publié: (2026)
par: Meng, Hao, et autres
Publié: (2026)
GMFlow: Global Motion-Guided Recurrent Flow for 6D Object Pose Estimation
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
Geometry-Aware Implicit Memory for Video World Models
par: Wei, Zhengxuan, et autres
Publié: (2026)
par: Wei, Zhengxuan, et autres
Publié: (2026)
Pathwise Test-Time Correction for Autoregressive Long Video Generation
par: Xiang, Xunzhi, et autres
Publié: (2026)
par: Xiang, Xunzhi, et autres
Publié: (2026)
Transformer-based EEG Decoding: A Survey
par: Zhang, Haodong, et autres
Publié: (2025)
par: Zhang, Haodong, et autres
Publié: (2025)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
par: Guo, Zhuoning, et autres
Publié: (2025)
par: Guo, Zhuoning, et autres
Publié: (2025)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
par: Zhu, Xiaorong, et autres
Publié: (2025)
par: Zhu, Xiaorong, et autres
Publié: (2025)
Redundancy Principles for MLLMs Benchmarks
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
Neural Video Compression with Domain Transfer
par: Zhang, Tiange, et autres
Publié: (2026)
par: Zhang, Tiange, et autres
Publié: (2026)
LightMotion: A Light and Tuning-free Method for Simulating Camera Motion in Video Generation
par: Song, Quanjian, et autres
Publié: (2025)
par: Song, Quanjian, et autres
Publié: (2025)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
par: Huang, Haojian, et autres
Publié: (2025)
par: Huang, Haojian, et autres
Publié: (2025)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
Fast Autoregressive Video Generation with Diagonal Decoding
par: Ye, Yang, et autres
Publié: (2025)
par: Ye, Yang, et autres
Publié: (2025)
Documents similaires
-
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026) -
Streaming Video Instruction Tuning
par: Xia, Jiaer, et autres
Publié: (2025) -
DreamWorld: Unified World Modeling in Video Generation
par: Tan, Boming, et autres
Publié: (2026) -
An Empirical Study on How Video-LLMs Answer Video Questions
par: Gou, Chenhui, et autres
Publié: (2025) -
VersusQ: Pairwise Margin Reasoning for Generalizable Video Quality Assessment
par: Meng, Shibei, et autres
Publié: (2026)