CyberV: Cybernetics for Test-time Scaling in Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Meng, Jiahao, Sun, Shuyang, Tan, Yue, Qi, Lu, Tong, Yunhai, Li, Xiangtai, Wen, Longyin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
par: Shi, Qingyu, et autres
Publié: (2025)
par: Shi, Qingyu, et autres
Publié: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
par: Yuan, Haobo, et autres
Publié: (2025)
par: Yuan, Haobo, et autres
Publié: (2025)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
par: Meng, Jiahao, et autres
Publié: (2026)
par: Meng, Jiahao, et autres
Publié: (2026)
SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified Flow
par: Wang, Chaoyang, et autres
Publié: (2024)
par: Wang, Chaoyang, et autres
Publié: (2024)
DreamRelation: Bridging Customization and Relation Generation
par: Shi, Qingyu, et autres
Publié: (2024)
par: Shi, Qingyu, et autres
Publié: (2024)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
par: Xu, Lu, et autres
Publié: (2024)
par: Xu, Lu, et autres
Publié: (2024)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
MotionBooth: Motion-Aware Customized Text-to-Video Generation
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
VG4D: Vision-Language Model Goes 4D Video Recognition
par: Deng, Zhichao, et autres
Publié: (2024)
par: Deng, Zhichao, et autres
Publié: (2024)
Explore In-Context Segmentation via Latent Diffusion Models
par: Wang, Chaoyang, et autres
Publié: (2024)
par: Wang, Chaoyang, et autres
Publié: (2024)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
par: Xu, Shilin, et autres
Publié: (2023)
par: Xu, Shilin, et autres
Publié: (2023)
Vidi: Large Multimodal Models for Video Understanding and Editing
par: Vidi Team, et autres
Publié: (2025)
par: Vidi Team, et autres
Publié: (2025)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
par: Zhou, Yikang, et autres
Publié: (2025)
par: Zhou, Yikang, et autres
Publié: (2025)
Video Prediction Transformers without Recurrence or Convolution
par: Tang, Yujin, et autres
Publié: (2024)
par: Tang, Yujin, et autres
Publié: (2024)
One-Step Distillation of Discrete Diffusion Image Generators via Fixed-Point Iteration
par: Wang, Chaoyang, et autres
Publié: (2026)
par: Wang, Chaoyang, et autres
Publié: (2026)
Dense360: Dense Understanding from Omnidirectional Panoramas
par: Zhou, Yikang, et autres
Publié: (2025)
par: Zhou, Yikang, et autres
Publié: (2025)
Thought Graph Traversal for Test-time Scaling in Chest X-ray VLLMs
par: Yao, Yue, et autres
Publié: (2025)
par: Yao, Yue, et autres
Publié: (2025)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
Unified Dense Prediction of Video Diffusion
par: Yang, Lehan, et autres
Publié: (2025)
par: Yang, Lehan, et autres
Publié: (2025)
Generative Classifier for Domain Generalization
par: Long, Shaocong, et autres
Publié: (2025)
par: Long, Shaocong, et autres
Publié: (2025)
RecTok: Reconstruction Distillation along Rectified Flow
par: Shi, Qingyu, et autres
Publié: (2025)
par: Shi, Qingyu, et autres
Publié: (2025)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
par: Li, Jiachen, et autres
Publié: (2024)
par: Li, Jiachen, et autres
Publié: (2024)
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
DC-SAM: In-Context Segment Anything in Images and Videos via Dual Consistency
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
Edit3K: Universal Representation Learning for Video Editing Components
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023)
par: Shen, Yaojie, et autres
Publié: (2023)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
par: Chen, Guo, et autres
Publié: (2024)
par: Chen, Guo, et autres
Publié: (2024)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
par: Li, Bingxuan, et autres
Publié: (2025)
par: Li, Bingxuan, et autres
Publié: (2025)
V-CORE: Temporally Consistent Video Understanding for Video-LLM
par: Kang, Zhengjian, et autres
Publié: (2026)
par: Kang, Zhengjian, et autres
Publié: (2026)
RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
par: Deng, Andong, et autres
Publié: (2026)
par: Deng, Andong, et autres
Publié: (2026)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
par: Kuo, Chia-Wen, et autres
Publié: (2025)
par: Kuo, Chia-Wen, et autres
Publié: (2025)
BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation
par: Wen, Haiquan, et autres
Publié: (2025)
par: Wen, Haiquan, et autres
Publié: (2025)
PanopticPartFormer++: A Unified and Decoupled View for Panoptic Part Segmentation
par: Li, Xiangtai, et autres
Publié: (2023)
par: Li, Xiangtai, et autres
Publié: (2023)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
par: Wu, Jianzong, et autres
Publié: (2025)
par: Wu, Jianzong, et autres
Publié: (2025)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
par: Feng, Haoran, et autres
Publié: (2025)
par: Feng, Haoran, et autres
Publié: (2025)
Documents similaires
-
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
par: Shi, Qingyu, et autres
Publié: (2025) -
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025) -
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
par: Yuan, Haobo, et autres
Publié: (2025) -
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
par: Meng, Jiahao, et autres
Publié: (2026) -
SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified Flow
par: Wang, Chaoyang, et autres
Publié: (2024)