Vidi2.5: Large Multimodal Models for Video Understanding and Creation
Fuente:
arXiv
Saved in:
| Main Authors: | Vidi Team, Kuo, Chia-Wen, Huang, Chuang, Du, Dawei, Chen, Fan, Lei, Fanding, Gao, Feng, Chen, Guang, Zhang, Haoji, Zhao, Haojun, Liu, Jin, Zhuge, Jingjing, Fang, Lili, Zhang, Lingxi, Wen, Longyin, Guo, Lu, Xu, Lu, Li, Lusha, Fan, Qihang, Deng, Rachel, Fang, Shaobo, Zhang, Shu, Zhu, Sijie, Siew, Stuart, Tao, Weiyan, Zhong, Wen, Shen, Xiaohui, Gu, Xin, Yuan, Ye, He, Yicheng, Cui, Yiming, Chen, Zhenfang, Wu, Zhihua, Lin, Zuhua |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vidi: Large Multimodal Models for Video Understanding and Editing
by: Vidi Team, et al.
Published: (2025)
by: Vidi Team, et al.
Published: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
by: Gu, Xin, et al.
Published: (2025)
by: Gu, Xin, et al.
Published: (2025)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
by: Deng, Andong, et al.
Published: (2026)
by: Deng, Andong, et al.
Published: (2026)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
by: Kuo, Chia-Wen, et al.
Published: (2025)
by: Kuo, Chia-Wen, et al.
Published: (2025)
Multi-Reward as Condition for Instruction-based Image Editing
by: Gu, Xin, et al.
Published: (2024)
by: Gu, Xin, et al.
Published: (2024)
Edit3K: Universal Representation Learning for Video Editing Components
by: Gu, Xin, et al.
Published: (2024)
by: Gu, Xin, et al.
Published: (2024)
SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
by: Li, Ming, et al.
Published: (2025)
by: Li, Ming, et al.
Published: (2025)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
by: Li, Jiachen, et al.
Published: (2024)
by: Li, Jiachen, et al.
Published: (2024)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
by: Xu, Lu, et al.
Published: (2024)
by: Xu, Lu, et al.
Published: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
by: Xing, Xiaoying, et al.
Published: (2025)
by: Xing, Xiaoying, et al.
Published: (2025)
From “Striving to Survive” to “Striving to Thrive”: A Narrative Inquiry Into a Student's Motivational Development via Translanguaging in EAP and EMI Contexts
by: Yihai Wen, et al.
Published: (2026)
by: Yihai Wen, et al.
Published: (2026)
Referring Layer Decomposition
by: Chen, Fangyi, et al.
Published: (2026)
by: Chen, Fangyi, et al.
Published: (2026)
Accurate and Fast Compressed Video Captioning
by: Shen, Yaojie, et al.
Published: (2023)
by: Shen, Yaojie, et al.
Published: (2023)
Toward Real-World Chinese Psychological Support Dialogues: CPsDD Dataset and a Co-Evolving Multi-Agent System
by: Shi, Yuanchen, et al.
Published: (2025)
by: Shi, Yuanchen, et al.
Published: (2025)
Multi-Hop Question Generation via Dual-Perspective Keyword Guidance
by: Li, Maodong, et al.
Published: (2025)
by: Li, Maodong, et al.
Published: (2025)
Unraveling the Emotions of an English as a Foreign Language Teacher and Their Impact on Professional Identity in Teaching Reform
by: Wen Liu, et al.
Published: (2025)
by: Wen Liu, et al.
Published: (2025)
AIPO: Improving Training Objective for Iterative Preference Optimization
by: Shen, Yaojie, et al.
Published: (2024)
by: Shen, Yaojie, et al.
Published: (2024)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
by: Li, Bingxuan, et al.
Published: (2025)
by: Li, Bingxuan, et al.
Published: (2025)
Chinese young adults' emotion regulation and conflict resolution response profiles, and their associations with perceived partner responsiveness and romantic relationship satisfaction
by: Lu Ran Zhang, et al.
Published: (2024)
by: Lu Ran Zhang, et al.
Published: (2024)
The Equation of State of Neutron Stars: Theoretical Models, Observational Constraints, and Future Perspectives
by: Ji, Zuhua, et al.
Published: (2025)
by: Ji, Zuhua, et al.
Published: (2025)
Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering
by: Zhang, Yichi, et al.
Published: (2023)
by: Zhang, Yichi, et al.
Published: (2023)
Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction
by: Ye, Yuanchang, et al.
Published: (2025)
by: Ye, Yuanchang, et al.
Published: (2025)
i‐Tac: Inverse Design of 3D‐Printed Tactile Elastomers with Tuneable Optical and Mechanical Properties
by: Wen Fan, et al.
Published: (2026)
by: Wen Fan, et al.
Published: (2026)
i-Tac: Inverse Design of 3D-Printed Tactile Elastomers with Scalable and Tunable Optical and Mechanical Properties
by: Fan, Wen, et al.
Published: (2026)
by: Fan, Wen, et al.
Published: (2026)
Impact of Stickers on Multimodal Sentiment and Intent in Social Media: A New Task, Dataset and Baseline
by: Shi, Yuanchen, et al.
Published: (2024)
by: Shi, Yuanchen, et al.
Published: (2024)
Insights into Neutron Star Matter: EoS Models and Observations
by: Ji, Zuhua, et al.
Published: (2025)
by: Ji, Zuhua, et al.
Published: (2025)
Dietary Chlorogenic Acid Improved Muscle Quality, Antioxidant Capacity, and Pro‐Inflammatory Responses of Blackspotted Croaker Protonibea diacanthus
by: Haoran Zhang, et al.
Published: (2024)
by: Haoran Zhang, et al.
Published: (2024)
Bushen Xiaozheng Decoction Improves Immunosuppression in a Rat Model of Endometriosis by Reducing IL‐10 and TGF‐ β Levels
by: Feng Chen, et al.
Published: (2026)
by: Feng Chen, et al.
Published: (2026)
A Map Segmentation Method Based on Image Processing for Robot Complete Coverage Operation
by: Haojun Si, et al.
Published: (2025)
by: Haojun Si, et al.
Published: (2025)
Cholecystokinin‐mediated effect of insulin pathway on the steroidogenic activity of follicular granulosa cells in Camelus bactrianus: In vitro study
by: Lusha Guo, et al.
Published: (2024)
by: Lusha Guo, et al.
Published: (2024)
Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification
by: Wen, Wen, et al.
Published: (2026)
by: Wen, Wen, et al.
Published: (2026)
Surgi-HDTMR: Closing the Sensorimotor Loop in Bimanual Microsurgery via Haptics, Digital Twin, and Mixed Reality
by: Ping, Songming, et al.
Published: (2026)
by: Ping, Songming, et al.
Published: (2026)
Structured Context Learning for Generic Event Boundary Detection
by: Gu, Xin, et al.
Published: (2025)
by: Gu, Xin, et al.
Published: (2025)
Network Analysis of Internet Addiction, Online Social Anxiety, Fear of Missing Out, and Interpersonal Sensitivity among Chinese University Students
by: Xinyi Zhu, et al.
Published: (2024)
by: Xinyi Zhu, et al.
Published: (2024)
Screening of Imidazole‐Based Catalysts Through Model Reactions for Efficient Polymerization of AB ‐Type Polybenzoxazole Monomers and Investigation of the Catalytic Mechanism
by: Qinglong Zhang, et al.
Published: (2026)
by: Qinglong Zhang, et al.
Published: (2026)
On Non-asymptotic Theory of Recurrent Neural Networks in Temporal Point Processes
by: Chen, Zhiheng, et al.
Published: (2024)
by: Chen, Zhiheng, et al.
Published: (2024)
Revisit and Outstrip Entity Alignment: A Perspective of Generative Models
by: Guo, Lingbing, et al.
Published: (2023)
by: Guo, Lingbing, et al.
Published: (2023)
Unveiling quantum criticality of disordered Aubry-André-Harper models via typical fidelity susceptibility
by: Yi, Tian-Cheng, et al.
Published: (2025)
by: Yi, Tian-Cheng, et al.
Published: (2025)
Mimicking Pain Conditioning Using an Electrolyte‐Gated Organic Synaptic Transistor
by: Zhihua Xu, et al.
Published: (2024)
by: Zhihua Xu, et al.
Published: (2024)
Convex Hulls of Dragon Curves
by: Wen, Fan
Published: (2022)
by: Wen, Fan
Published: (2022)
Similar Items
-
Vidi: Large Multimodal Models for Video Understanding and Editing
by: Vidi Team, et al.
Published: (2025) -
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
by: Gu, Xin, et al.
Published: (2025) -
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
by: Deng, Andong, et al.
Published: (2026) -
D-Attn: Decomposed Attention for Large Vision-and-Language Models
by: Kuo, Chia-Wen, et al.
Published: (2025) -
Multi-Reward as Condition for Instruction-based Image Editing
by: Gu, Xin, et al.
Published: (2024)