UniVG: Towards UNIfied-modal Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ruan, Ludan, Tian, Lei, Huang, Chuanwei, Zhang, Xu, Xiao, Xinyan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025)
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
di: Bai, Sule, et al.
Pubblicazione: (2025)
di: Bai, Sule, et al.
Pubblicazione: (2025)
UNICBench: UNIfied Counting Benchmark for MLLM
di: Rong, Chenggang, et al.
Pubblicazione: (2026)
di: Rong, Chenggang, et al.
Pubblicazione: (2026)
S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix
di: Dai, Peng, et al.
Pubblicazione: (2025)
di: Dai, Peng, et al.
Pubblicazione: (2025)
UNICON: UNIfied CONtinual Learning for Medical Foundational Models
di: Qazi, Mohammad Areeb, et al.
Pubblicazione: (2025)
di: Qazi, Mohammad Areeb, et al.
Pubblicazione: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
di: Du, Yang, et al.
Pubblicazione: (2025)
di: Du, Yang, et al.
Pubblicazione: (2025)
LLM4VG: Large Language Models Evaluation for Video Grounding
di: Feng, Wei, et al.
Pubblicazione: (2023)
di: Feng, Wei, et al.
Pubblicazione: (2023)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
di: Dai, Ming, et al.
Pubblicazione: (2024)
di: Dai, Ming, et al.
Pubblicazione: (2024)
UniVBench: Towards Unified Evaluation for Video Foundation Models
di: Wei, Jianhui, et al.
Pubblicazione: (2026)
di: Wei, Jianhui, et al.
Pubblicazione: (2026)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models
di: Hao, Jitai, et al.
Pubblicazione: (2025)
di: Hao, Jitai, et al.
Pubblicazione: (2025)
VG-SSL: Benchmarking Self-supervised Representation Learning Approaches for Visual Geo-localization
di: Xiao, Jiuhong, et al.
Pubblicazione: (2023)
di: Xiao, Jiuhong, et al.
Pubblicazione: (2023)
Unveiling the Black Box: Independent Functional Module Evaluation for Bird's-Eye-View Perception Model
di: Zhang, Ludan, et al.
Pubblicazione: (2024)
di: Zhang, Ludan, et al.
Pubblicazione: (2024)
UniVS: Unified and Universal Video Segmentation with Prompts as Queries
di: Li, Minghan, et al.
Pubblicazione: (2024)
di: Li, Minghan, et al.
Pubblicazione: (2024)
UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition
di: Lei, Guojun, et al.
Pubblicazione: (2025)
di: Lei, Guojun, et al.
Pubblicazione: (2025)
UniMapGen: A Generative Framework for Large-Scale Map Construction from Multi-modal Data
di: Yuan, Yujian, et al.
Pubblicazione: (2025)
di: Yuan, Yujian, et al.
Pubblicazione: (2025)
UniVid: Pyramid Diffusion Model for High Quality Video Generation
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
EndoMamba: An Efficient Foundation Model for Endoscopic Videos via Hierarchical Pre-training
di: Tian, Qingyao, et al.
Pubblicazione: (2025)
di: Tian, Qingyao, et al.
Pubblicazione: (2025)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
di: Qin, Luozheng, et al.
Pubblicazione: (2026)
di: Qin, Luozheng, et al.
Pubblicazione: (2026)
UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation
di: Sun, Yang-Tian, et al.
Pubblicazione: (2025)
di: Sun, Yang-Tian, et al.
Pubblicazione: (2025)
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
di: Chen, Houyuan, et al.
Pubblicazione: (2026)
di: Chen, Houyuan, et al.
Pubblicazione: (2026)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
Feature Map Convergence Evaluation for Functional Module
di: Zhang, Ludan, et al.
Pubblicazione: (2024)
di: Zhang, Ludan, et al.
Pubblicazione: (2024)
UniCtrl: Improving the Spatiotemporal Consistency of Text-to-Video Diffusion Models via Training-Free Unified Attention Control
di: Xia, Tian, et al.
Pubblicazione: (2024)
di: Xia, Tian, et al.
Pubblicazione: (2024)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
Token Entropy Regularization for Multi-modal Antenna Affiliation Identification
di: Chen, Dong, et al.
Pubblicazione: (2026)
di: Chen, Dong, et al.
Pubblicazione: (2026)
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
UniPLV: Towards Label-Efficient Open-World 3D Scene Understanding by Regional Visual Language Supervision
di: Wang, Yuru, et al.
Pubblicazione: (2024)
di: Wang, Yuru, et al.
Pubblicazione: (2024)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
Uni-Animator: Towards Unified Visual Colorization
di: Chen, Xinyuan, et al.
Pubblicazione: (2026)
di: Chen, Xinyuan, et al.
Pubblicazione: (2026)
Decoupled Functional Evaluation of Autonomous Driving Models via Feature Map Quality Scoring
di: Zhang, Ludan, et al.
Pubblicazione: (2025)
di: Zhang, Ludan, et al.
Pubblicazione: (2025)
UniMIC: Towards Universal Multi-modality Perceptual Image Compression
di: Gao, Yixin, et al.
Pubblicazione: (2024)
di: Gao, Yixin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025) -
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
di: Bai, Sule, et al.
Pubblicazione: (2025) -
UNICBench: UNIfied Counting Benchmark for MLLM
di: Rong, Chenggang, et al.
Pubblicazione: (2026) -
S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix
di: Dai, Peng, et al.
Pubblicazione: (2025) -
UNICON: UNIfied CONtinual Learning for Medical Foundational Models
di: Qazi, Mohammad Areeb, et al.
Pubblicazione: (2025)