Guardado en:
| Autores principales: | Li, Ke, Li, Maoliang, Chen, Jialiang, Chen, Jiayu, Zheng, Zihao, Wang, Shaoqi, Chen, Xiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.04875 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
por: Chen, Liyang, et al.
Publicado: (2025)
por: Chen, Liyang, et al.
Publicado: (2025)
HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
por: Chen, Zhiwei, et al.
Publicado: (2025)
por: Chen, Zhiwei, et al.
Publicado: (2025)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
por: Hu, Xiaowan, et al.
Publicado: (2024)
por: Hu, Xiaowan, et al.
Publicado: (2024)
Learning Brain Representation with Hierarchical Visual Embeddings
por: Zheng, Jiawen, et al.
Publicado: (2026)
por: Zheng, Jiawen, et al.
Publicado: (2026)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
por: Li, Yanjun, et al.
Publicado: (2025)
por: Li, Yanjun, et al.
Publicado: (2025)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
Language-Guided Diffusion Model for Visual Grounding
por: Chen, Sijia, et al.
Publicado: (2023)
por: Chen, Sijia, et al.
Publicado: (2023)
Taming Flow-based I2V Models for Creative Video Editing
por: Kong, Xianghao, et al.
Publicado: (2025)
por: Kong, Xianghao, et al.
Publicado: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
por: Qu, Mengxue, et al.
Publicado: (2024)
por: Qu, Mengxue, et al.
Publicado: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
por: Mao, Qingyang, et al.
Publicado: (2025)
por: Mao, Qingyang, et al.
Publicado: (2025)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
Region-Constraint In-Context Generation for Instructional Video Editing
por: Zhang, Zhongwei, et al.
Publicado: (2025)
por: Zhang, Zhongwei, et al.
Publicado: (2025)
VCoME: Verbal Video Composition with Multimodal Editing Effects
por: Gong, Weibo, et al.
Publicado: (2024)
por: Gong, Weibo, et al.
Publicado: (2024)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
por: Fang, Xinyu, et al.
Publicado: (2024)
por: Fang, Xinyu, et al.
Publicado: (2024)
MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition
por: Li, Maoliang, et al.
Publicado: (2025)
por: Li, Maoliang, et al.
Publicado: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
por: Yao, Linli, et al.
Publicado: (2023)
por: Yao, Linli, et al.
Publicado: (2023)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
por: Zhang, Rui, et al.
Publicado: (2024)
por: Zhang, Rui, et al.
Publicado: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
por: Chen, Zihao, et al.
Publicado: (2024)
por: Chen, Zihao, et al.
Publicado: (2024)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
Bernini: Latent Semantic Planning for Video Diffusion
por: Bernini Team, et al.
Publicado: (2026)
por: Bernini Team, et al.
Publicado: (2026)
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
por: Xu, Zitong, et al.
Publicado: (2026)
por: Xu, Zitong, et al.
Publicado: (2026)
AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
por: Ku, Max, et al.
Publicado: (2024)
por: Ku, Max, et al.
Publicado: (2024)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
por: Shi, Haoyuan, et al.
Publicado: (2026)
por: Shi, Haoyuan, et al.
Publicado: (2026)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
por: Liang, Feng, et al.
Publicado: (2023)
por: Liang, Feng, et al.
Publicado: (2023)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
Bridging Your Imagination with Audio-Video Generation via a Unified Director
por: Zhang, Jiaxu, et al.
Publicado: (2025)
por: Zhang, Jiaxu, et al.
Publicado: (2025)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
por: Yin, Zhiyu, et al.
Publicado: (2026)
por: Yin, Zhiyu, et al.
Publicado: (2026)
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation
por: Chen, Lizhi, et al.
Publicado: (2025)
por: Chen, Lizhi, et al.
Publicado: (2025)
Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
por: Liu, Ke, et al.
Publicado: (2025)
por: Liu, Ke, et al.
Publicado: (2025)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
por: Dai, Guangyu, et al.
Publicado: (2025)
por: Dai, Guangyu, et al.
Publicado: (2025)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)
por: Tian, Zeyue, et al.
Publicado: (2026)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
por: Chen, Zhihui, et al.
Publicado: (2025)
por: Chen, Zhihui, et al.
Publicado: (2025)
Generalizable Deepfake Detection Based on Forgery-aware Layer Masking and Multi-artifact Subspace Decomposition
por: Zhang, Xiang, et al.
Publicado: (2026)
por: Zhang, Xiang, et al.
Publicado: (2026)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
por: Xu, Jiaqi, et al.
Publicado: (2023)
por: Xu, Jiaqi, et al.
Publicado: (2023)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
por: Zhang, Beiyuan, et al.
Publicado: (2024)
por: Zhang, Beiyuan, et al.
Publicado: (2024)
AIS 2024 Challenge on Video Quality Assessment of User-Generated Content: Methods and Results
por: Conde, Marcos V., et al.
Publicado: (2024)
por: Conde, Marcos V., et al.
Publicado: (2024)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
por: Lu, Zhenyu, et al.
Publicado: (2025)
por: Lu, Zhenyu, et al.
Publicado: (2025)
Ejemplares similares
-
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025) -
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
por: Chen, Liyang, et al.
Publicado: (2025) -
HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
por: Chen, Zhiwei, et al.
Publicado: (2025) -
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
por: Hu, Xiaowan, et al.
Publicado: (2024) -
Learning Brain Representation with Hierarchical Visual Embeddings
por: Zheng, Jiawen, et al.
Publicado: (2026)