Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Yolo Yunlong, Xu, Siting, Wang, Teng, Lin, Qin, Lu, Qinglin, Zheng, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LaunchpadGPT: Language Model as Music Visualization Designer on Launchpad
par: Xu, Siting, et autres
Publié: (2023)
par: Xu, Siting, et autres
Publié: (2023)
Meta-CoT: Enhancing Granularity and Generalization in Image Editing
par: Zhang, Shiyi, et autres
Publié: (2026)
par: Zhang, Shiyi, et autres
Publié: (2026)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
par: Cai, Lingling, et autres
Publié: (2024)
par: Cai, Lingling, et autres
Publié: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023)
par: Yao, Linli, et autres
Publié: (2023)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
par: Dai, Guangyu, et autres
Publié: (2025)
par: Dai, Guangyu, et autres
Publié: (2025)
GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing
par: Lin, Zihao, et autres
Publié: (2026)
par: Lin, Zihao, et autres
Publié: (2026)
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
par: Li, Shaokai, et autres
Publié: (2024)
par: Li, Shaokai, et autres
Publié: (2024)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
par: Chen, Zhihui, et autres
Publié: (2025)
par: Chen, Zhihui, et autres
Publié: (2025)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)
par: Qin, Bosheng, et autres
Publié: (2023)
Interpretable Embedding for Ad-hoc Video Search
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Deep Reversible Consistency Learning for Cross-modal Retrieval
par: Pu, Ruitao, et autres
Publié: (2025)
par: Pu, Ruitao, et autres
Publié: (2025)
Copycat vs. Original: Multi-modal Pretraining and Variable Importance in Box-office Prediction
par: Chao, Qin, et autres
Publié: (2025)
par: Chao, Qin, et autres
Publié: (2025)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
par: Tang, Hao, et autres
Publié: (2026)
par: Tang, Hao, et autres
Publié: (2026)
MCIHN: A Hybrid Network Model Based on Multi-path Cross-modal Interaction for Multimodal Emotion Recognition
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026)
par: Tian, Zeyue, et autres
Publié: (2026)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
par: Liao, Junchao, et autres
Publié: (2026)
par: Liao, Junchao, et autres
Publié: (2026)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
par: Zhang, Zhihao, et autres
Publié: (2023)
par: Zhang, Zhihao, et autres
Publié: (2023)
DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
par: Xiong, Lingyu, et autres
Publié: (2024)
par: Xiong, Lingyu, et autres
Publié: (2024)
Region-Constraint In-Context Generation for Instructional Video Editing
par: Zhang, Zhongwei, et autres
Publié: (2025)
par: Zhang, Zhongwei, et autres
Publié: (2025)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
Kubrick: Multimodal Agent Collaborations for Synthetic Video Generation
par: He, Liu, et autres
Publié: (2024)
par: He, Liu, et autres
Publié: (2024)
Multi-modal and Metadata Capture Model for Micro Video Popularity Prediction
par: Lu, Jiacheng, et autres
Publié: (2025)
par: Lu, Jiacheng, et autres
Publié: (2025)
VCoME: Verbal Video Composition with Multimodal Editing Effects
par: Gong, Weibo, et autres
Publié: (2024)
par: Gong, Weibo, et autres
Publié: (2024)
Visual Grounding with Multi-modal Conditional Adaptation
par: Yao, Ruilin, et autres
Publié: (2024)
par: Yao, Ruilin, et autres
Publié: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights
par: Yang, Jasmine, et autres
Publié: (2026)
par: Yang, Jasmine, et autres
Publié: (2026)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
par: Zhao, Yumiao, et autres
Publié: (2024)
par: Zhao, Yumiao, et autres
Publié: (2024)
Quantifying and Enhancing Multi-modal Robustness with Modality Preference
par: Yang, Zequn, et autres
Publié: (2024)
par: Yang, Zequn, et autres
Publié: (2024)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
par: Chen, Zhikai, et autres
Publié: (2024)
par: Chen, Zhikai, et autres
Publié: (2024)
Taming Flow-based I2V Models for Creative Video Editing
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
par: Gao, Shixuan, et autres
Publié: (2024)
par: Gao, Shixuan, et autres
Publié: (2024)
VideoMap: Supporting Video Editing Exploration, Brainstorming, and Prototyping in the Latent Space
par: Lin, David Chuan-En, et autres
Publié: (2022)
par: Lin, David Chuan-En, et autres
Publié: (2022)
When and How to Cut Classical Concerts? A Multimodal Automated Video Editing Approach
par: Gonzálbez-Biosca, Daniel, et autres
Publié: (2025)
par: Gonzálbez-Biosca, Daniel, et autres
Publié: (2025)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
Extending Visual Dynamics for Video-to-Music Generation
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
Documents similaires
-
LaunchpadGPT: Language Model as Music Visualization Designer on Launchpad
par: Xu, Siting, et autres
Publié: (2023) -
Meta-CoT: Enhancing Granularity and Generalization in Image Editing
par: Zhang, Shiyi, et autres
Publié: (2026) -
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
par: Cai, Lingling, et autres
Publié: (2024) -
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023) -
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
par: Dai, Guangyu, et autres
Publié: (2025)