A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Panwen, Xiao, Nan, Li, Feifei, Chen, Yongquan, Huang, Rui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A multi-purpose automatic editing system based on lecture semantics for remote education
par: Hu, Panwen, et autres
Publié: (2024)
par: Hu, Panwen, et autres
Publié: (2024)
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
par: Hu, Panwen, et autres
Publié: (2025)
par: Hu, Panwen, et autres
Publié: (2025)
Towards Balanced RGB-TSDF Fusion for Consistent Semantic Scene Completion by 3D RGB Feature Completion and a Classwise Entropy Loss Function
par: Ding, Laiyan, et autres
Publié: (2024)
par: Ding, Laiyan, et autres
Publié: (2024)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
par: Chen, Lan, et autres
Publié: (2025)
par: Chen, Lan, et autres
Publié: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
par: Zhang, Xinsong, et autres
Publié: (2025)
par: Zhang, Xinsong, et autres
Publié: (2025)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
par: Zhang, Peng-Fei, et autres
Publié: (2025)
par: Zhang, Peng-Fei, et autres
Publié: (2025)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models
par: Huang, He, et autres
Publié: (2025)
par: Huang, He, et autres
Publié: (2025)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
par: Chen, Xuezheng, et autres
Publié: (2025)
par: Chen, Xuezheng, et autres
Publié: (2025)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
par: Ruan, Shouwei, et autres
Publié: (2024)
par: Ruan, Shouwei, et autres
Publié: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
Reinforcing Pre-trained Models Using Counterfactual Images
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
par: Huang, Jiale, et autres
Publié: (2024)
par: Huang, Jiale, et autres
Publié: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
par: Zhou, Hantao, et autres
Publié: (2024)
par: Zhou, Hantao, et autres
Publié: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
par: Chen, Xiuyuan, et autres
Publié: (2023)
par: Chen, Xiuyuan, et autres
Publié: (2023)
3D Scene Graph Guided Vision-Language Pre-training
par: Liu, Hao, et autres
Publié: (2024)
par: Liu, Hao, et autres
Publié: (2024)
Continual Forgetting for Pre-trained Vision Models
par: Zhao, Hongbo, et autres
Publié: (2024)
par: Zhao, Hongbo, et autres
Publié: (2024)
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
par: Che, Chengan, et autres
Publié: (2026)
par: Che, Chengan, et autres
Publié: (2026)
Contrastive Language Video Time Pre-training
par: Liu, Hengyue, et autres
Publié: (2024)
par: Liu, Hengyue, et autres
Publié: (2024)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
par: Chen, Wutao, et autres
Publié: (2026)
par: Chen, Wutao, et autres
Publié: (2026)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
par: Ding, Yuhe, et autres
Publié: (2024)
par: Ding, Yuhe, et autres
Publié: (2024)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
par: Zheng, Haonan, et autres
Publié: (2024)
par: Zheng, Haonan, et autres
Publié: (2024)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
par: Lin, Xiao, et autres
Publié: (2024)
par: Lin, Xiao, et autres
Publié: (2024)
DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance
par: Wang, Cong, et autres
Publié: (2023)
par: Wang, Cong, et autres
Publié: (2023)
Efficient Vision-Language Pre-training by Cluster Masking
par: Wei, Zihao, et autres
Publié: (2024)
par: Wei, Zihao, et autres
Publié: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
par: Gao, Yuan, et autres
Publié: (2024)
par: Gao, Yuan, et autres
Publié: (2024)
AttentionDrag: Exploiting Latent Correlation Knowledge in Pre-trained Diffusion Models for Image Editing
par: Yang, Biao, et autres
Publié: (2025)
par: Yang, Biao, et autres
Publié: (2025)
VLP: A Survey on Vision-Language Pre-training
par: Chen, Feilong, et autres
Publié: (2022)
par: Chen, Feilong, et autres
Publié: (2022)
Do Pre-trained Vision-Language Models Encode Object States?
par: Newman, Kaleb, et autres
Publié: (2024)
par: Newman, Kaleb, et autres
Publié: (2024)
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
par: Kim, Donggeun, et autres
Publié: (2024)
par: Kim, Donggeun, et autres
Publié: (2024)
FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models
par: Xu, Wan, et autres
Publié: (2023)
par: Xu, Wan, et autres
Publié: (2023)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
par: Tang, Longxiang, et autres
Publié: (2024)
par: Tang, Longxiang, et autres
Publié: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
par: Li, Qingqiu, et autres
Publié: (2024)
par: Li, Qingqiu, et autres
Publié: (2024)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
par: Silva, João Daniel, et autres
Publié: (2024)
par: Silva, João Daniel, et autres
Publié: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
par: Zhou, Wenlve, et autres
Publié: (2024)
par: Zhou, Wenlve, et autres
Publié: (2024)
Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
par: Qiao, Yixuan, et autres
Publié: (2021)
par: Qiao, Yixuan, et autres
Publié: (2021)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
par: Song, Wenhui, et autres
Publié: (2025)
par: Song, Wenhui, et autres
Publié: (2025)
Documents similaires
-
A multi-purpose automatic editing system based on lecture semantics for remote education
par: Hu, Panwen, et autres
Publié: (2024) -
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
par: Hu, Panwen, et autres
Publié: (2025) -
Towards Balanced RGB-TSDF Fusion for Consistent Semantic Scene Completion by 3D RGB Feature Completion and a Classwise Entropy Loss Function
par: Ding, Laiyan, et autres
Publié: (2024) -
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
par: Chen, Lan, et autres
Publié: (2025) -
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
par: Zhang, Xinsong, et autres
Publié: (2025)