A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Panwen, Xiao, Nan, Li, Feifei, Chen, Yongquan, Huang, Rui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A multi-purpose automatic editing system based on lecture semantics for remote education
por: Hu, Panwen, et al.
Publicado: (2024)
por: Hu, Panwen, et al.
Publicado: (2024)
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
por: Hu, Panwen, et al.
Publicado: (2025)
por: Hu, Panwen, et al.
Publicado: (2025)
Towards Balanced RGB-TSDF Fusion for Consistent Semantic Scene Completion by 3D RGB Feature Completion and a Classwise Entropy Loss Function
por: Ding, Laiyan, et al.
Publicado: (2024)
por: Ding, Laiyan, et al.
Publicado: (2024)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
por: Chen, Lan, et al.
Publicado: (2025)
por: Chen, Lan, et al.
Publicado: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
por: Zhang, Xinsong, et al.
Publicado: (2025)
por: Zhang, Xinsong, et al.
Publicado: (2025)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
por: Zhang, Peng-Fei, et al.
Publicado: (2025)
por: Zhang, Peng-Fei, et al.
Publicado: (2025)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models
por: Huang, He, et al.
Publicado: (2025)
por: Huang, He, et al.
Publicado: (2025)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
por: Chen, Xuezheng, et al.
Publicado: (2025)
por: Chen, Xuezheng, et al.
Publicado: (2025)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
por: Ruan, Shouwei, et al.
Publicado: (2024)
por: Ruan, Shouwei, et al.
Publicado: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023)
por: Ma, Shuailei, et al.
Publicado: (2023)
Reinforcing Pre-trained Models Using Counterfactual Images
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
por: Huang, Jiale, et al.
Publicado: (2024)
por: Huang, Jiale, et al.
Publicado: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
por: Zhou, Hantao, et al.
Publicado: (2024)
por: Zhou, Hantao, et al.
Publicado: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
3D Scene Graph Guided Vision-Language Pre-training
por: Liu, Hao, et al.
Publicado: (2024)
por: Liu, Hao, et al.
Publicado: (2024)
Continual Forgetting for Pre-trained Vision Models
por: Zhao, Hongbo, et al.
Publicado: (2024)
por: Zhao, Hongbo, et al.
Publicado: (2024)
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
por: Che, Chengan, et al.
Publicado: (2026)
por: Che, Chengan, et al.
Publicado: (2026)
Contrastive Language Video Time Pre-training
por: Liu, Hengyue, et al.
Publicado: (2024)
por: Liu, Hengyue, et al.
Publicado: (2024)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
por: Chen, Wutao, et al.
Publicado: (2026)
por: Chen, Wutao, et al.
Publicado: (2026)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
por: Yang, Fan, et al.
Publicado: (2024)
por: Yang, Fan, et al.
Publicado: (2024)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
por: Ding, Yuhe, et al.
Publicado: (2024)
por: Ding, Yuhe, et al.
Publicado: (2024)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
por: Zheng, Haonan, et al.
Publicado: (2024)
por: Zheng, Haonan, et al.
Publicado: (2024)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
por: Lin, Xiao, et al.
Publicado: (2024)
por: Lin, Xiao, et al.
Publicado: (2024)
DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance
por: Wang, Cong, et al.
Publicado: (2023)
por: Wang, Cong, et al.
Publicado: (2023)
Efficient Vision-Language Pre-training by Cluster Masking
por: Wei, Zihao, et al.
Publicado: (2024)
por: Wei, Zihao, et al.
Publicado: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
por: Gao, Yuan, et al.
Publicado: (2024)
por: Gao, Yuan, et al.
Publicado: (2024)
AttentionDrag: Exploiting Latent Correlation Knowledge in Pre-trained Diffusion Models for Image Editing
por: Yang, Biao, et al.
Publicado: (2025)
por: Yang, Biao, et al.
Publicado: (2025)
VLP: A Survey on Vision-Language Pre-training
por: Chen, Feilong, et al.
Publicado: (2022)
por: Chen, Feilong, et al.
Publicado: (2022)
Do Pre-trained Vision-Language Models Encode Object States?
por: Newman, Kaleb, et al.
Publicado: (2024)
por: Newman, Kaleb, et al.
Publicado: (2024)
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
por: Kim, Donggeun, et al.
Publicado: (2024)
por: Kim, Donggeun, et al.
Publicado: (2024)
FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models
por: Xu, Wan, et al.
Publicado: (2023)
por: Xu, Wan, et al.
Publicado: (2023)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
por: Tang, Longxiang, et al.
Publicado: (2024)
por: Tang, Longxiang, et al.
Publicado: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
por: Li, Qingqiu, et al.
Publicado: (2024)
por: Li, Qingqiu, et al.
Publicado: (2024)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
por: Silva, João Daniel, et al.
Publicado: (2024)
por: Silva, João Daniel, et al.
Publicado: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
por: Zhou, Wenlve, et al.
Publicado: (2024)
por: Zhou, Wenlve, et al.
Publicado: (2024)
Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
por: Qiao, Yixuan, et al.
Publicado: (2021)
por: Qiao, Yixuan, et al.
Publicado: (2021)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
por: Song, Wenhui, et al.
Publicado: (2025)
por: Song, Wenhui, et al.
Publicado: (2025)
Ejemplares similares
-
A multi-purpose automatic editing system based on lecture semantics for remote education
por: Hu, Panwen, et al.
Publicado: (2024) -
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
por: Hu, Panwen, et al.
Publicado: (2025) -
Towards Balanced RGB-TSDF Fusion for Consistent Semantic Scene Completion by 3D RGB Feature Completion and a Classwise Entropy Loss Function
por: Ding, Laiyan, et al.
Publicado: (2024) -
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
por: Chen, Lan, et al.
Publicado: (2025) -
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
por: Zhang, Xinsong, et al.
Publicado: (2025)