ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ghoddoosian, Reza, Agarwal, Nakul, Dwivedi, Isht, Darisuh, Behzad |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pose-Aware Weakly-Supervised Action Segmentation
par: Zhao, Seth Z., et autres
Publié: (2025)
par: Zhao, Seth Z., et autres
Publié: (2025)
Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models
par: Mittal, Himangi, et autres
Publié: (2024)
par: Mittal, Himangi, et autres
Publié: (2024)
Vamos: Versatile Action Models for Video Understanding
par: Wang, Shijie, et autres
Publié: (2023)
par: Wang, Shijie, et autres
Publié: (2023)
Towards Driver Behavior Understanding: Weakly-Supervised Risk Perception in Driving Scenes
par: Agarwal, Nakul, et autres
Publié: (2026)
par: Agarwal, Nakul, et autres
Publié: (2026)
AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?
par: Zhao, Qi, et autres
Publié: (2023)
par: Zhao, Qi, et autres
Publié: (2023)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
par: Xu, Jiacong, et autres
Publié: (2025)
par: Xu, Jiacong, et autres
Publié: (2025)
ActionDiffusion: An Action-aware Diffusion Model for Procedure Planning in Instructional Videos
par: Shi, Lei, et autres
Publié: (2024)
par: Shi, Lei, et autres
Publié: (2024)
Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
par: Dalaq, Alaa, et autres
Publié: (2025)
par: Dalaq, Alaa, et autres
Publié: (2025)
ACE: Attentional Concept Erasure in Diffusion Models
par: Carter, Finn
Publié: (2025)
par: Carter, Finn
Publié: (2025)
Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
Language Model Guided Interpretable Video Action Reasoning
par: Wang, Ning, et autres
Publié: (2024)
par: Wang, Ning, et autres
Publié: (2024)
ACE: Anti-Editing Concept Erasure in Text-to-Image Models
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
ACE: Concept Editing in Diffusion Models without Performance Degradation
par: Wang, Ruipeng, et autres
Publié: (2025)
par: Wang, Ruipeng, et autres
Publié: (2025)
LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos
par: Shi, Lei, et autres
Publié: (2026)
par: Shi, Lei, et autres
Publié: (2026)
Underwater Diffusion Attention Network with Contrastive Language-Image Joint Learning for Underwater Image Enhancement
par: Shaahid, Afrah, et autres
Publié: (2025)
par: Shaahid, Afrah, et autres
Publié: (2025)
Disentangled Concepts Speak Louder Than Words: Explainable Video Action Recognition
par: Lee, Jongseo, et autres
Publié: (2025)
par: Lee, Jongseo, et autres
Publié: (2025)
Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models
par: Cao, Cong, et autres
Publié: (2026)
par: Cao, Cong, et autres
Publié: (2026)
Multimodal Language Models for Domain-Specific Procedural Video Summarization
par: Hussain, Nafisa
Publié: (2024)
par: Hussain, Nafisa
Publié: (2024)
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Concepts in Motion: Temporal Concept Bottleneck Model for Interpretable Video Classification
par: Knab, Patrick, et autres
Publié: (2025)
par: Knab, Patrick, et autres
Publié: (2025)
ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models
par: Aydın, M. Arda, et autres
Publié: (2026)
par: Aydın, M. Arda, et autres
Publié: (2026)
Unified Video Action Model
par: Li, Shuang, et autres
Publié: (2025)
par: Li, Shuang, et autres
Publié: (2025)
Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding
par: Chatterjee, Dibyadip, et autres
Publié: (2025)
par: Chatterjee, Dibyadip, et autres
Publié: (2025)
Open-Event Procedure Planning in Instructional Videos
par: Wu, Yilu, et autres
Publié: (2024)
par: Wu, Yilu, et autres
Publié: (2024)
Unsupervised Multiview Contrastive Language-Image Joint Learning with Pseudo-Labeled Prompts Via Vision-Language Model for 3D/4D Facial Expression Recognition
par: Behzad, Muzammil
Publié: (2025)
par: Behzad, Muzammil
Publié: (2025)
Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models
par: Zhu, Shangwen, et autres
Publié: (2026)
par: Zhu, Shangwen, et autres
Publié: (2026)
AquaDiff: Diffusion-Based Underwater Image Enhancement for Addressing Color Distortion
par: Shaahid, Afrah, et autres
Publié: (2025)
par: Shaahid, Afrah, et autres
Publié: (2025)
Action-Guided Attention for Video Action Anticipation
par: Tai, Tsung-Ming, et autres
Publié: (2026)
par: Tai, Tsung-Ming, et autres
Publié: (2026)
Kronecker Mask and Interpretive Prompts are Language-Action Video Learners
par: Yang, Jingyi, et autres
Publié: (2025)
par: Yang, Jingyi, et autres
Publié: (2025)
Anticipating Object State Changes in Long Procedural Videos
par: Manousaki, Victoria, et autres
Publié: (2024)
par: Manousaki, Victoria, et autres
Publié: (2024)
Towards Polyp Counting In Full-Procedure Colonoscopy Videos
par: Parolari, Luca, et autres
Publié: (2025)
par: Parolari, Luca, et autres
Publié: (2025)
RECIPE: Procedural Planning via Grounding in Instructional Video
par: Seminara, Luigi, et autres
Publié: (2026)
par: Seminara, Luigi, et autres
Publié: (2026)
PDPP: Projected Diffusion for Procedure Planning in Instructional Videos
par: Wang, Hanlin, et autres
Publié: (2023)
par: Wang, Hanlin, et autres
Publié: (2023)
Self-Supervised Multi-View Representation Learning using Vision-Language Model for 3D/4D Facial Expression Recognition
par: Behzad, Muzammil
Publié: (2025)
par: Behzad, Muzammil
Publié: (2025)
Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition
par: Behzad, Muzammil
Publié: (2025)
par: Behzad, Muzammil
Publié: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
par: Peng, Jingwei, et autres
Publié: (2025)
par: Peng, Jingwei, et autres
Publié: (2025)
GenVideo: One-shot Target-image and Shape Aware Video Editing using T2I Diffusion Models
par: Harsha, Sai Sree, et autres
Publié: (2024)
par: Harsha, Sai Sree, et autres
Publié: (2024)
AICL: Action In-Context Learning for Video Diffusion Model
par: Liu, Jianzhi, et autres
Publié: (2024)
par: Liu, Jianzhi, et autres
Publié: (2024)
Predicting Implicit Arguments in Procedural Video Instructions
par: Batra, Anil, et autres
Publié: (2025)
par: Batra, Anil, et autres
Publié: (2025)
VideoLLM-online: Online Video Large Language Model for Streaming Video
par: Chen, Joya, et autres
Publié: (2024)
par: Chen, Joya, et autres
Publié: (2024)
Documents similaires
-
Pose-Aware Weakly-Supervised Action Segmentation
par: Zhao, Seth Z., et autres
Publié: (2025) -
Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models
par: Mittal, Himangi, et autres
Publié: (2024) -
Vamos: Versatile Action Models for Video Understanding
par: Wang, Shijie, et autres
Publié: (2023) -
Towards Driver Behavior Understanding: Weakly-Supervised Risk Perception in Driving Scenes
par: Agarwal, Nakul, et autres
Publié: (2026) -
AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?
par: Zhao, Qi, et autres
Publié: (2023)