VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Yifang, Sun, Yunzhuo, Xie, Zien, Zhai, Benxiang, Du, Sidan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
GPTSee: Enhancing Moment Retrieval and Highlight Detection via Description-Based Similarity Features
par: Sun, Yunzhuo, et autres
Publié: (2024)
par: Sun, Yunzhuo, et autres
Publié: (2024)
HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
FaceSnap: Enhanced ID-fidelity Network for Tuning-free Portrait Customization
par: Zhai, Benxiang, et autres
Publié: (2026)
par: Zhai, Benxiang, et autres
Publié: (2026)
Mamba-VMR: Multimodal Query Augmentation via Generated Videos for Precise Temporal Grounding
par: Sun, Yunzhuo, et autres
Publié: (2026)
par: Sun, Yunzhuo, et autres
Publié: (2026)
Diff-PC: Identity-preserving and 3D-aware Controllable Diffusion for Zero-shot Portrait Customization
par: Xu, Yifang, et autres
Publié: (2026)
par: Xu, Yifang, et autres
Publié: (2026)
FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding
par: Cao, Zhuo, et autres
Publié: (2024)
par: Cao, Zhuo, et autres
Publié: (2024)
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
par: Chamiti, Tzoulio, et autres
Publié: (2025)
par: Chamiti, Tzoulio, et autres
Publié: (2025)
Video-GPT via Next Clip Diffusion
par: Zhuang, Shaobin, et autres
Publié: (2025)
par: Zhuang, Shaobin, et autres
Publié: (2025)
Animating the Past: Reconstruct Trilobite via Video Generation
par: Wu, Xiaoran, et autres
Publié: (2024)
par: Wu, Xiaoran, et autres
Publié: (2024)
Zero-Shot Temporal Interaction Localization for Egocentric Videos
par: Zhang, Erhang, et autres
Publié: (2025)
par: Zhang, Erhang, et autres
Publié: (2025)
SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding
par: Han, Jiwook, et autres
Publié: (2026)
par: Han, Jiwook, et autres
Publié: (2026)
Zero-TIG: Temporal Consistency-Aware Zero-Shot Illumination-Guided Low-light Video Enhancement
par: Li, Yini, et autres
Publié: (2025)
par: Li, Yini, et autres
Publié: (2025)
Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization
par: Wu, Yuanli, et autres
Publié: (2025)
par: Wu, Yuanli, et autres
Publié: (2025)
VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding
par: Guo, Yongxin, et autres
Publié: (2024)
par: Guo, Yongxin, et autres
Publié: (2024)
AgroGPT: Efficient Agricultural Vision-Language Model with Expert Tuning
par: Awais, Muhammad, et autres
Publié: (2024)
par: Awais, Muhammad, et autres
Publié: (2024)
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
par: An, Joungbin, et autres
Publié: (2026)
par: An, Joungbin, et autres
Publié: (2026)
CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4V
par: Xu, Siyu, et autres
Publié: (2024)
par: Xu, Siyu, et autres
Publié: (2024)
TractoGPT: A GPT architecture for White Matter Segmentation
par: Goel, Anoushkrit, et autres
Publié: (2025)
par: Goel, Anoushkrit, et autres
Publié: (2025)
RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images
par: Li, Ke, et autres
Publié: (2025)
par: Li, Ke, et autres
Publié: (2025)
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
par: Liu, Jiazhen, et autres
Publié: (2024)
par: Liu, Jiazhen, et autres
Publié: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Can GPT-4o mini and Gemini 2.0 Flash Predict Fine-Grained Fashion Product Attributes? A Zero-Shot Analysis
par: Shukla, Shubham, et autres
Publié: (2025)
par: Shukla, Shubham, et autres
Publié: (2025)
TV-SAM: Increasing Zero-Shot Segmentation Performance on Multimodal Medical Images Using GPT-4 Generated Descriptive Prompts Without Human Annotation
par: Jiang, Zekun, et autres
Publié: (2024)
par: Jiang, Zekun, et autres
Publié: (2024)
3DAxisPrompt: Promoting the 3D Grounding and Reasoning in GPT-4o
par: Liu, Dingning, et autres
Publié: (2025)
par: Liu, Dingning, et autres
Publié: (2025)
GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
par: Liao, Haicheng, et autres
Publié: (2023)
par: Liao, Haicheng, et autres
Publié: (2023)
Zero-shot Building Age Classification from Facade Image Using GPT-4
par: Zeng, Zichao, et autres
Publié: (2024)
par: Zeng, Zichao, et autres
Publié: (2024)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
par: Chen, Ruizhe, et autres
Publié: (2025)
par: Chen, Ruizhe, et autres
Publié: (2025)
GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing
par: Lu, Hao, et autres
Publié: (2024)
par: Lu, Hao, et autres
Publié: (2024)
Object-Shot Enhanced Grounding Network for Egocentric Video
par: Feng, Yisen, et autres
Publié: (2025)
par: Feng, Yisen, et autres
Publié: (2025)
Spatio-Temporal Context Prompting for Zero-Shot Action Detection
par: Huang, Wei-Jhe, et autres
Publié: (2024)
par: Huang, Wei-Jhe, et autres
Publié: (2024)
GRAZE: Grounded Refinement and Motion-Aware Zero-Shot Event Localization
par: Zaidi, Syed Ahsan Masud, et autres
Publié: (2026)
par: Zaidi, Syed Ahsan Masud, et autres
Publié: (2026)
MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4
par: Azizi, Vahid, et autres
Publié: (2024)
par: Azizi, Vahid, et autres
Publié: (2024)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
GPT-4V(ision) is a Generalist Web Agent, if Grounded
par: Zheng, Boyuan, et autres
Publié: (2024)
par: Zheng, Boyuan, et autres
Publié: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
par: Qu, Mengxue, et autres
Publié: (2024)
par: Qu, Mengxue, et autres
Publié: (2024)
VideoPoet: A Large Language Model for Zero-Shot Video Generation
par: Kondratyuk, Dan, et autres
Publié: (2023)
par: Kondratyuk, Dan, et autres
Publié: (2023)
Zero-to-Hero: Zero-Shot Initialization Empowering Reference-Based Video Appearance Editing
par: Su, Tongtong, et autres
Publié: (2025)
par: Su, Tongtong, et autres
Publié: (2025)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
par: Wang, Haibo, et autres
Publié: (2026)
par: Wang, Haibo, et autres
Publié: (2026)
Documents similaires
-
Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection
par: Xu, Yifang, et autres
Publié: (2025) -
GPTSee: Enhancing Moment Retrieval and Highlight Detection via Description-Based Similarity Features
par: Sun, Yunzhuo, et autres
Publié: (2024) -
HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion
par: Xu, Yifang, et autres
Publié: (2025) -
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025) -
FaceSnap: Enhanced ID-fidelity Network for Tuning-free Portrait Customization
par: Zhai, Benxiang, et autres
Publié: (2026)