UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Joungbin, Jain, Agrim, Grauman, Kristen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
di: An, Joungbin, et al.
Pubblicazione: (2025)
di: An, Joungbin, et al.
Pubblicazione: (2025)
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding
di: Han, Jiwook, et al.
Pubblicazione: (2026)
di: Han, Jiwook, et al.
Pubblicazione: (2026)
VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPT
di: Xu, Yifang, et al.
Pubblicazione: (2024)
di: Xu, Yifang, et al.
Pubblicazione: (2024)
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
di: Zheng, Minghang, et al.
Pubblicazione: (2026)
di: Zheng, Minghang, et al.
Pubblicazione: (2026)
Learning Skill-Attributes for Transferable Assessment in Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding
di: Cao, Zhuo, et al.
Pubblicazione: (2024)
di: Cao, Zhuo, et al.
Pubblicazione: (2024)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
di: Baid, Ami, et al.
Pubblicazione: (2026)
di: Baid, Ami, et al.
Pubblicazione: (2026)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
di: Luo, Mi, et al.
Pubblicazione: (2025)
di: Luo, Mi, et al.
Pubblicazione: (2025)
EgoExo-WM: Unlocking Exo Video for Ego World Models
di: Tran, Danny, et al.
Pubblicazione: (2026)
di: Tran, Danny, et al.
Pubblicazione: (2026)
FIction: 4D Future Interaction Prediction from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Learning Object State Changes in Videos: An Open-World Perspective
di: Xue, Zihui, et al.
Pubblicazione: (2023)
di: Xue, Zihui, et al.
Pubblicazione: (2023)
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
Stitch-a-Demo: Video Demonstrations from Multistep Descriptions
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
SportSkills: Physical Skill Learning from Sports Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
Detours for Navigating Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Seeing the Arrow of Time in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
di: Luo, Mi, et al.
Pubblicazione: (2024)
di: Luo, Mi, et al.
Pubblicazione: (2024)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
di: Li, Zeqian, et al.
Pubblicazione: (2025)
di: Li, Zeqian, et al.
Pubblicazione: (2025)
MistExit: Learning to Exit for Early Mistake Detection in Procedural Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
ExpertAF: Expert Actionable Feedback from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
SPOC: Spatially-Progressing Object State Change Segmentation in Video
di: Mandikal, Priyanka, et al.
Pubblicazione: (2025)
di: Mandikal, Priyanka, et al.
Pubblicazione: (2025)
SkillSight: Efficient First-Person Skill Assessment with Gaze
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
UniBiomed: A Universal Foundation Model for Grounded Biomedical Image Interpretation
di: Wu, Linshan, et al.
Pubblicazione: (2025)
di: Wu, Linshan, et al.
Pubblicazione: (2025)
SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
Personal Visual Context Learning in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2026)
di: Xue, Zihui, et al.
Pubblicazione: (2026)
SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos
di: Wu, Jinlin, et al.
Pubblicazione: (2026)
di: Wu, Jinlin, et al.
Pubblicazione: (2026)
ActionSwitch: Class-agnostic Detection of Simultaneous Actions in Streaming Videos
di: Kang, Hyolim, et al.
Pubblicazione: (2024)
di: Kang, Hyolim, et al.
Pubblicazione: (2024)
Few-View Object Reconstruction with Unknown Categories and Camera Poses
di: Jiang, Hanwen, et al.
Pubblicazione: (2022)
di: Jiang, Hanwen, et al.
Pubblicazione: (2022)
Universal Pansharpening Foundation Model
di: Wang, Hebaixu, et al.
Pubblicazione: (2026)
di: Wang, Hebaixu, et al.
Pubblicazione: (2026)
Vid2Coach: Transforming How-To Videos into Task Assistants
di: Huh, Mina, et al.
Pubblicazione: (2025)
di: Huh, Mina, et al.
Pubblicazione: (2025)
Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models
di: T V, Sethuraman, et al.
Pubblicazione: (2026)
di: T V, Sethuraman, et al.
Pubblicazione: (2026)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
di: An, Joungbin, et al.
Pubblicazione: (2025) -
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024) -
SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding
di: Han, Jiwook, et al.
Pubblicazione: (2026) -
VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding
di: Guo, Yongxin, et al.
Pubblicazione: (2024) -
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)