Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiong, Yuanhao, Zhao, Long, Gong, Boqing, Yang, Ming-Hsuan, Schroff, Florian, Liu, Ting, Hsieh, Cho-Jui, Yuan, Liangzhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Distilling Vision-Language Models on Millions of Videos
di: Zhao, Yue, et al.
Pubblicazione: (2024)
di: Zhao, Yue, et al.
Pubblicazione: (2024)
VideoGLUE: Video General Understanding Evaluation of Foundation Models
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
On Discrete Prompt Optimization for Diffusion Models
di: Wang, Ruochen, et al.
Pubblicazione: (2024)
di: Wang, Ruochen, et al.
Pubblicazione: (2024)
Understanding the Impact of Negative Prompts: When and How Do They Take Effect?
di: Ban, Yuanhao, et al.
Pubblicazione: (2024)
di: Ban, Yuanhao, et al.
Pubblicazione: (2024)
The Crystal Ball Hypothesis in diffusion models: Anticipating object positions from initial noise
di: Ban, Yuanhao, et al.
Pubblicazione: (2024)
di: Ban, Yuanhao, et al.
Pubblicazione: (2024)
VideoPrism: A Foundational Visual Encoder for Video Understanding
di: Zhao, Long, et al.
Pubblicazione: (2024)
di: Zhao, Long, et al.
Pubblicazione: (2024)
One-Forcing: Towards Stable One-Step Autoregressive Video Generation
di: Feng, Jiaqi, et al.
Pubblicazione: (2026)
di: Feng, Jiaqi, et al.
Pubblicazione: (2026)
Image Diffusion Preview with Consistency Solver
di: Wang, Fu-Yun, et al.
Pubblicazione: (2025)
di: Wang, Fu-Yun, et al.
Pubblicazione: (2025)
Mitigating Bias in Dataset Distillation
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
IRIS: Intrinsic Reward Image Synthesis
di: Chen, Yihang, et al.
Pubblicazione: (2025)
di: Chen, Yihang, et al.
Pubblicazione: (2025)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
LoL: Longer than Longer, Scaling Video Generation to Hour
di: Cui, Justin, et al.
Pubblicazione: (2026)
di: Cui, Justin, et al.
Pubblicazione: (2026)
Self-Forcing++: Towards Minute-Scale High-Quality Video Generation
di: Cui, Justin, et al.
Pubblicazione: (2025)
di: Cui, Justin, et al.
Pubblicazione: (2025)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2026)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2026)
Spatial-Temporal Multi-level Association for Video Object Segmentation
di: Miao, Deshui, et al.
Pubblicazione: (2024)
di: Miao, Deshui, et al.
Pubblicazione: (2024)
LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
Video Creation by Demonstration
di: Sun, Yihong, et al.
Pubblicazione: (2024)
di: Sun, Yihong, et al.
Pubblicazione: (2024)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
di: Qing, Yuan, et al.
Pubblicazione: (2026)
di: Qing, Yuan, et al.
Pubblicazione: (2026)
How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms
di: Jin, Shengji, et al.
Pubblicazione: (2026)
di: Jin, Shengji, et al.
Pubblicazione: (2026)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
di: Fan, Rong, et al.
Pubblicazione: (2026)
di: Fan, Rong, et al.
Pubblicazione: (2026)
Text is All You Need for Vision-Language Model Jailbreaking
di: Chen, Yihang, et al.
Pubblicazione: (2026)
di: Chen, Yihang, et al.
Pubblicazione: (2026)
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
Embedding Space Selection for Detecting Memorization and Fingerprinting in Generative Models
di: He, Jack, et al.
Pubblicazione: (2024)
di: He, Jack, et al.
Pubblicazione: (2024)
VideoAds for Fast-Paced Video Understanding
di: Zhang, Zheyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zheyuan, et al.
Pubblicazione: (2025)
PLMM: Personal Large Language Models on Mobile Devices
di: Gong, Yuanhao
Pubblicazione: (2023)
di: Gong, Yuanhao
Pubblicazione: (2023)
Extending Video Masked Autoencoders to 128 frames
di: Gundavarapu, Nitesh Bharadwaj, et al.
Pubblicazione: (2024)
di: Gundavarapu, Nitesh Bharadwaj, et al.
Pubblicazione: (2024)
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization
di: Tao, Zhuo, et al.
Pubblicazione: (2025)
di: Tao, Zhuo, et al.
Pubblicazione: (2025)
Spatial Degradation-Aware and Temporal Consistent Diffusion Model for Compressed Video Super-Resolution
di: An, Hongyu, et al.
Pubblicazione: (2025)
di: An, Hongyu, et al.
Pubblicazione: (2025)
Culture in Action: Evaluating Text-to-Image Models through Social Activities
di: Malakouti, Sina, et al.
Pubblicazione: (2025)
di: Malakouti, Sina, et al.
Pubblicazione: (2025)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
di: Sun, Bowen, et al.
Pubblicazione: (2025)
di: Sun, Bowen, et al.
Pubblicazione: (2025)
Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos
di: Pan, Yulin, et al.
Pubblicazione: (2023)
di: Pan, Yulin, et al.
Pubblicazione: (2023)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
SITE: towards Spatial Intelligence Thorough Evaluation
di: Wang, Wenqi, et al.
Pubblicazione: (2025)
di: Wang, Wenqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Distilling Vision-Language Models on Millions of Videos
di: Zhao, Yue, et al.
Pubblicazione: (2024) -
VideoGLUE: Video General Understanding Evaluation of Foundation Models
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023) -
On Discrete Prompt Optimization for Diffusion Models
di: Wang, Ruochen, et al.
Pubblicazione: (2024) -
Understanding the Impact of Negative Prompts: When and How Do They Take Effect?
di: Ban, Yuanhao, et al.
Pubblicazione: (2024) -
The Crystal Ball Hypothesis in diffusion models: Anticipating object positions from initial noise
di: Ban, Yuanhao, et al.
Pubblicazione: (2024)