TimeRefine: Temporal Grounding with Time Refining Video LLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xizi, Cheng, Feng, Wang, Ziyang, Wang, Huiyu, Islam, Md Mohaiminul, Torresani, Lorenzo, Bansal, Mohit, Bertasius, Gedas, Crandall, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
LoCoNet: Long-Short Context Network for Active Speaker Detection
di: Wang, Xizi, et al.
Pubblicazione: (2023)
di: Wang, Xizi, et al.
Pubblicazione: (2023)
A Simple LLM Framework for Long-Range Video Question-Answering
di: Zhang, Ce, et al.
Pubblicazione: (2023)
di: Zhang, Ce, et al.
Pubblicazione: (2023)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2023)
di: Hannan, Tanveer, et al.
Pubblicazione: (2023)
SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence
di: Pan, Yulu, et al.
Pubblicazione: (2026)
di: Pan, Yulu, et al.
Pubblicazione: (2026)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
SiLVR: A Simple Language-based Video Reasoning Framework
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
DAM: Dynamic Adapter Merging for Continual Video QA Learning
di: Cheng, Feng, et al.
Pubblicazione: (2024)
di: Cheng, Feng, et al.
Pubblicazione: (2024)
Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
di: Li, Baiqi, et al.
Pubblicazione: (2026)
di: Li, Baiqi, et al.
Pubblicazione: (2026)
BASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation
di: Pan, Yulu, et al.
Pubblicazione: (2025)
di: Pan, Yulu, et al.
Pubblicazione: (2025)
Sequence-Based Identification of First-Person Camera Wearers in Third-Person Views
di: Zhao, Ziwei, et al.
Pubblicazione: (2025)
di: Zhao, Ziwei, et al.
Pubblicazione: (2025)
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion
di: Tursynbek, Nurislam, et al.
Pubblicazione: (2026)
di: Tursynbek, Nurislam, et al.
Pubblicazione: (2026)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
di: Lee, Daeun, et al.
Pubblicazione: (2024)
di: Lee, Daeun, et al.
Pubblicazione: (2024)
VITED: Video Temporal Evidence Distillation
di: Lu, Yujie, et al.
Pubblicazione: (2025)
di: Lu, Yujie, et al.
Pubblicazione: (2025)
RECIPE: Procedural Planning via Grounding in Instructional Video
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
Siamese Vision Transformers are Scalable Audio-visual Learners
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Step Differences in Instructional Video
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
di: Wang, Zun, et al.
Pubblicazione: (2024)
di: Wang, Zun, et al.
Pubblicazione: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
MAMM-Refine: A Recipe for Improving Faithfulness in Generation with Multi-Agent Collaboration
di: Wan, David, et al.
Pubblicazione: (2025)
di: Wan, David, et al.
Pubblicazione: (2025)
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
di: Han, Tingting, et al.
Pubblicazione: (2026)
di: Han, Tingting, et al.
Pubblicazione: (2026)
Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal Grounding
di: Deng, Andong, et al.
Pubblicazione: (2024)
di: Deng, Andong, et al.
Pubblicazione: (2024)
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
di: Zhou, Yixiao, et al.
Pubblicazione: (2026)
di: Zhou, Yixiao, et al.
Pubblicazione: (2026)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
DGIQA: Depth-guided Feature Attention and Refinement for Generalizable Image Quality Assessment
di: Ramesh, Vaishnav, et al.
Pubblicazione: (2025)
di: Ramesh, Vaishnav, et al.
Pubblicazione: (2025)
ExAct: A Video-Language Benchmark for Expert Action Analysis
di: Yi, Han, et al.
Pubblicazione: (2025)
di: Yi, Han, et al.
Pubblicazione: (2025)
MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for Reasoning
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2024)
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2024)
Exploring Iterative Refinement with Diffusion Models for Video Grounding
di: Liang, Xiao, et al.
Pubblicazione: (2023)
di: Liang, Xiao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025) -
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
di: Wang, Ziyang, et al.
Pubblicazione: (2025) -
LoCoNet: Long-Short Context Network for Active Speaker Detection
di: Wang, Xizi, et al.
Pubblicazione: (2023) -
A Simple LLM Framework for Long-Range Video Question-Answering
di: Zhang, Ce, et al.
Pubblicazione: (2023) -
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)