Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Islam, Md Mohaiminul, Nagarajan, Tushar, Wang, Huiyu, Chu, Fu-Jen, Kitani, Kris, Bertasius, Gedas, Yang, Xitong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2023)
di: Hannan, Tanveer, et al.
Pubblicazione: (2023)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
TimeRefine: Temporal Grounding with Time Refining Video LLM
di: Wang, Xizi, et al.
Pubblicazione: (2024)
di: Wang, Xizi, et al.
Pubblicazione: (2024)
SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence
di: Pan, Yulu, et al.
Pubblicazione: (2026)
di: Pan, Yulu, et al.
Pubblicazione: (2026)
A Simple LLM Framework for Long-Range Video Question-Answering
di: Zhang, Ce, et al.
Pubblicazione: (2023)
di: Zhang, Ce, et al.
Pubblicazione: (2023)
ExpertAF: Expert Actionable Feedback from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
BASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation
di: Pan, Yulu, et al.
Pubblicazione: (2025)
di: Pan, Yulu, et al.
Pubblicazione: (2025)
Step Differences in Instructional Video
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
Siamese Vision Transformers are Scalable Audio-visual Learners
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Low dimensional fragment-based descriptors for property predictions in inorganic materials with machine learning
di: Islam, Md Mohaiminul
Pubblicazione: (2024)
di: Islam, Md Mohaiminul
Pubblicazione: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
di: Li, Baiqi, et al.
Pubblicazione: (2026)
di: Li, Baiqi, et al.
Pubblicazione: (2026)
Detours for Navigating Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Augmented Reality Demonstrations for Scalable Robot Imitation Learning
di: Yang, Yue, et al.
Pubblicazione: (2024)
di: Yang, Yue, et al.
Pubblicazione: (2024)
ARCADE: Scalable Demonstration Collection and Generation via Augmented Reality for Imitation Learning
di: Yang, Yue, et al.
Pubblicazione: (2024)
di: Yang, Yue, et al.
Pubblicazione: (2024)
TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion
di: Tursynbek, Nurislam, et al.
Pubblicazione: (2026)
di: Tursynbek, Nurislam, et al.
Pubblicazione: (2026)
SiLVR: A Simple Language-based Video Reasoning Framework
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
LoCoNet: Long-Short Context Network for Active Speaker Detection
di: Wang, Xizi, et al.
Pubblicazione: (2023)
di: Wang, Xizi, et al.
Pubblicazione: (2023)
BOSS: Benchmark for Observation Space Shift in Long-Horizon Task
di: Yang, Yue, et al.
Pubblicazione: (2025)
di: Yang, Yue, et al.
Pubblicazione: (2025)
Imagining the Indian Nation Through Provincial Development and Freedom Movement: A Close Reading of Ghaffar Khan's My Life and Struggle
di: Md Samsujjaman, et al.
Pubblicazione: (2025)
di: Md Samsujjaman, et al.
Pubblicazione: (2025)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
ReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis
di: Fang, Yu, et al.
Pubblicazione: (2025)
di: Fang, Yu, et al.
Pubblicazione: (2025)
NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning
di: Fu, Jiahui, et al.
Pubblicazione: (2026)
di: Fu, Jiahui, et al.
Pubblicazione: (2026)
DAM: Dynamic Adapter Merging for Continual Video QA Learning
di: Cheng, Feng, et al.
Pubblicazione: (2024)
di: Cheng, Feng, et al.
Pubblicazione: (2024)
ExAct: A Video-Language Benchmark for Expert Action Analysis
di: Yi, Han, et al.
Pubblicazione: (2025)
di: Yi, Han, et al.
Pubblicazione: (2025)
Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
Multi-Object Tracking by Hierarchical Visual Representations
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
DUA-D2C: Dynamic Uncertainty Aware Method for Overfitting Remediation in Deep Learning
di: Siddiqui, Md. Saiful Bari, et al.
Pubblicazione: (2024)
di: Siddiqui, Md. Saiful Bari, et al.
Pubblicazione: (2024)
Human Action Anticipation: A Survey
di: Lai, Bolin, et al.
Pubblicazione: (2024)
di: Lai, Bolin, et al.
Pubblicazione: (2024)
Harmony4D: A Video Dataset for In-The-Wild Close Human Interactions
di: Khirodkar, Rawal, et al.
Pubblicazione: (2024)
di: Khirodkar, Rawal, et al.
Pubblicazione: (2024)
LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies
di: Yang, Yue, et al.
Pubblicazione: (2026)
di: Yang, Yue, et al.
Pubblicazione: (2026)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
G-HOP: Generative Hand-Object Prior for Interaction Reconstruction and Grasp Synthesis
di: Ye, Yufei, et al.
Pubblicazione: (2024)
di: Ye, Yufei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025) -
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024) -
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024) -
RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2023) -
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)