Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Ce, Song, Yale, Desai, Ruta, Iuzzolino, Michael Louis, Tighe, Joseph, Bertasius, Gedas, Kottur, Satwik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation
por: Lebailly, Tim, et al.
Publicado: (2025)
por: Lebailly, Tim, et al.
Publicado: (2025)
BASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation
por: Pan, Yulu, et al.
Publicado: (2025)
por: Pan, Yulu, et al.
Publicado: (2025)
SiLVR: A Simple Language-based Video Reasoning Framework
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
por: Lin, Yan-Bo, et al.
Publicado: (2024)
por: Lin, Yan-Bo, et al.
Publicado: (2024)
LoCoNet: Long-Short Context Network for Active Speaker Detection
por: Wang, Xizi, et al.
Publicado: (2023)
por: Wang, Xizi, et al.
Publicado: (2023)
BOSS: Benchmark for Observation Space Shift in Long-Horizon Task
por: Yang, Yue, et al.
Publicado: (2025)
por: Yang, Yue, et al.
Publicado: (2025)
RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos
por: Hannan, Tanveer, et al.
Publicado: (2023)
por: Hannan, Tanveer, et al.
Publicado: (2023)
A Simple LLM Framework for Long-Range Video Question-Answering
por: Zhang, Ce, et al.
Publicado: (2023)
por: Zhang, Ce, et al.
Publicado: (2023)
TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion
por: Tursynbek, Nurislam, et al.
Publicado: (2026)
por: Tursynbek, Nurislam, et al.
Publicado: (2026)
TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
por: Li, Baiqi, et al.
Publicado: (2026)
por: Li, Baiqi, et al.
Publicado: (2026)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
por: Islam, Md Mohaiminul, et al.
Publicado: (2025)
por: Islam, Md Mohaiminul, et al.
Publicado: (2025)
Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
por: Zhou, Yiyang, et al.
Publicado: (2025)
por: Zhou, Yiyang, et al.
Publicado: (2025)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
por: Hannan, Tanveer, et al.
Publicado: (2024)
por: Hannan, Tanveer, et al.
Publicado: (2024)
Video ReCap: Recursive Captioning of Hour-Long Videos
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
EgoTV: Egocentric Task Verification from Natural Language Task Descriptions
por: Hazra, Rishi, et al.
Publicado: (2023)
por: Hazra, Rishi, et al.
Publicado: (2023)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
por: Wang, Ziyang, et al.
Publicado: (2025)
por: Wang, Ziyang, et al.
Publicado: (2025)
ExAct: A Video-Language Benchmark for Expert Action Analysis
por: Yi, Han, et al.
Publicado: (2025)
por: Yi, Han, et al.
Publicado: (2025)
Enhancing Monocular Depth Estimation with Multi-Source Auxiliary Tasks
por: Quercia, Alessio, et al.
Publicado: (2025)
por: Quercia, Alessio, et al.
Publicado: (2025)
SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence
por: Pan, Yulu, et al.
Publicado: (2026)
por: Pan, Yulu, et al.
Publicado: (2026)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
por: Wang, Ziyang, et al.
Publicado: (2026)
por: Wang, Ziyang, et al.
Publicado: (2026)
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
por: Hannan, Tanveer, et al.
Publicado: (2025)
por: Hannan, Tanveer, et al.
Publicado: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
por: Lin, Yan-Bo, et al.
Publicado: (2024)
por: Lin, Yan-Bo, et al.
Publicado: (2024)
ReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis
por: Fang, Yu, et al.
Publicado: (2025)
por: Fang, Yu, et al.
Publicado: (2025)
Embodied Navigation with Auxiliary Task of Action Description Prediction
por: Kondoh, Haru, et al.
Publicado: (2025)
por: Kondoh, Haru, et al.
Publicado: (2025)
Unprejudiced Training Auxiliary Tasks Makes Primary Better: A Multi-Task Learning Perspective
por: Li, Yuanze, et al.
Publicado: (2024)
por: Li, Yuanze, et al.
Publicado: (2024)
Auxiliary Tasks Enhanced Dual-affinity Learning for Weakly Supervised Semantic Segmentation
por: Xu, Lian, et al.
Publicado: (2024)
por: Xu, Lian, et al.
Publicado: (2024)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
DAM: Dynamic Adapter Merging for Continual Video QA Learning
por: Cheng, Feng, et al.
Publicado: (2024)
por: Cheng, Feng, et al.
Publicado: (2024)
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
por: Lin, Yan-Bo, et al.
Publicado: (2026)
por: Lin, Yan-Bo, et al.
Publicado: (2026)
Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization
por: Fontana, Maxime, et al.
Publicado: (2024)
por: Fontana, Maxime, et al.
Publicado: (2024)
SMART: Scalable Multi-agent Real-time Motion Generation via Next-token Prediction
por: Wu, Wei, et al.
Publicado: (2024)
por: Wu, Wei, et al.
Publicado: (2024)
LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies
por: Yang, Yue, et al.
Publicado: (2026)
por: Yang, Yue, et al.
Publicado: (2026)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
por: Lin, Yan-Bo, et al.
Publicado: (2025)
por: Lin, Yan-Bo, et al.
Publicado: (2025)
Improving Vessel Segmentation with Multi-Task Learning and Auxiliary Data Available Only During Model Training
por: Sobotka, Daniel, et al.
Publicado: (2025)
por: Sobotka, Daniel, et al.
Publicado: (2025)
Enhancing Mamba Decoder with Bidirectional Interaction in Multi-Task Dense Prediction
por: Cao, Mang, et al.
Publicado: (2025)
por: Cao, Mang, et al.
Publicado: (2025)
A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to 1st VCL Challenge -- Multi-Task Robustness Track
por: Chen, Zehui, et al.
Publicado: (2024)
por: Chen, Zehui, et al.
Publicado: (2024)
DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary
por: Guan, Jiazhi, et al.
Publicado: (2026)
por: Guan, Jiazhi, et al.
Publicado: (2026)
Test-time Distribution Learning Adapter for Cross-modal Visual Reasoning
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
MedRAT: Unpaired Medical Report Generation via Auxiliary Tasks
por: Hirsch, Elad, et al.
Publicado: (2024)
por: Hirsch, Elad, et al.
Publicado: (2024)
Ejemplares similares
-
Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation
por: Lebailly, Tim, et al.
Publicado: (2025) -
BASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation
por: Pan, Yulu, et al.
Publicado: (2025) -
SiLVR: A Simple Language-based Video Reasoning Framework
por: Zhang, Ce, et al.
Publicado: (2025) -
Siamese Vision Transformers are Scalable Audio-visual Learners
por: Lin, Yan-Bo, et al.
Publicado: (2024) -
LoCoNet: Long-Short Context Network for Active Speaker Detection
por: Wang, Xizi, et al.
Publicado: (2023)